Přeskočit na obsah
Modely 3 min čtení

H2O-Lightning-4B vede v JevBench ve skóre zahrnujícím rychlost a cenu

H2O.ai vyzdvihuje první místo modelu Lightning v souhrnném skóre JevBench. V pořadí podle schopností je při kontrole 8. října pátý a cena jeho provozu v hodnocení vychází z odhadu.

Vědec pracuje u počítače Dell Precision s grafem na monitoru
Práce u počítače, ilustrační snímek z roku 2013. Foto: Jennie Groom, Wikimedia Commons (CC BY 2.0)

První místo na kartě modelu H2O-Lightning-4B má přesné zadání: souhrnné skóre, do kterého vstupuje kvalita odpovědí, jejich jistota, rychlost a cena. H2O.ai se na kartě modelu odvolává na výsledky JevBench z 7. října 2026. Nezávislý provozovatel testu Benchmark Heaven skutečně uvádí pro verzi Lightning 1.1 hodnotu 72,5. U referenčního systému Jev 1.13.0 stojí 71,5.

Pro čtenáře, který vybírá model na třídění dokumentů nebo zákaznických požadavků, je však podstatné i druhé pořadí. Žebříček podle schopností měl Lightning při kontrole 8. října na pátém místě. V historii změn ze 7. října byl třetí. První místo v souhrnné tabulce zůstalo zachované; mění se tedy odpověď podle toho, kterou tabulku člověk čte.

Model vybírá odpověď z předem daných možností

Lightning vznikl doladěním čínského Qwenu 3.5-4B. Uživatel mu předá záznam a otázky: například jakou prioritu má zákaznický požadavek podle přiložených pravidel. Výstup obsahuje pravděpodobnosti nabízených možností. Rozhraní přijímá také otázku ano/ne nebo hodnocení na zadané stupnici.

Každé rozhodnutí podle výrobce potřebuje jeden průchod modelem a jeden výstupní token, tedy krátký úsek textu, se kterým model pracuje. Souvislé vysvětlení své volby nevytváří. Karta uvádí, že autoři model hodnotili převážně v angličtině, takže z výsledku nelze vyčíst jeho spolehlivost při práci s českými dokumenty.

Známka schopností cenu neobsahuje

Benchmark Heaven model spustil na pronajatém stroji s jednou kartou NVIDIA RTX 5090, serverem vLLM 0.30.0 a veřejným pomocným programem od autorů Lightningu. Podle popisu nezávislého měření proběhl test 4. října, bez přístupových údajů a s vypnutým vnějším připojením během hodnocení. Výsledek patří metodice JevBench 1.6.1; historie webu zaznamenává přidání modelu 7. října.

Hodnotitel rozlišuje čtyři osy. Intelligence měří kvalitu rozhodnutí, Calibration to, nakolik uváděná jistota odpovídá výsledkům. Zbylé dvě osy hodnotí rychlost a náklady. Souhrnné Composite Score používá jejich harmonický průměr se stejnými vahami, který více zohledňuje slabší hodnoty.

Capability Score, česky známka schopností, naproti tomu průměruje jen kvalitu rozhodnutí a kalibraci. Pro Lightning jde o hodnoty 60 a 90, tedy vlastní přepočet (60 + 90) / 2 = 75. Referenční Jev má 63,6 a 90,6; stejným výpočtem dostaneme 77,1. V tomto porovnání vychází Jev výš, přestože má nižší souhrnné skóre.

Pořadí podle schopností ovšem také má provozní podmínku. Do hlavního výběru patří systémy, které splní stanovený strop ceny i prostřední hodnoty doby odpovědi. Samotná známka je počítaná ze dvou os, vstup do pořadí hlídají ještě náklady a čekání.

Dolarová částka je odhad provozu

U Lightningu uvádí srovnávací stránka 0,021 dolaru za tisíc rozhodnutí a výslovně jej označuje jako odhad. Model se provozuje z otevřených vah a nemá veřejný tarif, ze kterého by hodnotitel mohl opsat účet. Podklad nákladů přenesl ze starší verze Lightning 1.0 měřené na sadě JevBench 1.5. Kontrolní výpočet z množství vstupních tokenů verze 1.1 mu vyšel na 0,0204 dolaru.

Uvedené částky odpovídají stavu stránky z 8. října 2026. Zahrnují konkrétní pracovní zátěž testu; nelze je přenést na libovolně dlouhý firemní dokument. Také dobu odpovědi lokálně spuštěného modelu hodnotitel upravuje: zdvojnásobí naměřenou hodnotu a přičte 0,15 sekundy. Stránka tento přídavek označuje za předpoklad, nikoli za měření.

Váhy jsou veřejně dostupné. Soubor LICENSE obsahuje licenci Apache 2.0, která dovoluje užití, úpravy i šíření za uvedených podmínek. Při dalším šíření se musí zachovat licence a příslušné údaje o autorství a označit změněné soubory. Provozovatel si tak může model otestovat na vlastních záznamech; zveřejněné pořadí mu nenahradí ověření těch otázek a jazyka, které skutečně používá.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Google vydal EmbeddingGemma 2 pro vyhledávání v textu, obrazech i zvuku

    Google 6. října vydal EmbeddingGemma 2, která hledá souvislosti mezi textem, obrázky, videem a zvukem přímo v zařízení. Údaj o 191 MB paměti platí jen pro textové váhy;…

  2. Modely

    Model Beam zaostal v tabulce Reflection za GLM-5.3 ve všech dvanácti společných testech

    Reflection AI ohlásila 5. října svůj první otevřený model Beam s 501 miliardami parametrů, váhy ale zatím nevydala. V oznámení ho staví vedle staršího GLM-5.2; novější…

  3. Modely

    Reka ukázala Rho-1 pro tvorbu videa a řízení robotů v jediné síti

    Reka představila Rho-1 jako výzkumnou ukázku, která spojuje text, obraz a pohybové příkazy. Při delším běhu se ale rozchází uspořádání scény a úpravy obrazu zůstávají…

  4. Modely

    Aleph Alpha vydala Kolibri s 78,8 GB otevřených vah

    Německo-anglický Kolibri používá přes 78 miliard parametrů, při každém kroku zapojí 3,46 miliardy. Aleph Alpha doporučuje pro složité úlohy nejvýše 262 144 tokenů,…