Přeskočit na obsah
Čínské modely 3 min čtení

InternLM vydal tři modely, které odpověď nevypisují, ale odečítají ji z logitů

InternLM zveřejnil 26. září 2026 tři modely Intern-Decision doladěné z Qwen3.5. Nevypisují text: obsluha jim předloží kostru odpovědi se zástupnými značkami a model v jediném průchodu odečte pravděpodobnosti povolených odpovědí. Z vah přitom zmizel celý blok pro předpověď více tokenů dopředu, u čtyřmiliardové verze přesně 120 599 552 parametrů.

Skupina InternLM, která má na GitHubu jako sídlo uvedenou Čínu, zveřejnila 26. září 2026 tři modely řady Intern-Decision o velikostech 0,8, 2 a 4 miliardy parametrů. Chatovací modely to nejsou. Na vstupu berou popis situace, seznam pojmenovaných otázek s vyjmenovanými možnostmi a nepovinně obrázky; na výstupu vracejí ke každé otázce rozdělení pravděpodobností. Žádná věta u toho nevznikne.

Odpověď se čte před značkou, ne za ní

Postup je na kartě modelu rozepsaný krok za krokem. Obsluha složí celou odpověď dopředu jako kostru JSONu a do každého pole vloží zástupnou značku <decision>. Povolené odpovědi přemapuje na jednopísmenné symboly A až Z, a až z a 0 až 9. Pak pustí jediný průchod sítí a u každé značky si přečte logity na pozici těsně před ní. Logit je surové číslo, které model přiřadí tokenu dřív, než se z něj stane pravděpodobnost. Přes ně se pustí softmax omezený jen na symboly, které u té otázky přicházejí v úvahu, a výsledek se přepočítá kalibrací.

Volání generate() se nepoužije ani jednou a správná odpověď se do vstupu nikdy nedostane; podle repozitáře se objevuje jen v trénovacích štítcích. Všechna pole se přitom vyhodnotí v tomtéž průchodu. Jeden dotaz smí mít jednu až šestnáct otázek, u každé nejvýš 62 možností, nejvýš osm obrázků a celkem 8 192 tokenů. Delší vstup obsluha odmítne, nezkracuje ho.

Grafická karta GeForce RTX 4090
Karta Asus ROG Strix s čipem GeForce RTX 4090 za provozu. Foto: Benlisquare, Wikimedia Commons (CC BY-SA 4.0)

Na měření to je znát. Na jedné RTX 4090 uvádí InternLM průměrnou dobu jednoho dotazu 33,98 ms u nejmenšího modelu, 33,28 ms u dvoumiliardového a 44,16 ms u čtyřmiliardového. V devadesáti pěti procentech případů se čtyřmiliardová verze vešla do 44,60 ms, tedy o necelý půl milisekundy víc než průměr. Placený model Jev od firmy TypeSafe AI, se kterým se InternLM poměřuje, má v téže tabulce průměr 109,70 ms.

Z vah zmizela hlava na předvídání

Všechny tři modely jsou doladěné ze série Qwen3.5 od Alibaby a vycházejí pod licencí Apache 2.0; původní licenci Qwenu repozitář vede zvlášť v souboru LICENSE-QWEN, a je to rovněž Apache 2.0. Obrazovou část a projektor nechal InternLM podle repozitáře zmrazené, doladil jen jazykovou páteř.

Rozhraní Hugging Face u obou repozitářů vypisuje počet parametrů odečtený přímo ze souborů vah, takže se dá porovnat. Qwen3.5-4B má 4 659 865 088 parametrů, Intern-Decision-4B jich má 4 539 265 536, tedy o 120 599 552 méně. Mapa tenzorů říká, kde ten rozdíl je: v odvozenině chybí patnáct tenzorů, jejichž jméno začíná na mtp, a nic jiného. Je to celý blok pro předpověď více tokenů dopředu, kterým Qwen zrychluje psaní textu. Součet jejich tvarů z hlaviček souborů vah dá 120 599 552 přesně, takže rozdíl vysvětluje beze zbytku. U dvoumiliardové verze jde o 60 828 160 parametrů a u nejmenší o 20 452 864, pokaždé o týchž patnáct tenzorů.

Dává to smysl u modelu, který nic nepíše. Ani karta, ani repozitář to ale nezmiňují, takže důvod je náš dopočet, ne údaj od vydavatele. Soubor config.json přitom jednu vrstvu mtp dál deklaruje.

Měření proběhlo na veřejné polovině sady

InternLM uvádí u čtyřmiliardové verze průměrnou přesnost 90,02 % přes sedm testovacích sad proti 88,74 % u modelu Jev. Tři z těch sad pocházejí z JevBenche, testu pro rozhodovací modely, který pod licencí MIT vede projekt Benchmark Heaven a který sám uvádí, že s TypeSafe AI nemá nic společného.

Návod na zopakování měření v repozitáři InternLM vypisuje i počty řádků: obtížná část má 111 položek. JevBench má obtížnou úroveň postavenou z 220 rozhodnutí, z nichž je 111 veřejných a 109 zapečetěných. Měřilo se tedy na té veřejné polovině, o které autor benchmarku v jeho popisu píše, že se na ní dá trénovat nebo podle ní vybírat. Verzi JevBenche neuvádí karta modelu ani manifest testovacích sad; ten vede jen adresu repozitáře a otisky souborů. Benchmark přitom vydal za týden od svého vzniku pět číslovaných verzí a na jeho žebříčku, kde je 93 systémů, Intern-Decision zatím není.

Žebříček navíc neřadí podle přesnosti. Skládá se ze čtyř os, ve kterých má stejnou váhu i kalibrace, rychlost a cena za tisíc rozhodnutí, a vede ho model decider-4b v2 se skóre 64,13 před Jevem 1.13.0 s 63,29. Čísla z karty Intern-Decision se s tímhle pořadím porovnávat nedají.

Na druhou stranu InternLM nezveřejnil jen tabulku. V repozitáři jsou všechny testovací sady s otisky SHA-256, manifest s uvedením původu každé z nich, hodnoticí kód i postup, jak výsledky zopakovat. Kalibrační teplotu 1,99241824 nese karta včetně metody, jakou vznikla: minimalizací záporné věrohodnosti na 1 728 kalibračních případech s 1 693 oddělenými ověřovacími. Repozitář sám upozorňuje, že protokoly jednotlivých tabulek se liší, a že výsledky z druhého způsobu odvozování se mají uvádět jako jiné nastavení. To je víc, než kolik u vydání modelu bývá.

Co ta čísla vydrží, ukáže až běh na zapečetěné polovině, na který InternLM sám nedosáhne. Zajímavější než pořadí je stejně ten způsob odvozování: klasifikace, kterou dnes spousta provozů kupuje jako službu po tokenech, se tady vejde do jedné herní karty a do zlomku vteřiny.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čínské modely

    Posilované učení modelu MiMo V2.6 Pro stálo podle Xiaomi 2,62 milionu dolarů

    Xiaomi vydal 22. září řadu MiMo V2.6 a spolu s vahami zveřejnil i cenu závěrečné fáze trénování. Posilované učení větší varianty Pro vyšlo na 2,62 milionu dolarů, menší…

  2. Čínské modely

    Qwen-Image-2.1 má zveřejněné váhy jen pro nekomerční použití

    Alibaba 20. září vydala Qwen-Image-2.1 pro generování i úpravy obrázků; obrazová část má 7,1 miliardy parametrů a model pracuje až s deseti předlohami. Váhy lze podle…

  3. Čínské modely

    Qwen účtuje za Omni-Flash pětinu ceny Gemini 3.8 Flash a váhy drží u sebe

    Alibaba pustila 18. září omnimodální model Qwen3.8-Omni-Flash a chce za něj 0,15 dolaru za milion vstupních tokenů bez ohledu na to, jestli jde o text, zvuk, nebo video.…

  4. Čínské modely

    Agentní model Atria Dawn stojí na nezměněné architektuře GLM-5.2

    Šanghajská laboratoř umělé inteligence zveřejnila váhy agentního modelu Atria Dawn Preview a technickou zprávu k němu. Soubor s nastavením se od modelu GLM-5.2 firmy Z…