InternLM vydal tři modely, které odpověď nevypisují, ale odečítají ji z logitů
InternLM zveřejnil 26. září 2026 tři modely Intern-Decision doladěné z Qwen3.5. Nevypisují text: obsluha jim předloží kostru odpovědi se zástupnými značkami a model v jediném průchodu odečte pravděpodobnosti povolených odpovědí. Z vah přitom zmizel celý blok pro předpověď více tokenů dopředu, u čtyřmiliardové verze přesně 120 599 552 parametrů.
Skupina InternLM, která má na GitHubu jako sídlo uvedenou Čínu, zveřejnila 26. září 2026 tři modely řady Intern-Decision o velikostech 0,8, 2 a 4 miliardy parametrů. Chatovací modely to nejsou. Na vstupu berou popis situace, seznam pojmenovaných otázek s vyjmenovanými možnostmi a nepovinně obrázky; na výstupu vracejí ke každé otázce rozdělení pravděpodobností. Žádná věta u toho nevznikne.
Odpověď se čte před značkou, ne za ní
Postup je na kartě modelu rozepsaný krok za krokem. Obsluha složí celou odpověď dopředu jako kostru JSONu a do každého pole vloží zástupnou značku <decision>. Povolené odpovědi přemapuje na jednopísmenné symboly A až Z, a až z a 0 až 9. Pak pustí jediný průchod sítí a u každé značky si přečte logity na pozici těsně před ní. Logit je surové číslo, které model přiřadí tokenu dřív, než se z něj stane pravděpodobnost. Přes ně se pustí softmax omezený jen na symboly, které u té otázky přicházejí v úvahu, a výsledek se přepočítá kalibrací.
Volání generate() se nepoužije ani jednou a správná odpověď se do vstupu nikdy nedostane; podle repozitáře se objevuje jen v trénovacích štítcích. Všechna pole se přitom vyhodnotí v tomtéž průchodu. Jeden dotaz smí mít jednu až šestnáct otázek, u každé nejvýš 62 možností, nejvýš osm obrázků a celkem 8 192 tokenů. Delší vstup obsluha odmítne, nezkracuje ho.

Na měření to je znát. Na jedné RTX 4090 uvádí InternLM průměrnou dobu jednoho dotazu 33,98 ms u nejmenšího modelu, 33,28 ms u dvoumiliardového a 44,16 ms u čtyřmiliardového. V devadesáti pěti procentech případů se čtyřmiliardová verze vešla do 44,60 ms, tedy o necelý půl milisekundy víc než průměr. Placený model Jev od firmy TypeSafe AI, se kterým se InternLM poměřuje, má v téže tabulce průměr 109,70 ms.
Z vah zmizela hlava na předvídání
Všechny tři modely jsou doladěné ze série Qwen3.5 od Alibaby a vycházejí pod licencí Apache 2.0; původní licenci Qwenu repozitář vede zvlášť v souboru LICENSE-QWEN, a je to rovněž Apache 2.0. Obrazovou část a projektor nechal InternLM podle repozitáře zmrazené, doladil jen jazykovou páteř.
Rozhraní Hugging Face u obou repozitářů vypisuje počet parametrů odečtený přímo ze souborů vah, takže se dá porovnat. Qwen3.5-4B má 4 659 865 088 parametrů, Intern-Decision-4B jich má 4 539 265 536, tedy o 120 599 552 méně. Mapa tenzorů říká, kde ten rozdíl je: v odvozenině chybí patnáct tenzorů, jejichž jméno začíná na mtp, a nic jiného. Je to celý blok pro předpověď více tokenů dopředu, kterým Qwen zrychluje psaní textu. Součet jejich tvarů z hlaviček souborů vah dá 120 599 552 přesně, takže rozdíl vysvětluje beze zbytku. U dvoumiliardové verze jde o 60 828 160 parametrů a u nejmenší o 20 452 864, pokaždé o týchž patnáct tenzorů.
Dává to smysl u modelu, který nic nepíše. Ani karta, ani repozitář to ale nezmiňují, takže důvod je náš dopočet, ne údaj od vydavatele. Soubor config.json přitom jednu vrstvu mtp dál deklaruje.
Měření proběhlo na veřejné polovině sady
InternLM uvádí u čtyřmiliardové verze průměrnou přesnost 90,02 % přes sedm testovacích sad proti 88,74 % u modelu Jev. Tři z těch sad pocházejí z JevBenche, testu pro rozhodovací modely, který pod licencí MIT vede projekt Benchmark Heaven a který sám uvádí, že s TypeSafe AI nemá nic společného.
Návod na zopakování měření v repozitáři InternLM vypisuje i počty řádků: obtížná část má 111 položek. JevBench má obtížnou úroveň postavenou z 220 rozhodnutí, z nichž je 111 veřejných a 109 zapečetěných. Měřilo se tedy na té veřejné polovině, o které autor benchmarku v jeho popisu píše, že se na ní dá trénovat nebo podle ní vybírat. Verzi JevBenche neuvádí karta modelu ani manifest testovacích sad; ten vede jen adresu repozitáře a otisky souborů. Benchmark přitom vydal za týden od svého vzniku pět číslovaných verzí a na jeho žebříčku, kde je 93 systémů, Intern-Decision zatím není.
Žebříček navíc neřadí podle přesnosti. Skládá se ze čtyř os, ve kterých má stejnou váhu i kalibrace, rychlost a cena za tisíc rozhodnutí, a vede ho model decider-4b v2 se skóre 64,13 před Jevem 1.13.0 s 63,29. Čísla z karty Intern-Decision se s tímhle pořadím porovnávat nedají.
Na druhou stranu InternLM nezveřejnil jen tabulku. V repozitáři jsou všechny testovací sady s otisky SHA-256, manifest s uvedením původu každé z nich, hodnoticí kód i postup, jak výsledky zopakovat. Kalibrační teplotu 1,99241824 nese karta včetně metody, jakou vznikla: minimalizací záporné věrohodnosti na 1 728 kalibračních případech s 1 693 oddělenými ověřovacími. Repozitář sám upozorňuje, že protokoly jednotlivých tabulek se liší, a že výsledky z druhého způsobu odvozování se mají uvádět jako jiné nastavení. To je víc, než kolik u vydání modelu bývá.
Co ta čísla vydrží, ukáže až běh na zapečetěné polovině, na který InternLM sám nedosáhne. Zajímavější než pořadí je stejně ten způsob odvozování: klasifikace, kterou dnes spousta provozů kupuje jako službu po tokenech, se tady vejde do jedné herní karty a do zlomku vteřiny.