Přeskočit na obsah
Čísla 3 min čtení

Všech osm příkazů v návodu k Intern-S2-397B spouští jeho osmibitovou verzi

Laboratoř InternLM doplnila 24. září k modelu Intern-S2-397B návod na nasazení. Všech osm příkazů v něm ale sahá do jiného repozitáře, než ve kterém návod leží: spouštějí osmibitovou verzi o 406,25 GB místo zveřejněných 806,86 GB. Serveru pak tytéž příkazy nastaví jméno modelu, jehož váhy nenačetly.

Laboratoř InternLM nahrála 13. září 2026 na Hugging Face váhy modelu Intern-S2-397B. Je to multimodální model se směsí expertů pod licencí Apache 2.0: šedesát vrstev, 512 expertů, z nichž se na každý token zapojí deset, a nativní okno 262 144 tokenů. Karta modelu mluví o vědeckých úlohách a dlouhoběžících agentech. O hardwaru v ní nestojí ani slovo.

Návod na nasazení přibyl do repozitáře až 24. září, tedy jedenáct dní po vahách. Doporučuje uzel s osmi kartami H100 nebo H200 a nabízí hotové příkazy pro tři servery: LMDeploy, vLLM a SGLang. Osm z nich načítá model a všech osm sahá do jiného repozitáře, než ve kterém návod leží.

Řady skříní superpočítače Frontier v Oak Ridge National Laboratory
Uzel s osmi akcelerátory je dnes běžná jednotka, na kterou se velké modely nasazují. Na snímku superpočítač Frontier. Foto: oakridgelabnews, Flickr (CC BY 2.0)

Osm příkazů a jeden repozitář navíc

Soubor deployment_guide.md má 4 373 bajtů a devět ukázek. První spouští proxy LMDeploy a žádné váhy nenačítá; zbylých osm ano, z toho tři pro LMDeploy, tři pro vLLM a dvě pro SGLang. V každém z těch osmi stojí jako cesta k vahám internlm/Intern-S2-FP8. Je to zkrácené jméno, které Hugging Face přesměruje kódem 307 na repozitář Intern-S2-397B-FP8.

Ten vznikl 11. září, o dva dny dřív než repozitář se šestnáctibitovými vahami, a 12. září do něj laboratoř přidala kartu modelu spolu s návodem. Oba návody mají 4 373 bajtů a neliší se ani bajtem: do hlavního repozitáře se o dvanáct dní později zkopíroval beze změny, i s odkazy na ten druhý.

Plné váhy se do osmi karet H100 nevejdou

Rozhraní Hugging Face vydá velikost každého souboru, takže se váhy dají sečíst bez stahování. Hlavní repozitář má 188 souborů .safetensors o 806 859 499 264 bajtech, tedy 806,86 GB neboli 751,45 GiB. Verze FP8 má 95 souborů a 406 250 846 376 bajtů, tedy 406,25 GB. Obojí je vlastní součet z výpisu repozitářů, ne údaj z karty modelu.

Parametrů je v obou případech stejně, 403 423 094 768. Liší se datový typ. V hlavním repozitáři leží skoro všechny ve formátu BF16, tedy po dvou bajtech. Ve verzi FP8 jich 400 719 609 856 zabírá po jednom bajtu a zbylé 2,7 miliardy zůstaly šestnáctibitové.

Teď aritmetika. NVIDIA uvádí u H100 dvě kapacity: 80 GB u provedení SXM a 94 GB u karty do PCIe. Osm karet tedy dá 640, nebo 752 GB, a ani jedno na 806,86 GB nestačí – to ještě bez KV cache a bez aktivací. H200 má 141 GB, osmice tedy 1 128 GB; tam se plné váhy vejdou a zbude 321 GB. Verze FP8 projde všude a na osmi kartách po 80 GB po ní zbývá 234 GB.

Návod přitom obě sestavy jmenuje jedním dechem, jako by byly zaměnitelné. Zaměnitelné jsou jen pro tu verzi vah, kterou spouští. Podobně počítal i starší model Hy4 preview od Tencentu, u kterého se na osm karet po 80 GB nevešla ani kvantizovaná verze.

Jméno v odpovědi serveru patří jiným vahám

Ve druhém řádku každého z osmi příkazů stojí přepínač --served-model-name, u LMDeploy --model-name, a jeho hodnota je internlm/Intern-S2-397B. Zdrojový kód vLLM u téhle volby říká, že takové jméno se objeví v poli model v odpovědi rozhraní a zároveň ve značce model_name u metrik pro Prometheus.

Server postavený přesně podle návodu tedy hlásí jméno šestnáctibitového modelu a počítá pod ním s osmibitovými vahami. Komu jde o rychlost, tomu to nevadí. Komu jde o srovnání naměřených čísel nebo o záznam, čím která odpověď vznikla, tomu ano: rozdíl mezi BF16 a FP8 se na výsledcích projevit může a z názvu v logu se nepozná.

Co návod naopak nežádá

Verze nástrojů, které předepisuje, jsou všechny vydané. LMDeploy chce 0.14.0 a novější, poslední vydání je 0.17.0 z 1. září. vLLM chce 0.22.1, poslední je 0.30.0 z 22. září. SGLang chce 0.5.13, poslední je 0.5.20 z 18. září. Nic se nemusí instalovat z rozpracované větve, což u čerstvě vydaného modelu není samozřejmost.

Otevřené jsou i samotné váhy. Oba repozitáře stojí pod licencí Apache 2.0, tedy bez prahů podle obratu a bez zákazu komerčního užití. Verze FP8 není nic utajeného: visí ve stejné organizaci a návod na ni odkazuje přímo v příkazech. Jen to nikde nestojí slovy, takže kdo příkaz zkopíruje, spustí něco jiného, než co si podle karty modelu stáhl.

Dlouhý kontext má v návodu dvě různé meze. Konfigurace modelu udává 262 144 tokenů, ukázka pro LMDeploy nastavuje 512 000 a ukázka pro vLLM 1 010 000; obě si okno roztahují přepsáním parametrů YaRN s násobkem 4. Proč jsou ta dvě čísla různá, návod nevysvětluje.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Anthropic slibuje u Opusu 5.5 o 40 % nižší náklady, sazby za tokeny klesly o pětinu

    Anthropic vydal Claude Opus 5.5 a slibuje u něj o 40 % nižší náklady než u Opusu 5. V ceníku ale žádná položka o 40 % neklesla: tokeny zlevnily o pětinu, čtení z cache o…

  2. Čísla

    Claude API účtuje zhuštění konverzace mimo hlavní pole odpovědi

    Messages API Anthropicu umí od 14. září zhustit konverzaci na požádání: aplikace pošle historii, server vrátí podepsané shrnutí místo odpovědi. Volání se účtuje jako…

  3. Čísla

    GitHub nabídne žádost o vyšší rozpočet vývojáři, kterému dojdou kredity Copilotu

    Vývojáři, kterému v GitHub Copilotu dojdou AI kredity, se od 16. září ukáže nabídka požádat správce o vyšší rozpočet; žádost míří na účet, který ten rozpočet platí.…

  4. Čísla

    Refaktor s 1 393 agenty stál Nous Research asi 25 tisíc dolarů

    Hermes Agent v hlavním běhu vyslal 1 393 subagentů a po následných opravách vyšla modelová útrata asi na 25 000 dolarů. Nous Research uvádí pokles netestovacího Pythonu…