Všech osm příkazů v návodu k Intern-S2-397B spouští jeho osmibitovou verzi
Laboratoř InternLM doplnila 24. září k modelu Intern-S2-397B návod na nasazení. Všech osm příkazů v něm ale sahá do jiného repozitáře, než ve kterém návod leží: spouštějí osmibitovou verzi o 406,25 GB místo zveřejněných 806,86 GB. Serveru pak tytéž příkazy nastaví jméno modelu, jehož váhy nenačetly.
Laboratoř InternLM nahrála 13. září 2026 na Hugging Face váhy modelu Intern-S2-397B. Je to multimodální model se směsí expertů pod licencí Apache 2.0: šedesát vrstev, 512 expertů, z nichž se na každý token zapojí deset, a nativní okno 262 144 tokenů. Karta modelu mluví o vědeckých úlohách a dlouhoběžících agentech. O hardwaru v ní nestojí ani slovo.
Návod na nasazení přibyl do repozitáře až 24. září, tedy jedenáct dní po vahách. Doporučuje uzel s osmi kartami H100 nebo H200 a nabízí hotové příkazy pro tři servery: LMDeploy, vLLM a SGLang. Osm z nich načítá model a všech osm sahá do jiného repozitáře, než ve kterém návod leží.

Osm příkazů a jeden repozitář navíc
Soubor deployment_guide.md má 4 373 bajtů a devět ukázek. První spouští proxy LMDeploy a žádné váhy nenačítá; zbylých osm ano, z toho tři pro LMDeploy, tři pro vLLM a dvě pro SGLang. V každém z těch osmi stojí jako cesta k vahám internlm/Intern-S2-FP8. Je to zkrácené jméno, které Hugging Face přesměruje kódem 307 na repozitář Intern-S2-397B-FP8.
Ten vznikl 11. září, o dva dny dřív než repozitář se šestnáctibitovými vahami, a 12. září do něj laboratoř přidala kartu modelu spolu s návodem. Oba návody mají 4 373 bajtů a neliší se ani bajtem: do hlavního repozitáře se o dvanáct dní později zkopíroval beze změny, i s odkazy na ten druhý.
Plné váhy se do osmi karet H100 nevejdou
Rozhraní Hugging Face vydá velikost každého souboru, takže se váhy dají sečíst bez stahování. Hlavní repozitář má 188 souborů .safetensors o 806 859 499 264 bajtech, tedy 806,86 GB neboli 751,45 GiB. Verze FP8 má 95 souborů a 406 250 846 376 bajtů, tedy 406,25 GB. Obojí je vlastní součet z výpisu repozitářů, ne údaj z karty modelu.
Parametrů je v obou případech stejně, 403 423 094 768. Liší se datový typ. V hlavním repozitáři leží skoro všechny ve formátu BF16, tedy po dvou bajtech. Ve verzi FP8 jich 400 719 609 856 zabírá po jednom bajtu a zbylé 2,7 miliardy zůstaly šestnáctibitové.
Teď aritmetika. NVIDIA uvádí u H100 dvě kapacity: 80 GB u provedení SXM a 94 GB u karty do PCIe. Osm karet tedy dá 640, nebo 752 GB, a ani jedno na 806,86 GB nestačí – to ještě bez KV cache a bez aktivací. H200 má 141 GB, osmice tedy 1 128 GB; tam se plné váhy vejdou a zbude 321 GB. Verze FP8 projde všude a na osmi kartách po 80 GB po ní zbývá 234 GB.
Návod přitom obě sestavy jmenuje jedním dechem, jako by byly zaměnitelné. Zaměnitelné jsou jen pro tu verzi vah, kterou spouští. Podobně počítal i starší model Hy4 preview od Tencentu, u kterého se na osm karet po 80 GB nevešla ani kvantizovaná verze.
Jméno v odpovědi serveru patří jiným vahám
Ve druhém řádku každého z osmi příkazů stojí přepínač --served-model-name, u LMDeploy --model-name, a jeho hodnota je internlm/Intern-S2-397B. Zdrojový kód vLLM u téhle volby říká, že takové jméno se objeví v poli model v odpovědi rozhraní a zároveň ve značce model_name u metrik pro Prometheus.
Server postavený přesně podle návodu tedy hlásí jméno šestnáctibitového modelu a počítá pod ním s osmibitovými vahami. Komu jde o rychlost, tomu to nevadí. Komu jde o srovnání naměřených čísel nebo o záznam, čím která odpověď vznikla, tomu ano: rozdíl mezi BF16 a FP8 se na výsledcích projevit může a z názvu v logu se nepozná.
Co návod naopak nežádá
Verze nástrojů, které předepisuje, jsou všechny vydané. LMDeploy chce 0.14.0 a novější, poslední vydání je 0.17.0 z 1. září. vLLM chce 0.22.1, poslední je 0.30.0 z 22. září. SGLang chce 0.5.13, poslední je 0.5.20 z 18. září. Nic se nemusí instalovat z rozpracované větve, což u čerstvě vydaného modelu není samozřejmost.
Otevřené jsou i samotné váhy. Oba repozitáře stojí pod licencí Apache 2.0, tedy bez prahů podle obratu a bez zákazu komerčního užití. Verze FP8 není nic utajeného: visí ve stejné organizaci a návod na ni odkazuje přímo v příkazech. Jen to nikde nestojí slovy, takže kdo příkaz zkopíruje, spustí něco jiného, než co si podle karty modelu stáhl.
Dlouhý kontext má v návodu dvě různé meze. Konfigurace modelu udává 262 144 tokenů, ukázka pro LMDeploy nastavuje 512 000 a ukázka pro vLLM 1 010 000; obě si okno roztahují přepsáním parametrů YaRN s násobkem 4. Proč jsou ta dvě čísla různá, návod nevysvětluje.
Zdroje
- Hugging Face: internlm/Intern-S2-397B – karta modelu,
config.jsonadeployment_guide.md, 24. 9. 2026 - Hugging Face: internlm/Intern-S2-397B-FP8 – karta modelu a návod k nasazení, 12. 9. 2026
- Hugging Face: výpis souborů a velikostí obou repozitářů přes rozhraní API
- vLLM: vllm/config/model.py – popis volby
served_model_name - NVIDIA: H100 a H200 – kapacita paměti
- ModelScope: Shanghai_AI_Laboratory/Intern-S2-397B