Přeskočit na obsah
Čísla 4 min čtení

Tabulka n-gramů drží ve vahách Qwen3.8-Flash-Next 51 miliard parametrů

Qwen zveřejnil váhy Qwen3.8-Flash-Next, na kterých chce postavit příští generaci svých modelů. Soubory nesou 179 999 981 459 parametrů a zaberou 360 GB. Přes 51 miliard z toho ale nic nepočítá: je to vyhledávací tabulka, kterou jde odsunout do operační paměti serveru.

Serverový paměťový modul DDR5 RDIMM od Micronu s kapacitou 64 GiB
Serverový modul DDR5 RDIMM o kapacitě 64 GiB. Tabulka n-gramů z Qwen3.8-Flash-Next se v BF16 vejde do dvou takových. Foto: PantheraLeo1359531, Wikimedia Commons (CC BY 4.0)

Repozitář Qwen/Qwen3.8-Flash-Next vznikl na Hugging Face 24. srpna 2026, oznámení k němu vyšlo o dva dny později. Qwen ho popisuje jako časný náhled architektury, na které má stát řada Qwen4 – tedy stejnou roli, jakou před rokem sehrál Qwen3-Next pro řadu Qwen3.5. Model bere na vstupu text i obrázky, nativně zvládá 262 144 tokenů kontextu a metodou YaRN se dá roztáhnout na milion.

Co v těch souborech doopravdy je

Váhy jsou rozsekané do 131 souborů. Jejich soupis model.safetensors.index.json uvádí total_size 359 999 963 128 bajtů, tedy 360 GB, a rozhraní Hugging Face k nim hlásí 179 999 981 459 parametrů. Každý soubor .safetensors nese v prvních bajtech hlavičku se jménem a tvarem každého tenzoru, takže se dá spočítat, kam ty parametry padnou, aniž se stáhne jediný gigabajt vah.

část modeluparametrůpodíl
experti MoE120,80 mld67,1 %
tabulka n-gramů51,20 mld28,4 %
modul MTP2,61 mld1,4 %
Gated DeltaNet2,09 mld1,2 %
vstupní a výstupní slovník1,27 mld0,7 %
gated residual0,64 mld0,4 %
řídká pozornost QSA0,62 mld0,3 %
obrazový kodér0,45 mld0,2 %
sdílený expert0,24 mld0,1 %

Součet sedí na poslední jednotku s číslem, které hlásí Hugging Face. Je to vlastní výpočet z hlaviček všech 131 souborů.

Padesát jedna miliard je jedna tabulka

Druhý řádek té tabulky stojí za řeč. Tenzory se jmenují ngram_embedding.shard_0shard_127, každý má 2 500 012 řádků po 160 číslech a všech 128 dílů sedí u jediné vrstvy blízko začátku sítě. Dohromady 320 001 536 řádků a 51 200 245 760 parametrů. V BF16 zabere 102,4 GB – do operační paměti serveru se to vejde, na akcelerátoru je to místo, které by jinak patřilo expertům.

Karta modelu k tomu uvádí slovník 20 milionů n-gramů, konfigurace osm hlav na n-gram a řeč je o bigramech i trigramech – dvacet milionů krát osm hlav krát dva řády dá 320 milionů řádků. V souborech jich je o 1 536 víc, protože se slovník zarovnává nahoru.

Rozdíl proti expertům MoE je v tom, co se s takovou tabulkou dělá. Nevynásobí se, jen se z ní podle několika předchozích tokenů vyzvedne pár řádků. Adresy jsou navíc známé dopředu, takže Qwen tabulku pokládá za součást vah, kterou lze držet v operační paměti hostitele a přednačítat ji souběžně s počítáním. Server SGLang na to má přepínač --ple-offload-embedding, který ji odsune do připnuté paměti procesoru a tahá ji vedlejším proudem CUDA; u vah v BF16 na kartách NVIDIA se zapíná sám. Na kartách pak zbyde 128,8 miliardy parametrů, tedy 257,6 GB.

Na token se použije šest miliard

Model má 48 vrstev, skrytý rozměr 2 560 a 512 expertů, z nichž se na token pustí deset plus jeden sdílený. Tři ze čtyř vrstev jsou Gated DeltaNet, čtvrtá počítá řídkou pozornost QSA – v konfiguraci je to 36 lineárních vrstev proti dvanácti s plnou pozorností.

Kolik z těch 180 miliard se na jeden token opravdu vynásobí, jde dopočítat: deset z 512 expertů dá napříč vrstvami 2,36 miliardy, k tomu sdílený expert 0,24, Gated DeltaNet 2,09, řídká pozornost 0,62, gated residual 0,64 a směrovač 0,06. Dohromady 6,0 miliardy, což je přesně číslo, které Qwen uvádí jako počet aktivovaných parametrů. Vlastní přepočet mu tedy dává za pravdu.

Čím se to dá spustit

V konfiguraci stojí architektura Qwen4ExpForConditionalGeneration, kterou vydané verze knihovny Transformers do 26. srpna neznaly. Přidal ji návrh změny 48337 sloučený 26. srpna 2026 ve 12:03 UTC a vydání v5.16.0, které vyšlo o dvaatřicet minut později, už příslušné soubory obsahuje.

Server SGLang dostal kuchařku k modelu týž den, jeho návod ale zatím posílá uživatele stavět podporu z větve, protože ve vydané verzi není. Ověřených sestav je v ní dvaadvacet a všechny se vejdou do jednoho stroje: BF16 i FP8 běží na čtyřech kartách, na akcelerátorech AMD na osmi, a po kvantizaci do NVFP4 na jediné kartě Blackwell. Qwen vedle výchozích vah vydal i variantu Qwen3.8-Flash-Next-FP8; má tytéž parametry, ale 174,5 miliardy z nich je v osmibitovém formátu, takže soubory spadnou na 185,5 GB.

Licence a cena

Soubor LICENSE v repozitáři nese Qwen Community License 1.0. Otevřený zdroj to není: kdo modelem obslouží produkt s víc než 100 miliony uživatelů měsíčně nebo 20 miliony dolarů měsíčních tržeb, musí jméno modelu viditelně uvést v jeho rozhraní, a kdo provozuje pronájem modelu jako služby nebo asistenta pro programování a kancelářskou práci, potřebuje od Qwenu licenci zvlášť. Vlastní licenci má Qwen na svých vahách od letošního srpna, dřív vydával pod Apache 2.0.

Hostovanou obdobu pod jménem Qwen3.8-Flash chce Qwen prodávat za 0,16 USD za milion vstupních tokenů a 0,47 USD za milion výstupních. Zatím jde o ohlášenou cenu: oznámení samo píše, že rozhraní teprve přijde, a stránka toho modelu na webu Qwen Cloudu vrací 404.

Co z toho plyne

Srovnávací tabulka v oznámení vede Qwen3.8-Flash-Next jako model se 125 miliardami parametrů a tabulku n-gramů má v samostatném řádku. Číslo v první řádce tedy neříká, kolik se toho musí stáhnout ani kolik paměti to spolyká – to řeknou až soubory samotné, a u nich vychází 360 GB. Výsledky testů, kterými Qwen model doprovodil, měřil zatím jen on sám.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  2. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  3. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  4. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…