Přeskočit na obsah
Modely 3 min čtení

GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev

Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne rozměrů. Levný je proto, že z 45 vrstev si klíče a hodnoty ukládá jen jedenáct; zbylých 34 má lineární pozornost se stavem stálé velikosti.

Grafická karta držená v ruce
Váhy GLM-5.3-Flash zaberou 305,8 GiB, takže se ani ve formátu FP8 na jednu kartu nevejdou. Foto: Shixart1985, Wikimedia Commons (CC BY 2.0)

Repozitář s vahami modelu GLM-5.3-Flash vznikl na Hugging Face 25. srpna 2026 a den nato k němu firma Z.ai vydala oznámení. Slovo „Flash“ v názvu míří na cenu provozu, ne na rozměry: model nese 321,3 miliardy parametrů a jeho váhy zabírají v 62 souborech 328,3 GB. Licencí je MIT – 1 070 bajtů textu bez prahu obratu a bez pravidel přijatelného užití.

Klíče a hodnoty si pamatuje každá čtvrtá vrstva

Odkud se ta levnota bere, se dá přečíst z souboru config.json. Model má 45 vrstev a pole layer_types jim rozdává dva různé druhy pozornosti: 34 vrstev dostalo lineární, zbylých jedenáct řídkou. Ty řídké jsou vypsané jmenovitě – jsou to vrstvy 3, 7, 11 a tak dál po čtyřech až po 43.

Rozdíl mezi nimi je v paměti. Běžná pozornost si ke každému zpracovanému tokenu ukládá klíč a hodnotu do takzvané KV cache, tedy do vyrovnávací paměti, která roste s délkou rozhovoru. Lineární pozornost místo toho drží stav stálé velikosti a je jí jedno, jestli v kontextu leží tisíc tokenů, nebo milion. Okno má přitom GLM-5.3-Flash nastavené na 1 048 576 tokenů, takže je to rozdíl, na kterém při plném okně stojí celý provoz.

Z.ai to v oznámení vyčíslila proti svému staršímu modelu GLM-5.3: výpočet pozornosti klesl třikrát a KV cache 4,4krát. Ve stejném odstavci ale sama píše, že proti DeepSeeku V4-Flash a proti Kimi K3 je její KV cache pořád o něco větší a že tam zbývá prostor ke zlepšení.

Na jeden token připadá osmnáct miliard parametrů z 321

Druhá polovina úspory je ve směsi expertů. Konfigurace uvádí 288 směrovaných expertů a jednoho sdíleného, na každý token se z nich vybírá osm a první tři vrstvy zůstávají husté. Z celkových 321,3 miliardy parametrů se tedy na token použije osmnáct miliard, tedy 5,6 % – to je náš přepočet z čísel, která uvádí výrobce.

V paměti karet ale musí ležet všechny. Součet 62 souborů safetensors dává 328,3 GB, po přepočtu na binární jednotky 305,8 GiB, a 97,8 % parametrů je uloženo rovnou v osmibitovém FP8. Recept vLLM uvádí jako výchozí sestavu osm karet H200 se 141 GB paměti a mezi podporovaným hardwarem vede i starší H100 s 80 GB. Osm osmdesátigigabajtových karet dá dohromady 640 GiB, takže na samotné váhy to vyjde a na kontext zbývá zhruba polovina; kolik okna se do toho zbytku vejde, recept neříká.

Knihovnu, kterou karta jmenuje, model přerostl o jedno vydání

Karta se hlásí ke knihovně transformers a config.json u sebe uvádí verzi 5.16.0. Ta vyšla 26. srpna ve 12:35 UTC a architekturu glm5_next v sobě nemá; adresář s jejím kódem v té značce vydání vůbec není. Přibyl až návrhem změny číslo 48342, sloučeným téhož dne ve 14:26 UTC. O dvacet tři minut později vyšlo vydání 5.16.1 a jeho poznámky začínají větou, že jde o mimořádné vydání právě kvůli GLM.

U serverů pro inferenci je to zatím dál. Recept vLLM nenabízí číslo verze, ale zvláštní obraz vllm/vllm-openai:glm53-flash, a v hlavní větvi vLLM ani SGLangu jsme 27. srpna soubor pro tuhle architekturu nenašli. Kdo si chce model pustit u sebe, sahá tedy po připraveném obrazu, ne po vydané verzi serveru.

Před vydáním běžel na OpenRouteru beze jména

Z.ai v oznámení přiznává, že model před zveřejněním vah zkoušela anonymně pod označením Ox Alpha, a to na OpenRouteru a v nástroji OpenCode. O podmínkách toho zkušebního provozu jsme psali 24. srpna: bezplatný přístup byl vázaný na licenci, která provozovateli modelu dovoluje použít obsah požadavků k dalšímu trénování. Teď je jasné, komu ta data šla.

V katalogu OpenRouteru stálo 27. srpna 2026 devět poskytovatelů, skoro všichni s vahami ve FP8. Základní sazba je 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních; Z.AI, Novita a GMICloud k tomu téhož dne dávaly zaváděcí slevu 50 %. Starší GLM-5.3 tam stojí 1,40 a 4,40 dolaru, tedy zhruba devětkrát tolik.

Co z toho plyne

Tabulku testů, kterou oznámení doprovází, měřila Z.ai sama; jedinou výjimkou je řádek GDPval-AA v2, u kterého uvádí jako měřiče Artificial Analysis. Nezávislé zopakování zatím nikdo nezveřejnil. Oznámení končí provozním údajem: model prý týden obsluhoval klastr čínských akcelerátorů a proti výchozímu stavu na témž hardwaru se výkon zvedl třikrát. Který čip to je a od koho, v textu nestojí.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…