Přeskočit na obsah
Čísla aktualizováno 10. 8. 2026 3 min čtení

LongCat-Flash-Lite-Sparse má pod MIT 138 GB vah a plné okno přidá dalších 16 GB

Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Má 69 miliard parametrů, licenci MIT bez jakýchkoli prahů a kontextové okno 983 040 tokenů, tedy o něco méně, než kolik karta modelu slibuje. Z konfigurace jsme spočítali, kolik paměti si vezmou váhy a plný kontext a o kolik model povyrostl proti husté verzi.

Serverovna v CERNu
Serverovna v CERNu. Váhy modelu LongCat-Flash-Lite-Sparse mají 138,3 GB, takže se na jednu akcelerátorovou kartu vejdou, ale bez místa na dlouhý kontext. Foto: Florian Hirzinger, Wikimedia Commons (CC BY-SA 3.0)

Čínský Meituan dal 31. července na Hugging Face váhy modelu LongCat-Flash-Lite-Sparse. Karta modelu ho popisuje jako model se směsí odborníků, tedy takový, kde se na každý token zapojí jen část sítě: z 69 miliard parametrů zhruba tři miliardy. Soubor LICENSE v repozitáři je holá licence MIT, bez prahu na tržby i bez prahu na počet uživatelů. Karta k ní dodává jedinou výhradu: práva k ochranným známkám a patentům Meituanu z ní neplynou.

Pod touž licencí vyšel týž den i ostrý DeepSeek V4-Flash, jehož váhy mají 166,9 GB. Souvislost je i technická: řídká pozornost Meituanu je podle karty rozšířením DeepSeek Sparse Attention.

Indexer řídké pozornosti stál 109 megabajtů

Model navazuje na LongCat-Flash-Lite z 27. ledna a liší se podle karty jedinou věcí: hustou pozornost nahradila vlastní řídká, kterou výrobce označuje LongCat Sparse Attention (LSA). Porovnání obou souborů config.json to potvrzuje. Shodují se v šířce (3072), v počtu vrstev (14), v počtu odborníků (256 a k tomu 128 „nulových“, které vstup jen propustí) i v tom, že se na token vybírá dvanáct z nich. Přibyla jen pole s předponou index_, tedy nastavení výběru tokenů.

Kolik ten výběr váží, se dá spočítat z rejstříků vah. Hustá verze v něm uvádí 138 179 712 000 bajtů, řídká 138 288 833 280. Rozdíl je 109 121 280 bajtů, tedy 109 MB – necelá desetina procenta celku, a při šestnáctibitových vahách zhruba 55 milionů parametrů. Vlastní přepočet z obou souborů.

Z okna 983 040 tokenů se čte 2 048

Karta mluví o nativní podpoře kontextu až do jednoho milionu tokenů. V config.json má pole max_position_embeddings hodnotu 983 040, což je o 1,7 % méně. Číslo není náhodné: je to 8 192 krát 120, tedy základní okno roztažené postupem YaRN s činitelem 120, který stojí o pár řádků níž v témže souboru. Hustý předchůdce měl 327 680, okno se tedy ztrojnásobilo přesně.

Rozdíl mezi zaokrouhleným slibem a nastavením není v oboru nový. Podobně se rozešel údaj o milionu tokenů u modelu Laguna S 2.1 s tím, na co byly nastavené balíčky, které k němu výrobce sám nabízel.

Řídká pozornost znamená, že se dotaz nedívá na celé okno. Rozpočet výběru je v config.json zapsaný jako index_topk s hodnotou 2048; podle názvů dalších polí z něj připadá 1024 na okolí právě zpracovávaného místa a 16 na začátek textu, zbytek vybírá indexer podle obsahu. Při plném okně je to 0,21 % dostupných tokenů (vlastní výpočet). Karta k tomu popisuje tři doplňky: přesun části rozpočtu na pevné okolí kvůli souvislému čtení z paměti, sdílení jednoho výběru mezi sousedními vrstvami a dvoustupňové skórování od hrubého k jemnému, které jde zapnout až při běhu.

Kolik paměti si to vezme

Váhy zaberou 138,3 GB. Kontext se k nim počítá zvlášť a u tohohle modelu vychází nezvykle malý, protože používá pozornost s latentním klíčem a hodnotou: z konfigurace plyne 512 plus 64 čísel na token a vrstvu. Ve formátu bfloat16, který si vyžádá spouštěcí příkaz uvedený v kartě, to je 16 128 bajtů na jeden token, při plném okně 15,9 GB. Dohromady s vahami 154 GB. Obojí je vlastní výpočet z údajů v konfiguraci.

Karta u nasazení píše, že se LongCat-Flash-Lite dá obsloužit na jednom uzlu, a jako příklad uvádí H20 se 141 GB. Ta věta se týká hustého předchůdce a mluví o uzlu, ne o jediné kartě, a na tom rozdílu záleží: samotné váhy by se na kartu se 141 GB vešly, plný kontext k nim už ne.

Naměřil to výrobce sám

Tabulka v kartě staví řídkou verzi proti husté. U agentního programování uvádí na SWE-Bench Verified 68,20 proti 54,40, u práce s nástroji na τ²-Telecom 95,18 proti 72,80. Obecné znalosti zůstávají na svém: MMLU 85,31 proti 85,52. Všechna čísla naměřil Meituan a údaje za hustou verzi navíc přebírá z její vlastní technické zprávy z 29. ledna, ne z jednoho společného měření. Nikdo nezávislý je zatím nezopakoval.

Ta lednová zpráva stojí za přečtení i kvůli něčemu jinému. Popisuje, že hustý předchůdce má 68,5 miliardy parametrů a přes 30 miliard z nich je v tabulkách vnoření, ne v odbornících. Řídká verze má v konfiguraci tentýž poměr, takže nejméně dvě pětiny těch 138 GB nepočítají nic, jen se z nich vyhledává.

V SGLangu je zatím otevřený návrh

Karta odkazuje na návrh změny 32918 v SGLangu. K 2. srpnu je otevřený a nesloučený, mění tři soubory o 26 přidaných řádcích a automatické zkoušky u něj neprošly; vyplývá to z rozhraní GitHubu. Vlastní repozitář s kódem model zatím nemá, přestože jich účet meituan-longcat vede sedmatřicet. Technická zpráva k řídké verzi leží jako PDF přímo v repozitáři na Hugging Face.

Za pozornost stojí poměr, který se z těch čísel skládá. Na jeden token se použijí 4,3 % parametrů, do paměti se ale musí vejít všech 138 GB, a řídká pozornost na tom nic nemění: šetří práci s kontextem, ne místo pro váhy. Podle nás je to hlavní důvod, proč se údaj o aktivních parametrech nedá číst jako nárok na hardware, i když se tak často cituje.

Zdroje: karta modelu, konfigurace a licence na Hugging Face, karta a konfigurace husté verze, technická zpráva na arXivunávrh změny v SGLangu.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  2. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  3. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  4. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…