Přeskočit na obsah
Čísla 3 min čtení

Globální KV cache DeepSeeku V4.1 Flash zabere při milionu tokenů 890 MiB

DeepSeek zveřejnil váhy multimodálního modelu V4.1 Flash s kontextem dlouhým 1 048 576 tokenů. Globální KV cache ukládá 890 bajtů na token, takže při zaplnění celého okna zabere přesně 890 MiB. Je to vlastní výpočet z údajů výrobce, nikoli změřená spotřeba celého serveru.

Kruhová skříň superpočítače Cray-2 vedle jeho chladicí jednotky
Superpočítač Cray-2 v muzejní expozici. Foto: David.Monniaux, Wikimedia Commons (CC BY-SA 3.0)

DeepSeek 10. září 2026 zveřejnil váhy modelu V4.1 Flash. Den předtím šlo jen o časově omezenou betu v placeném rozhraní; TechNode doložil formální vydání až následující ráno. Nová verze navazuje na srpnový experimentální model pro text a obrázky, tentokrát ale přidává otevřené váhy, technickou zprávu a přesný účet paměti pro dlouhý kontext.

Model přijímá text i obrázky a má kontextové okno 1 048 576 tokenů. DeepSeek u něj uvádí 552 miliard parametrů v hlavní části modelu a dalších 196 miliard v podmíněné paměti Engram. Při zpracování vstupu se podle výrobce aktivuje osm miliard parametrů na token, při vytváření odpovědi šestnáct miliard. Tato čísla pocházejí z karty modelu; nejde o nezávisle zopakované měření.

Jeden token znamená 890 bajtů globální cache

KV cache uchovává klíče a hodnoty, které už model při práci s konverzací spočítal. Bez ní by při každém novém tokenu znovu procházel celý předchozí text. U dlouhých kontextů proto paměť nezabírají jen váhy modelu: s každým tokenem roste i stav rozpracované konverzace.

Nezávislý rozbor MarkTechPostu potvrzuje údaj 890 bajtů globální KV cache na token. Výpočet pro celé okno je přímočarý: 890 × 1 048 576 dává 933 232 640 bajtů. Protože jeden MiB má právě 1 048 576 bajtů, vyjde přesně 890 MiB na jednu zaplněnou relaci.

Předchozí DeepSeek V4 Flash ukládal 3 514 bajtů na token. Při stejně dlouhém kontextu by jeho globální KV cache zabrala 3 514 MiB, tedy přibližně 3,43 GiB. Rozdíl činí 2 624 MiB neboli 2,56 GiB na každou relaci, která využije celé milionové okno. Všechna tři čísla jsou vlastní dopočet z hodnot na token; serverová režie, dočasné pracovní plochy ani paměť pro váhy v nich nejsou.

Čtyři vrstvy počítají cache pro zbytek modelu

První úsporu dělí příčinný kodér a dekodér. Čtyřicet vrstev se rozdělilo na dvacet vrstev kodéru a dvacet vrstev dekodéru. Při prvním zpracování promptu projde token jen kodérem. Globální cache dekodéru se pak promítne z jeho posledního skrytého stavu, místo aby ji všech dvacet vrstev dekodéru počítalo samostatně.

Druhou část nese Compressed Sparse Attention 2. Její vrstvy mají tři pevné režimy. Režim Full spočítá vlastní hlavní klíče a hodnoty i indexy vybraných tokenů. Reindex převezme cache z předchozí plné vrstvy, ale tokeny znovu ohodnotí. Reuse převezme obojí. Konfigurace modelu jmenuje jako zdroj hlavní cache vrstvy 2, 8, 14 a 20; dalších šestatřicet vrstev ji tedy nevytváří od nuly.

Hlavní KV cache je navíc uložená ve čtyřbitovém formátu FP4. Krátká pozornost s oknem 128 tokenů má vlastní stav, ten však model nemusí trvale držet pro celý kontext. Když chybí, znovu přehraje jen posledních 128 tokenů. Údaj 890 bajtů proto popisuje globální cache, nikoli každý kus paměti, který inference používá.

Samotné váhy mají 510,3 gigabajtu

Rozdíl mezi cache a celou spotřebou je u tohoto modelu podstatný. Veřejný výpis souborů Hugging Face vede 48 částí vah. Jejich velikosti dávají po sečtení 510 296 708 312 bajtů, tedy 510,3 GB nebo 475,3 GiB. To je účet za soubory na disku; pro běh přibudou pracovní plochy, aktivace a další cache.

Váhy i doprovodný kód jsou pod licencí MIT. Karta přitom nedává běžnou šablonu konverzace ve formátu Jinja. Místo ní obsahuje vlastní referenční kodér pro zprávy, volání nástrojů, průběžné uvažování a obrázky. Provozovatel tedy neřeší jen stažení půl terabajtu vah, ale také přesné sestavení vstupu.

Číslo 890 MiB je užitečné pro plánování kapacity, nesmí se však zaměnit za požadavek na celý server. Říká, kolik zabere globální KV cache jedné relace s plným kontextem. Vedle ní zůstává téměř půl tebibajtu souborů vah a další paměťové položky, které karta modelu do tohoto údaje nepočítá.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Modely Flare a Sunburst z GPT Image 2.5 mají stejné sazby za token

    OpenAI rozdělila GPT Image 2.5 do dvou modelů pro API. Flare má rychleji obsloužit běžné generování, Sunburst má přesněji upravovat obraz; sazby za textové i obrazové…

  2. Čísla

    Pydantic AI 2.40 po zapnutí každou hodinu stahuje 1 678 cenových položek

    Pydantic AI 2.40 přidala volitelné stahování cen modelů hned po startu a potom každou hodinu. Při našem testu se seznam rozšířil z 1 646 na 1 678 položek; výpadek…

  3. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  4. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…