Přeskočit na obsah
Modely 3 min čtení

DeepSeek vydal V4-Pro, který si draft model pro zrychlení nese přímo ve vahách

DeepSeek vydal 13. srpna 2026 ostrou verzi modelu DeepSeek-V4-Pro-0813 pod licencí MIT. Hlavní novinkou je modul DSpark, který navrhuje tokeny dopředu a jehož váhy neleží v samostatném souboru, ale uvnitř týchž 66 souborů jako model sám. Ty mají dohromady 892,7 GB.

Řady serverových skříní v sále britského Národního archivu
Serverovna britského Národního archivu. Foto: The National Archives (UK), Wikimedia Commons (CC BY 3.0)

DeepSeek zveřejnil 13. srpna 2026 na Hugging Face váhy modelu DeepSeek-V4-Pro-0813. Karta modelu ho popisuje jako ostrou verzi, která nahrazuje dřívější preview, a jako hlavní změnu uvádí připojený modul DSpark. Licence je MIT stejně jako u červencového V4-Flash; stojí to v souboru LICENSE v repozitáři, ne jen v oznámení.

Draft model leží v týchž souborech jako model sám

Spekulativní dekódování je postup, kterým se běh modelu zrychluje: malý a rychlý model, anglicky draft model, navrhne několik tokenů dopředu a velký model je pak jedním průchodem buď potvrdí, nebo zahodí. Obvykle to znamená stáhnout dva checkpointy, jeden velký a jeden malý.

U V4-Pro to tak není. Návod pro SGLang na kartě modelu výslovně říká, že se nemá zadávat samostatná cesta --speculative-draft-model-path, protože cílové i draft váhy pocházejí z téhož checkpointu. Potvrzuje to i kód vLLM: v souboru vllm/config/speculative.py je u větve pro DSpark komentář, že tahle metoda umí dodat váhy uvnitř cílového checkpointu, a o pár set řádků níž, že DeepSeek-V4 používá pro draft tutéž konfiguraci jako model sám.

Kolik místa modul zabere, DeepSeek neuvádí. Z konfigurace jde vyčíst jen to, jak je postavený: dspark_target_layer_ids jmenuje vrstvy 58, 59 a 60, tedy tři poslední z 61, dspark_block_size je 5 a dspark_markov_rank 512. Návod pro vLLM doporučuje navrhovat sedm tokenů dopředu.

DSpark není jen věc DeepSeeku

Ta metoda není nová a nepatří jen tomuhle modelu. vLLM zná v téže části kódu i architektury Qwen3DSparkModel, Gemma4DSparkModelK3DSparkModel a jako příklad odkazuje na repozitář deepseek-ai/dspark_qwen3_8b_block7, který na Hugging Face leží od 28. června 2026. SGLang má na DSpark vlastní adresář o dvanácti souborech. Rozdíl je v tom, že u těch ostatních modelů zůstává draft samostatný; u V4-Pro ne.

892,7 GB vah

Váhy jsou v 66 souborech formátu safetensors a jejich součet je 892 744 322 880 bajtů, tedy 892,7 GB. Je to náš součet velikostí ze seznamu souborů, který vydá rozhraní Hugging Face. Pro srovnání: V4-Flash z 31. července má 48 souborů a 166 886 535 336 bajtů, tedy 166,9 GB. Pro je proti němu 5,3× větší.

Právě tohle číslo rozhoduje, kde model poběží. Uzel s osmi kartami po 80 GB má dohromady 640 GB, takže na samotné váhy nestačí, natož na keš klíčů a hodnot. Karta modelu proto uvádí jako příklad uzel se čtyřmi kusy NVIDIA GB300 a odkazuje na recepty vLLM a na kuchařku SGLangu. Sami jsme model nespouštěli, tyhle nároky jsou z dokumentace.

Váhy nejsou v plné přesnosti. Konfigurace uvádí u expertů expert_dtype rovné fp4, tedy čtyři bity na parametr, a u zbytku kvantizaci fp8 ve formátu e4m3 po blocích 128×128. Model má 61 vrstev, 384 směrovaných expertů a jednoho sdíleného; na každý token se z nich vybere šest.

Tabulku výsledků měřil výrobce sám

Karta modelu srovnává V4-Pro-0813 v deseti testech se staršími verzemi i s cizími modely. Všechna čísla naměřil DeepSeek, u agentních úloh vlastním nástrojem DeepSeek Harness v režimu minimal, s nastavením temperature 1.0top_p 0.95 a s nejvyšší úrovní uvažování. Dvě řady z deseti jsou navíc vnitřní testovací sady firmy, DSBench-FullStack a DSBench-Hard, které zvenčí zopakovat nejde. Nezávislé měření zatím není.

Milion tokenů kontextu a žádná šablona chatu

Konfigurace udává max_position_embeddings 1 048 576, tedy milion tokenů; rozšíření obstarává YaRN s faktorem 16 z původních 65 536. Technická zpráva na arXivu z 26. dubna 2026 popisuje ještě verzi preview: Pro má podle ní 1,6 bilionu parametrů, z nichž je 49 miliard aktivních, a předtrénovala se na víc než 32 bilionech tokenů. K ostré verzi vlastní zpráva zatím nevyšla.

Jedna věc zůstala stejná jako u Flashe: repozitář nemá šablonu chatu ve formátu Jinja. Místo ní je v něm adresář encoding s pythonovými skripty, které převedou zprávy ve formátu OpenAI na vstupní řetězec a výstup zase zpátky. Parametr reasoning_effort nově zná tři stupně: low, highmax. Pro dva vyšší z nich doporučuje karta modelu počítat s výstupem až 384 tisíc tokenů.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…