Přeskočit na obsah
Čísla aktualizováno 10. 8. 2026 2 min čtení

DFlash v hlavní větvi Ollamy zrychlil Lagunu-S při úpravách o 59 %, u prózy ji zpomalil

Ollama přidala 8. srpna do hlavní vývojové větve blokové spekulativní dekódování DFlash pro modely Laguna. V jejím měření na M5 Max vzrostla rychlost Laguny-S při úpravách textu ze 72,4 na 115,3 tokenu za sekundu, zatímco u prózy klesla ze 75,4 na 74,6. Přínos stejné techniky se tedy podle úlohy lišil od poklesu o 1,1 procenta po růst o 59,3 procenta.

Ollama přidala 8. srpna do hlavní vývojové větve podporu DFlash pro modely Laguna. DFlash je blokové spekulativní dekódování: menší pomocný model připraví několik dalších tokenů naráz a hlavní model je následně ověří. Smyslem je omezit počet pomalých kroků, při kterých velký model vytváří výstup po jednom tokenu.

Černý MacBook Pro s čipem Apple M5 na dřevěném stole
MacBook Pro s čipem M5. Snímek je ilustrační, Ollama měřila na výkonnější variantě M5 Max. Foto: AzureSaturn, Wikimedia Commons (CC0)

Čísla zveřejněná přímo v commitu s podporou Laguny ale ukazují, že DFlash není automatická zkratka k vyšší rychlosti. U menší Laguny-XS pomohl jen mírně a u jedné úlohy dokonce ubral. U Laguny-S se rozdíl rozevřel od malého zpomalení po téměř šedesátiprocentní zrychlení.

Šest měření, dva pomalejší výsledky

Ollama porovnala běžné dekódování s DFlash na M5 Max. Cílový i pomocný model byly ve formátu NVFP4, teplota byla 0,8 a penalizace opakování 1,1. Test zahrnoval prózu, kód a úpravu textu. Rychlost je uvedená v tokenech za sekundu:

  • Laguna-XS, próza: 139,4 bez DFlash a 142,3 s DFlash;
  • Laguna-XS, kód: 139,7 a 139,2;
  • Laguna-XS, úpravy: 137,3 a 145,1;
  • Laguna-S, próza: 75,4 a 74,6;
  • Laguna-S, kód: 70,0 a 80,8;
  • Laguna-S, úpravy: 72,4 a 115,3.

Procenta jsme přepočítali jako rozdíl rychlostí dělený rychlostí bez DFlash. U Laguny-S při úpravách tedy platí (115,3 − 72,4) / 72,4 × 100 = 59,3 %. Stejným výpočtem vychází u kódu plus 15,4 % a u prózy minus 1,1 %. U Laguny-XS jsou změny plus 2,1 %, minus 0,4 % a plus 5,7 %.

Největší číslo tak nepopisuje model obecně. Patří jedné velikosti modelu, jedné úloze a jednomu počítači. Commit neuvádí použité výzvy, délku odpovědí ani počet opakování, takže z něj nelze určit rozptyl měření. Je to výsledek vývojářů Ollamy, ne naše nezávislé měření.

Pomocný model si půjčuje části hlavního

Implementace vznikla ve třech souvisejících commitech. První přidává pomocný model DFlash, který nemá vlastní tabulku tokenů ani výstupní vrstvu a půjčuje si je od cílového modelu. Druhý přidává samostatné blokové sezení: pomocný model navrhne celý blok v jednom průchodu, výsledky se vyberou dávkově a nepřijatá část se z mezipaměti vrátí zpět.

Třetí commit propojuje DFlash právě s Lagunou. Hlavní model předává pomocnému výstupy vybraných vrstev a zpřístupňuje mu vstupní i výstupní převod tokenů. Při načtení se zároveň kontroluje šířka skrytých vrstev, slovník i pozice vrstev, ze kterých pomocný model čerpá. Neodpovídající dvojice proto nemá projít jako funkční.

DFlash už není zvláštnost jednoho programu

Že nejde o pojmenování vymyšlené jen pro Ollamu, potvrzují dvě nezávislé implementace. NVIDIA přidala podporu pomocného DFlash modelu pro Lagunu do TensorRT-LLM už 14. července. Změna zahrnuje kód pro Lagunu, spekulativní dekódování i testy přesnosti.

Také dokumentace SGLang uvádí DFlash mezi podporovanými způsoby spekulativního dekódování. Popisuje ho jako samostatný pomocný model s lineárním ověřením bloku a upozorňuje na omezení: nelze současně zapnout některé režimy paralelismu a plánování. SGLang tedy potvrzuje princip a praktické použití, nikoli rychlost naměřenou Ollamou.

Pro uživatele je podstatnější rozpětí výsledků než rekordních 59,3 %. V téže tabulce jsou dvě zpomalení, dvě jednociferná zrychlení a teprve u Laguny-S při kódu a úpravách přichází větší zisk. DFlash má proto smysl hodnotit na vlastních výzvách; samotné zapnutí ještě nezaručuje rychlejší odpověď.

Zdroje: tři commity projektu Ollama z 8. srpna 2026, commit projektu TensorRT-LLM ze 14. července 2026 a dokumentace projektu SGLang. Procentní rozdíly jsou náš přepočet ze zdrojových hodnot Ollamy.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  2. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  3. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  4. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…