Přeskočit na obsah
U sebe doma 4 min čtení

Nejstahovanější převod modelu Clef do GGUF nemá rozhodovací hlavu

Cloudflare zveřejnil 30. září rozhodovací modely Clef a Clef-Flash, které místo textu vracejí pravděpodobnosti voleb. Počítá je zvláštní hlava se 128 miliony parametrů. V převodech do GGUF od uživatele bartowski, které mají na Hugging Face nejvíc stažení, chybí a soubory se hlásí jako obyčejný Qwen.

Cloudflare nahrál 30. září 2026 večer na Hugging Face dva modely, Clef a Clef-Flash, a druhý den je ohlásil na svém blogu. Nejsou to modely na psaní textu. Dostanou popis situace a sadu otázek s vyjmenovanými odpověďmi, třeba „který tým má tiket řešit“ nebo „je služba mimo provoz“, a ke každé možnosti vrátí pravděpodobnost. Cloudflare jim říká rozhodovací modely. Podobný přístup už dřív zvolil InternLM u modelů Intern-Decision, které odpověď odečítají přímo z logitů jazykového modelu. Clef na to má vlastní vrstvu navíc, a právě ta se při převodu pro běh u sebe dá snadno ztratit.

Police plné rozsvícených lávových lamp na stěně kanceláře
Stěna lávových lamp v kanceláři Cloudflaru, prosinec 2022. Foto: F ASTILY, Wikimedia Commons (CC BY-SA 4.0)

Rozhodnutí počítá hlava, ne jazykový model

Základem Clefu je Qwen3.8-27B, menší Clef-Flash stojí na starším Qwen3.5-9B. Podle blogu Cloudflare obě páteře zmrazil a doučil k nim adaptéry LoRA s hodností 256 spolu se samostatnou hlavou. Ta čte skryté stavy z poslední vrstvy páteře a každé povolené možnosti přidělí jedno číslo. Text se přitom negeneruje ani po tokenech: celý dotaz projde sítí jednou a oskórují se naráz všechny možnosti všech otázek.

V repozitáři leží hlava zvlášť jako soubor joint_head.safetensors o velikosti 256 MB. Podle hlavičky toho souboru obsahuje 122 tenzorů a dohromady 128 056 324 parametrů ve formátu BF16, konfigurace k ní uvádí čtyři vrstvy o šířce 1 024 se šestnácti hlavami pozornosti. Spouští ji přibalený skript joint_schema_model.py. Karta modelu uvádí, že ho Cloudflare zkoušel s knihovnami torch 2.11 a transformers 5.10.2 na jedné kartě H200.

Převod od bartowski nese jen páteř

Uživatel bartowski nahrál 1. října převody Clefu do GGUF ve 24 kvantizacích a v plném BF16. Podle jeho karty vznikly nástroji llama.cpp ve verzi b11279 z 30. září, tedy dřív, než llama.cpp architekturu Clefu znal. Hlavičku souboru Q4_K_M jsme přečetli rozsahovým dotazem: architektura je zapsaná jako qwen35, tenzorů je 851 a mimo bloky páteře v souboru zbývají jen vstupní embedding, závěrečná normalizace a klasická výstupní vrstva pro předpověď dalšího tokenu. Rozhodovací hlava tam není. Převod Clef-Flash od téhož autora vypadá stejně, 427 tenzorů s architekturou qwen35.

Návod na kartě k tomu radí spustit model přes llama-server a jeho vestavěné chatovací rozhraní. Kalibrační text pro kvantizaci složil z běžné prózy a z konverzací s voláním nástrojů. Takový soubor llama.cpp načte jako obyčejný jazykový model, který odpovídá textem. Pravděpodobnosti voleb, kvůli kterým Clef vznikl, z něj nedostanete, protože vrstva, která je počítá, v souboru chybí. Soubory jsme nespouštěli, plyne to z jejich hlavičky.

Podle počítadla Hugging Face ke 4. říjnu má bartowskiho převod Clefu 20 514 stažení a převod Clef-Flash 10 014. Mezi převody Clefu do GGUF je to nejvíc. Počet stažení ovšem neříká, kolik lidí soubor opravdu použilo.

Hlavu nesou převody ggml-org a Ollama

Podporu do llama.cpp dopsal vývojář s přezdívkou ngxson v návrhu změny #29831, sloučeném 3. října v 0:50 UTC. První vydání, které ji obsahuje, je b11371 z téhož dne. Hlava tam nečte výstup po jednom tokenu, ale průměruje úseky vstupu, které patří otázce a jednotlivým možnostem, takže llama.cpp k tomu dostalo novou funkci na jejich označení. Podpora je zatím jen textová, obrázky čekají na jiný návrh, a v jedné dávce smí být jen jedna sekvence.

Převody od ggml-org, nahrané 2. října, mají v hlavičce architekturu clef, klíče clef.decision.* a 1 011 tenzorů, tedy o 160 víc než soubor od bartowski. Karta výslovně upozorňuje, že jde o rozhodovací model pro rozhraní /v1/systemone a že potřebuje zmíněnou změnu. Ke 4. říjnu mají 2 237 a 3 458 stažení.

Ollama přidala Clef do verze 0.35.1 z 29. září a pouští ho přes stejné rozhraní /v1/systemone, podle poznámek k vydání i s obrázky. Její balík clef:27b má 18 GB. Hlavu nese i převod mlx-community/clef-flash-4bit pro počítače Apple, který má vedle vah i joint_head.safetensors a vlastní spouštěcí skript.

Kolik paměti si model vezme a jaký má kontext

Clef má podle rozhraní Hugging Face 27 356 728 560 parametrů v BF16, takže jen váhy páteře zaberou 54,7 GB. U Clef-Flash je to 9 409 813 744 parametrů a 18,8 GB. Čtyřbitový soubor Q4_K_M od ggml-org má u velkého modelu 19,2 GB a u malého 6,5 GB, k tomu se přičítá paměť na kontext.

S délkou kontextu se zdroje rozcházejí. Blog Cloudflaru i popis v knihovně Ollamy uvádějí 64 tisíc tokenů. Tabulka Ollamy u téhož modelu ukazuje 256 tisíc, což odpovídá hodnotě 262 144 zděděné po základním modelu Qwen, kterou nesou i hlavičky GGUF. Referenční kód na kartě modelu zase ořezává vstup ve výchozím nastavení na 16 384 tokenů.

Výsledky testů změřil sám Cloudflare

Tabulka na kartě modelu je podle Cloudflaru jeho „internal run“ sady Decision Index ve verzi 0.2.1 a žebříček, na který odkazuje, běží na jeho vlastní službě workers.dev. Nezávislé zopakování zatím nikdo nezveřejnil. Menší Clef-Flash v ní velký Clef předčí v 18 ze 41 testů, například v simulaci domácích spotřebičů 97,7 proti 83,0. Jinde zaostává o desítky bodů: v rozpoznání záměru CLINC150 má 66,8 proti 97,4 a při hledání vymyšlených tvrzení RAGTruth 35,6 proti 79,4. Medián odezvy uvádí Cloudflare 209,3 ms pro Clef a 38,8 ms pro Clef-Flash.

Soubor LICENSE v obou repozitářích je Apache 2.0, stejně jako u základních modelů Qwen. Cloudflare to na blogu nazývá úplným otevřením. Zveřejněné jsou váhy a kód pro spuštění; syntetická data, na kterých modely učil, jsou podle téhož blogu interní.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    Ternární Bonsai 2 vyšel v baleních, která přečte jen fork llama.cpp

    Prism ML vydal druhou generaci svého ternárního přebalení modelu Qwen3.8-27B: 5,95 GB proti 53,8 GB u souboru v F16. Oba zveřejněné soubory ale nesou typy tenzorů, které…

  2. U sebe doma

    Ollama vrací Codexu shrnutí konverzace jako prostý JSON v poli encrypted_content

    Testovací verze Ollamy 0.34.0 přidává do rozhraní kompatibilního s OpenAI koncový bod /v1/responses/compact a rozumí spouštěči kompakce, který Codex posílá na konci…

  3. U sebe doma

    llama.cpp sloučil pro DeepSeek V4 zhruba 137 uzlů do jednoho spuštění

    Backend Vulkan v llama.cpp dostal tři sloučené operace pro hyperpropojení DeepSeeku V4. Při dekódování na Strix Halo naměřil autor změny 16,77 místo 11,16 tokenu za…

  4. U sebe doma

    llama.cpp počítal u sedmi architektur normalizaci jinak než jejich referenční kód

    Vektory dotazů a klíčů v hybridní vrstvě Gated DeltaNet dělil llama.cpp odmocninou ořezanou zdola, kdežto knihovna, ke které se jejich referenční kód hlásí, k té…