Přeskočit na obsah
Modely 3 min čtení

Mach-1 sbalil váhy Qwen3.6-35B na 7,5 GB, běžný nástroj je ale nepřečte

Syzygy Research vydala Mach-1 Additive 35B, ternární balení modelu Qwen3.6-35B-A3B, které srazí 71,9 GB vah na 7,53 GB. Vlastní měření vydavatele mu přisuzuje 95 % výkonu původního modelu. Repozitář ale místo obvyklých vah obsahuje dekodér v NumPy a běžný nástroj z něj model nenačte.

Na Hugging Face je od 2. srpna model Mach-1 Additive 35B od organizace Syzygy Research. Není to nový model v obvyklém smyslu slova: je to jinak zabalený Qwen3.6-35B-A3B, jehož váhy se vešly do balíku zhruba desetkrát menšího. Za to se ale platí tím, že s ním zatím žádný běžný nástroj nepracuje.

Grafická karta s osmi gigabajty paměti
Balík vah Mach-1 má 7,53 GB, tedy zhruba tolik, kolik pojme paměť běžné herní karty. Snímek je ilustrační. Foto: Jacek Halicki, Wikimedia Commons (CC BY-SA 4.0)

Sedm a půl gigabajtu místo dvaasedmdesáti

Původní Qwen3.6-35B-A3B má podle rozhraní Hugging Face 35 951 822 704 parametrů uložených v bf16 a jeho repozitář zabírá 71,92 GB. Soubor MANIFEST.json u Mach-1 uvádí u textové části balíku 7,5335 GB a průměr 1,6978 bitu na váhu. To je 9,5násobný rozdíl.

Ta dvě čísla jdou proti sobě prověřit. 7,5335 GB je 60,27 miliardy bitů; vydělené 1,6978 dávají 35,5 miliardy vah, tedy o 450 milionů méně, než kolik má původní model. Manifest to sám vysvětluje na dvou místech: sedmnáct tenzorů z vrstvy pro předpověď více tokenů do balíku nešlo a embedding je přiložený ve dvou zaměnitelných podobách, ale do součtu se počítá jen jedna. Celý repozitář má proto 8,12 GB, o něco víc než deklarovaná textová část.

Průměr 1,6978 bitu je přitom vyšší než log₂3, tedy zhruba 1,585 bitu, které by teoreticky stačily na tři úrovně. Vedle vlastních kódů vah totiž balík nese i spojité stupnice ve fp16 a měřítka pro jednotlivé skupiny, a ta se do průměru počítají taky.

Sčítání místo násobení

Popis formátu je v souborech BOARD.mdRELEASE_NOTES.md. Experti jsou uložení jako celočíselné trellisové kódy s vlastní kódovou knihou, páteř sítě v 64úrovňové celočíselné mřížce, výstupní vrstva v pětibitovém formátu po skupinách po 64 a embedding ve čtyřech bitech. Trellisový kód popisuje posloupnost hodnot přechody mezi stavy místo jednotlivých čísel, takže se rozbaluje popořadě, ne po jednotlivých vahách.

Slovo „additive“ v názvu odkazuje na to, co je z toho v dokumentaci vyzdvižené: každý maticový součin vah je podle BOARD.md jen sčítání a odčítání, bez násobení. To je smysl ternárních vah obecně – když má váha jen hodnoty −1, 0 a +1, násobička není potřeba. Jak s ternárními vahami zachází nástroj, který je umí načíst, jsme rozebírali u dvoubitového Q2_0 v llama.cpp.

V repozitáři je dekodér, ne váhy

Praktický háček je v tom, že soubory v repozitáři nejsou váhy, které by načetl transformers, vLLM nebo llama.cpp. Jsou to komprimované bitové proudy ve vlastním rozvržení a jediné, co je umí přečíst, je přiložený decode.py – samostatný dekodér napsaný v NumPy. Jeho úvodní komentář popisuje rozvržení do detailu, takže se dá zpětně dopočítat, co v kterém souboru je. Spustit z něj model ale znamená napsat si zbytek sám.

Vidět je to na diskusi pod modelem. Dva dny po vydání se tam někdo ptal, jaký nástroj to vlastně spustí, a odpověď od jiného uživatele zněla, že si nechal předělat webové rozhraní a posílá odkaz na sdílené úložiště. O den později další uživatel hledal slíbenou verzi GGUF, na kterou odkazuje popis upravené větve llama.cpp, a dostal chybu 401. V odpovědi ze 6. srpna stojí, že GGUF i upravená větev llama.cpp vyjdou „ještě tenhle týden“ (v originále „later this week“). Desátého srpna se v témže vlákně ptal na termín někdo další; repozitář s GGUF k tomu dni pořád vrací 401 a veřejné vyhledávání na GitHubu tu upravenou větev nenajde.

Na hlášení v diskusi se přitom odpovídá rychle. Když nejstarší z nich upozornilo, že v repozitáři chybí jeden ze souborů s embeddingem, byl týž den doplněný.

Devadesát pět procent, ale změřených doma

Karta modelu uvádí, že si Mach-1 na dvanácti testech drží průměrně 95,0 % skóre nezmenšeného učitele. Nejlépe dopadly matematické úlohy: u sady AIME26 je to 89,58 proti 90,00 bodu, tedy 99,5 %. Nejhůř skončilo sledování instrukcí v IFBench, kde model dal 54,08 bodu proti 64,97, tedy 83,2 %. Vedle toho stojí v tabulce Ternary Bonsai 27B od prism-ml s 93,6 % a dvoubitová varianta Gemma 4 s 85,6 %.

Všechna ta čísla naměřil vydavatel sám a nezávislé zopakování zatím není. BOARD.md aspoň říká, jak měřil: EvalScope 1.9.1 nad vLLM, režim uvažování, teplota 1,0, top_p 0,95 a top_k 20, u sad AIME průměr z osmi běhů. Poznamenává také, že rozptyl mezi opakovanými měřeními dosahuje u IFEval dvou až tří bodů a u τ²-bench až šesti, takže rozdíly pod jedním bodem jsou v jeho vlastní tabulce shoda, ne pořadí. Podle nás je to u srovnávací tabulky vydavatele nadprůměrně otevřené.

Váhy jsou pod licencí Apache 2.0, tedy bez prahů na tržby nebo počet uživatelů. Soubor LICENSE v repozitáři učitelského Qwenu je týž.

Z Mach-1 je zatím vidět formát a čísla, ne běžící model – podobně jako u ternárního Maple-Preview, kde se rozcházel slibovaný a skutečný obsah repozitáře. Kdo chce ternární model rovnou spustit, sáhne dnes po něčem, co existuje ve formátu GGUF. Jestli mezi to Mach-1 přibude, rozhodne slíbené vydání.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…