Kimi K3 se dá stáhnout i v jednobitové verzi. Má pořád 594 GB a chce 610 GB paměti
Moonshot vydal 27. července váhy modelu Kimi K3 o velikosti 1,56 TB. Firma Unsloth k nim během dvou dnů dodala zmenšené verze; nejmenší má 594 GB a podle jejího vlastního měření se v 78,9 % případů trefí do stejného tokenu jako předloha. Ani ta se ale do stolního počítače nevejde.
Moonshot AI vydal 27. července váhy modelu Kimi K3. Že jsou venku, popsal server magazin.chatujme.cz. Pro toho, kdo si chce model pustit u sebe, je ale podstatnější jiné číslo: balík na Hugging Face má 1,56 TB. Během dvou dnů k němu firma Unsloth vydala zmenšené verze a u každé zveřejnila, kolik zabere a kolik se na ní ztratí. Nejmenší má 594 GB.

Čtyři bity nejsou zlevnění, ale výchozí stav
Kvantizace je uložení vnitřních čísel modelu nahrubo: místo šestnácti bitů na jedno číslo třeba čtyři. Soubor se zmenší a přesnost odpovědí klesne. U Kimi K3 je ovšem výchozí bod jinde, než bývá zvykem. Karta modelu uvádí, že váhy jsou ve formátu MXFP4 a aktivace v MXFP8 a že se model v téhle přesnosti rovnou trénoval. Čtyřbitový je tedy od výroby, ne až po zásahu někoho zvenčí.
Dá se to přepočítat. Hugging Face u repozitáře uvádí 2 779 931 837 184 parametrů, karta modelu je zaokrouhluje na 2,8 bilionu. Součet velikostí souborů dává 1 561 GB. Na jeden parametr tak vychází zhruba 4,5 bitu – přepočet je náš, obě vstupní čísla jsou z Hugging Face.
Odtud plyne i jinak nepochopitelný detail nabídky: osmibitová varianta, kterou Unsloth označuje za bezeztrátovou, je jen asi o 50 GB větší než čtyřbitová. Podle jeho dokumentace obě v podstatě kopírují původní přesnost. Osmibitová sleduje původní rozvržení přesně, čtyřbitová se od ní liší jen tím, jak jsou uložené tenzory mimo experty. Skutečné zmenšování začíná až pod touhle hranicí.
Co zmenšení ubere
Unsloth zveřejnil u každé varianty dvě čísla. Shoda nejpravděpodobnějšího tokenu říká, jak často zmenšený model sáhne po tomtéž slově jako nezmenšená předloha. Perplexita měří, jak moc je model překvapený textem, který čte; nižší je lepší.
| Varianta | Velikost | Shoda | Perplexita | Paměť |
|---|---|---|---|---|
| UD-IQ1_S | 594,0 GB | 78,9 % | 2,58 | 610 GB |
| UD-IQ1_M | 648,9 GB | 81,2 % | 2,36 | 665 GB |
| UD-IQ2_XXS | 711,1 GB | 84,1 % | 2,13 | 726 GB |
| UD-Q2_K_XL | 861,3 GB | 90,4 % | 1,74 | 880 GB |
| UD-Q8_K_XL | 1 560 GB | předloha | 1,4581 | 1,6 TB |
Sloupec s pamětí je součet operační paměti a paměti grafických karet, jak ho uvádí dokumentace. Všechna čísla v tabulce naměřil Unsloth na vlastní kalibraci a nikdo je zatím nezopakoval; jsou to tedy údaje toho, kdo soubory nabízí.
Označení „jednobitový“ je přitom volnější, než zní. Ze 594 GB a 2,78 bilionu parametrů vychází 1,7 bitu na parametr, protože část vah zůstává uložená přesněji. Přepočet je opět náš.
Rozhoduje paměť, ne místo na disku
Stáhnout 594 GB je otázka linky a trpělivosti. Spustit je otázka paměti. Dokumentace Unslothu dává jednoduché pravidlo: součet operační paměti a paměti karet má být zhruba tak velký jako soubor s modelem. Když není, model poběží taky, ale bude si chybějící část dočítat z disku a bude mnohem pomalejší.
U nejmenší varianty to znamená aspoň 610 GB. To je řádově jinde než běžný počítač s 32 nebo 64 GB. Rychlost Unsloth uvádí pro sestavu s akcelerátory B200: zhruba 20 tokenů za sekundu při generování a přes 120 tokenů za sekundu celkové propustnosti, pokud se model do paměti vejde. Sami jsme to nezkoušeli, jde o čísla z dokumentace.
Kde měření naráží samo na sebe
Perplexita čtyřbitové varianty vyšla 1,4579, osmibitové 1,4581. Rozdíl je v šumu, přestože jedna z nich je označená za bezeztrátovou a druhá ne. Podle nás z toho plyne, že těch 50 GB navíc si stahovat nemusíte – jenže perplexita je jediné číslo, které dokumentace u obou variant uvádí, takže na víc se opřít nedá.
Dokumentace dál srovnává vlastní soubory s kvantizacemi jiných lidí a vychází z toho velmi dobře – cizí verze prý mají při srovnatelné velikosti perplexitu jednadvacetkrát až pětačtyřicetkrát horší. Konkrétní repozitáře ale nejmenuje a nezávisle to nikdo neověřil, takže je to tvrzení jedné strany o práci té druhé.
A jedna hranice zůstala nepřekonaná. Nejmenší varianta má 553,2 GiB, tedy víc než půl tebibajtu, a Unsloth píše, že zatím zkoumá, jestli se dá dostat pod 512 GiB, aniž by model poškodil. Zatím se to nepovedlo.
Ke stažení není totéž co ke spuštění
Kimi K3 je model se směsí expertů: z 2,8 bilionu parametrů se na jeden token zapojí jen 104 miliard, kontextové okno má milion tokenů. Jenže v paměti musí ležet celý, protože dopředu není jasné, kterých šestnáct z 896 expertů si vybere. Právě proto se velikost stlačit dá, ale nároky na paměť ne.
Zmenšené verze tak podle nás posunuly Kimi K3 z kategorie „potřebujete serverovnu“ do kategorie „potřebujete jeden pořádný stroj“. To je velký rozdíl pro laboratoře a firmy. Pro člověka s počítačem doma se nezměnilo nic, i když se soubory jmenují jednobitové.
Zdroje: karta modelu Kimi K3 na Hugging Face, repozitář Unsloth Kimi-K3-GGUF, návod a měření Unslothu. Velikosti souborů a počet parametrů jsme sečetli z rozhraní Hugging Face.