Dvě tabulky slovníku zabírají v modelu MiniCPM5-2B pětinu parametrů
Skupina OpenBMB vydala 6. září model MiniCPM5-2B pro běh na koncových zařízeních. Z jeho 2 516 756 480 parametrů připadá 534 773 760 na dvojici tabulek, které převádějí tokeny na vektory a zpátky. Tři modely, se kterými se karta srovnává, vystačí s jednou.
Skupina OpenBMB nahrála 6. září 2026 na Hugging Face model MiniCPM5-2B. Je to druhý model řady MiniCPM5 po květnovém MiniCPM5-1B a karta ho popisuje jako model pro místní nasazení, kódovací agenty a práci s nástroji. Stojí na architektuře LlamaForCausalLM, takže ho běhová prostředí načtou bez vlastního jádra i bez odnože modelového kódu; karta to uvádí výslovně jako přednost.

Hned v přehledu vlastností stojí dvě čísla vedle sebe: 2 516 756 480 parametrů celkem a 1 981 982 720 parametrů bez vkládacích tabulek. Rozdíl mezi nimi je 534 773 760, tedy 21,25 % modelu. Vydavatel to nekomentuje, ale je to největší jednotlivá položka po vrstvách samotných.
Co v souboru vah opravdu leží
Karta se dá ověřit, aniž se stahuje pět gigabajtů. Každý soubor safetensors nese v prvních osmi bajtech délku své hlavičky a hned za ní seznam všech tenzorů se jménem, typem a tvarem. Rozsahový dotaz na první dva megabajty stačí. Hlavička MiniCPM5-2B měří 44 128 bajtů, vypisuje 381 tenzorů a jejich součet dá přesně to číslo, které tvrdí karta.
Dvě z těch 381 položek jsou matice model.embed_tokens.weight a lm_head.weight, obě o rozměrech 130 560 na 2 048. Slovník má tedy 130 560 tokenů a model si každý z nich drží jako vektor o 2 048 číslech: jednou na vstupu, podruhé na výstupu, kde se z vektoru počítá skóre pro každý token slovníku. Každá matice je 267 386 880 parametrů, dohromady zmíněných 534 773 760.
Zbytek se dělí předvídatelně. Na dopředné vrstvy dvaačtyřiceti bloků připadá 1 585 446 912 parametrů (63,00 %), na pozornost 396 361 728 (15,75 %) a na normalizaci 174 080. Procenta jsou náš dopočet ze součtů v hlavičce; celek je uvedených 2 516 756 480.
U menšího sourozence je podíl ještě vyšší
MiniCPM5-1B má týž slovník, jen menší vnitřek: skrytý rozměr 1 536 místo 2 048 a 24 vrstev místo dvaačtyřiceti. Tabulky se ale nezmenšily o tolik jako model, takže z jeho 1 080 632 832 parametrů zabírají 401 080 320, tedy 37,12 %. Čím menší model, tím větší kus zabere slovník; u dvoumiliardového je to pětina, u miliardového víc než třetina.
Jménu modelu odpovídá pokaždé jiné z těch dvou čísel. U dvojky sedí na „2B“ počet bez tabulek (1,98 miliardy), u jedničky celkový počet (1,08 miliardy). Převodník do formátu GGUF si s tím poradil po svém a do metadat zapsal jméno MiniCPM5 2.6B.
Modely ze stejného srovnání mají místo dvou tabulek jednu
Karta se poměřuje se třemi modely téže velikostní třídy. Všechny tři mají v konfiguraci tie_word_embeddings nastavené na true, tedy vstupní a výstupní tabulku sdílejí jako jednu sadu vah: Qwen3.5-2B se slovníkem 248 320 tokenů, Gemma-4-E2B-it s 262 144 a LFM2.5-2.6B se 128 000. Obě velikosti MiniCPM5 mají tentýž přepínač na false.
Sdílení není samo o sobě lepší řešení: vstup a výstup se tím svážou do jedné reprezentace, což je omezení, které se u větších modelů obvykle nedělá. Ušetří ale přesně tolik parametrů, kolik jedna tabulka váží. Proč se OpenBMB rozhodl opačně, karta neuvádí.
Po kvantizaci na čtyři bity zabírají skoro čtvrtinu
Den před hlavním modelem vyšla v samostatném repozitáři verze GGUF pro llama.cpp, Ollamu a LM Studio. Soubor Q4_K_M má 1 561 318 368 bajtů, zatímco čtyři bity na každou z 2,52 miliardy vah by daly 1 258 378 240. Rozdíl dělá z velké části právě slovník: vstupní tabulka je uložená v Q4_K po 4,5 bitu na váhu, výstupní v jemnějším Q6_K po 6,5625 bitu.
Odečteno z odstupů mezi tenzory v souboru to je 150 405 120 a 219 340 800 bajtů, dohromady 369 745 920. To je 23,68 % čtyřbitového souboru; kvantizace tedy podíl tabulek nesnížila, ale zvýšila. Pro běh na telefonu nebo na jednodeskovém počítači je to konkrétní účet, ne akademický údaj – a právě proto nechává llama.cpp velké vkládací tabulky raději na disku.
Čí jsou čísla v tabulce výsledků
Karta uvádí, že model dosáhl v porovnávané sadě průměru 53,9 bodu a překonal i všechny uvedené větší modely, z nichž nejlepší má 51,1. Poznámka pod tabulkou upřesňuje, že hvězdičkou označené hodnoty pocházejí z vydání Artificial Analysis a „všechny ostatní jsou reprodukované interně“. Většina čísel v tabulce tedy zatím stojí na měření vydavatele.
Váhy jsou pod licencí Apache 2.0. Kolonka na kartě i závěrečný oddíl se shodují a soubor v repozitáři projektu je opravdu plné znění Apache 2.0, bez dodatků o tržbách nebo počtu uživatelů. Vedle vah vyšly i trénovací sady a varianty pro MLX, GPTQ a spekulativní dekódování.
Zdroje
- Karta modelu MiniCPM5-2B – počty parametrů, srovnávací tabulka a poznámka o měření
- config.json – velikost slovníku, skrytý rozměr a přepínač
tie_word_embeddings - Repozitář GGUF – soubory, ze kterých jsme odečetli velikosti jednotlivých tenzorů
- Znění licence – plný text Apache 2.0 v repozitáři projektu