Přeskočit na obsah
Modely 3 min čtení

Dvě tabulky slovníku zabírají v modelu MiniCPM5-2B pětinu parametrů

Skupina OpenBMB vydala 6. září model MiniCPM5-2B pro běh na koncových zařízeních. Z jeho 2 516 756 480 parametrů připadá 534 773 760 na dvojici tabulek, které převádějí tokeny na vektory a zpátky. Tři modely, se kterými se karta srovnává, vystačí s jednou.

Skupina OpenBMB nahrála 6. září 2026 na Hugging Face model MiniCPM5-2B. Je to druhý model řady MiniCPM5 po květnovém MiniCPM5-1B a karta ho popisuje jako model pro místní nasazení, kódovací agenty a práci s nástroji. Stojí na architektuře LlamaForCausalLM, takže ho běhová prostředí načtou bez vlastního jádra i bez odnože modelového kódu; karta to uvádí výslovně jako přednost.

Otevřená stránka vícejazyčného technického slovníku s odbornými termíny v pěti jazycích
Stránka pětijazyčného technického slovníku z roku 1974. Foto: Jack Shainsky, Flickr (CC BY 2.0)

Hned v přehledu vlastností stojí dvě čísla vedle sebe: 2 516 756 480 parametrů celkem a 1 981 982 720 parametrů bez vkládacích tabulek. Rozdíl mezi nimi je 534 773 760, tedy 21,25 % modelu. Vydavatel to nekomentuje, ale je to největší jednotlivá položka po vrstvách samotných.

Co v souboru vah opravdu leží

Karta se dá ověřit, aniž se stahuje pět gigabajtů. Každý soubor safetensors nese v prvních osmi bajtech délku své hlavičky a hned za ní seznam všech tenzorů se jménem, typem a tvarem. Rozsahový dotaz na první dva megabajty stačí. Hlavička MiniCPM5-2B měří 44 128 bajtů, vypisuje 381 tenzorů a jejich součet dá přesně to číslo, které tvrdí karta.

Dvě z těch 381 položek jsou matice model.embed_tokens.weightlm_head.weight, obě o rozměrech 130 560 na 2 048. Slovník má tedy 130 560 tokenů a model si každý z nich drží jako vektor o 2 048 číslech: jednou na vstupu, podruhé na výstupu, kde se z vektoru počítá skóre pro každý token slovníku. Každá matice je 267 386 880 parametrů, dohromady zmíněných 534 773 760.

Zbytek se dělí předvídatelně. Na dopředné vrstvy dvaačtyřiceti bloků připadá 1 585 446 912 parametrů (63,00 %), na pozornost 396 361 728 (15,75 %) a na normalizaci 174 080. Procenta jsou náš dopočet ze součtů v hlavičce; celek je uvedených 2 516 756 480.

U menšího sourozence je podíl ještě vyšší

MiniCPM5-1B má týž slovník, jen menší vnitřek: skrytý rozměr 1 536 místo 2 048 a 24 vrstev místo dvaačtyřiceti. Tabulky se ale nezmenšily o tolik jako model, takže z jeho 1 080 632 832 parametrů zabírají 401 080 320, tedy 37,12 %. Čím menší model, tím větší kus zabere slovník; u dvoumiliardového je to pětina, u miliardového víc než třetina.

Jménu modelu odpovídá pokaždé jiné z těch dvou čísel. U dvojky sedí na „2B“ počet bez tabulek (1,98 miliardy), u jedničky celkový počet (1,08 miliardy). Převodník do formátu GGUF si s tím poradil po svém a do metadat zapsal jméno MiniCPM5 2.6B.

Modely ze stejného srovnání mají místo dvou tabulek jednu

Karta se poměřuje se třemi modely téže velikostní třídy. Všechny tři mají v konfiguraci tie_word_embeddings nastavené na true, tedy vstupní a výstupní tabulku sdílejí jako jednu sadu vah: Qwen3.5-2B se slovníkem 248 320 tokenů, Gemma-4-E2B-it s 262 144 a LFM2.5-2.6B se 128 000. Obě velikosti MiniCPM5 mají tentýž přepínač na false.

Sdílení není samo o sobě lepší řešení: vstup a výstup se tím svážou do jedné reprezentace, což je omezení, které se u větších modelů obvykle nedělá. Ušetří ale přesně tolik parametrů, kolik jedna tabulka váží. Proč se OpenBMB rozhodl opačně, karta neuvádí.

Po kvantizaci na čtyři bity zabírají skoro čtvrtinu

Den před hlavním modelem vyšla v samostatném repozitáři verze GGUF pro llama.cpp, Ollamu a LM Studio. Soubor Q4_K_M má 1 561 318 368 bajtů, zatímco čtyři bity na každou z 2,52 miliardy vah by daly 1 258 378 240. Rozdíl dělá z velké části právě slovník: vstupní tabulka je uložená v Q4_K po 4,5 bitu na váhu, výstupní v jemnějším Q6_K po 6,5625 bitu.

Odečteno z odstupů mezi tenzory v souboru to je 150 405 120 a 219 340 800 bajtů, dohromady 369 745 920. To je 23,68 % čtyřbitového souboru; kvantizace tedy podíl tabulek nesnížila, ale zvýšila. Pro běh na telefonu nebo na jednodeskovém počítači je to konkrétní účet, ne akademický údaj – a právě proto nechává llama.cpp velké vkládací tabulky raději na disku.

Čí jsou čísla v tabulce výsledků

Karta uvádí, že model dosáhl v porovnávané sadě průměru 53,9 bodu a překonal i všechny uvedené větší modely, z nichž nejlepší má 51,1. Poznámka pod tabulkou upřesňuje, že hvězdičkou označené hodnoty pocházejí z vydání Artificial Analysis a „všechny ostatní jsou reprodukované interně“. Většina čísel v tabulce tedy zatím stojí na měření vydavatele.

Váhy jsou pod licencí Apache 2.0. Kolonka na kartě i závěrečný oddíl se shodují a soubor v repozitáři projektu je opravdu plné znění Apache 2.0, bez dodatků o tržbách nebo počtu uživatelů. Vedle vah vyšly i trénovací sady a varianty pro MLX, GPTQ a spekulativní dekódování.

Zdroje

  • Karta modelu MiniCPM5-2B – počty parametrů, srovnávací tabulka a poznámka o měření
  • config.json – velikost slovníku, skrytý rozměr a přepínač tie_word_embeddings
  • Repozitář GGUF – soubory, ze kterých jsme odečetli velikosti jednotlivých tenzorů
  • Znění licence – plný text Apache 2.0 v repozitáři projektu

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…