Přeskočit na obsah
Modely 3 min čtení

Váhy modelu SenseNova U1.5-8B-MoT mají 17,5 miliardy parametrů

SenseTime vydala 19. srpna otevřený multimodální model SenseNova U1.5-8B-MoT. Rozhraní Hugging Face u něj napočítá 17 532 854 464 parametrů a osm souborů s vahami zabere pětatřicet gigabajtů. Není to překlep: architektura Mixture-of-Transformers nese každou vrstvu dvakrát, jednou pro chápání vstupu a jednou pro kreslení obrázků.

Ruka zasouvá paměťový modul do patice serverové základní desky
Kolik paměti model spolyká, se pozná až ze součtu souborů s vahami. Foto: Jemimus, Wikimedia Commons (CC BY 2.0)

SenseTime dala 19. srpna 2026 na Hugging Face váhy modelu SenseNova-U1.5-8B-MoT a kartu k nim doplnila druhý den. Model dělá obojí naráz: rozumí obrázkům i textu a obrázky zároveň kreslí a upravuje. Licenci Apache 2.0 uvádí karta i repozitář referenčního kódu.

Součet souborů dá pětatřicet gigabajtů

Rozhraní Hugging Face vypisuje u každého úložiště počet parametrů odečtený přímo z vah. U tohohle stojí v poli safetensors.total hodnota 17 532 854 464 a všechny jsou v bf16, tedy po dvou bajtech na parametr. Osm souborů zabere dohromady 35 065 858 136 bajtů, což je 35,07 GB, nebo 32,66 GiB, když se počítá po mocninách dvou.

Celkové číslo v kartě nestojí a jméno modelu slibuje jiné. Označení „8B“ v něm patří té části, která rozumí vstupu; článek autorů na arXivu z 12. května 2026 mluví o husté osmimiliardové předloze pro chápání. Rozdíl mezi číslem v názvu a velikostí stahování není na Hugging Face nic výjimečného – ternární Maple-Preview měl v hlavním repozitáři 40 GB vah proti slíbeným 5,31.

Každou vrstvu nese úložiště dvakrát

Kde se druhá půlka bere, prozradí rejstřík tenzorů. Stáhli jsme hlavičky všech osmi souborů a sečetli tvary: u každé ze 42 vrstev leží vedle sebe dvě sady vah stejných rozměrů a ta druhá má v názvu příponu _mot_gen. Zdvojené jsou projekce dotazu, klíče, hodnoty i výstupu, celý blok dopředné sítě a obě normalizace.

Čísla z toho součtu vypadají takhle. Větev _mot_gen má 8 103 754 240 parametrů a její textový protějšek přesně tolik taky. K tomu přijde 1 244 659 712 parametrů ve vstupní tabulce tokenů a ve výstupní hlavě, které jsou pro obě větve společné, a 80 686 272 v obrazových modulech a v hlavě pro flow matching. Dvakrát 8 103 754 240 plus 1 244 659 712 plus 80 686 272 dá 17 532 854 464 – tedy přesně to, co hlásí rozhraní.

Rozdělení podle modality vymyslel někdo jiný

Architekturu Mixture-of-Transformers popsala práce skupiny kolem Weixina Lianga, zveřejněná 7. listopadu 2024 a přijatá o rok později do časopisu TMLR. Recept zní: oddělit podle modality všechny parametry kromě vloženého slovníku, tedy dopředné sítě, matice pozornosti i normalizace, a nechat pozornost samotnou působit přes celou vstupní posloupnost.

Váhy to potvrzují do puntíku. Společná zůstala tabulka tokenů a výstupní hlava, dohromady 1,24 miliardy parametrů; všechno ostatní má každá modalita svoje. Autoři MoT si od toho slibují levnější trénování – v jednom z jejich pokusů dosáhl model kvality husté předlohy na 55,8 % počtu operací. Ta úspora je ale ve výpočtu, ne v paměti: parametry v ní leží všechny.

Model se obejde bez kodéru i bez autoenkodéru

Vlastní příspěvek SenseTime je v tom, co v modelu chybí. V zápisu NEO-unify z 5. března 2026 firma píše, že model pracuje rovnou s pixely a slovy, bez vizuálního kodéru a bez variačního autoenkodéru. Obrazová část je proto drobná: obě kopie vizuálního modulu mají dohromady 35 137 536 parametrů, tedy dvě promile celku. Zbytek práce odvede jazykový transformer.

Konfigurace k tomu dodá dvě čísla, která karta nezmiňuje. Kontextové okno má 262 144 tokenů a horní mez obrázku je 16 777 216 pixelů, tedy 4 096 na 4 096. Odtud slib nativního 4K v popisu.

Náhled vážil o patnáct gigabajtů víc

Stahování mezitím zhublo. Náhledová verze z 28. července má týchž 17 532 854 464 parametrů, jenže rozhraní u ní hlásí 9 972 275 648 v bf16 a 7 560 578 816 ve fp32; třináct souborů zabere 50 187 015 408 bajtů, tedy 50,19 GB. Commit z 24. srpna nazvaný „Convert to BF16 and re-shard“ převedl zbytek na poloviční přesnost a přebalil váhy do osmi souborů. Ubral tím 15,12 GB, aniž se počet parametrů změnil.

Karta neuvádí nároky na paměť

Karta ukazuje dva příkazy ke spuštění, oba s přepínačem --device_map auto, který model rozloží na dostupné karty. Kolik jich má být a kolik paměti dohromady, se z ní nedozvíte; instalační návod uvádí Python 3.11, PyTorch 2.8 a CUDA 12.8 a o paměti mlčí taky. Samotné váhy si těch 32,66 GiB vezmou dřív, než se zpracuje první token.

Jinde je karta otevřená až nezvykle. Vlastní oddíl v ní vyjmenuje, co modelu nejde: přeostřuje detaily a barvy, plete se v drobném a hustém textu, u přesných počtů a zarovnání chybuje a při rozsáhlejších úpravách obrázku ujíždí od zadání. Takový výčet se v popisech modelů nevidí často.

Dubnová verze má parametrů ještě o něco víc

Zdvojení není zvláštnost téhle verze. Dubnový SenseNova U1-8B-MoT hlásí 17 552 340 992 parametrů a varianta U1-A3B-MoT, postavená podle článku na třicetimiliardové směsi expertů, jich má 38 737 986 560. Kdo si z téhle rodiny vybírá podle čísla v názvu, počítá s poloviční pamětí, než jakou bude potřebovat.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…