Přeskočit na obsah
Modely aktualizováno 10. 8. 2026 3 min čtení

Nová řada modelů zkouší vštípit hodnoty už při předtrénování

Skupina model-raising zveřejnila 9. srpna rodinu malých jazykových modelů ke studii Synthetic Persona Pretraining. Ta zkouší vepsat modelu hodnoty už do předtrénování, místo aby se přidávaly až po něm. Vyšla jako ablační mřížka pěti postupů ve dvou velikostech, i s mezikroky trénování jako samostatnými revizemi.

Vizualizace neuronové sítě s čipem
Běžná ilustrace neuronové sítě. Foto: mikemacmarketing, Wikimedia Commons (CC BY 2.0)

Skupina model-raising zveřejnila rodinu malých jazykových modelů, které patří ke studii Synthetic Persona Pretraining (SPP). Její teze zní, že dnešní zarovnání je mělké: hodnoty se modelu dodávají až po předtrénování, a proto se dají obejít. SPP je zkouší zapsat rovnou do předtrénování. Zarovnání je přitom obvyklé české slovo pro to, jak se model ladí, aby dělal, co po něm chceme, a odmítal, co nemá.

Postup je jednoduchý. Zhruba k desetině předtrénovacích dokumentů se za zvláštní značku <assistant> připojí umělá úvaha v první osobě – morální komentář opřený o hodnotovou ústavu o šesti oblastech (důstojnost a práva, újma a bezpečí, poctivost, vztahy, blahobyt, moc a správa). U závadného textu úvaha říká, co je špatně a proč, u neškodného poznamená, že není co řešit. Aby přípisek neměnil, jak původní text pokračuje, drží ho stranou maskování pozornosti a posun pozic v RoPE, tedy ve způsobu, jakým model počítá polohu slov.

Vydaná mřížka porovnává pět postupů vedle sebe

Nevyšel jeden model, ale mřížka: pět variant ve dvou velikostech (1,7 a 3 miliardy parametrů) a pokaždé v základní a instrukční podobě, dohromady dvacet repozitářů. Dva jsou srovnávací. Varianta vanilla je běžné předtrénování bez zásahu, filtered navíc maskuje ztrátu na dokumentech označených jako nebezpečné – to je ten odečítací přístup, který závadná data spíš odstraňuje. Tři varianty používají SPP: t0 vkládá úvahy od prvního tokenu předtrénování, mt až v pozdější mezifázi a t0-mt v obojím. Srovnání je smysl celé věci, základní modely tu jsou proto, aby šlo účinek zásahu vyčíst.

Architekturu mají všechny stejnou: tvar podle Llama 3.2 3B, trénované od nuly na zhruba 500 miliardách tokenů z výřezu směsi Olmo 3 Dolma 3. Varianty s SPP jedou na rozšířeném tokenizéru SmolLM2 s přidanou značkou <assistant> a znaky ústavy (slovník 49 280), srovnávací modely na běžném (49 152).

Výsledky jsou zatím měření samotných autorů

Předběžný zápis autorů z 20. května uvádí na menších modelech (1,7 miliardy parametrů, 100 miliard tokenů) a napříč pěti protivnickými testy průměrnou úspěšnost útoku 1,7 %, tedy o 63 % méně než u základního modelu. Jsou to ale čísla autorů, změřená na těch menších modelech, ne na dnes vydané řadě 3B – a karty modelů žádnou nezávisle zopakovanou tabulku nenesou. Výsledek testu je tvrzení toho, kdo měřil, dokud ho nezopakuje někdo jiný. Myšlenka stojí na modelu výběru person (Marks a kol., 2026): předtrénování ustaví prostor person a pozdější ladění už jen vybírá z těch, které v něm jsou, žádnou novou nepřidá.

Váhy modelu 3B zaberou necelých 6 GB

Váhy modelu 3B jsou ve dvou souborech, 4,98 GB a 0,96 GB, tedy 5,94 GB podle rozpisu velikostí v kartě modelu. To odpovídá aritmetice: 3 miliardy parametrů po 2 bajtech (formát bf16) jsou přibližně 6 GB, takže se model vejde na běžnou herní kartu s 8 GB, menší varianta 1,7B tím spíš. Licence je slabší místo. V metadatech je uvedena jako „other“, jenže repozitáře nenesou název licence, odkaz na ni ani soubor LICENSE. Za jakých podmínek se váhy smějí použít, tak v repozitáři nestojí – a u otevřených vah je právě soubor s licencí jediný zdroj pravdy.

Ke každému modelu jsou i mezikroky trénování

Kvůli ověřitelnosti jsou k modelům přibalené i mezikroky, uložené jako revize gitu. Základní model t0 3B jich má jedenáct, od kroku 25 000 po 254 313, a každý se dá načíst parametrem revision=. Instrukční modely k tomu přidávají řadu podle podílu bezpečnostních dat, od nuly do šedesáti procent z 300 000 příkladů doladění. Vydané jsou jen váhy, ne stav optimalizátoru ani generátoru náhody, takže z nich jde vyhodnocovat, zkoumat a doučovat, ale ne přesně zopakovat celý běh. Samotné doladění instrukčních modelů je popsané do detailu: 300 000 jednokolových příkladů, z toho 90 % pokynů z WildChat-1M a 10 % bezpečnostních, odpovědi citují ústavu přímo v textu značkou [N.M], jedna epocha.

Otevřená otázka teď není další ukázkové povídání s modelem, ale nezávislé zopakování na větších modelech: jestli hodnoty vepsané už do předtrénování drží líp než ty přidané až po něm, a co to stojí na schopnostech. Právě to, že vydaná mřížka nese i mezikroky trénování, dělá takové zopakování možným – kdokoli může načíst tentýž bod trajektorie a měřit na něm sám.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…