Přeskočit na obsah
Čínské modely 4 min čtení

Posilované učení modelu MiMo V2.6 Pro stálo podle Xiaomi 2,62 milionu dolarů

Xiaomi vydal 22. září řadu MiMo V2.6 a spolu s vahami zveřejnil i cenu závěrečné fáze trénování. Posilované učení větší varianty Pro vyšlo na 2,62 milionu dolarů, menší Flash na 0,85 milionu; obě měly třicet kroků a zhruba 750 tisíc trajektorií. Co všechno se do té částky počítá, firma neuvádí.

Řady skříní superpočítače Frontier v sále laboratoře v Oak Ridge
Posilované učení MiMo V2.6 běželo podle technické zprávy na tisících akcelerátorů; kolik jich přesně bylo, zpráva neuvádí. Na snímku superpočítač Frontier v Oak Ridge National Laboratory. Foto: OLCF at ORNL, Wikimedia Commons (CC BY 2.0)

Tým MiMo společnosti Xiaomi vydal 22. září dvojici modelů MiMo-V2.6-Pro a MiMo-V2.6-Flash. Váhy jsou ke stažení, kontext má milion tokenů a na vstupu model bere text, obrázky, zvuk i video. Vedle toho firma udělala něco, co se u oznámení modelu vidí zřídka: napsala, kolik stála poslední fáze trénování.

Tou fází je posilované učení, anglicky reinforcement learning. Model dostává úkoly, za jejich splnění odměnu a podle ní se dolaďuje, takže se neučí z hotových textů, ale z vlastních pokusů. U varianty Pro vyšla na 2,62 milionu dolarů, u menší Flash na 0,85 milionu. Technická zpráva tytéž částky zaokrouhluje na 2,6 a 0,9 milionu.

Třicet kroků, 750 tisíc trajektorií

Podle blogu doběhlo trénování u obou modelů pod šest dní a mělo třicet kroků. Jeden krok pracuje s 1 568 zadáními, ke každému model vygeneruje šestnáct pokusů, takže na krok připadá 25 088 sekvencí a na celý běh 752 640. To je vlastní výpočet z čísel v technické zprávě a sedí s formulací blogu, který mluví zhruba o 750 tisících trajektorií. Jedna sekvence má 110 až 150 tisíc tokenů.

Z toho se dá dopočítat i cena za kus. Jeden krok stál u modelu Pro zhruba 87 tisíc dolarů a u Flash 28 tisíc; jedna trajektorie vychází na 3,48, respektive 1,13 dolaru. Obojí je náš dopočet z uvedené celkové částky a z počtu sekvencí, firma ho takhle rozepsaný neuvádí.

Zpráva k tomu přidává, kam peníze šly. U modelu Pro spolkla generování pokusů 43,8 %, samotné učení 43,5 % a hodnocení výsledků zbylých 12,7 %. Hodnotitel je tu totiž taky model: úlohy se neznámkují jen průchodem testu, ale porovnáním pokusů mezi sebou, aby se dalo odlišit dobré řešení od ještě lepšího.

Jedno číslo si oba dokumenty rozhodly různě. Blog uvádí 3,5 až 3,7 miliardy tokenů na krok, technická zpráva 2,7 až 3,7 miliardy. Horní hranice sedí, spodní se liší o 800 milionů a ani jeden text nevysvětluje, čím.

Kam se model za ty peníze dostal

Na testu DeepSWE v1.1, který měří dlouhé programátorské úkoly, stoupl podle technické zprávy Pro během trénování z 58,4 na 72,6 bodu a Flash z 48,7 na 65,7. Jsou to průměry ze tří běhů. Karta modelu na Hugging Face uvádí u téhož testu 71,9 a 67,9, tedy u Flash o dva body víc a u Pro o sedm desetin míň. Čím se ta dvě měření liší, nepíše ani karta, ani zpráva.

Nezávisle model změřila společnost Artificial Analysis. V jejím souhrnném indexu má MiMo-V2.6-Pro 46 bodů a je první ze 114 modelů s otevřenými vahami. Mezi uzavřenými modely je to jiné pořadí: Claude Opus 5.5 má 58 bodů, Claude Fable 5.1 a GPT-6 Astra po 53, Muse Spark 1.3 pak 48. Stejně jako MiMo skončil Grok 4.7 a o bod níž GLM-5.3.

Rozdíl je v ceně. Jedna úloha indexu vyšla u MiMo-V2.6-Pro na 0,13 dolaru, u Claude Opus 5.5 na 5,98 a nejlevněji, za sedm centů, u GPT-6 Luna. Celé měření indexu stálo Artificial Analysis u MiMo 206,66 dolaru. Za to si model vybírá jinde: dává 55 tokenů za vteřinu proti mediánu 67.

Sazby přes rozhraní API zůstaly stejné jako u řady V2.5 – 0,435 dolaru za milion tokenů na vstupu a 0,87 na výstupu u Pro, 0,14 a 0,28 u Flash. Potvrzuje to i výpis modelů na OpenRouteru, kde má MiMo-V2.5-Pro tytéž dvě čísla. Rychlejší režim UltraSpeed stojí desetinásobek.

Váhy váží 573 GB, licence je jen v kolonce

Model Pro má bilion a 24 miliardy parametrů, z nichž se na každý token použije 42 miliard. Součet souborů v repozitáři vah dává 573,5 GB ve 132 kusech; u varianty Flash je to 177,8 GB v 67 souborech. Na osm akcelerátorů po 80 GB, tedy na 640 GB paměti, se větší model vejde i s rezervou na kontext jen taktak; Flash zabere tři karty. Kontextové okno je přesně 1 048 576 tokenů.

Jako licenci hlásí karta obou modelů MIT, tedy podmínky bez prahů na tržby i na počet uživatelů. Soubor LICENSE ale v žádném z obou repozitářů není a rozhraní Hugging Face na něj odpovídá hláškou o chybějícím záznamu. Jediné, co licenci určuje, je tak kolonka v hlavičce karty. Stejně na tom byl model Ornith 1.5, opačným směrem šla laboratoř Z.AI u GLM-5.3, která MIT vyměnila za vlastní podmínky s prahem deseti miliard dolarů.

Otevřený kód je jedna větev nad cizím rámcem

Blog slibuje, že s modelem vychází i kód posilovaného učení a trénovací prostředí. V repozitářích to vypadá takhle: Xiaomi si odštěpil projekt verl, otevřený rámec pro posilované učení, a do větve mimo-oss přidal 21. září jediný commit o 30 672 řádcích ve 191 souborech. Nový rámec to tedy není, jsou to recepty nad existujícím kódem.

Zajímavější je jejich obsah. Mezi přibylými soubory jsou nastavení jednotlivých agentních prostředí, proti kterým se model trénoval, a jmenují se mini-claude-code, mini-codex, mini-mimocodemini-bash. Firma tedy míchala do jedné dávky úlohy zadávané přes rozhraní konkurenčních nástrojů a v blogu tvrdí, že se naučené postupy přenesly i na prostředí, která model při trénování neviděl. Vlastního agenta mimoagent odvodila z projektu mini-swe-agent.

Zbývá říct, co ta částka nepokrývá. Je to cena posilovaného učení, ne celého trénování: předtrénování ani mezitrénování technická zpráva nevyčísluje. Neuvádí ani počet karet a odpracovaných hodin, jen že běh probíhal na tisících akcelerátorů naráz, a nikde nestojí, jestli je v částce pronájem cizí kapacity, provoz vlastní, nebo obojí. Číslo tak říká, kolik podle firmy stál jeden konkrétní krok, ne kolik stojí postavit model.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čínské modely

    Qwen-Image-2.1 má zveřejněné váhy jen pro nekomerční použití

    Alibaba 20. září vydala Qwen-Image-2.1 pro generování i úpravy obrázků; obrazová část má 7,1 miliardy parametrů a model pracuje až s deseti předlohami. Váhy lze podle…

  2. Čínské modely

    Qwen účtuje za Omni-Flash pětinu ceny Gemini 3.8 Flash a váhy drží u sebe

    Alibaba pustila 18. září omnimodální model Qwen3.8-Omni-Flash a chce za něj 0,15 dolaru za milion vstupních tokenů bez ohledu na to, jestli jde o text, zvuk, nebo video.…

  3. Čínské modely

    Agentní model Atria Dawn stojí na nezměněné architektuře GLM-5.2

    Šanghajská laboratoř umělé inteligence zveřejnila váhy agentního modelu Atria Dawn Preview a technickou zprávu k němu. Soubor s nastavením se od modelu GLM-5.2 firmy Z…

  4. Čínské modely

    Návrh na opravu štítku u GLM-OCR ležel v repozitáři Z.ai od května do září

    Vývojář Hugging Face nechal u čínského modelu GLM-OCR návrh na opravu štítku 19. května. Z.ai ho sloučila 11. září. Dvě hlášení uživatelů, kterým se model přes rozhraní…