Přeskočit na obsah
Čínské modely 4 min čtení

Xiaomi dotrénoval MiMo V2.6, protože model volal tytéž nástroje dokola

Xiaomi zveřejnil 27. září váhy dvou upravených verzí modelu MiMo V2.6 s příponou MOPD. Opravují chování, při kterém model posílal stejné požadavky na nástroje dokola, aniž se tím k něčemu dostal. K tomu vydal rozbor, ze kterého plyne, že si to chování vypěstoval jeho vlastní trénink pod příliš mírnou pokutou.

Čínský Xiaomi zveřejnil 27. září na Hugging Face dva nové soubory vah svého modelu MiMo-V2.6-Flash-MOPD a MiMo-V2.6-Pro-MOPD, oba pod licencí MIT. Nejsou to nové modely, ale dotrénované verze těch, které vyšly o šest dní dřív – tehdy k nim laboratoř zveřejnila i cenu posilovaného učení. Důvod úpravy popsala v technickém rozboru ze stejného dne a je neobvykle konkrétní: model dokola posílal tytéž požadavky na nástroje.

Areál Xiaomi Science and Technology Park v Pekingu
Vědecko-technický park Xiaomi v Pekingu, kde sídlí i tým MiMo. Foto: Justin Sijbolts, Wikimedia Commons (CC BY 4.0)

Porucha, na kterou nic neupozorní

Opakované volání nástroje je podle rozboru takové, pro které není rozumný důvod: model posílá stejný nebo velmi podobný požadavek, přestože se ani dostupné informace, ani stav prostředí nezměnily a není co zkoušet znovu. Xiaomi to odděluje od dvou jevů, které vypadají podobně. Paralelní volání, tedy když si agent načte několik souborů naráz, je běžný způsob, jak práci zrychlit. Zaplavení je stav, kdy model pošle víc požadavků, než úloha potřebuje nebo než okolí zvládne obsloužit. Opakovaný pokus po chybě ani pravidelné dotazování na stav se do poruchy nepočítají.

Nepříjemné na tom je, že nic nespadne. Nástroje běží, agent odpovídá, jen se nikam nedostává – a uživatel to rozpozná až po dlouhém čekání, když vůbec. Xiaomi píše, že po vydání MiMo V2.6 to byla jedna z nejvíc patrných vad, na které naráželi lidé v jeho vlastní aplikaci MiMo Desktop i v cizích agentních nástrojích.

Čísla pod tím jsou z vlastního vyhodnocení laboratoře a nikdo je zatím nezopakoval. Nejvyšší podíl opakovaných volání vyšel v prostředí OpenCode: 1,02 % u varianty Flash a 0,54 % u Pro. V Claude Code 0,27 a 0,10 %, v Codexu 0,23 a 0,07 %, ve vlastním MiMo Desktopu 0,19 % u obou. Měřilo se tak, že se vzala dávka volání z jednoho tahu modelu a spočítalo, kolik z nich je po sjednocení zápisu argumentů doslova totožných. Sama laboratoř přiznává, že je to jen dolní hranice: metrika nevidí opakování mezi tahy, nevidí volání, která se liší v detailu a slouží témuž účelu, a nevidí požadavky schované uvnitř spouštěného kódu.

Pokuta se spouštěla až nad 32 voláními

Zajímavější než porucha je to, odkud se vzala. Xiaomi si pustilo staré příklady s opakováním proti kontrolním bodům z různých fází posilovaného učení, tedy po nultém, pátém, desátém, patnáctém a dvacátém kroku. U varianty Flash měl zaplavení – víc než deset volání v jednom tahu – už na začátku 11,1 % přehraných příkladů a na konci 24,6 %. V prostředí MiMo Code to bylo 30,6 % na začátku a 41,7 % ke konci. Trénink to chování tedy nepotlačil, ale zesílil.

A to přesto, že pokuta za zaplavení v tréninku byla. Spouštěla se ale až tehdy, když model v jednom tahu poslal víc než 32 požadavků; pak se průchod ukončil a dostal nulovou odměnu. Pod tou mezí se nic nedělo, takže se chování postupně posilovalo, dokud mez nepřekročilo. Rozbor přitom nechává zaplavení a opakování oddělené: část zaplavených průchodů duplicitní volání obsahovala, ale laboratoř jedno za druhé nevydává.

Přísnější pokuta by stála 2,31 milionu dolarů

Nejpřímější oprava byla mez snížit. Xiaomi to vyzkoušelo na odděleném pokusu: mez z 32 na osm volání a pokračování od 28. kroku varianty Flash. Zabralo to, počet tahů s víc než osmi voláními výrazně spadl a celková odměna se nezhoršila. Jenže se to projevilo až po dalších asi dvaceti krocích tréninku, a zopakovat to v plném rozsahu by znamenalo pustit dvacet kroků hlavního tréninku znovu – podle odhadu laboratoře za 2,31 milionu dolarů.

Druhá potíž byla horší než cena. Výsledný kontrolní bod snížil podíl opakování na interní sadě z 13,45 % na 3,83 %, ale nezbavil se ho. Pokuta uvázaná na počet volání zkrátka neměla jak zabrat mimo situace, na kterých se trénovalo.

Učitel, který se naučil zastavit

Xiaomi proto sáhlo po destilaci od specializovaného učitele – to je ten postup, po kterém nové soubory nesou v názvu MOPD. Nejdřív vzniknul malý model natrénovaný jen na shromážděných příkladech opakování, který dostal odměnu jedna pouze tehdy, když v jeho odpovědi nebylo ani opakování, ani chybné použití nástroje. Po dvanácti krocích a asi sedmi tisících příkladech dával na přehrávaných případech nulu, a to i na těch, které neviděl.

Rozbor u toho ukazuje jednu trajektorii, na které se rozdíl dá číst po jednotlivých tokenech. Model před opravou v ní poslal 59 volání a u dvanáctého měl 94,56 % pravděpodobnost, že pošle další. Opravený model tamtéž s pravděpodobností 92,17 % tah ukončil. Celkově se opravený model na té trajektorii zastavil do osmi volání s pravděpodobností 99,87 %, kdežto ten původní měl i po 59 voláních naději na zastavení asi jen poloviční. Sloučení toho chování do hlavního modelu stálo podle Xiaomi kolem 90 000 dolarů, tedy 4 % odhadované ceny té druhé cesty.

V rozhraní to bylo dřív a beze změny jména

Kdo si váhy stahuje, pozná verzi z přípony. Kdo za model platí, to nepozná. Do vlastního rozhraní Xiaomi se opravené modely dostaly už 25. září v 6.00 pekingského času, tedy dva dny před zveřejněním vah, a rozbor výslovně píše, že jména zůstala stejná: mimo-v2.6-pro a mimo-v2.6-flash. Totéž platí v katalogu OpenRouteru, který 29. září vede u varianty Flash sazbu 0,14 dolaru za milion vstupních tokenů a 0,28 za milion výstupních, u Pro 0,435 a 0,87 dolaru – a o tom, který kontrolní bod za jménem stojí, neříká nic. Uživatelům aplikace MiMo Desktop laboratoř jako omluvu vynulovala zbytek vyčerpané kvóty v probíhajícím období.

Že jde o dotrénování téhož modelu, a ne o novou stavbu, se dá ověřit bez stahování vah. Rozhraní Hugging Face hlásí u varianty Flash před úpravou i po ní shodných 310 756 322 688 parametrů a u Pro 1 024 216 603 392, a shodné je i rozdělení podle datových typů. Karta modelu popisuje Flash jako řídkou směs expertů s 309 miliardami parametrů celkem a 15 miliardami aktivními na token, s kontextem jednoho milionu tokenů.

Co v rozboru chybí, je druhá polovina tabulky. Podíly opakování po úpravě laboratoř vydala jen jako obrázek s poznámkou, že prázdná pole znamenají hodnotu do 0,001 % nebo žádné pozorování – konkrétní číslo za opraveným modelem z něj tedy nevyčtete. Doloženo je zatím jen to, že na nulu se dostal onen pomocný učitel, ne vydaný model.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čínské modely

    Qwen zapnul svému streamovacímu moderátoru vyrovnávací paměť až po roce

    Moderační model Qwen3Guard-Stream posuzuje bezpečnost odpovědi průběžně, token po tokenu. Referenční kód, který k němu Alibaba Cloud přiložila, ale nikdy nezapnul…

  2. Čínské modely

    InternLM vydal tři modely, které odpověď nevypisují, ale odečítají ji z logitů

    InternLM zveřejnil 26. září 2026 tři modely Intern-Decision doladěné z Qwen3.5. Nevypisují text: obsluha jim předloží kostru odpovědi se zástupnými značkami a model v…

  3. Čínské modely

    Posilované učení modelu MiMo V2.6 Pro stálo podle Xiaomi 2,62 milionu dolarů

    Xiaomi vydal 22. září řadu MiMo V2.6 a spolu s vahami zveřejnil i cenu závěrečné fáze trénování. Posilované učení větší varianty Pro vyšlo na 2,62 milionu dolarů, menší…

  4. Čínské modely

    Qwen-Image-2.1 má zveřejněné váhy jen pro nekomerční použití

    Alibaba 20. září vydala Qwen-Image-2.1 pro generování i úpravy obrázků; obrazová část má 7,1 miliardy parametrů a model pracuje až s deseti předlohami. Váhy lze podle…