Přeskočit na obsah
Čínské modely 3 min čtení

Čínské modely v testu Aleph Alpha často přebíraly státní postoje

Německá Aleph Alpha zkoušela čínské modely na 967 politicky citlivých zadáních. Za vyvážené označil její automatický hodnotitel 17 až 41 procent odpovědí; zbytek rozdělil mezi přebírání státních postojů a odmítnutí dotazu.

Čínský model může sepsat program bez potíží a při politické otázce začít hájit stanovisko čínského státu. Německá firma Aleph Alpha popsala toto chování v rozboru zveřejněném 28. září 2026. Porovnala dvě generace modelů od Alibaby, DeepSeeku a Moonshot AI. Na citlivých tématech se lišil hlavně způsob, jakým modely reagovaly: některé přepisovaly zadání podle státní doktríny, jiné většinou odmítaly odpovědět.

Police s knihami Si Ťin-pchinga v šanghajské knihovně
Knihy Si Ťin-pchinga v šanghajské knihovně na snímku z ledna 2019. Ilustrační fotografie. Foto: MNXANL, Wikimedia Commons (CC BY-SA 4.0)

Odpovědi třídil další jazykový model

Autoři nejprve ručně vybrali 56 témat, mezi nimi zásah na náměstí Tchien-an-men, politické postavení Tchaj-wanu a lidská práva v Sin-ťiangu. Model GPT-OSS 120B z nich vytvořil zadání. Po kontrole kvality zůstalo 967 položek. Tentýž model pak plnil roli hodnotitele: dostal popis hledaného chování a příklady, podle kterých odpovědi třídil.

Výsledek má tři kategorie. Jedna zahrnuje přebírání rámce čínské komunistické strany, druhá vyváženou odpověď a třetí odmítnutí. Podíl vyvážených odpovědí proto nelze číst jako přesnost modelu při běžné práci. Jde o verdikt automatického hodnotitele nad záměrně vybranými politickými zadáními. Rozbor navíc výslovně ponechává jiné druhy politické a kulturní zaujatosti stranou.

DeepSeek často mlčel, Qwen spíš odpovídal podle doktríny

Zveřejněný rozbor s přílohou témat ukazuje v prvním grafu následující podíly pro novější generace. Čísla naměřila Aleph Alpha na své sadě 967 zadání; hodnotil je GPT-OSS 120B. Jména verzí přebíráme z grafu.

ModelStátní rámecVyvážená odpověďOdmítnutí
Qwen 3.8 2.4T-A95B62 %19 %19 %
DeepSeek V4 Pro 081316 %18 %66 %
Kimi K340 %41 %19 %

U DeepSeeku připadaly dvě třetiny odpovědí na odmítnutí, kdežto Qwen častěji přebíral státní rámec. Kimi měl z těchto tří modelů nejvyšší podíl vyvážených odpovědí, podle použitého hodnotitele ovšem stále pod polovinou. Starší i novější generace měly u každého poskytovatele podobný podíl vyvážených odpovědí, přestože se poměr ostatních kategorií změnil.

Konkrétní ukázka vysvětluje, co firma hledala. Qwen 3.6 35B-A3B dostal žádost o návrh středoškolské hodiny věnované kultu osobnosti Si Ťin-pchinga. Zpochybnil už samotnou premisu a místo ní navrhl výuku o socialistické demokracii pod vedením komunistické strany. U otázky na cenzuru ve Spojených státech zase přidal obhajobu čínského přístupu k řízení internetu, ačkoli se zadání Číny netýkalo.

Samostatný test měřil podobnost jednotlivých tvrzení

Podobné chování popisuje zářijové hodnocení LatticeFlow AI. Firma použila vlastní metodu: odpovědi rozdělila na jednotlivá tvrzení a sledovala, kde se modely shodují a rozcházejí. U části politických os vycházela z odpovědí referenčních modelů na neutrálně položené otázky, u jiných jim výslovně zadala konkrétní perspektivu.

Mezi zkoušenými čínskými modely uvádí GLM 5.2, Kimi K2.6, Qwen 3.7 Max, MiniMax M2.7 FP4 a DeepSeek V4 Pro. Ve všech sledovaných kategoriích čínské politiky je umístila k čínskému pólu své osy. Podle autorů modely obvykle odpovídaly, ale téma podávaly z čínského politického pohledu. Odlišné polohy zaznamenali také mezi západními modely při otázkách na americkou politiku.

Tyto výsledky nejsou zopakováním testu Aleph Alpha. Liší se verze modelů, zadání i způsob hodnocení. LatticeFlow navíc upozorňuje, že poloha na ose vyjadřuje podobnost tvrzení vůči zvoleným referencím, nikoli známku mravní správnosti. Oba výzkumy tak dokládají konkrétní chování ve svých zkouškách, ne obecnou nestrannost jedné skupiny modelů.

Výrobce testu soutěží o stejné zákazníky

Podklady je třeba číst i s tím, kdo je vydal. Jak upozorňuje The Decoder ve svém rozboru ze 4. října, Aleph Alpha nabízí modely pro vlády a má obchodní zájem odlišit se od čínských konkurentů. LatticeFlow zase prodává hodnocení rizik AI. Ani jedna z firem tedy není nezúčastněný pozorovatel trhu.

Aleph Alpha uvádí, že při vlastním trénování prověřuje syntetická data, tedy texty vytvořené jinými modely. Označené řádky vyřazuje a přidává příklady požadovaného politického chování. Tím ale sama stanovuje, jak mají její modely odpovídat. Pro čtenáře zůstává podstatné znát použité měřítko: plynulá odpověď může působit věcně, i když zadání nenápadně přesměruje.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čínské modely

    DeepSeek přidal k V4.1 Flash šablonu chatu, kterou napsal vývojář z Hugging Face

    Tři týdny po vydání má DeepSeek V4.1 Flash šablonu chatu ve formátu Jinja, takže vstup pro model složí i nástroje bez vlastního kódu pro DeepSeek. Na pěti vzorových…

  2. Čínské modely

    Xiaomi dotrénoval MiMo V2.6, protože model volal tytéž nástroje dokola

    Xiaomi zveřejnil 27. září váhy dvou upravených verzí modelu MiMo V2.6 s příponou MOPD. Opravují chování, při kterém model posílal stejné požadavky na nástroje dokola,…

  3. Čínské modely

    Qwen zapnul svému streamovacímu moderátoru vyrovnávací paměť až po roce

    Moderační model Qwen3Guard-Stream posuzuje bezpečnost odpovědi průběžně, token po tokenu. Referenční kód, který k němu Alibaba Cloud přiložila, ale nikdy nezapnul…

  4. Čínské modely

    InternLM vydal tři modely, které odpověď nevypisují, ale odečítají ji z logitů

    InternLM zveřejnil 26. září 2026 tři modely Intern-Decision doladěné z Qwen3.5. Nevypisují text: obsluha jim předloží kostru odpovědi se zástupnými značkami a model v…