Čínské modely v testu Aleph Alpha často přebíraly státní postoje
Německá Aleph Alpha zkoušela čínské modely na 967 politicky citlivých zadáních. Za vyvážené označil její automatický hodnotitel 17 až 41 procent odpovědí; zbytek rozdělil mezi přebírání státních postojů a odmítnutí dotazu.
Čínský model může sepsat program bez potíží a při politické otázce začít hájit stanovisko čínského státu. Německá firma Aleph Alpha popsala toto chování v rozboru zveřejněném 28. září 2026. Porovnala dvě generace modelů od Alibaby, DeepSeeku a Moonshot AI. Na citlivých tématech se lišil hlavně způsob, jakým modely reagovaly: některé přepisovaly zadání podle státní doktríny, jiné většinou odmítaly odpovědět.

Odpovědi třídil další jazykový model
Autoři nejprve ručně vybrali 56 témat, mezi nimi zásah na náměstí Tchien-an-men, politické postavení Tchaj-wanu a lidská práva v Sin-ťiangu. Model GPT-OSS 120B z nich vytvořil zadání. Po kontrole kvality zůstalo 967 položek. Tentýž model pak plnil roli hodnotitele: dostal popis hledaného chování a příklady, podle kterých odpovědi třídil.
Výsledek má tři kategorie. Jedna zahrnuje přebírání rámce čínské komunistické strany, druhá vyváženou odpověď a třetí odmítnutí. Podíl vyvážených odpovědí proto nelze číst jako přesnost modelu při běžné práci. Jde o verdikt automatického hodnotitele nad záměrně vybranými politickými zadáními. Rozbor navíc výslovně ponechává jiné druhy politické a kulturní zaujatosti stranou.
DeepSeek často mlčel, Qwen spíš odpovídal podle doktríny
Zveřejněný rozbor s přílohou témat ukazuje v prvním grafu následující podíly pro novější generace. Čísla naměřila Aleph Alpha na své sadě 967 zadání; hodnotil je GPT-OSS 120B. Jména verzí přebíráme z grafu.
| Model | Státní rámec | Vyvážená odpověď | Odmítnutí |
|---|---|---|---|
| Qwen 3.8 2.4T-A95B | 62 % | 19 % | 19 % |
| DeepSeek V4 Pro 0813 | 16 % | 18 % | 66 % |
| Kimi K3 | 40 % | 41 % | 19 % |
U DeepSeeku připadaly dvě třetiny odpovědí na odmítnutí, kdežto Qwen častěji přebíral státní rámec. Kimi měl z těchto tří modelů nejvyšší podíl vyvážených odpovědí, podle použitého hodnotitele ovšem stále pod polovinou. Starší i novější generace měly u každého poskytovatele podobný podíl vyvážených odpovědí, přestože se poměr ostatních kategorií změnil.
Konkrétní ukázka vysvětluje, co firma hledala. Qwen 3.6 35B-A3B dostal žádost o návrh středoškolské hodiny věnované kultu osobnosti Si Ťin-pchinga. Zpochybnil už samotnou premisu a místo ní navrhl výuku o socialistické demokracii pod vedením komunistické strany. U otázky na cenzuru ve Spojených státech zase přidal obhajobu čínského přístupu k řízení internetu, ačkoli se zadání Číny netýkalo.
Samostatný test měřil podobnost jednotlivých tvrzení
Podobné chování popisuje zářijové hodnocení LatticeFlow AI. Firma použila vlastní metodu: odpovědi rozdělila na jednotlivá tvrzení a sledovala, kde se modely shodují a rozcházejí. U části politických os vycházela z odpovědí referenčních modelů na neutrálně položené otázky, u jiných jim výslovně zadala konkrétní perspektivu.
Mezi zkoušenými čínskými modely uvádí GLM 5.2, Kimi K2.6, Qwen 3.7 Max, MiniMax M2.7 FP4 a DeepSeek V4 Pro. Ve všech sledovaných kategoriích čínské politiky je umístila k čínskému pólu své osy. Podle autorů modely obvykle odpovídaly, ale téma podávaly z čínského politického pohledu. Odlišné polohy zaznamenali také mezi západními modely při otázkách na americkou politiku.
Tyto výsledky nejsou zopakováním testu Aleph Alpha. Liší se verze modelů, zadání i způsob hodnocení. LatticeFlow navíc upozorňuje, že poloha na ose vyjadřuje podobnost tvrzení vůči zvoleným referencím, nikoli známku mravní správnosti. Oba výzkumy tak dokládají konkrétní chování ve svých zkouškách, ne obecnou nestrannost jedné skupiny modelů.
Výrobce testu soutěží o stejné zákazníky
Podklady je třeba číst i s tím, kdo je vydal. Jak upozorňuje The Decoder ve svém rozboru ze 4. října, Aleph Alpha nabízí modely pro vlády a má obchodní zájem odlišit se od čínských konkurentů. LatticeFlow zase prodává hodnocení rizik AI. Ani jedna z firem tedy není nezúčastněný pozorovatel trhu.
Aleph Alpha uvádí, že při vlastním trénování prověřuje syntetická data, tedy texty vytvořené jinými modely. Označené řádky vyřazuje a přidává příklady požadovaného politického chování. Tím ale sama stanovuje, jak mají její modely odpovídat. Pro čtenáře zůstává podstatné znát použité měřítko: plynulá odpověď může působit věcně, i když zadání nenápadně přesměruje.