OpenAI viní lidi kolem Moonshotu, že zkoušeli vytáhnout skryté uvažování z modelů GPT
OpenAI zastavil v červenci kampaň, která přes víc než 15 000 účtů zkoušela rozšifrovat skryté uvažování jeho modelů, a její jádro připsal lidem kolem čínské laboratoře Moonshot AI. Technický doklad pro to nezveřejnil. Slabinu, na které útok stál, popsali nezávislí výzkumníci už v srpnu u OpenAI, Anthropicu i Googlu.

OpenAI 30. září zveřejnil zprávu o kampani, která se od začátku července snažila dostat z jeho modelů chráněné uvažování. Tak firma říká záznamu, ve kterém si model úlohu promýšlí, než napíše odpověď. Uživatel ho nevidí a rozhraní ho klientovi vrací jen zašifrovaný. Jádro kampaně OpenAI připsal „jednotlivcům spojeným s Moonshot AI“, tedy s čínskou laboratoří, která vyvíjí modely Kimi.
Firma to celé řadí pod destilaci: výstupy cizího modelu se bez svolení použijí k výcviku nebo vylepšení vlastního. Uvažování je pro takový výcvik cennější než hotová odpověď, protože ukazuje i postup.
Šestnáct tisíc pokusů za dva dny
Podle zprávy začala aktivita 1. července v malém objemu. Prudce vzrostla 24. a 25. července, kdy OpenAI napočítal 16 000 požadavků s tímtéž vzorem od více než 4 000 uživatelů. Další pátrání našlo příbuzné dotazy u skupiny přes 15 000 účtů a 28. července byla podle firmy kampaň úplně zastavená. Poznámka pod čarou dodává, že čísla popisují pokusy, ne nutně úspěšná vytažení.
Šifru útočníci nelomili a do databází se nedostali. Zkopírovali zašifrované uvažování z jedné konverzace, vložili ho do jiné a požádali tamní model, aby obsah rozšifroval a přepsal. OpenAI píše, že tahle manipulace není slabina jen jeho modelů, a zjištění předal ostatním laboratořím přes Frontier Model Forum i vládním kanálům.
Slabinu popsali výzkumníci už v srpnu
Zpráva odkazuje na nezávislé výzkumníky, kteří příbuzné chyby nahlásili. Jejich práce Stealing Reasoning Traces from Proprietary LLM APIs vyšla na arXivu 10. srpna a mechanismus rozebírá podrobněji. Anthropic, OpenAI i Google vracejí uvažování jako zašifrovaný blok, který klient posílá zpátky s každým dalším dotazem, aby ho poskytovatel nemusel ukládat u sebe. Autoři zjistili, že bloky jsou u téhož poskytovatele zaměnitelné mezi relacemi, uživateli i modely.
Na tom útok stojí. Velký model je vycvičený, aby své uvažování neprozradil. Jeho levnější sourozenec takovou ochranu často nemá, blok od velkého modelu přijme a poslouží jako dešifrovací nástroj. Jako nejslabší použitelný model uvádějí autoři u Clauda Haiku 4.5, u OpenAI GPT-5.6 Luna a u Googlu Gemini Robotics 1.6.
Navazují přitom na starší nález. Podle práce už v květnu upozornil jiný výzkumník, že bloky jdou přehrát mimo původní kontext, a poskytovatelé tehdy podle něj žádný bezpečnostní dopad nepřiznali. Po srpnovém nahlášení všechny firmy příjem potvrdily a autoři pak stejné útoky zopakovat nedokázali.
Klíče a hesla ve veřejných záznamech
Pro běžné uživatele je v práci důležitější jiná část než destilace. Vývojáři často zveřejňují záznamy relací svých agentů a netuší, co v zašifrovaných blocích leží. Autoři rozšifrovali 315 320 bloků posbíraných z veřejných repozitářů a našli v nich 367 osobních údajů a 182 přístupových údajů, tedy klíčů k API a hesel. Podle práce je po spočítání hned smazali. Kdo záznamy sdílí, má z nich bloky uvažování vyškrtat, i když je čitelná část textu očištěná.
Poskytovatelům navrhují dvě cesty. Buď uvažování držet na serveru a klientovi dávat jen náhodný identifikátor, nebo zašifrovaný blok svázat s uživatelem a konverzací, aby jinde neprošel. OpenAI ve zprávě popisuje krok podobný té druhé: uzavřel cestu, kterou šlo cizí zašifrované uvažování přehrát a obnovit jeho obsah, a přidal kontroly, které pozdrží průběžně posílaný výstup, když by uvažování prozrazoval. Hotovo podle vlastních slov nemá. Stejnou ochranu potřebují i nasazení u partnerů v cloudu.
Na čem stojí obvinění Moonshotu
Technický doklad, podle kterého OpenAI jádro kampaně Moonshotu připsal, ve zprávě není. Upozornil na to CyberScoop, kterému OpenAI další podrobnosti „z bezpečnostních důvodů“ odmítl dát. Firma sama píše, že neví, jestli všechny zachycené operátory řídil jediný aktér. Moonshot podle CNBC na žádost o vyjádření hned neodpověděl.
Je to druhé takové obvinění za necelé tři týdny. Anthropic 10. září tvrdil, že Moonshot a DeepSeek posílaly dotazy svých uživatelů Claudovi a odpovědi sbíraly k výcviku vlastních modelů. Tam šlo o viditelné odpovědi, tady o tu část, kterou poskytovatel zásadně neukazuje. Moonshot přitom váhy svých modelů dává ke stažení, naposledy u Kimi K3.
Zdroje
- OpenAI: Disrupting a coordinated model-distillation campaign, 30. září 2026.
- Panfilov a kol.: Stealing Reasoning Traces from Proprietary LLM APIs, arXiv, 10. srpna 2026.
- CyberScoop: OpenAI reveals ‘novel’ encryption bypass used in distillation attack, 30. září 2026.
- CNBC: OpenAI links China’s Moonshot AI to extraction attempt, 1. října 2026.