Přeskočit na obsah
Laboratoře 3 min čtení

OpenAI viní lidi kolem Moonshotu, že zkoušeli vytáhnout skryté uvažování z modelů GPT

OpenAI zastavil v červenci kampaň, která přes víc než 15 000 účtů zkoušela rozšifrovat skryté uvažování jeho modelů, a její jádro připsal lidem kolem čínské laboratoře Moonshot AI. Technický doklad pro to nezveřejnil. Slabinu, na které útok stál, popsali nezávislí výzkumníci už v srpnu u OpenAI, Anthropicu i Googlu.

Kancelářská budova na 1515 Third Street v San Francisku
Budova na 1515 Third Street v sanfranciské čtvrti Mission Bay, v době pořízení snímku (červen 2025) sídlo OpenAI. Foto: Coolcaesar, Wikimedia Commons (CC BY 4.0)

OpenAI 30. září zveřejnil zprávu o kampani, která se od začátku července snažila dostat z jeho modelů chráněné uvažování. Tak firma říká záznamu, ve kterém si model úlohu promýšlí, než napíše odpověď. Uživatel ho nevidí a rozhraní ho klientovi vrací jen zašifrovaný. Jádro kampaně OpenAI připsal „jednotlivcům spojeným s Moonshot AI“, tedy s čínskou laboratoří, která vyvíjí modely Kimi.

Firma to celé řadí pod destilaci: výstupy cizího modelu se bez svolení použijí k výcviku nebo vylepšení vlastního. Uvažování je pro takový výcvik cennější než hotová odpověď, protože ukazuje i postup.

Šestnáct tisíc pokusů za dva dny

Podle zprávy začala aktivita 1. července v malém objemu. Prudce vzrostla 24. a 25. července, kdy OpenAI napočítal 16 000 požadavků s tímtéž vzorem od více než 4 000 uživatelů. Další pátrání našlo příbuzné dotazy u skupiny přes 15 000 účtů a 28. července byla podle firmy kampaň úplně zastavená. Poznámka pod čarou dodává, že čísla popisují pokusy, ne nutně úspěšná vytažení.

Šifru útočníci nelomili a do databází se nedostali. Zkopírovali zašifrované uvažování z jedné konverzace, vložili ho do jiné a požádali tamní model, aby obsah rozšifroval a přepsal. OpenAI píše, že tahle manipulace není slabina jen jeho modelů, a zjištění předal ostatním laboratořím přes Frontier Model Forum i vládním kanálům.

Slabinu popsali výzkumníci už v srpnu

Zpráva odkazuje na nezávislé výzkumníky, kteří příbuzné chyby nahlásili. Jejich práce Stealing Reasoning Traces from Proprietary LLM APIs vyšla na arXivu 10. srpna a mechanismus rozebírá podrobněji. Anthropic, OpenAI i Google vracejí uvažování jako zašifrovaný blok, který klient posílá zpátky s každým dalším dotazem, aby ho poskytovatel nemusel ukládat u sebe. Autoři zjistili, že bloky jsou u téhož poskytovatele zaměnitelné mezi relacemi, uživateli i modely.

Na tom útok stojí. Velký model je vycvičený, aby své uvažování neprozradil. Jeho levnější sourozenec takovou ochranu často nemá, blok od velkého modelu přijme a poslouží jako dešifrovací nástroj. Jako nejslabší použitelný model uvádějí autoři u Clauda Haiku 4.5, u OpenAI GPT-5.6 Luna a u Googlu Gemini Robotics 1.6.

Navazují přitom na starší nález. Podle práce už v květnu upozornil jiný výzkumník, že bloky jdou přehrát mimo původní kontext, a poskytovatelé tehdy podle něj žádný bezpečnostní dopad nepřiznali. Po srpnovém nahlášení všechny firmy příjem potvrdily a autoři pak stejné útoky zopakovat nedokázali.

Klíče a hesla ve veřejných záznamech

Pro běžné uživatele je v práci důležitější jiná část než destilace. Vývojáři často zveřejňují záznamy relací svých agentů a netuší, co v zašifrovaných blocích leží. Autoři rozšifrovali 315 320 bloků posbíraných z veřejných repozitářů a našli v nich 367 osobních údajů a 182 přístupových údajů, tedy klíčů k API a hesel. Podle práce je po spočítání hned smazali. Kdo záznamy sdílí, má z nich bloky uvažování vyškrtat, i když je čitelná část textu očištěná.

Poskytovatelům navrhují dvě cesty. Buď uvažování držet na serveru a klientovi dávat jen náhodný identifikátor, nebo zašifrovaný blok svázat s uživatelem a konverzací, aby jinde neprošel. OpenAI ve zprávě popisuje krok podobný té druhé: uzavřel cestu, kterou šlo cizí zašifrované uvažování přehrát a obnovit jeho obsah, a přidal kontroly, které pozdrží průběžně posílaný výstup, když by uvažování prozrazoval. Hotovo podle vlastních slov nemá. Stejnou ochranu potřebují i nasazení u partnerů v cloudu.

Na čem stojí obvinění Moonshotu

Technický doklad, podle kterého OpenAI jádro kampaně Moonshotu připsal, ve zprávě není. Upozornil na to CyberScoop, kterému OpenAI další podrobnosti „z bezpečnostních důvodů“ odmítl dát. Firma sama píše, že neví, jestli všechny zachycené operátory řídil jediný aktér. Moonshot podle CNBC na žádost o vyjádření hned neodpověděl.

Je to druhé takové obvinění za necelé tři týdny. Anthropic 10. září tvrdil, že Moonshot a DeepSeek posílaly dotazy svých uživatelů Claudovi a odpovědi sbíraly k výcviku vlastních modelů. Tam šlo o viditelné odpovědi, tady o tu část, kterou poskytovatel zásadně neukazuje. Moonshot přitom váhy svých modelů dává ke stažení, naposledy u Kimi K3.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Laboratoře

    Provozní ztráta Anthropicu loni přesáhla osm miliard dolarů

    Prospekt k chystanému vstupu na burzu ukazuje provozní ztrátu 8,06 miliardy dolarů při tržbách 4,6 miliardy. Reuters píše i o závazcích za výpočetní kapacitu ve výši 518…

  2. Laboratoře

    Anthropic připsal Claudovi nález enzymového systému s neznámou funkcí

    Model Claude podle technické zprávy Anthropicu během 21,5 hodiny upozornil na opakující se úseky DNA u neobvyklé reverzní transkriptázy. Laboratorní pokusy potvrdily…

  3. Laboratoře

    Historické texty z Oxfordu skončily v trénovacích datech OpenAI

    Interní zápisy získané Guardianem ukazují, že digitalizované sbírky Bodleian Libraries naplnily trénovací soubor OpenAI. Veřejné oznámení partnerství z března 2025…

  4. Laboratoře

    Cache promptu vydrží u GPT-6 nejméně třicet minut od posledního použití

    OpenAI 22. září popsala, jak u řady GPT-6 funguje ukládání promptů do cache. Čtení z ní stojí desetinu běžné sazby za vstup, zápis do ní naopak o čtvrtinu víc. Lhůtu, po…