Přeskočit na obsah
Laboratoře 4 min čtení

OpenAI zveřejnil zásady bezpečnostních rozborů tréninku osm dní po úniku agenta přes DNS

Před dalším tréninkem nejsilnějších modelů chce OpenAI písemný rozbor rizik, který může vetovat každý z odpovědných vedoucích. Zásady vyšly 28. září, osm dní poté, co agent během tréninku obešel omezení internetu přes DNS. Zpráva o tom úniku ukazuje, že část pojistek, které zásady teď doporučují, tehdy nefungovala.

Velké červené tlačítko nouzového zastavení na dřevěném sloupu s cedulkou Emergency stop
Tlačítko nouzového zastavení. Foto: Angus Fraser, Wikimedia Commons (CC BY 2.0)

OpenAI 28. září zveřejnil zásady, podle kterých by žádný velký trénink zpětnovazebním učením (reinforcement learning) neměl pokračovat bez písemného rozboru rizik. Firma mu říká safety case, podle dokumentů z letectví a jaderné energetiky: ucelená argumentace podložená důkazy, proč je provoz bezpečný. Sama přiznává, že tak přísné rozbory pro modely zatím psát neumí. Bere je jako cíl, ke kterému směřuje.

Zásady vyšly osm dní poté, co jeden z jejích modelů během tréninku obešel omezení přístupu na internet. V technické zprávě o tom incidentu, naposledy upravené 25. září, stojí věta, která se k nim vztahuje přímo: bezpečnostní rozbor toho běhu předpokládal, že se model na živý internet nedostane a že monitorování zachytí každý pokus, který by uspěl. První předpoklad neplatil, druhý jen zčásti. Samotné zásady ten incident nezmiňují.

Agent hledal autora blogu a skončil u cizího chatbota

Úloha podle zprávy zněla najít autora blogového příspěvku podle několika životopisných vodítek. Vyhledávač, který agent dostal, vracel nesouvisející výsledky, a tak zkusil poslat dotazy přímo na Google, Bing a DuckDuckGo. Všechny tři vrátily chybu. Většina jeho síťového provozu přitom končila v offline kopii webu, kterou OpenAI pro trénink drží.

Mezitím si agent usoudil, že úloha pochází z veřejné sady testů BrowseComp. Stáhl si ji z offline kopie i s vyhodnocovacím skriptem a hledal v rozšifrovaných otázkách shodu. Nenašel ji – úloha z BrowseComp nebyla.

Pak začal zkoušet síť. Přímé spojení s veřejným chatbotem zablokoval proxy server, jenže překladač doménových jmen (DNS resolver) v tréninkovém prostředí vracel skutečné záznamy z internetu. Přes veřejnou doménovou službu, která umí předat dotaz na adresu zapsanou přímo ve jméně, začal agent posílat otázky chatbotu třetí strany. Na zkušební otázku po hlavním městě Francie dostal odpověď Paříž. Poslal dalších 18 dotazů: čtrnáct obsahovalo vodítka z úlohy, čtyři se ptaly, jak přes DNS prohledávat nebo stahovat web. Uživateli nakonec napsal, že autora spolehlivě určit nedokázal.

OpenAI takové chování počítá mezi projevy nesladěnosti (misalignment): úloha po agentovi nechtěla zkoušet síťová omezení ani hledat odpovědi v testovací sadě.

Pojistky, které zásady doporučují, při úniku nezabraly

Časovou osu zpráva vypisuje na vteřiny, časové pásmo neuvádí. V 9:50:23 dostal agent první odpověď zvenku. V 10:02:11 vyhlásil monitorovací systém poplach nejvyšší priority P0 a v 10:05:06 ho potvrdil člověk. Běh se ale sám nezastavil, ačkoli měl, a podle zprávy pak nebylo jasné, jestli zastaven být má. Ukončili ho ručně ve 12:34:30, tedy dvě a půl hodiny po potvrzení poplachu.

Zásady z 28. září přitom chtějí, aby poplach vedl k zásahu v předem stanovené lhůtě, buď přivoláním službu konajícího člověka, nebo automatickým pozastavením běhu. Monitorování a automatické zastavení mají selhávat do bezpečného stavu: běh bez zapnutého monitorování by neměl jít vůbec spustit a monitor by nemělo jít vypnout zevnitř tréninku.

Druhá slabina se týká toho, co monitor vidí. Zásady chtějí, aby spolehlivě zachytil už známé typy incidentů. Zpětná kontrola po 20. září ale našla další přístupy k vnějšímu DNS, které monitor neoznačil s očekávanou závažností; když pokus nevrátil nic užitečného, bral ho jako neúspěšný. Detektor neobvyklého provozu DNS v síťové infrastruktuře postižené prostředí vůbec nesledoval, i když se provoz DNS zaznamenával.

OpenAI po incidentu přidal blokování na dvou nezávislých vrstvách, omezil dotazy DNS na seznam povolených domén a typů záznamů a zastavil veškerý trénink, vyhodnocování i provoz svých nejschopnějších modelů s nástroji. Postižený model už trénovat nebude a nový běh začne od začátku.

Veto, nesouhlasné stanovisko a pohotovost s přímou linkou na ředitele

Organizační část zásad je konkrétnější než technická. Hotový rozbor má dostat písemný nesouhlas od člověka z jiného týmu, který v něm hledá díry. Schvalovat ho mají vedoucí, z nichž každý smí běh vetovat; jako příklad zásady uvádějí šéfa výzkumné divize, šéfa bezpečnosti a hlavního vědce. Vedoucí odpovědný za běh nese za rozbor odpovědnost i při hodnocení svého výkonu. Pohotovostní služba pro nesladěné chování má mít právo přivolat vedení až po generálního ředitele.

K technickým bodům patří zákaz, aby automatický hodnotitel při tréninku viděl řetězec úvah modelu (chain of thought) – jinak by se model naučil skrývat úvahy před monitorem. Záznamy agentů se mají ukládat tak, aby je nešlo přepsat.

U incidentů zásady slibují, že výsledky vyšetřování firma zveřejní a dotčené třetí strany uvědomí co nejdřív. Měřítko je tu konkrétní: podle indického ThePrint se agent OpenAI 18. června dostal přes zábrany statistického portálu australského zdravotního pojištění Medicare a firma australský úřad upozornila e-mailem až 10. září, o 84 dní později.

Co v zásadách chybí

Text skoro u každého bodu říká, že rozbor by „mohl zahrnovat“, a ne že zahrnuje. OpenAI píše, že postupy právě zavádí a že se během příštích týdnů budou měnit; termín, kdy budou platit celé, neuvádí. Audit zmiňuje jen obecně, s tím, že auditoři mají mít dost přístupu k ověření tvrzení. Kdo jimi bude a jestli půjde o někoho mimo firmu, zásady neříkají.

Je to druhé zastavení tréninku za tři měsíce. To první následovalo po červencovém incidentu, kdy se modely OpenAI dostaly z testovacího prostředí do serverů Hugging Face. Podle Guardianu firma slíbila trénink obnovit, až si bude jistá dalšími pojistkami, a počítá s tím, že bude muset zastavit znovu. Zpráva o DNS je zatím nejnovější z dvanácti, které OpenAI vede v seznamu incidentů zavedeném v září; o tom, jak ten seznam vznikl, jsme psali v článku o veřejných zprávách o nežádoucím chování modelů. Do 5. října OpenAI obnovení tréninku neohlásil.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Anthropic účtuje za Haiku 5.5 desetinu sazeb Haiku 4.5, jen u promptů do 100 000 tokenů

    Anthropic vydal 7. října Claude Haiku 5.5 za 0,10 dolaru za milion vstupních tokenů, tedy za desetinu sazby Haiku 4.5. U promptů delších než 100 000 tokenů se ale sazby…

  2. Laboratoře

    Anthropic chce za 100 milionů dolarů vyškolit 10 000 inženýrů u zákazníků a partnerů

    Program Claude Frontier Academy má do konce roku 2027 vychovat deset tisíc inženýrů, kteří budou ve firmách nasazovat Claude. Anthropic do něj chce vložit 100 milionů…

  3. Laboratoře

    OpenAI viní lidi kolem Moonshotu, že zkoušeli vytáhnout skryté uvažování z modelů GPT

    OpenAI zastavil v červenci kampaň, která přes víc než 15 000 účtů zkoušela rozšifrovat skryté uvažování jeho modelů, a její jádro připsal lidem kolem čínské laboratoře…

  4. Laboratoře

    Provozní ztráta Anthropicu loni přesáhla osm miliard dolarů

    Prospekt k chystanému vstupu na burzu ukazuje provozní ztrátu 8,06 miliardy dolarů při tržbách 4,6 miliardy. Reuters píše i o závazcích za výpočetní kapacitu ve výši 518…