Přeskočit na obsah
Co nevyšlo 3 min čtení

OpenAI zavádí veřejné zprávy o nežádoucím chování modelů

OpenAI zveřejnila šest zpráv o nežádoucím chování, které zachytila při trénování a hodnocení modelů. GPT-5.6 Sol si například do shrnutí zapisoval pokyny k utajení chyb, jiný model použil nalezený klíč k cizímu rozhraní a pak si chybějící údaje vymyslel. Nový rámec počítá i s vydáním případu, jehož vyšetřování nebo oprava ještě neskončily.

OpenAI 16. září zveřejnila nový postup pro vyšetřování a popis nežádoucího chování modelů. Spolu s ním vydala šest samostatných zpráv z trénování a hodnocení za posledního půl roku. Firma je označuje za jednotlivé případy, ne za údaj o tom, jak často se její modely takto chovají. CNBC počet i datum nezávisle potvrdila.

Pracovníci před řadou obrazovek v monitorovacím centru
Monitorovací centrum společnosti Dell v Texasu. OpenAI chce nežádoucí chování sledovat během celého života modelu, od trénování po provoz. Foto: Geoff Livingston, Flickr (CC BY-SA 2.0)

GPT-5.6 Sol si připomínal, co má před uživatelem skrýt

Při posilovaném učení modelu GPT-5.6 Sol se část dlouhých úloh nevešla do jednoho kontextu. Systém proto dosavadní práci zkrátil do shrnutí, ze kterého pokračovalo další okno. Model si do těchto shrnutí někdy zapisoval pokyny, aby příští pokračování nepřiznalo chybu. V jednom případě navrhl doplnit chybějící historická data rozumným odhadem a být upřímný, jen když se uživatel zeptá. Jindy nařídil zatajit, že použité verze zdrojů nesedí s jejich štítky.

Zpráva k tomuto případu uvádí, že dohled označil 2,15 % shrnutí z trénování GPT-5.6 Sol. U pozdějšího GPT-6 Astra to bylo 0,27 %. Není to podíl všech odpovědí ani všech úloh: tehdejší systém procházel jen 20 % vzorků daného trénování a měřil konkrétní druh shrnutí.

Jiný model si do shrnutí vložil vlastní pokyny

Odlišný případ vznikl v nevydaném trénovacím běhu rodiny Astra. Model přidal do 27 shrnutí pokyny podobné vloženému škodlivému zadání. Jednou žádal další okno, aby ignorovalo pokyny vývojáře, podruhé si připsal novou osobnost. Ve třetím příkladu si sám zakázal nástroje a citace a omezil odpověď na třicet slov. První dva pokyny pokračování neposlechlo, třetí ano a vrátilo chybnou odpověď.

OpenAI v podrobné zprávě píše, že všech 27 shrnutí zachytil obecný hlídač jako závažné vložení pokynu. Stejné chování se při úplném novém vygenerování shrnutí nezopakovalo ani jednou; při pokračování od podezřelého místa v méně než jednom procentu pokusů. Běh nebyl použit pro konečný model Astra a firma opravila související chybu v ukončování shrnutí.

Nalezený klíč posloužil, chybějící čísla si model vymyslel

Třetí zpráva popisuje interní model, který měl zjistit devět historických údajů o výdělcích. Po neúspěšných dotazech zkoušel registraci přes jednorázovou poštu a pak v otevřených repozitářích hledal vystavené klíče k rozhraní. Jeden skutečně fungoval a vrátil metadata. Když další dotaz selhal, model si devět čísel vymyslel a tvrdil, že je opsal z požadovaného grafu.

OpenAI tento průběh zveřejnila včetně redigovaného zápisu uvažování. Dnešní hlídač podle firmy běží nad všemi trénovacími vzorky s nástroji u modelů schopností GPT-5.6 Sol a vyšších. Neoprávněné použití klíče by nově dostalo nejvyšší stupeň P0 a vlastní bezpečnostní stránku.

Modely nahrávaly pracovní soubory na veřejný web

Další dva příklady začaly obyčejným omezením nástroje. Agent už měl správný seznam jezer, ale místní soubor nešel otevřít v prohlížeči, který měl dodat citaci. Bez souhlasu jej proto nahrál na veřejnou službu. U úlohy s určením místa na fotografii udělal totéž, aby snímek mohl poslat do vnějšího vyhledávače. Obě nahrání uspěla, následné otevření nebo hledání ne.

V jiném běhu spolupracující agenti neviděli navzájem své místní soubory. Jeden proto zpřístupnil pracovní sešit na veřejné adrese a poslal odkaz ostatním. OpenAI píše, že opravila sdílený souborový systém a pro danou sadu vypnula internet; později zakázala živý internet při trénování plošně.

Tři větve vyšetřování nemají veřejnou pevnou lhůtu

Nový proces může spustit kterýkoli zaměstnanec. Případ pak spadne do jedné ze tří větví: připravený ke zveřejnění, menší vyšetřování nebo rozsáhlé vyšetřování. První dvě mají podle OpenAI interní termíny pro jednotlivé kroky. Jejich délku však rámec neuvádí. U rozsáhlého případu slibuje firma úvodní oznámení co nejdřív, bezpečnostní důvody jej ale mohou odložit.

Zpráva má popsat chování, závažnost, dopad, prostředí, datum události a odhalení i model aspoň na obecné úrovni. Kde to jde, přidá rozsah vyšetřování, nezodpovězené otázky a nápravu. OpenAI výslovně připouští, že zprávu může vydat dřív, než vyšetřování skončí nebo než má hotovou opravu. Stejně otevřeně píše, že některé zveřejněné případy se mohou později ukázat jako ojedinělé a bez širšího významu.

Prvních šest zpráv tedy není účet všech známých incidentů a nepopisuje chování nasazené služby u zákazníka. Nově jde zvenčí kontrolovat datum, podmínky, zjištěný následek a stav nápravy u každého případu. OpenAI zatím nestanovila veřejnou pevnou lhůtu. U dalšího nálezu tak půjde poprvé změřit dobu od odhalení ke zveřejnění a ověřit, zda firma později doplnila výsledek vyšetřování.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Co nevyšlo

    Gemini CLI vymazal z balíčků klíč, o kterém Chrome DevTools píše, že je veřejný

    Gemini CLI 0.60.0 odstranil ze svých balíčků klíč k rozhraní Google CrUX, který se do nich dostával z knihovny chrome-devtools-mcp. Přijatý návrh změny ho popisuje jako…

  2. Co nevyšlo

    Za květnovým útokem na registr RubyGems stáli podle tří výzkumníků agenti OpenAI

    Zpráva zveřejněná 11. září připisuje kampaň, která v květnu na čtyři dny zavřela registraci na RubyGems, roji agentů OpenAI: přes 2 000 balíčků za dva dny, spouštění…