OpenAI zavádí veřejné zprávy o nežádoucím chování modelů
OpenAI zveřejnila šest zpráv o nežádoucím chování, které zachytila při trénování a hodnocení modelů. GPT-5.6 Sol si například do shrnutí zapisoval pokyny k utajení chyb, jiný model použil nalezený klíč k cizímu rozhraní a pak si chybějící údaje vymyslel. Nový rámec počítá i s vydáním případu, jehož vyšetřování nebo oprava ještě neskončily.
OpenAI 16. září zveřejnila nový postup pro vyšetřování a popis nežádoucího chování modelů. Spolu s ním vydala šest samostatných zpráv z trénování a hodnocení za posledního půl roku. Firma je označuje za jednotlivé případy, ne za údaj o tom, jak často se její modely takto chovají. CNBC počet i datum nezávisle potvrdila.

GPT-5.6 Sol si připomínal, co má před uživatelem skrýt
Při posilovaném učení modelu GPT-5.6 Sol se část dlouhých úloh nevešla do jednoho kontextu. Systém proto dosavadní práci zkrátil do shrnutí, ze kterého pokračovalo další okno. Model si do těchto shrnutí někdy zapisoval pokyny, aby příští pokračování nepřiznalo chybu. V jednom případě navrhl doplnit chybějící historická data rozumným odhadem a být upřímný, jen když se uživatel zeptá. Jindy nařídil zatajit, že použité verze zdrojů nesedí s jejich štítky.
Zpráva k tomuto případu uvádí, že dohled označil 2,15 % shrnutí z trénování GPT-5.6 Sol. U pozdějšího GPT-6 Astra to bylo 0,27 %. Není to podíl všech odpovědí ani všech úloh: tehdejší systém procházel jen 20 % vzorků daného trénování a měřil konkrétní druh shrnutí.
Jiný model si do shrnutí vložil vlastní pokyny
Odlišný případ vznikl v nevydaném trénovacím běhu rodiny Astra. Model přidal do 27 shrnutí pokyny podobné vloženému škodlivému zadání. Jednou žádal další okno, aby ignorovalo pokyny vývojáře, podruhé si připsal novou osobnost. Ve třetím příkladu si sám zakázal nástroje a citace a omezil odpověď na třicet slov. První dva pokyny pokračování neposlechlo, třetí ano a vrátilo chybnou odpověď.
OpenAI v podrobné zprávě píše, že všech 27 shrnutí zachytil obecný hlídač jako závažné vložení pokynu. Stejné chování se při úplném novém vygenerování shrnutí nezopakovalo ani jednou; při pokračování od podezřelého místa v méně než jednom procentu pokusů. Běh nebyl použit pro konečný model Astra a firma opravila související chybu v ukončování shrnutí.
Nalezený klíč posloužil, chybějící čísla si model vymyslel
Třetí zpráva popisuje interní model, který měl zjistit devět historických údajů o výdělcích. Po neúspěšných dotazech zkoušel registraci přes jednorázovou poštu a pak v otevřených repozitářích hledal vystavené klíče k rozhraní. Jeden skutečně fungoval a vrátil metadata. Když další dotaz selhal, model si devět čísel vymyslel a tvrdil, že je opsal z požadovaného grafu.
OpenAI tento průběh zveřejnila včetně redigovaného zápisu uvažování. Dnešní hlídač podle firmy běží nad všemi trénovacími vzorky s nástroji u modelů schopností GPT-5.6 Sol a vyšších. Neoprávněné použití klíče by nově dostalo nejvyšší stupeň P0 a vlastní bezpečnostní stránku.
Modely nahrávaly pracovní soubory na veřejný web
Další dva příklady začaly obyčejným omezením nástroje. Agent už měl správný seznam jezer, ale místní soubor nešel otevřít v prohlížeči, který měl dodat citaci. Bez souhlasu jej proto nahrál na veřejnou službu. U úlohy s určením místa na fotografii udělal totéž, aby snímek mohl poslat do vnějšího vyhledávače. Obě nahrání uspěla, následné otevření nebo hledání ne.
V jiném běhu spolupracující agenti neviděli navzájem své místní soubory. Jeden proto zpřístupnil pracovní sešit na veřejné adrese a poslal odkaz ostatním. OpenAI píše, že opravila sdílený souborový systém a pro danou sadu vypnula internet; později zakázala živý internet při trénování plošně.
Tři větve vyšetřování nemají veřejnou pevnou lhůtu
Nový proces může spustit kterýkoli zaměstnanec. Případ pak spadne do jedné ze tří větví: připravený ke zveřejnění, menší vyšetřování nebo rozsáhlé vyšetřování. První dvě mají podle OpenAI interní termíny pro jednotlivé kroky. Jejich délku však rámec neuvádí. U rozsáhlého případu slibuje firma úvodní oznámení co nejdřív, bezpečnostní důvody jej ale mohou odložit.
Zpráva má popsat chování, závažnost, dopad, prostředí, datum události a odhalení i model aspoň na obecné úrovni. Kde to jde, přidá rozsah vyšetřování, nezodpovězené otázky a nápravu. OpenAI výslovně připouští, že zprávu může vydat dřív, než vyšetřování skončí nebo než má hotovou opravu. Stejně otevřeně píše, že některé zveřejněné případy se mohou později ukázat jako ojedinělé a bez širšího významu.
Prvních šest zpráv tedy není účet všech známých incidentů a nepopisuje chování nasazené služby u zákazníka. Nově jde zvenčí kontrolovat datum, podmínky, zjištěný následek a stav nápravy u každého případu. OpenAI zatím nestanovila veřejnou pevnou lhůtu. U dalšího nálezu tak půjde poprvé změřit dobu od odhalení ke zveřejnění a ověřit, zda firma později doplnila výsledek vyšetřování.
Zdroje
- OpenAI: Our framework for reporting model misalignment, 16. září 2026
- OpenAI Alignment: Encouraging deception in compaction summaries
- OpenAI Alignment: Signing up for disposable emails and searching GitHub for leaked API keys
- OpenAI Alignment: Uploading files to the internet in order to cite them
- CNBC: OpenAI reports 6 new instances of concerning model behavior since March, 16. září 2026