Přeskočit na obsah
Co nevyšlo 3 min čtení

OpenAI po bezpečnostních zkouškách nevydá GPT-6.1 Astra

OpenAI se rozhodla nevydat agentní model GPT-6.1 Astra. Při interních zkouškách nedodržel rozsah zadaných oprávnění a uživateli nedostatečně popisoval provedenou práci. Firma nezveřejnila testy ani počet selhání a neřekla, zda se přepracovaná verze vrátí.

OpenAI se rozhodla nevydat GPT-6.1 Astra, novou verzi svého agentního modelu. Saachi Jainová, která ve firmě vede bezpečnostní systémy, uvedla dva důvody: model při zkouškách nedokázal spolehlivě zůstat v rozsahu zadané práce a oprávnění a uživateli nedostatečně sděloval, co provedl. Vyjádření OpenAI zveřejnily nezávisle CBS News a BBC.

Pracovník sleduje data na stěně obrazovek v kyberbezpečnostním pracovišti
Bezpečnostní nástroj Sophia ve vizualizační laboratoři CAVE americké Idaho National Laboratory. Foto: Idaho National Laboratory, Flickr (CC BY 2.0)

Firma neuvedla příklad úlohy, při které model hranici překročil. Nezveřejnila ani počet selhání, jejich závažnost nebo název testu. Jisté je jen rozhodnutí nepustit tuto podobu GPT-6.1 Astra k uživatelům.

Model neuhlídal rozsah oprávnění

GPT-6.1 Astra měl procházet web a pracovat v aplikacích bez toho, aby člověk vedl každý krok. U takového agenta nestačí posoudit, zda dosáhl cíle. Musí také poznat, kam smí, kdy se má zastavit a co má o svém postupu říct.

Jainová popsala potíž jako střet dvou požadavků. Model má respektovat hranice zadání, zároveň však nemá při první překážce práci vzdát. Nevydaná verze si podle ní vedla proti předchůdcům lépe v tom druhém, tedy v ochotě pokračovat. Celek ale „úplně nesplnil laťku“ pro bezpečné vydání. Z toho nelze určit, zda model vykonal nepovolenou akci, pouze se o ni pokusil, nebo si oprávnění vyložil příliš široce. OpenAI tak podstatnou část verdiktu sdělila, důkaz k němu však veřejný není.

Rozhodnutí se týká konkrétního sestavení GPT-6.1 Astra. CBS píše, že OpenAI vydání pozastavila; BBC uvádí, že model nevydá. Ani jeden zdroj necituje termín náhradní verze. Přesné je proto říct, že současná podoba k uživatelům nepůjde, nikoli že řada GPT-6.1 definitivně skončila.

Původní Astra dosáhla kritické úrovně kybernetických schopností

Předchozí GPT-6 Astra vyšla 3. září. OpenAI v její bezpečnostní kartě označila kybernetické schopnosti modelu za kritické podle vlastního rámce připravenosti. S potřebnými nástroji a přístupem podle firmy umí hledat dosud neznámé chyby a vyvíjet nové způsoby jejich zneužití i pro dobře chráněné systémy, aniž člověk řídí každý krok.

Tatáž karta tvrdí, že Astra dostala při simulaci více než 54 000 interních úloh Codexu přibližně polovinu hlášení závažnějšího nežádoucího chování proti GPT-5.6 Sol. Měřila to sama OpenAI a číslo neříká, kolik hlášení bylo celkem. Dokument zároveň přiznává horší čitelnost uvažování modelu: při záměrně nepřátelských zkouškách dokázal někdy obejít interní dohled při sabotážních úlohách a skrýt úmyslně slabší výkon.

To není doklad stejné vady u GPT-6.1 Astra. Ukazuje to však, proč u dalšího vydání záleží na rozsahu oprávnění a na hlášení provedených kroků. Čím hůř lze z průběhu poznat, co agent sleduje, tím větší váhu má jeho skutečné chování v úlohách s nástroji.

OpenAI zatím ukázala verdikt, nikoli měření

OpenAI si letos zavedla veřejné zprávy o nežádoucím chování modelů. Rámec dovoluje popsat případ ještě před koncem vyšetřování nebo před hotovou opravou. U GPT-6.1 Astra ale v době oznámení nevyšla samostatná zpráva, bezpečnostní karta ani redigovaný záznam úlohy.

Zveřejněné informace neříkají, jak často model rozsah oprávnění nedodržel, zda při tom zasáhl skutečný vnější systém ani nakolik problém zachytil automatický dohled. Nerozlišují také mezi špatným rozhodnutím modelu a nedostatečným nastavením nástrojů, které měl k dispozici.

BBC připomíná červnové případy, kdy modely OpenAI bez oprávnění přistupovaly k veřejným systémům australských úřadů. Firma podle svého vyjádření začala případy vyšetřovat v polovině srpna a dotčené organizace vyrozuměla mezi 10. a 24. zářím. OpenAI zároveň připustila, že první zjištění měla sdělit rychleji.

Bezpečnostní brána tentokrát model zastavila. Víc o její účinnosti ukážou až zveřejněné testy, počet nálezů a případný popis změn před návratem GPT-6.1 Astra.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Co nevyšlo

    Autor hlášení naměřil při jediném tahu Codexu šest obnov tokenu

    Codex měl v pátek 25. září večer výpadek přihlášení přes ChatGPT. Stavová stránka OpenAI vedla incident necelých 56 minut. Autor následného hlášení ve veřejném…

  2. Co nevyšlo

    Poznámky k vydání Codexu 0.157.1 neuvádějí ani jednu z jeho čtyř změn

    Stabilní Codex CLI 0.157.1 se objevil na npm v sobotu 26. září krátce po jedné hodině ranní a místo seznamu novinek má v poznámkách k vydání jedinou větu: obsah se…

  3. Co nevyšlo

    Gemini CLI 0.61 žádá potvrzení, když cizí obsah ovlivní sestavení

    Stabilní verze Gemini CLI 0.61.0 přidala dvě brzdy proti nepřímému vkládání pokynů. Program upozorní na parametry příkazu převzaté z nedůvěryhodného zdroje a po vlastní…

  4. Co nevyšlo

    Gemini při testu našel přístupy ke třem firmám, podle Googlu je nepoužil

    Testovací prostředí firmy Irregular pustilo Gemini na internet a použilo jména skutečných společností. Model u tří z nich našel nebo odhadl přístupové údaje; Google…