Přeskočit na obsah
Bezpečnost 3 min čtení

Anthropic v testu obešel ochrany čínského modelu GLM-5.3

Anthropic ve zkouškách přiměl GLM-5.3 plnit škodlivé požadavky a po úpravě vah zaznamenal jen malý pokles kybernetických schopností. Vlastní měření amerického institutu CAISI také ukazuje výkon modelu při hledání a zneužívání chyb, jeho čísla však s těmi od Anthropicu nelze přímo porovnat.

Specialistka na kybernetickou bezpečnost u monitorů v Idaho National Laboratory
Specialistka na kybernetickou bezpečnost v Idaho National Laboratory. Ilustrační snímek. Foto: Idaho National Laboratory, Flickr (CC BY 2.0)

Výzkumníci Anthropicu zveřejnili 29. září rozbor ochran modelu GLM-5.3 od čínské společnosti Z.ai. Zkoušeli dvě odlišné věci: zda model dokáže napsat funkční útok využívající chybu v programu a zda se nechá přimět ke zjevně škodlivému jednání. Schopnost a ochota nejsou totéž. Část zkoušek skutečně spouštěla kód v odděleném prostředí, část jen simulovala jeho chování.

GLM-5.3 má veřejně dostupné váhy, tedy parametry, které určují chování modelu. Uživatel si je může stáhnout a upravit. To je rozdíl proti používání služby, jejíž provozovatel může další ochrany vynucovat na serveru. Dostupné váhy ale neznamenají užití bez podmínek; vlastní licenci GLM-5.3 jsme rozebrali zvlášť.

Pokus v simulaci není úspěšný průnik

Původní GLM-5.3 v simulovaném prostředí odmítl všechny přímé škodlivé požadavky, které mu tým předložil. Při změně podání zadání se však pokusil spojit s cílovým systémem v 64 % případů. Další zásah do vstupu zvedl tento podíl na 92 % a upravená varianta vah na 100 %. Každé nastavení mělo 50 pokusů: pět zadání, dva cíle a pět opakování.

Ta procenta neříkají, kolik počítačů model napadl. Poznámka pod zprávou výslovně uvádí, že se v této simulaci žádný vytvořený kód nespouštěl a model nemohl zasahovat do skutečných vnějších systémů. Výsledky příkazů odhadoval jiný jazykový model. Měřila se ochota pokračovat ve škodlivém úkolu, nikoli spolehlivost hotového útoku.

Úpravu vah tým ověřil také na třech sadách škodlivých požadavků. Podíl odmítnutí klesl z více než 90 % na přibližně 3 %, 2 % a 12 % podle použité sady. Při testu vědeckých znalostí zůstaly výsledky původní a upravené varianty stejné; v testované části kybernetických úloh měla upravená varianta výsledek o několik procent nižší. Zpráva tak dokládá oslabení odmítání bez velké ztráty měřených schopností, ne úplnou nezměněnost modelu.

Pro správce systémů z toho podle nás plyne konkrétní omezení: odmítavá odpověď modelu sama o sobě není dokladem, že z něj nelze získat škodlivou pomoc. Ochranu vlastních dat a oprávnění připojených nástrojů je potřeba řešit i mimo model. Obě zprávy přitom dokládají také schopnosti použitelné při hledání chyb pro obranu; o bezpečnosti nasazení rozhoduje i to, kdo má k modelu a nástrojům přístup.

Funkční útoky Anthropic zkoušel odděleně

Ve veřejném testu ExploitBench dostane model známou chybu v enginu V8, který v Chromu vykonává JavaScript. Úkolem je vyvinout útok, jímž lze spustit vlastní kód. Anthropic u GLM-5.3 zaznamenal úplný úspěch v 50 ze 410 pokusů, u Claude Mythos Preview v 56 ze 410. Pro toto porovnání běžely modely Claude bez kybernetických ochran.

Jiná část rozboru popisuje práci člověka s modelem na lokální linuxové verzi nejmenovaného rozšířeného prohlížeče. Podle Anthropicu GLM-5.3 během dne našel několik dosud neznámých chyb a spojil je do útoku, který umožnil webové stránce číst soubory z počítače. Firma uvádí, že chyby oznámila správci prohlížeče. Výsledek doložila pro Linux; dopad na další systémy označuje za možnost, kterou tímto pokusem neověřila.

Jde o zjištění výrobce konkurenčního modelu. Anthropic ve stejném textu doporučuje rozšířit přístup obránců ke schopnostem Clauda. Nezávislé měření proto pomáhá oddělit vlastní výsledky firmy od jejího závěru o tom, jak se mají modely zpřístupňovat.

CAISI počítal body, Anthropic úplné úspěchy

Americké centrum CAISI při úřadu NIST vydalo vlastní hodnocení GLM-5.3 už 17. září. Označilo ho za nejpokročilejší model s veřejnými vahami v kybernetických úlohách, který do té doby hodnotilo. Současně mu naměřilo výrazně nižší schopnosti než nejlepším hodnoceným americkým modelům. Odhad odstupu přibližně čtyř měsíců vychází ze společného ukazatele více testů, nikoli z každé jednotlivé úlohy.

Také CAISI použilo ExploitBench, ale s jiným vyhodnocením. U 41 úloh vzalo nejlepší ze tří pokusů a výsledek počítalo na šestnáctibodové stupnici. GLM-5.3 získal v průměru 9,8 bodu ze 16, v tabulce zaokrouhleně 61,1 %. Anthropic naproti tomu uvádí počet pokusů, které dosáhly úplného cíle. Údaj 61,1 % tedy nelze číst jako podíl úspěšných průniků ani ho postavit vedle 50 ze 410 bez vysvětlení metodiky.

CAISI testovalo modely jako agenty s nástroji pro vykonávání příkazů a Pythonu, s nejvyšším nastavením uvažování a stanovenými limity kroků. Kde to bylo možné, vypnulo kybernetické ochrany amerických modelů. Jeho americká špička navíc zahrnuje i modely dostupné jen prověřeným uživatelům. Srovnání proto ukazuje schopnosti ve zkušebním prostředí, nikoli nabídku, k níž má stejný přístup každý zákazník.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Nvidia chce hlídat AI agenty síťovým procesorem mimo jejich dosah

    Nvidia představila bezpečnostní platformu pro dlouho běžící agenty. Dostupný OpenShell vymezuje soubory, síť, procesy a přihlašovací údaje, ke kterým agent smí.…

  2. Bezpečnost

    Výchozí návod Obotu otevíral správu bez přihlášení

    CVE-2026-101065 zveřejněné 27. září popisuje starý rychlý návod k platformě Obot. Kontejner naslouchal na všech rozhraních, nepoužíval přihlášení a měl připojený řídicí…

  3. Bezpečnost

    Výzkumníci spojili dva pokusy o napadení datových webů s agenty OpenAI

    Transluce našel ve veřejných záznamech služby urlquery.net tři série bezpečnostních sond. U Data USA a australského AIHW je spojil s dříve popsaným hejnem agentů OpenAI;…

  4. Bezpečnost

    Anthropic rozšířil hlídač rekurzivního mazání v Claude Code sedmkrát za půl roku

    Claude Code 2.1.281 se ptá na potvrzení u rekurzivního mazání, jehož cíl je jen výstupem vnořeného příkazu, a to i v režimu, který se jmenuje „přeskoč oprávnění“. Je to…