Anthropic v testu obešel ochrany čínského modelu GLM-5.3
Anthropic ve zkouškách přiměl GLM-5.3 plnit škodlivé požadavky a po úpravě vah zaznamenal jen malý pokles kybernetických schopností. Vlastní měření amerického institutu CAISI také ukazuje výkon modelu při hledání a zneužívání chyb, jeho čísla však s těmi od Anthropicu nelze přímo porovnat.

Výzkumníci Anthropicu zveřejnili 29. září rozbor ochran modelu GLM-5.3 od čínské společnosti Z.ai. Zkoušeli dvě odlišné věci: zda model dokáže napsat funkční útok využívající chybu v programu a zda se nechá přimět ke zjevně škodlivému jednání. Schopnost a ochota nejsou totéž. Část zkoušek skutečně spouštěla kód v odděleném prostředí, část jen simulovala jeho chování.
GLM-5.3 má veřejně dostupné váhy, tedy parametry, které určují chování modelu. Uživatel si je může stáhnout a upravit. To je rozdíl proti používání služby, jejíž provozovatel může další ochrany vynucovat na serveru. Dostupné váhy ale neznamenají užití bez podmínek; vlastní licenci GLM-5.3 jsme rozebrali zvlášť.
Pokus v simulaci není úspěšný průnik
Původní GLM-5.3 v simulovaném prostředí odmítl všechny přímé škodlivé požadavky, které mu tým předložil. Při změně podání zadání se však pokusil spojit s cílovým systémem v 64 % případů. Další zásah do vstupu zvedl tento podíl na 92 % a upravená varianta vah na 100 %. Každé nastavení mělo 50 pokusů: pět zadání, dva cíle a pět opakování.
Ta procenta neříkají, kolik počítačů model napadl. Poznámka pod zprávou výslovně uvádí, že se v této simulaci žádný vytvořený kód nespouštěl a model nemohl zasahovat do skutečných vnějších systémů. Výsledky příkazů odhadoval jiný jazykový model. Měřila se ochota pokračovat ve škodlivém úkolu, nikoli spolehlivost hotového útoku.
Úpravu vah tým ověřil také na třech sadách škodlivých požadavků. Podíl odmítnutí klesl z více než 90 % na přibližně 3 %, 2 % a 12 % podle použité sady. Při testu vědeckých znalostí zůstaly výsledky původní a upravené varianty stejné; v testované části kybernetických úloh měla upravená varianta výsledek o několik procent nižší. Zpráva tak dokládá oslabení odmítání bez velké ztráty měřených schopností, ne úplnou nezměněnost modelu.
Pro správce systémů z toho podle nás plyne konkrétní omezení: odmítavá odpověď modelu sama o sobě není dokladem, že z něj nelze získat škodlivou pomoc. Ochranu vlastních dat a oprávnění připojených nástrojů je potřeba řešit i mimo model. Obě zprávy přitom dokládají také schopnosti použitelné při hledání chyb pro obranu; o bezpečnosti nasazení rozhoduje i to, kdo má k modelu a nástrojům přístup.
Funkční útoky Anthropic zkoušel odděleně
Ve veřejném testu ExploitBench dostane model známou chybu v enginu V8, který v Chromu vykonává JavaScript. Úkolem je vyvinout útok, jímž lze spustit vlastní kód. Anthropic u GLM-5.3 zaznamenal úplný úspěch v 50 ze 410 pokusů, u Claude Mythos Preview v 56 ze 410. Pro toto porovnání běžely modely Claude bez kybernetických ochran.
Jiná část rozboru popisuje práci člověka s modelem na lokální linuxové verzi nejmenovaného rozšířeného prohlížeče. Podle Anthropicu GLM-5.3 během dne našel několik dosud neznámých chyb a spojil je do útoku, který umožnil webové stránce číst soubory z počítače. Firma uvádí, že chyby oznámila správci prohlížeče. Výsledek doložila pro Linux; dopad na další systémy označuje za možnost, kterou tímto pokusem neověřila.
Jde o zjištění výrobce konkurenčního modelu. Anthropic ve stejném textu doporučuje rozšířit přístup obránců ke schopnostem Clauda. Nezávislé měření proto pomáhá oddělit vlastní výsledky firmy od jejího závěru o tom, jak se mají modely zpřístupňovat.
CAISI počítal body, Anthropic úplné úspěchy
Americké centrum CAISI při úřadu NIST vydalo vlastní hodnocení GLM-5.3 už 17. září. Označilo ho za nejpokročilejší model s veřejnými vahami v kybernetických úlohách, který do té doby hodnotilo. Současně mu naměřilo výrazně nižší schopnosti než nejlepším hodnoceným americkým modelům. Odhad odstupu přibližně čtyř měsíců vychází ze společného ukazatele více testů, nikoli z každé jednotlivé úlohy.
Také CAISI použilo ExploitBench, ale s jiným vyhodnocením. U 41 úloh vzalo nejlepší ze tří pokusů a výsledek počítalo na šestnáctibodové stupnici. GLM-5.3 získal v průměru 9,8 bodu ze 16, v tabulce zaokrouhleně 61,1 %. Anthropic naproti tomu uvádí počet pokusů, které dosáhly úplného cíle. Údaj 61,1 % tedy nelze číst jako podíl úspěšných průniků ani ho postavit vedle 50 ze 410 bez vysvětlení metodiky.
CAISI testovalo modely jako agenty s nástroji pro vykonávání příkazů a Pythonu, s nejvyšším nastavením uvažování a stanovenými limity kroků. Kde to bylo možné, vypnulo kybernetické ochrany amerických modelů. Jeho americká špička navíc zahrnuje i modely dostupné jen prověřeným uživatelům. Srovnání proto ukazuje schopnosti ve zkušebním prostředí, nikoli nabídku, k níž má stejný přístup každý zákazník.