Přeskočit na obsah
Čísla 3 min čtení

Metoda Googlu zlepšila agenty v testu i na úlohách, které při úpravách neviděli

Tým Google Cloud AI Research zveřejnil metodu RRSI, která upravuje nástroje a pokyny kolem jazykového modelu. Na neznámých úlohách získala v testech až 4,7 bodu; samotné váhy modelu se neměnily.

Lepší výsledek na opakovaně zadávané úloze může znamenat, že se agent naučil její zvláštnosti. Jinde mu pak úprava nepomůže. Peng Xia a kolegové z Google Cloud AI Research a několika univerzit zkoumají tuto potíž ve studii RRSI. První verzi zveřejnili 21. září, druhou 23. září 2026. Jde o předběžnou vědeckou práci na arXivu; uvedené výsledky naměřili její autoři.

Pracovní stůl programátora s monitorem, klávesnicí a knihami
Pracoviště programátora na ilustračním snímku. Foto: Bsmalley, Wikimedia Commons (CC BY-SA 3.0)

Mění se obsluha modelu

Agent potřebuje víc než model, který píše odpovědi. Pokyny, nástroje, paměť a program kolem něj určují, který soubor otevře, co udělá po neúspěšném příkazu a kdy práci odevzdá. Autoři pro tento celek používají anglické slovo harness. RRSI nechává model beze změny a přepisuje právě jeho obsluhu. Podobný rozdíl mezi modelem a jeho okolím ukázaly už testy vyhledávacího agenta Iris-mini, kde výsledek ovlivnila správa kontextu.

V běžném postupu automatických úprav navrhne jazykový model změnu a systém ji ponechá, když se skóre zvedne. Jenže tentýž soubor úloh slouží k hodnocení znovu a znovu. Obsluha může začít obsahovat konkrétní odpovědi nebo pravidla, která platí jen pro tento test. Přibývat mohou i kroky, jejichž hlavním účinkem je vyšší spotřeba.

Úprava musí obstát před kritikem

RRSI omezuje počet samostatných změn v jednom návrhu. U programovacího agenta začínal rozpočet na čtyřech úpravách a postupně klesal na jednu; hledání mělo dvacet kol. Zpočátku tak systém může přestavět větší část obsluhy, později už snáz určí, která změna pomohla. Historie pokusů mu připomíná zamítnuté návrhy. Když pokrok ustane, dostane prostor část obsluhy, kterou dosud neupravoval.

Ještě před měřením návrh přečte další model v roli kritika. Odmítá vložené názvy testovacích úloh, konkrétní odpovědi a jiné zkratky šité na míru hodnocení. Výběr zohledňuje také kolísání výsledků mezi běhy. Vyšší spotřeba tokenů musí mít oporu v naměřeném přínosu a části bez dalšího užitku se odstraňují. V hlavním experimentu navrhoval změny, posuzoval je i plnil úlohy Claude Opus 4.8.

Známé úlohy a neznámé úlohy vycházejí jinak

Tým měřil programování, práci s dokumenty a technické návrhy na osmi sadách. Obsluhu upravoval vždy na jedné sadě pro daný obor a potom ji beze změny přenesl jinam. U práce s dokumenty vyhradil v Harvey LAB 120 úloh pro úpravy a dalších 40 pro oddělenou zkoušku. Vedle nich použil tři jiné sady, které do výběru změn vůbec nevstoupily.

Tabulka 1 ve studii v2 ukazuje, proč na rozdělení záleží. Srovnávací metoda Meta-Harness zvýšila skóre na známé části Harvey LAB z 89,4 na 93,0. RRSI dosáhla jen 90,5. Na neznámém JobBench ale původní agent získal 36,0, Meta-Harness 37,1 a RRSI 40,7. Přínos RRSI proti původnímu agentu tedy činil 4,7 bodu. Nejde o zvýšení o 4,7 procenta.

U programování s Claudem Opus 4.8 vzrostl výsledek na Terminal-Bench 2.1 ze 74,2 na 80,2. Na SWE-bench Verified, který ověřuje opravy chyb v repozitářích a při úpravách se nepoužíval, stoupl z 82,0 na 83,8. Autoři uvádějí zlepšení na všech oddělených zkouškách. Rozsah přenosu ale zůstává výsledkem jejich experimentu, nikoli zárukou pro libovolný firemní úkol.

Úspora závisí na tom, s čím se porovnává

Spotřebu tým rozepsal v tabulce 2 pro agenta pracujícího s dokumenty. Bez omezování sebeúprav spotřebovala jeho obsluha průměrně 3,80 milionu tokenů na pokus, s RRSI 2,42 milionu. Token je jednotka textu, který model zpracovává nebo vytváří. Z těchto hodnot vychází pokles o 36,3 procenta: (3,80 − 2,42) / 3,80. Jde o náš přepočet tabulky. Abstrakt uvádí úsporu 30 procent, aniž u tohoto čísla rozepisuje základ výpočtu.

Původní agent před jakýmikoli úpravami ovšem potřeboval jen 1,56 milionu tokenů. RRSI proti němu spotřebovala přibližně o 55 procent víc: (2,42 − 1,56) / 1,56. Ani levnější ze zlepšovaných variant tedy není levnější než původní obsluha. Na tento rozdíl upozorňuje také nezávislý rozbor The Decoder ze 4. října. Počet tokenů popisuje provoz výsledného agenta; není to účet za celé hledání jeho úprav.

Kód RRSI je veřejný pod licencí Apache 2.0. Repozitář upozorňuje, že nejde o oficiálně podporovaný produkt Googlu. Autoři zatím nezkoumali sebeúpravy, při nichž by se měnily také váhy modelu. Další ověření potřebuje přenos na jiné uspořádání agentů, jiné nástroje a delší běhy.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Anthropic účtuje za Haiku 5.5 desetinu sazeb Haiku 4.5, jen u promptů do 100 000 tokenů

    Anthropic vydal 7. října Claude Haiku 5.5 za 0,10 dolaru za milion vstupních tokenů, tedy za desetinu sazby Haiku 4.5. U promptů delších než 100 000 tokenů se ale sazby…

  2. Čísla

    Institut FRI našel podceněné odhady pokroku AI v testech

    Srovnání předpovědí s dosaženými výsledky ukázalo, že odborníci čekali matematické milníky později. Průběžná zpráva ale snáz odhalí příliš nízký odhad než příliš vysoký.

  3. Čísla

    Měřič útraty v bráně Claude apps účtoval hodinovou mezipaměť levnější sazbou

    Claude Code 2.1.286 opravuje měřič, podle kterého brána Claude apps hlídá útratové limity vývojářů. Zápis do hodinové mezipaměti počítal sazbou pětiminutové, tedy o 37,5…

  4. Licence a podmínky

    Anthropic zase účtuje odmítnuté požadavky ve třech z pěti kategorií

    Od 24. září 2026 se za požadavek, který bezpečnostní klasifikátor Claudu odmítne ještě před prvním slovem odpovědi, zase platí. Nedopadá to na všechna odmítnutí, jen na…