Správa kontextu zvedla vyhledávacímu agentu Iris-mini výsledek testu o 21,2 bodu
Laboratoř AllSpark Research zveřejnila váhy vyhledávacích agentů Iris-mini a Iris-pro a k nim i program, kterým je měřila. Z jejích vlastních tabulek plyne, že týž model dostane na testu BrowseComp 64,7 bodu bez správy kontextu a 85,9 s ní. Náskok před nejbližším soupeřem v téže tabulce přitom dělá 3,4 bodu.

Laboratoř AllSpark Research zveřejnila 2. září 2026 váhy dvou vyhledávacích agentů. Iris-mini je doladěný Qwen3.6-35B-A3B, Iris-pro stojí na Qwen3.5-397B-A17B; oba pracují s oknem 256 tisíc tokenů a oba jsou pod Apache 2.0. Vyhledávací agent je model, který si sám klade dotazy do vyhledávače, čte, co přijde zpátky, a rozhoduje, kdy má důkazů dost.
Zajímavější než pořadí v tabulce je ale to, co AllSpark zveřejnil vedle vah: Iris-Harness, tedy program, kterým ta čísla naměřil. A s ním tabulku, ze které je vidět, kolik z výsledku dělá model a kolik obsluha okolo něj.
Týž model, týž test, čtyři různá čísla
Na testu BrowseComp, který po agentovi chce dohledat vzácný údaj podle nepřímých vodítek, dostal Iris-mini 64,7 bodu bez jakékoli správy kontextu. S nastavením discard-all už 82,2 a s přidaným retry 85,9. Rozdíl mezi nejnižším a nejvyšším číslem je 21,2 bodu – to je vlastní odečet z tabulky na kartě modelu a totéž číslo uvádí i německý The Decoder.
U většího Iris-pro je rozpětí menší, ale pořád velké: 72,6 bez správy kontextu proti 90,3 s oběma mechanismy, tedy 17,7 bodu. Na zkoušce Humanity's Last Exam, kde se víc spoléhá na znalosti než na hledání, dělá totéž u menšího modelu jen 9,2 bodu. Nejcitlivější je právě BrowseComp.
Náskok před soupeřem je šestkrát menší než tenhle rozdíl
V porovnávací tabulce pro modely velikosti 30 až 35 miliard parametrů stojí Iris-mini první s 82,2 bodu, za ním XYZ-Aquila-mini se 78,8. Náskok dělá 3,4 bodu. Tedy zhruba šestinu toho, co u téhož modelu udělá zapnutá správa kontextu.
AllSpark k té tabulce sám připisuje, že čísla soupeřů pocházejí z jejich vlastních zpráv, „každé pod vlastní správou kontextu“ (v originále each under its own context management). Není to formalita. XYZ AI Lab měří svou Aquilu harnessem AxisAgentic, který má vedle hledání a stahování stránek ještě třetí nástroj – stavové spouštění Pythonu. Iris-Harness má nástroje dva, web_search a scrape_website. Jedno číslo tedy vzniklo na jinak vybaveném pracovišti než druhé.
Kdyby se do té tabulky dosadilo číslo bez správy kontextu, skončí Iris-mini se svými 64,7 za všemi šesti srovnávanými modely. Jenže i tenhle výpočet kulhá na tutéž nohu: těch šest čísel je zase z šesti různých harnessů. Přesně o tom AllSpark píše, když v dokumentaci harnessu stojí, že zveřejněné skóre patří agentovi a jeho harnessu dohromady.
Co ty dva mechanismy dělají
Nastavení discard-all zahodí nashromážděnou historii nástrojových volání a vrátí konverzaci na úvodní otázku, jakmile vstup překročí zadaný práh; v příkladu na kartě modelu je to 131 072 tokenů, tedy polovina okna. Model pak nevidí ani vlastní dřívější úvahy. Do souboru se celá stopa zapisuje dál.
Nastavení retry spustí znovu epizodu, která skončila bez čitelné odpovědi, a přenese do nového pokusu krátkou poznámku o tom, co už bylo vyloučeno. Špatná odpověď se neopakuje nikdy, jen chybějící. Harness umí ještě třetí mechanismus – posílat v úplném znění jen posledních K výsledků nástrojů –, ten se ale v žádném ze čtyř zveřejněných režimů nepoužil.
Jako hlavní číslo AllSpark uvádí discard-all, i tam, kde by přidané retry vyšlo výš. To je proti běžnému zvyku vybrat si nejlepší sloupec.
Odkud harness pochází
Soubor NOTICE v repozitáři říká, že jádro harnessu je odvozené z projektu MiroFlow od týmu MiroMind – jehož model MiroThinker-1.7-mini je v téže srovnávací tabulce nejslabší. Vlastní přínos AllSparku jsou podle téhož souboru právě ty strategie správy kontextu, zápis konverzace a ověřování odpovědi agentem.
To poslední stojí za pozornost. V harnessu leží soubor self_verification.py, který po odpovědi spustí druhého agenta s týmiž nástroji, nechá ho odpověď prověřit a při záporném verdiktu zadá úlohu znovu. Tvar převzal AllSpark podle vlastní poznámky v kódu od AxisAgentiku, tedy od konkurenta. Mezi čtyřmi zveřejněnými režimy ta funkce není a The Decoder píše, že skóre Iris pocházejí z jediného agenta bez ověřovacích kroků navíc. Z repozitáře se to potvrdit ani vyvrátit nedá – jen je vidět, že ten kus kódu tam je.
Drobnost na okraj
Oba repozitáře modelů uvádějí licenci Apache 2.0 v kolonce karty i v textu, ale soubor LICENSE v nich není. Základní modely Qwenu, ze kterých Iris vychází, ho mají. U harnessu na GitHubu znění licence přiložené je.
Srovnatelnost výsledků řeší obor dlouhodobě špatně; podobný nález měl i Ling-3.0-flash, který podmínky měření popsal podrobně, ale výsledky vydal jen jako obrázky. Iris je v tomhle o kus dál: kdo má dost karet a klíč k vyhledávacímu rozhraní, může si čtyři čísla z tabulky přeměřit sám a ověřit i konkurenci na stejném pracovišti. Zatím to podle veřejných zdrojů nikdo neudělal.
Zdroje
- Karta modelu Iris-mini a Iris-pro, Hugging Face – tabulky výkonu a správy kontextu
- Iris-Harness, AllSpark Research – dokumentace mechanismů a soubor
NOTICE - Karta modelu XYZ-Aquila-mini, XYZ AI Lab – popis harnessu AxisAgentic a jeho sady nástrojů
- Iris-mini and Iris-pro are the strongest open-weight search agents in their class, The Decoder, 13. 9. 2026