Přeskočit na obsah
Čísla 3 min čtení

Správa kontextu zvedla vyhledávacímu agentu Iris-mini výsledek testu o 21,2 bodu

Laboratoř AllSpark Research zveřejnila váhy vyhledávacích agentů Iris-mini a Iris-pro a k nim i program, kterým je měřila. Z jejích vlastních tabulek plyne, že týž model dostane na testu BrowseComp 64,7 bodu bez správy kontextu a 85,9 s ní. Náskok před nejbližším soupeřem v téže tabulce přitom dělá 3,4 bodu.

Rovnoramenné laboratorní váhy se sadou závaží
Rovnoramenné váhy; snímek je ilustrační. Foto: Lilly_M, Wikimedia Commons (CC BY-SA 3.0)

Laboratoř AllSpark Research zveřejnila 2. září 2026 váhy dvou vyhledávacích agentů. Iris-mini je doladěný Qwen3.6-35B-A3B, Iris-pro stojí na Qwen3.5-397B-A17B; oba pracují s oknem 256 tisíc tokenů a oba jsou pod Apache 2.0. Vyhledávací agent je model, který si sám klade dotazy do vyhledávače, čte, co přijde zpátky, a rozhoduje, kdy má důkazů dost.

Zajímavější než pořadí v tabulce je ale to, co AllSpark zveřejnil vedle vah: Iris-Harness, tedy program, kterým ta čísla naměřil. A s ním tabulku, ze které je vidět, kolik z výsledku dělá model a kolik obsluha okolo něj.

Týž model, týž test, čtyři různá čísla

Na testu BrowseComp, který po agentovi chce dohledat vzácný údaj podle nepřímých vodítek, dostal Iris-mini 64,7 bodu bez jakékoli správy kontextu. S nastavením discard-all už 82,2 a s přidaným retry 85,9. Rozdíl mezi nejnižším a nejvyšším číslem je 21,2 bodu – to je vlastní odečet z tabulky na kartě modelu a totéž číslo uvádí i německý The Decoder.

U většího Iris-pro je rozpětí menší, ale pořád velké: 72,6 bez správy kontextu proti 90,3 s oběma mechanismy, tedy 17,7 bodu. Na zkoušce Humanity's Last Exam, kde se víc spoléhá na znalosti než na hledání, dělá totéž u menšího modelu jen 9,2 bodu. Nejcitlivější je právě BrowseComp.

Náskok před soupeřem je šestkrát menší než tenhle rozdíl

V porovnávací tabulce pro modely velikosti 30 až 35 miliard parametrů stojí Iris-mini první s 82,2 bodu, za ním XYZ-Aquila-mini se 78,8. Náskok dělá 3,4 bodu. Tedy zhruba šestinu toho, co u téhož modelu udělá zapnutá správa kontextu.

AllSpark k té tabulce sám připisuje, že čísla soupeřů pocházejí z jejich vlastních zpráv, „každé pod vlastní správou kontextu“ (v originále each under its own context management). Není to formalita. XYZ AI Lab měří svou Aquilu harnessem AxisAgentic, který má vedle hledání a stahování stránek ještě třetí nástroj – stavové spouštění Pythonu. Iris-Harness má nástroje dva, web_searchscrape_website. Jedno číslo tedy vzniklo na jinak vybaveném pracovišti než druhé.

Kdyby se do té tabulky dosadilo číslo bez správy kontextu, skončí Iris-mini se svými 64,7 za všemi šesti srovnávanými modely. Jenže i tenhle výpočet kulhá na tutéž nohu: těch šest čísel je zase z šesti různých harnessů. Přesně o tom AllSpark píše, když v dokumentaci harnessu stojí, že zveřejněné skóre patří agentovi a jeho harnessu dohromady.

Co ty dva mechanismy dělají

Nastavení discard-all zahodí nashromážděnou historii nástrojových volání a vrátí konverzaci na úvodní otázku, jakmile vstup překročí zadaný práh; v příkladu na kartě modelu je to 131 072 tokenů, tedy polovina okna. Model pak nevidí ani vlastní dřívější úvahy. Do souboru se celá stopa zapisuje dál.

Nastavení retry spustí znovu epizodu, která skončila bez čitelné odpovědi, a přenese do nového pokusu krátkou poznámku o tom, co už bylo vyloučeno. Špatná odpověď se neopakuje nikdy, jen chybějící. Harness umí ještě třetí mechanismus – posílat v úplném znění jen posledních K výsledků nástrojů –, ten se ale v žádném ze čtyř zveřejněných režimů nepoužil.

Jako hlavní číslo AllSpark uvádí discard-all, i tam, kde by přidané retry vyšlo výš. To je proti běžnému zvyku vybrat si nejlepší sloupec.

Odkud harness pochází

Soubor NOTICE v repozitáři říká, že jádro harnessu je odvozené z projektu MiroFlow od týmu MiroMind – jehož model MiroThinker-1.7-mini je v téže srovnávací tabulce nejslabší. Vlastní přínos AllSparku jsou podle téhož souboru právě ty strategie správy kontextu, zápis konverzace a ověřování odpovědi agentem.

To poslední stojí za pozornost. V harnessu leží soubor self_verification.py, který po odpovědi spustí druhého agenta s týmiž nástroji, nechá ho odpověď prověřit a při záporném verdiktu zadá úlohu znovu. Tvar převzal AllSpark podle vlastní poznámky v kódu od AxisAgentiku, tedy od konkurenta. Mezi čtyřmi zveřejněnými režimy ta funkce není a The Decoder píše, že skóre Iris pocházejí z jediného agenta bez ověřovacích kroků navíc. Z repozitáře se to potvrdit ani vyvrátit nedá – jen je vidět, že ten kus kódu tam je.

Drobnost na okraj

Oba repozitáře modelů uvádějí licenci Apache 2.0 v kolonce karty i v textu, ale soubor LICENSE v nich není. Základní modely Qwenu, ze kterých Iris vychází, ho mají. U harnessu na GitHubu znění licence přiložené je.

Srovnatelnost výsledků řeší obor dlouhodobě špatně; podobný nález měl i Ling-3.0-flash, který podmínky měření popsal podrobně, ale výsledky vydal jen jako obrázky. Iris je v tomhle o kus dál: kdo má dost karet a klíč k vyhledávacímu rozhraní, může si čtyři čísla z tabulky přeměřit sám a ověřit i konkurenci na stejném pracovišti. Zatím to podle veřejných zdrojů nikdo neudělal.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Zbytečný převod na 32 bitů bral v knihovně TRL přes pětinu času na grafické kartě

    Vnitřní smyčka výchozí ztrátové funkce v knihovně TRL převáděla obě vstupní matice ze šestnácti bitů na dvaatřicet, ačkoli obě v paměti ležely v šestnácti. Násobení se…

  2. Čísla

    Globální KV cache DeepSeeku V4.1 Flash zabere při milionu tokenů 890 MiB

    DeepSeek zveřejnil váhy multimodálního modelu V4.1 Flash s kontextem dlouhým 1 048 576 tokenů. Globální KV cache ukládá 890 bajtů na token, takže při zaplnění celého…

  3. Čísla

    Modely Flare a Sunburst z GPT Image 2.5 mají stejné sazby za token

    OpenAI rozdělila GPT Image 2.5 do dvou modelů pro API. Flare má rychleji obsloužit běžné generování, Sunburst má přesněji upravovat obraz; sazby za textové i obrazové…

  4. Čísla

    Pydantic AI 2.40 po zapnutí každou hodinu stahuje 1 678 cenových položek

    Pydantic AI 2.40 přidala volitelné stahování cen modelů hned po startu a potom každou hodinu. Při našem testu se seznam rozšířil z 1 646 na 1 678 položek; výpadek…