Refaktor s 1 393 agenty stál Nous Research asi 25 tisíc dolarů
Hermes Agent v hlavním běhu vyslal 1 393 subagentů a po následných opravách vyšla modelová útrata asi na 25 000 dolarů. Nous Research uvádí pokles netestovacího Pythonu o 34,4 %, jenže totéž zadání nezkusil s jedním agentem. Ani opačné tvrzení vývojáře Codexu, že by jediný agent vyšel na zlomek ceny, proto nemá veřejné srovnání.
Nous Research 15. září popsala refaktor svého otevřeného nástroje Hermes Agent. Hlavní běh trval asi devatenáct aktivních hodin, vyslal podle firmy 1 393 subagentů a v jednu chvíli jich souběžně pracovalo 218. Odhadované náklady na modely činily zhruba 19 300 dolarů; po započtení navazujících sezení odhadla firma celkovou útratu asi na 25 000 dolarů. Lidský čas na kontrolu v částce není.

Refaktor zkrátil Python o 34,4 procenta
Výsledný pull request změnil 2 655 souborů, přidal 436 199 řádků a 784 430 jich smazal. Netestovací části napsané v Pythonu se zmenšily z 1 063 826 na 698 363 řádků, tedy o 34,4 %. Soubor gateway/run.py klesl z 34 847 na 5 512 řádků a počet funkcí delších než 300 řádků ze 192 na dvě.
Projekt porovnal i čtení kódu. Simulace hledala definice stejných 4 000 symbolů v původní a nové verzi. Průměrný počet tokenů vrácených na jedno hledání klesl z 2 218 na 993 a počet případů, které potřebovaly víc než jedno okno, z 628 na 184. Autoři ale výslovně píšou, že měřili cenu vyhledání definice, nikoli úspěšnost agentů při programátorských úlohách.
Kontrola našla chyby, které testy minuly
Hermes rozdělil repozitář do 36 nepřekrývajících se skupin. Pracovníci dostali vlastní gitové worktree, koordinační agent jejich větve spojoval a spouštěl kontroly. Úplná sada testů měla podle pull requestu na nové větvi stejných 51 selhání jako nezměněná hlavní větev. Z toho ale neplynulo, že byl první návrh bez vady.
Komunitní kontrola našla odstraněná veřejná jména, která uvnitř repozitáře nikdo nevolal, ale mohly je používat cizí pluginy. Automatická změna volání suppress() navíc zasáhla zpracování výjimek asi na 65 místech. Nous obě třídy chyb před sloučením opravila; další opravy následovaly po něm. Výsledek tedy není práce agentů bez lidského zásahu, ale práce agentů, dvou kol komunitní kontroly a následných oprav.
Čísla závisí na tom, co se počítá
Veřejné materiály Nous nepoužívají jednu sadu počítadel. Článek a následný rozbor běhu mluví o 1 393 subagentech. Tabulka v pull requestu, odvozená z dochovaných zápisů, uvádí 1 652 úloh pro subagenty, z nichž 1 569 došlo k závěrečné odpovědi. Stejně tak rozbor uvádí 93 284 volání, zatímco data připojená k pull requestu počítají 111 352 volání nástrojů.
Rozdíl nemusí znamenat chybu: agent může dostat více úloh a užší soupis může vynechat některé druhy volání. Nous však u čísel nevysvětlila, kde přesně hranici vede. Pro nákladové srovnání je to podstatné, protože každé opakované zadání, kontrola a opětovné spuštění spotřebovává další tokeny.
Koordinační daň nebyla jen teorie
Běh se asi po padesáti minutách zastavil kvůli vypršení přihlašovacího tokenu. Commity přežily, ale část práce se musela znovu rozdělit. Následný rozbor odhaduje náklady na opakované zadání 74 úloh na 3 900 dolarů. U vnořeného delegování zaznamenal 332 vypršení času a jen 89 z přibližně 1 400 volání se vrátilo. Pozdější opravy změnily obnovu přihlášení, hlášení mrtvého pracovníka i délku ukládání mezipaměti.
Tohle jsou konkrétní náklady koordinace, nikoli důkaz, že by byla zbytečná celá paralelní práce. Bez srovnávacího běhu nevíme, kolik by stejný refaktor stál s menším počtem pracovníků, jak dlouho by trval a kolik chyb by po sobě nechal.
Vývojář Codexu tvrdí opak bez vlastního měření
Vývojář Codexu Eric Provencher 15. září napsal, že při více než dvou souběžných subagentech se téměř jistě pálí tokeny bez zlepšení kvality, protože agenti si navzájem kontrolují práci. O den později označil experiment Nous za potvrzení svého názoru a tvrdil, že jediný agent Astra by refaktor zvládl za zlomek ceny.
Ani Provencher stejný úkol s jedním agentem nepustil a nezveřejnil cenu, čas ani výsledný rozdíl. Jeho výhrada dobře popisuje přebytečné ověřování, které ukázal i rozbor Nous, ale tvrzení o nulovém přínosu a zlomkové ceně zůstává odhadem.
Odhad 1,8 milionu dolarů není naměřená úspora
Nous postavila proti modelové útratě hrubý odhad lidské práce od 150 000 do 1,8 milionu dolarů. Rozpětí sahá od malého týmu na dva měsíce po dva roky a nezahrnuje veřejný rozpis lidí, sazeb ani úloh. Titulek původního textu přitom používá jen horní hranici a mluví o hodnotě 1,8 milionu dolarů.
Experiment dokládá, že masivně paralelní běh vytvořil a po kontrole dostal do hlavní větve mimořádně velký refaktor za necelé dva dny. Nedokládá, že 25 000 dolarů byla nejnižší dosažitelná cena, že jediný agent by práci dokončil, ani že lidská alternativa opravdu stála 1,8 milionu. K tomu by bylo potřeba stejné výchozí revize, stejné zadání a stejné přijímací testy pro jeden agent, menší tým agentů i roj, včetně času lidské kontroly a oprav.
Zdroje
- Nous Research: Refactoring Hermes with 1,393 agents, 15. září 2026
- Hermes Agent: pull request 102117 s výsledky a měřením, sloučeno 4. září 2026
- Hermes Agent: následný rozbor běhu a oprav
- Eric Provencher: tvrzení o více než dvou subagentech, 15. září 2026
- Eric Provencher: reakce na experiment Nous Research, 16. září 2026
- The Decoder: AI agent swarms are a massive waste of tokens with zero quality gain, 17. září 2026