Institut FRI našel podceněné odhady pokroku AI v testech
Srovnání předpovědí s dosaženými výsledky ukázalo, že odborníci čekali matematické milníky později. Průběžná zpráva ale snáz odhalí příliš nízký odhad než příliš vysoký.
Matematická úloha se dá vyhodnotit dřív než předpověď, kolik pracovních míst změní umělá inteligence. Právě ten rozdíl provází zprávu Forecasting Research Institute z 23. září 2026. Institut FRI porovnal odhady, které sbírá od poloviny roku 2022, s tím, co už lze ověřit. U výsledků v testech našel opakované podcenění pokroku. Dopady na zaměstnanost nebo hospodářský růst však podle autorů zatím poctivě vyhodnotit nelze.

Zlatou úroveň olympiády čekali až v roce 2030
V předpovědích z roku 2022 vycházel prostřední odhad odborníků pro výkon AI na úrovni zlaté medaile Mezinárodní matematické olympiády na rok 2030. U zkušených prognostiků, které institut označuje jako superforecasters, to byl rok 2035. Jde o lidi s doloženou úspěšností v předchozím předpovídání, nemusí však být specialisty na AI. Podle vyhodnocení FRI modely dosáhly této úrovně už v červenci 2025. Proti oběma prostředním odhadům je to o pět, respektive deset let dřív.
Prostřední odhad neboli medián rozděluje seřazené odpovědi na dvě poloviny. Neříká, že se spletli všichni. Autoři výslovně připouštějí, že takový souhrn může zakrýt menší skupinu, která předpovídala přesněji.
První odhady navíc vznikly před veřejným spuštěním ChatGPT. Tím se ale podle FRI rozdíl nevyčerpává: podceněné výsledky našel i v pozdějších předpovědích matematických a programátorských testů. Nejde o nové měření modelů, nýbrž o zpětné srovnání předpovědí s výsledky. Na tento rozdíl navazuje také článek The Decoder z 24. září, který rozebírá jak zmeškané milníky, tak opačné případy.
Nízký odhad se odhalí dřív než vysoký
Představme si předpověď milníku na rok 2030. Když ho model splní už letos, příliš pozdní odhad se dá poznat okamžitě. Pokud ho ovšem splní až v roce 2035, dnes ještě není možné určit, o kolik předpověď předběhla skutečnost. Tímto příkladem FRI vysvětluje, proč průběžné vyhodnocení snáz najde podcenění než přecenění. Většina jeho otázek dosud nemá konečný výsledek.
Rozdíl je i mezi testem a nasazením. Pro podíl jízd objednaných přes aplikace, které v USA v roce 2027 obstarají autonomní vozidla, dali odborníci medián 7,3 %. Institut proti tomu staví odhad 2,5 % od jazykového modelu. To však není naměřený podíl za rok 2027. Je to další předpověď, takže závěr o přehnaném očekávání zůstává předběžný.
Podobná srovnání připravil FRI pomocí GPT-5.5 s vysokým nastavením uvažování v srpnu 2026. Model přitom dostal novější zprávy a údaje, než měli lidé v okamžiku svých odpovědí. Autoři proto varují před čtením výsledku jako rovného souboje člověka s AI. Model měl výhodu pozdějších informací.
Záleží i na zadání předpovědi
Institut vybíral otázky, u nichž už znal výsledek nebo měl alespoň podklady k jeho odhadu. Výběr byl podle zprávy částečně subjektivní. Také se mezi jednotlivými průzkumy měnilo složení odborníků. Panel LEAP, v němž FRI sbírá předpovědi opakovaně, začínal s 339 odborníky: 76 z informatiky, 76 z firem zabývajících se AI, 68 z ekonomie a 119 z oblasti pravidel a politiky kolem AI. Tento počet tedy nepopisuje každý dílčí průzkum zprávy.
Podrobnosti komplikují i zdánlivě přímočaré testy. U matematické sady FrontierMath autoři použili výsledek před pozdější opravou chybných úloh, protože lidé předpovídali dřív, než byly chyby známé. U programátorského LiveCodeBench Pro zase připouštějí, že někteří účastníci nemuseli pochopit možnost testovat modely na otázkách z předchozích čtvrtletí. Samotné zadání tak mohlo část rozdílu ovlivnit.
FRI chce další vyhodnocení zveřejňovat průběžně. Až bude mít dost výsledků, plánuje také vybrat nejpřesnější účastníky panelu a ukazovat jejich odhady samostatně. Teprve s přibývajícími uzavřenými otázkami půjde lépe rozlišit, kdo odhadoval špatně, kde byla nejasná otázka a které dnešní očekávání ještě čeká na svou zkoušku.