Přeskočit na obsah
Čísla 3 min čtení

Institut FRI našel podceněné odhady pokroku AI v testech

Srovnání předpovědí s dosaženými výsledky ukázalo, že odborníci čekali matematické milníky později. Průběžná zpráva ale snáz odhalí příliš nízký odhad než příliš vysoký.

Matematická úloha se dá vyhodnotit dřív než předpověď, kolik pracovních míst změní umělá inteligence. Právě ten rozdíl provází zprávu Forecasting Research Institute z 23. září 2026. Institut FRI porovnal odhady, které sbírá od poloviny roku 2022, s tím, co už lze ověřit. U výsledků v testech našel opakované podcenění pokroku. Dopady na zaměstnanost nebo hospodářský růst však podle autorů zatím poctivě vyhodnotit nelze.

Matematik píše vzorce a graf na zelenou tabuli
Tabule v centru aplikované matematiky École polytechnique; ilustrační snímek. Foto: Ecole polytechnique Université Paris-Saclay, Wikimedia Commons (CC BY-SA 2.0)

Zlatou úroveň olympiády čekali až v roce 2030

V předpovědích z roku 2022 vycházel prostřední odhad odborníků pro výkon AI na úrovni zlaté medaile Mezinárodní matematické olympiády na rok 2030. U zkušených prognostiků, které institut označuje jako superforecasters, to byl rok 2035. Jde o lidi s doloženou úspěšností v předchozím předpovídání, nemusí však být specialisty na AI. Podle vyhodnocení FRI modely dosáhly této úrovně už v červenci 2025. Proti oběma prostředním odhadům je to o pět, respektive deset let dřív.

Prostřední odhad neboli medián rozděluje seřazené odpovědi na dvě poloviny. Neříká, že se spletli všichni. Autoři výslovně připouštějí, že takový souhrn může zakrýt menší skupinu, která předpovídala přesněji.

První odhady navíc vznikly před veřejným spuštěním ChatGPT. Tím se ale podle FRI rozdíl nevyčerpává: podceněné výsledky našel i v pozdějších předpovědích matematických a programátorských testů. Nejde o nové měření modelů, nýbrž o zpětné srovnání předpovědí s výsledky. Na tento rozdíl navazuje také článek The Decoder z 24. září, který rozebírá jak zmeškané milníky, tak opačné případy.

Nízký odhad se odhalí dřív než vysoký

Představme si předpověď milníku na rok 2030. Když ho model splní už letos, příliš pozdní odhad se dá poznat okamžitě. Pokud ho ovšem splní až v roce 2035, dnes ještě není možné určit, o kolik předpověď předběhla skutečnost. Tímto příkladem FRI vysvětluje, proč průběžné vyhodnocení snáz najde podcenění než přecenění. Většina jeho otázek dosud nemá konečný výsledek.

Rozdíl je i mezi testem a nasazením. Pro podíl jízd objednaných přes aplikace, které v USA v roce 2027 obstarají autonomní vozidla, dali odborníci medián 7,3 %. Institut proti tomu staví odhad 2,5 % od jazykového modelu. To však není naměřený podíl za rok 2027. Je to další předpověď, takže závěr o přehnaném očekávání zůstává předběžný.

Podobná srovnání připravil FRI pomocí GPT-5.5 s vysokým nastavením uvažování v srpnu 2026. Model přitom dostal novější zprávy a údaje, než měli lidé v okamžiku svých odpovědí. Autoři proto varují před čtením výsledku jako rovného souboje člověka s AI. Model měl výhodu pozdějších informací.

Záleží i na zadání předpovědi

Institut vybíral otázky, u nichž už znal výsledek nebo měl alespoň podklady k jeho odhadu. Výběr byl podle zprávy částečně subjektivní. Také se mezi jednotlivými průzkumy měnilo složení odborníků. Panel LEAP, v němž FRI sbírá předpovědi opakovaně, začínal s 339 odborníky: 76 z informatiky, 76 z firem zabývajících se AI, 68 z ekonomie a 119 z oblasti pravidel a politiky kolem AI. Tento počet tedy nepopisuje každý dílčí průzkum zprávy.

Podrobnosti komplikují i zdánlivě přímočaré testy. U matematické sady FrontierMath autoři použili výsledek před pozdější opravou chybných úloh, protože lidé předpovídali dřív, než byly chyby známé. U programátorského LiveCodeBench Pro zase připouštějí, že někteří účastníci nemuseli pochopit možnost testovat modely na otázkách z předchozích čtvrtletí. Samotné zadání tak mohlo část rozdílu ovlivnit.

FRI chce další vyhodnocení zveřejňovat průběžně. Až bude mít dost výsledků, plánuje také vybrat nejpřesnější účastníky panelu a ukazovat jejich odhady samostatně. Teprve s přibývajícími uzavřenými otázkami půjde lépe rozlišit, kdo odhadoval špatně, kde byla nejasná otázka a které dnešní očekávání ještě čeká na svou zkoušku.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Měřič útraty v bráně Claude apps účtoval hodinovou mezipaměť levnější sazbou

    Claude Code 2.1.286 opravuje měřič, podle kterého brána Claude apps hlídá útratové limity vývojářů. Zápis do hodinové mezipaměti počítal sazbou pětiminutové, tedy o 37,5…

  2. Licence a podmínky

    Anthropic zase účtuje odmítnuté požadavky ve třech z pěti kategorií

    Od 24. září 2026 se za požadavek, který bezpečnostní klasifikátor Claudu odmítne ještě před prvním slovem odpovědi, zase platí. Nedopadá to na všechna odmítnutí, jen na…

  3. Modely

    NVIDIA měřila nový diarizační model u šesti z osmi sad proti jiným referenčním štítkům

    NVIDIA vydala 23. září model Nemotron 3 Diarization, který v nahrávce rozliší až osm mluvčích a zvládne to i za běhu. Proti předchozí verzi klesla chybovost v průměru o…

  4. Čísla

    Všech osm příkazů v návodu k Intern-S2-397B spouští jeho osmibitovou verzi

    Laboratoř InternLM doplnila 24. září k modelu Intern-S2-397B návod na nasazení. Všech osm příkazů v něm ale sahá do jiného repozitáře, než ve kterém návod leží:…