Přeskočit na obsah
Čísla aktualizováno 10. 8. 2026 3 min čtení

Bez jasného pokynu modely při doučování matematiky příliš napovídají, ukázal test Ai2

Institut Ai2 zveřejnil TutorMoments, měřítko postavené na 462 přepisech skutečného doučování matematiky. Sedmi jazykovým modelům dal roli doučovatele: bez bližšího pokynu většinou napovídaly za žáka a jen zřídka ho tlačily k vlastní úvaze. Pokyn, který ten rozdíl popsal, výsledky zvedl, ale mezeru k člověku nezavřel.

Institut Ai2 (Allen Institute for AI) zveřejnil 7. srpna náhled měřítka TutorMoments. Ptá se na jednu z nejtěžších věcí ve výuce: kdy má doučovatel zabrat a pomoct a kdy naopak ustoupit a nechat žáka počítat samotného. Test běží na přepisech skutečného doučování matematiky a sleduje, jak se v téže situaci zachová jazykový model, když ho posadíte na místo doučovatele.

Tabule s matematickými vzorci v učebně
Tabule s matematickými vzorci v učebně Cornellovy univerzity. Snímek je ilustrační, nepochází ze studie. Foto: LBM1948, Wikimedia Commons (CC BY-SA 4.0)

Hlavní zjištění zní: model, kterému řeknete jen „dobře doučuj“, většinou napoví za žáka a málokdy ho pošťouchne k vlastní úvaze. Když se do zadání ten rozdíl vypíše, výsledky se zvednou – ale k člověku, který se do situace trefí pokaždé, je nezavřou.

Jak se doučovatel testuje

TutorMoments nepracuje s umělými úlohami. Zkušení učitelé matematiky projdou přepis skutečné hodiny a označí klíčový okamžik – místo, kde se doučovatel musel rozhodnout mezi tím, že žákovi látku zpřístupní (opora, anglicky scaffolding), a tím, že na něj přitlačí a nechá ho myslet (tlak na náročnost).

Test pak přepis v tom bodě zastaví, předá ho modelu a ten pokračuje jako doučovatel po pět tahů (tři jeho, dva žákovy). Žáka přitom hraje jiný model, Claude Opus 4.6, kterému dají popis, jak se původní žák choval. Co doučovatel udělal, ohodnotí další model podle měřítek ověřených proti úsudku učitelů: dal oporu, když bylo potřeba? přitlačil, když byl žák připravený? a nepřehnal to s oporou? Sedm modelů takhle prošlo 520 okamžiků, rozdělených napůl mezi ty, kde se hodí opora, a ty, kde se hodí tlak.

Co je v přepisech

Zveřejněná sada TutorMoments-Preview obsahuje 462 anonymizovaných přepisů individuálního doučování matematiky s americkými žáky od druhé do sedmé třídy. Pochází z programu intenzivního doučování, jehož žáci většinou chodí do škol pro sociálně slabší; provozovatel je uvolnil pod výzkumnou doložkou, se kterou souhlasili rodiče. Osobní údaje z nich smazal nejdřív provozovatel a pak ještě druhý průchod uzpůsobený matematice, aby při čištění nesmazal čísla v příkladech.

Anotace dodalo 27 amerických učitelů, každý s praxí přes tři roky. Ve 122 přepisech označili 1 536 klíčových okamžiků, každý v průměru tři a půl krát. Vhodných na oporu je 738, na tlak 260 – tlak je vzácnější a hůř se rozpoznává, což je vidět i na výsledcích.

Bez pokynu se napovídá

Každé číslo v tabulce je podíl mezi 0 a 1: kolik z vhodných okamžiků model trefil. Nejvýmluvnější je tlak na náročnost; s prostým zadáním na něj modely skoro nesáhly, se zadáním, které rozdíl popisuje, výrazně přidaly.

ModelBez pokynuS pokynem
Claude Opus 4.80,2080,831
Claude Sonnet 4.60,0850,792
DeepSeek V4 Pro0,0880,492
Gemini 2.5 Pro0,2230,712
Gemini 3.5 Flash0,1580,646
GPT 5.50,0460,531
GPT 5.4 mini0,0230,404
Lidští doučovatelé0,182 (referenční)

Čísla platí pro tlak na náročnost ve vhodných okamžicích. GPT 5.5 s prostým zadáním přitlačil jen v 0,046 z nich, tedy ani ne v pěti ze sta. Lidští doučovatelé mají v téže sadě 0,182 – i to je nízké číslo, protože učitelé schválně vybírali okamžiky, kde doučování vázlo; nejde tedy o vzor ideální praxe, ale o přirozené srovnání.

Náš výpočet z tabulky: průměr přes všech sedm modelů je u tlaku na náročnost 0,12 s prostým zadáním a 0,63 se zadáním, které rozdíl popisuje. Prosté zadání tedy vyšlo hůř než lidská referenční hodnota; teprve pokyn ji překonal. Zvedly se všechny tři míry u všech sedmi modelů – rozhoduje tedy formulace zadání, ne jen volba modelu.

Co test neměří

Ai2 sadu označuje za náhled a sama vypisuje meze. Skóre popisuje, jak se model zachová v rozhodovacím bodě, ne jestli se žák něco naučil – žáka hraje model, ne dítě. Hodnotí ho navíc další jazykový model, byť ověřený proti učitelům, takže čísla jsou měřením jednoho nástroje, ne absolutní pravdou. Sada je taky úzká: americká, hlavně matematika prvního a druhého stupně, jeden okruh učitelů. A nejlepší modely, Gemini 2.5 Pro a Claude Opus 4.8, odpovídaly v průměru přes deset sekund na tah, což se do živé hodiny nehodí.

Celý postup i výsledky jsou v technické zprávě a kód k přehrávání hodin je na GitHubu. Ai2 chystá větší a vícejazyčnou verzi; náhled vyšel proto, aby k němu obor stihl dát připomínky dřív, než sada doroste.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  2. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  3. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  4. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…