GPT-6 Astra vytvářel v testu funkční 3D scény, jejich věrnost ale zaostala
Výzkumníci z Marylandské univerzity a AWS nechali agenty podle obrázku napsat scénu v Blenderu. GPT-6 Astra dosáhl nejvyššího skóre, ale ani funkční výstup nezaručil správnou geometrii; při posuzování vlastních úprav modely často chybovaly.
Scéna se otevře, obsahuje kameru a dá se z ní vytvořit obrázek. To ještě neříká, zda stůl stojí na správném místě nebo zda má místnost správný tvar. Právě tenhle rozdíl měří LEGO-Bench, nový test agentů, kteří ovládají Blender psaním kódu. Studie od Xiruiho Lia a kolegů z Marylandské univerzity a AWS vyšla 28. září na arXivu ve verzi v1. Jde o předběžnou vědeckou práci, nikoli o nezávisle zopakované měření.

Obrázek se mění v program
Postup LEGO-Anything začíná jedním obrázkem. Agent napíše program pro Blender, spustí ho, prohlédne si scénu i její vykreslenou podobu a kód upraví. Výsledkem je upravitelný svět s objekty, jejich polohou a kamerou. Jednotlivé části lze dál kontrolovat nebo měnit, protože zůstávají popsané v programu.
Pro ověření autoři připravili 208 obrázků ze 104 vnitřních a venkovních scén. Vznikly v simulátoru, takže výzkumníci znají skutečnou geometrii, hloubku i příslušnost jednotlivých bodů k objektům. Agent dostane obraz a veřejné doprovodné údaje; přesné podklady pro hodnocení zůstanou skryté. U běžné fotografie takto úplný soupis prostorových vztahů není k dispozici.
Sto procent platných výstupů není dokonalá rekonstrukce
Autoři studie oddělují použitelnost souborů, shodu viditelných povrchů a podobnost vykresleného obrázku. První položka kontroluje mimo jiné přítomnost geometrie a aktivní kamery. Další dvě už porovnávají obsah scény s předlohou. Souhrnné skóre vychází z průměru geometrické a obrazové shody; nepoužitelný výstup dostane nulu.
V prostředí Codexu s Blenderem 5.0.1 měřili šest konfigurací modelů GPT. Čísla ve verzi v1 jsou průměry tří běhů. GPT-6 Astra měl u interiérů 100 % platných výstupů, ale souhrnné skóre 53,4 %. U venkovních scén dosáhl 39,6 %. Tato procenta nejsou podílem zcela správných scén. Vyjadřují skóre podle pravidel testu.
Přesnější obrázek dává rozpad výsledku interiérů: geometrická shoda dosáhla 52,4 % a obrazová podobnost 54,4 %. Mezi funkčním souborem a jeho věrností tak zůstává velký rozdíl. Stejnou mezeru rozebírá The Decoder v článku z 3. října. Ani tento rozbor není novým měřením modelů.
Další úprava může scénu zhoršit
Výzkumníci sledovali také průběh práce. Agenti někdy začali slabým návrhem a později zahodili část už dosaženého pokroku. Když jim tým ukázal dvě vykreslené verze stejné scény, měli určit, která je lepší. Jejich volbu pak porovnal s výsledkem přesného hodnocení.
U geometrie se modely při posuzování vlastních scén shodly s měřidlem v 45,8 % případů. Náhodný výběr ze dvou možností odpovídá 50 %. Na vzhledu obrazu si vedly lépe, se shodou 62,2 %. Model tedy může docela dobře rozeznat líbivější obraz a současně přehlédnout zhoršení prostorového uspořádání. Ta dvě hodnocení se nemají slévat.
Doplněk hlídá průběh práce bez dalšího trénování
Na základě těchto chyb autoři sestavili LEGO-Plugin. Doplněk navazuje počáteční scénu na předlohu, opírá další úpravy o měřitelné údaje a chrání dosažený výsledek před zásahy, které ho zhorší. Model zůstává tím, kdo plánuje práci; doplněk mění způsob její kontroly.
Na kancelářské podmnožině o 42 případech zlepšil skóre všech šesti konfigurací. Největší relativní nárůst, 62,7 %, naměřili autoři u GPT-5.6 Luna. U GPT-6 Astra činil 2,1 %. Jde o nárůst vůči výchozímu skóre, nikoli o procentní body ani o výsledek celého souboru interiérů a exteriérů.
Při čtení výsledků je zatím nutné zůstat u zveřejněné studie a ukázek. Projektová stránka ke 4. říjnu u kódu stále uvádí, že bude zpřístupněn později. Veřejný příslib vydání tedy ještě není nástroj, který si lze stáhnout a použít k vlastnímu opakování testu.