Přeskočit na obsah
Modely 3 min čtení

GPT-6 Astra vytvářel v testu funkční 3D scény, jejich věrnost ale zaostala

Výzkumníci z Marylandské univerzity a AWS nechali agenty podle obrázku napsat scénu v Blenderu. GPT-6 Astra dosáhl nejvyššího skóre, ale ani funkční výstup nezaručil správnou geometrii; při posuzování vlastních úprav modely často chybovaly.

Scéna se otevře, obsahuje kameru a dá se z ní vytvořit obrázek. To ještě neříká, zda stůl stojí na správném místě nebo zda má místnost správný tvar. Právě tenhle rozdíl měří LEGO-Bench, nový test agentů, kteří ovládají Blender psaním kódu. Studie od Xiruiho Lia a kolegů z Marylandské univerzity a AWS vyšla 28. září na arXivu ve verzi v1. Jde o předběžnou vědeckou práci, nikoli o nezávisle zopakované měření.

Rozhraní Blenderu 4.3.2 s modrou hlavou opice a zobrazenou sítí polygonů
Blender 4.3.2 na ilustračním snímku; studie používala verzi 5.0.1. Foto: UnnecessaryDecision, Wikimedia Commons (CC0)

Obrázek se mění v program

Postup LEGO-Anything začíná jedním obrázkem. Agent napíše program pro Blender, spustí ho, prohlédne si scénu i její vykreslenou podobu a kód upraví. Výsledkem je upravitelný svět s objekty, jejich polohou a kamerou. Jednotlivé části lze dál kontrolovat nebo měnit, protože zůstávají popsané v programu.

Pro ověření autoři připravili 208 obrázků ze 104 vnitřních a venkovních scén. Vznikly v simulátoru, takže výzkumníci znají skutečnou geometrii, hloubku i příslušnost jednotlivých bodů k objektům. Agent dostane obraz a veřejné doprovodné údaje; přesné podklady pro hodnocení zůstanou skryté. U běžné fotografie takto úplný soupis prostorových vztahů není k dispozici.

Sto procent platných výstupů není dokonalá rekonstrukce

Autoři studie oddělují použitelnost souborů, shodu viditelných povrchů a podobnost vykresleného obrázku. První položka kontroluje mimo jiné přítomnost geometrie a aktivní kamery. Další dvě už porovnávají obsah scény s předlohou. Souhrnné skóre vychází z průměru geometrické a obrazové shody; nepoužitelný výstup dostane nulu.

V prostředí Codexu s Blenderem 5.0.1 měřili šest konfigurací modelů GPT. Čísla ve verzi v1 jsou průměry tří běhů. GPT-6 Astra měl u interiérů 100 % platných výstupů, ale souhrnné skóre 53,4 %. U venkovních scén dosáhl 39,6 %. Tato procenta nejsou podílem zcela správných scén. Vyjadřují skóre podle pravidel testu.

Přesnější obrázek dává rozpad výsledku interiérů: geometrická shoda dosáhla 52,4 % a obrazová podobnost 54,4 %. Mezi funkčním souborem a jeho věrností tak zůstává velký rozdíl. Stejnou mezeru rozebírá The Decoder v článku z 3. října. Ani tento rozbor není novým měřením modelů.

Další úprava může scénu zhoršit

Výzkumníci sledovali také průběh práce. Agenti někdy začali slabým návrhem a později zahodili část už dosaženého pokroku. Když jim tým ukázal dvě vykreslené verze stejné scény, měli určit, která je lepší. Jejich volbu pak porovnal s výsledkem přesného hodnocení.

U geometrie se modely při posuzování vlastních scén shodly s měřidlem v 45,8 % případů. Náhodný výběr ze dvou možností odpovídá 50 %. Na vzhledu obrazu si vedly lépe, se shodou 62,2 %. Model tedy může docela dobře rozeznat líbivější obraz a současně přehlédnout zhoršení prostorového uspořádání. Ta dvě hodnocení se nemají slévat.

Doplněk hlídá průběh práce bez dalšího trénování

Na základě těchto chyb autoři sestavili LEGO-Plugin. Doplněk navazuje počáteční scénu na předlohu, opírá další úpravy o měřitelné údaje a chrání dosažený výsledek před zásahy, které ho zhorší. Model zůstává tím, kdo plánuje práci; doplněk mění způsob její kontroly.

Na kancelářské podmnožině o 42 případech zlepšil skóre všech šesti konfigurací. Největší relativní nárůst, 62,7 %, naměřili autoři u GPT-5.6 Luna. U GPT-6 Astra činil 2,1 %. Jde o nárůst vůči výchozímu skóre, nikoli o procentní body ani o výsledek celého souboru interiérů a exteriérů.

Při čtení výsledků je zatím nutné zůstat u zveřejněné studie a ukázek. Projektová stránka ke 4. říjnu u kódu stále uvádí, že bude zpřístupněn později. Veřejný příslib vydání tedy ještě není nástroj, který si lze stáhnout a použít k vlastnímu opakování testu.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Google vydal EmbeddingGemma 2 pro vyhledávání v textu, obrazech i zvuku

    Google 6. října vydal EmbeddingGemma 2, která hledá souvislosti mezi textem, obrázky, videem a zvukem přímo v zařízení. Údaj o 191 MB paměti platí jen pro textové váhy;…

  2. Modely

    Model Beam zaostal v tabulce Reflection za GLM-5.3 ve všech dvanácti společných testech

    Reflection AI ohlásila 5. října svůj první otevřený model Beam s 501 miliardami parametrů, váhy ale zatím nevydala. V oznámení ho staví vedle staršího GLM-5.2; novější…

  3. Modely

    Reka ukázala Rho-1 pro tvorbu videa a řízení robotů v jediné síti

    Reka představila Rho-1 jako výzkumnou ukázku, která spojuje text, obraz a pohybové příkazy. Při delším běhu se ale rozchází uspořádání scény a úpravy obrazu zůstávají…

  4. Modely

    Aleph Alpha vydala Kolibri s 78,8 GB otevřených vah

    Německo-anglický Kolibri používá přes 78 miliard parametrů, při každém kroku zapojí 3,46 miliardy. Aleph Alpha doporučuje pro složité úlohy nejvýše 262 144 tokenů,…