Reka ukázala Rho-1 pro tvorbu videa a řízení robotů v jediné síti
Reka představila Rho-1 jako výzkumnou ukázku, která spojuje text, obraz a pohybové příkazy. Při delším běhu se ale rozchází uspořádání scény a úpravy obrazu zůstávají nespolehlivé.
Zadání pro obrázek, změna počasí ve videu a příkaz robotickému ramenu mohou procházet jednou neuronovou sítí. Takový postup ukázala Reka AI 5. října 2026 v oznámení Rho-1. Firma uvádí 19 miliard parametrů, tedy čísel, která určují chování modelu. Jde o výzkumnou ukázku, nikoli hotový výrobek pro běžné nasazení.

Obrázek zůstává součástí rozhovoru
V předvedeném rozhovoru dostane model nejprve pokyn nakreslit červenobílý maják na skalnatém pobřeží. Potom kolem majáku vyznačí rámeček, rozhýbe scénu jako záběr přibližujícího se dronu a změní počasí na sněhovou bouři. Nakonec slovně popíše rozdíl mezi videi. Reka ukazuje pět navazujících kroků jedné relace a říká, že při nich nevolá jiný model ani vnější nástroj.
Text a obrazové informace se ukládají do společného kontextu, tedy obsahu, se kterým síť při odpovědi pracuje. Vytvořený obrázek proto nemusí další systém znovu načítat a rozpoznávat. Podle popisu výrobce ho Rho-1 už má ve svém vnitřním stavu. Odtud také čte předchozí záběry a nové pokyny.
Uvnitř každého bloku sítě přesto pracují dvě části. Jedna zpracovává jazyk a rozpoznává obraz, druhá vytváří obraz či video postupným odstraňováním šumu. Obě sdílejí mechanismus pozornosti, který propojuje související informace, a stejnou paměť dosavadního kontextu. Jediná síť tedy neznamená, že všechny výstupy vznikají stejným výpočtem.
Příkaz může změnit probíhající simulaci
Další ukázka začíná dvěma míčky na pracovní desce. Na pokyn přijde robotické rameno, uchopí červený míček a zvedne ho; po dalším pokynu ho položí a pustí. Video pokračuje po navazujících úsecích. Instrukce přichází za běhu a mění pokračování scény bez nového začátku.
To je jiný úkol než vyrobit jeden klip z textového zadání. Nezávislý výzkumný projekt OpenWorldLib definuje model světa pomocí vnímání, interakce a dlouhodobé paměti: má prostředí chápat a předpovídat jeho vývoj. Tato definice vysvětluje, proč záleží na reakci na nové příkazy a zachování stavu. Sama ovšem nepotvrzuje kvalitu Rho-1; projekt tu slouží jako nezávislý rámec pro popis schopností.
Reka ve své ukázce robotiky používá také LIBERO, simulační prostředí pro zkoušky manipulace s předměty. Ukazuje pohled kamery, předpovídaný obraz a sedm výstupních kanálů pohybových příkazů. Firma tvrdí, že budoucí obraz a příkazy pro pohyb vycházejí ze stejného vnitřního stavu sítě. Záznam simulace není zkouškou spolehlivosti skutečného robota.
Pěkný obraz může skrývat rozpad prostoru
Výrobce sám uvádí, že delší simulace ztrácejí správné uspořádání prostoru dřív než vzhled. Třicetisekundový proud může dál ukazovat věrohodné povrchy a jemné detaily, zatímco rozmístění místnosti už neodpovídá dřívějším záběrům. Pro plánování pohybu je přitom poloha věcí podstatná.
Omezení se týkají i cílených úprav. Změna počasí v rozhovoru s majákem se povedla, ale Reka přiznává nespolehlivou konzistenci při různých zadáních. Rozpoznání objektů a jejich souřadnic podle firmy funguje u statických snímků, zatím ne spolehlivě napříč videem. Výstupní video má nyní nejvýše 672 × 384 obrazových bodů. Zrychlené přehrávání čekání v úvodní ukázce navíc neukazuje skutečnou dobu každé odpovědi.
The Decoder ve zprávě z 5. října zasazuje Rho-1 do vývoje multimodálních modelů a přebírá popis společného zpracování médií a pohybů. Neuvádí vlastní měření. Ohlášené schopnosti proto zůstávají tvrzením Reky, které ukázky ilustrují, ale nezávislý test dosud v těchto zdrojích nedokládá.
Podle Reky vznikl předvedený model trénováním od začátku na 320 akcelerátorech H100 po tři měsíce. Firma předpokládá, že větší rozsah trénování část chyb omezí; takový výsledek teprve potřebuje ověřit. Zájemce o spolupráci na robotice a interaktivních simulacích odkazuje na svůj tým. Oznámení zatím neposkytuje běžný návod, jak si Rho-1 stáhnout a spustit doma.