Přeskočit na obsah
Modely 3 min čtení

Reka ukázala Rho-1 pro tvorbu videa a řízení robotů v jediné síti

Reka představila Rho-1 jako výzkumnou ukázku, která spojuje text, obraz a pohybové příkazy. Při delším běhu se ale rozchází uspořádání scény a úpravy obrazu zůstávají nespolehlivé.

Zadání pro obrázek, změna počasí ve videu a příkaz robotickému ramenu mohou procházet jednou neuronovou sítí. Takový postup ukázala Reka AI 5. října 2026 v oznámení Rho-1. Firma uvádí 19 miliard parametrů, tedy čísel, která určují chování modelu. Jde o výzkumnou ukázku, nikoli hotový výrobek pro běžné nasazení.

Malé robotické rameno s průhlednou konstrukcí, vodiči a uchopovacími čelistmi
Robotické rameno řízené Arduinem na ilustračním snímku; nejde o zařízení z ukázky Rho-1. Foto: Nicolò Bertuccioli, Wikimedia Commons (CC BY-SA 4.0)

Obrázek zůstává součástí rozhovoru

V předvedeném rozhovoru dostane model nejprve pokyn nakreslit červenobílý maják na skalnatém pobřeží. Potom kolem majáku vyznačí rámeček, rozhýbe scénu jako záběr přibližujícího se dronu a změní počasí na sněhovou bouři. Nakonec slovně popíše rozdíl mezi videi. Reka ukazuje pět navazujících kroků jedné relace a říká, že při nich nevolá jiný model ani vnější nástroj.

Text a obrazové informace se ukládají do společného kontextu, tedy obsahu, se kterým síť při odpovědi pracuje. Vytvořený obrázek proto nemusí další systém znovu načítat a rozpoznávat. Podle popisu výrobce ho Rho-1 už má ve svém vnitřním stavu. Odtud také čte předchozí záběry a nové pokyny.

Uvnitř každého bloku sítě přesto pracují dvě části. Jedna zpracovává jazyk a rozpoznává obraz, druhá vytváří obraz či video postupným odstraňováním šumu. Obě sdílejí mechanismus pozornosti, který propojuje související informace, a stejnou paměť dosavadního kontextu. Jediná síť tedy neznamená, že všechny výstupy vznikají stejným výpočtem.

Příkaz může změnit probíhající simulaci

Další ukázka začíná dvěma míčky na pracovní desce. Na pokyn přijde robotické rameno, uchopí červený míček a zvedne ho; po dalším pokynu ho položí a pustí. Video pokračuje po navazujících úsecích. Instrukce přichází za běhu a mění pokračování scény bez nového začátku.

To je jiný úkol než vyrobit jeden klip z textového zadání. Nezávislý výzkumný projekt OpenWorldLib definuje model světa pomocí vnímání, interakce a dlouhodobé paměti: má prostředí chápat a předpovídat jeho vývoj. Tato definice vysvětluje, proč záleží na reakci na nové příkazy a zachování stavu. Sama ovšem nepotvrzuje kvalitu Rho-1; projekt tu slouží jako nezávislý rámec pro popis schopností.

Reka ve své ukázce robotiky používá také LIBERO, simulační prostředí pro zkoušky manipulace s předměty. Ukazuje pohled kamery, předpovídaný obraz a sedm výstupních kanálů pohybových příkazů. Firma tvrdí, že budoucí obraz a příkazy pro pohyb vycházejí ze stejného vnitřního stavu sítě. Záznam simulace není zkouškou spolehlivosti skutečného robota.

Pěkný obraz může skrývat rozpad prostoru

Výrobce sám uvádí, že delší simulace ztrácejí správné uspořádání prostoru dřív než vzhled. Třicetisekundový proud může dál ukazovat věrohodné povrchy a jemné detaily, zatímco rozmístění místnosti už neodpovídá dřívějším záběrům. Pro plánování pohybu je přitom poloha věcí podstatná.

Omezení se týkají i cílených úprav. Změna počasí v rozhovoru s majákem se povedla, ale Reka přiznává nespolehlivou konzistenci při různých zadáních. Rozpoznání objektů a jejich souřadnic podle firmy funguje u statických snímků, zatím ne spolehlivě napříč videem. Výstupní video má nyní nejvýše 672 × 384 obrazových bodů. Zrychlené přehrávání čekání v úvodní ukázce navíc neukazuje skutečnou dobu každé odpovědi.

The Decoder ve zprávě z 5. října zasazuje Rho-1 do vývoje multimodálních modelů a přebírá popis společného zpracování médií a pohybů. Neuvádí vlastní měření. Ohlášené schopnosti proto zůstávají tvrzením Reky, které ukázky ilustrují, ale nezávislý test dosud v těchto zdrojích nedokládá.

Podle Reky vznikl předvedený model trénováním od začátku na 320 akcelerátorech H100 po tři měsíce. Firma předpokládá, že větší rozsah trénování část chyb omezí; takový výsledek teprve potřebuje ověřit. Zájemce o spolupráci na robotice a interaktivních simulacích odkazuje na svůj tým. Oznámení zatím neposkytuje běžný návod, jak si Rho-1 stáhnout a spustit doma.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Google vydal EmbeddingGemma 2 pro vyhledávání v textu, obrazech i zvuku

    Google 6. října vydal EmbeddingGemma 2, která hledá souvislosti mezi textem, obrázky, videem a zvukem přímo v zařízení. Údaj o 191 MB paměti platí jen pro textové váhy;…

  2. Modely

    Model Beam zaostal v tabulce Reflection za GLM-5.3 ve všech dvanácti společných testech

    Reflection AI ohlásila 5. října svůj první otevřený model Beam s 501 miliardami parametrů, váhy ale zatím nevydala. V oznámení ho staví vedle staršího GLM-5.2; novější…

  3. Modely

    Aleph Alpha vydala Kolibri s 78,8 GB otevřených vah

    Německo-anglický Kolibri používá přes 78 miliard parametrů, při každém kroku zapojí 3,46 miliardy. Aleph Alpha doporučuje pro složité úlohy nejvýše 262 144 tokenů,…

  4. Modely

    GPT-6 Astra vytvářel v testu funkční 3D scény, jejich věrnost ale zaostala

    Výzkumníci z Marylandské univerzity a AWS nechali agenty podle obrázku napsat scénu v Blenderu. GPT-6 Astra dosáhl nejvyššího skóre, ale ani funkční výstup nezaručil…