Gemini 3.8 Live dostal avatar pro firemní agenty
Google přidal k modelu Gemini 3.8 Live obrazový výstup, který mluvenou odpověď převádí do pohybu přednastavené nebo vlastní postavy. Live Avatar od 24. září běží v Gemini Enterprise, zvládá 97 jazyků a vlastní podobu smí organizace použít jen po schválení. Modelová karta zároveň říká, že souvislý rozhovor vydrží jen několik minut.
Google 24. září rozšířil Gemini 3.8 Live o funkci Live Avatar. Model při rozhovoru poslouchá, sleduje obraz a mluvenou odpověď převádí do videa s pohyblivou postavou. Nejde zatím o novou tvář v běžné aplikaci Gemini: Google ji zpřístupnil ve firemní platformě Gemini Enterprise.

Organizace si mohou vybrat postavu z připravené knihovny. Vlastní podobu vytváří systém z referenčního obrázku a má při tom zachovat rysy člověka, výtvarný styl nebo identitu postavy. Google ji povoluje jen schváleným zákazníkům. Oznámení nepopisuje podmínky schválení ani postup, kterým firma ověřuje právo k použité tváři.
Avatar přepíná mezi 97 jazyky
Live Avatar spojuje řeč, obraz a text v jednom průběžném rozhovoru. Google uvádí 97 jazyků a tvrdí, že model při přechodu mezi nimi přizpůsobí pohyb rtů i výraz tváře bez postupného rozcházení zvuku s obrazem. V ukázce také agent odbavuje hosta v hotelu: zatímco mluví, na pozadí volá další nástroje a načítá data. Je to předváděcí scénář výrobce, ne nezávislý test přesnosti.
Modelová karta Gemini 3.8 Audio doplňuje meze, které v oznámení nezazní. Vstupní okno má až 128 000 tokenů. Běžné varianty Gemini 3.8 Live mají výstupní okno 64 000 tokenů, s avatarem klesá na 24 000 tokenů. Souvislý rozhovor může trvat jen několik minut. Hodiny nevydrží. Google mezi známými omezeními uvádí také halucinace, občasné zpomalení a časové limity. Znalostní uzávěrka celého modelu je leden 2025.
Neviditelný vodoznak označí obraz i zvuk
Veškerý obrazový a zvukový výstup má nést neviditelný vodoznak SynthID. Ten má pomáhat rozpoznat obsah vytvořený umělou inteligencí. Vodoznak ale divákovi nic neukáže přímo na obrazovce; k jeho přečtení je potřeba odpovídající detekce. Google v oznámení neuvádí viditelný štítek, který by byl součástí každého snímku videa.
Modelová karta popisuje avatar jako další výstup Gemini 3.8 Audio, které stojí na Gemini 3 Pro. Pro bezpečnostní posouzení Google používá výsledky staršího Gemini 3.7 Flash. Podle firmy totiž zvukové varianty 3.8 ani Live Avatar nepřidávají podstatně nové schopnosti a výkon proti tomuto modelu. Pohyblivá tvář je tedy nové rozhraní, ne doklad chytřejšího modelu.
Polidštění modelu může zvýšit důvěru ve špatnou odpověď
Právě rozhraní přitom mění, jak lidé odpověď vnímají. Studie výzkumníků DeepMind z roku 2021 zařadila mezi rizika jazykových modelů jejich polidšťování. Uživatel podle autorů může z lidsky působící konverzace mylně odvodit, že systém má stálou osobnost, empatii nebo spolehlivý úsudek. The Register na ten rozpor upozornil den po oznámení Live Avataru.
Starší práce neposuzovala tuto konkrétní funkci a nedokazuje, že avatar uživatele skutečně mate. Ukazuje však, co samotný SynthID neřeší: označení původu obsahu není totéž jako upozornění, že příjemný hlas a věrohodná mimika nezvyšují správnost odpovědi. Google v modelové kartě dál uvádí halucinace. Avatar je může podat přesvědčivěji, ale neodstraní je.
Zdroje: oznámení Gemini 3.8 Live with Live Avatar, modelová karta Gemini 3.8 Audio, studie Ethical and social risks of harm from Language Models a článek The Register.