Přeskočit na obsah
Modely 2 min čtení

Gemini 3.8 Live dostal avatar pro firemní agenty

Google přidal k modelu Gemini 3.8 Live obrazový výstup, který mluvenou odpověď převádí do pohybu přednastavené nebo vlastní postavy. Live Avatar od 24. září běží v Gemini Enterprise, zvládá 97 jazyků a vlastní podobu smí organizace použít jen po schválení. Modelová karta zároveň říká, že souvislý rozhovor vydrží jen několik minut.

Google 24. září rozšířil Gemini 3.8 Live o funkci Live Avatar. Model při rozhovoru poslouchá, sleduje obraz a mluvenou odpověď převádí do videa s pohyblivou postavou. Nejde zatím o novou tvář v běžné aplikaci Gemini: Google ji zpřístupnil ve firemní platformě Gemini Enterprise.

Obličej člověka s body pro snímání pohybu a jeho digitální model na monitoru
Ukázka snímání pohybu tváře a jeho převodu do digitálního modelu. Foto: Luca Bezzi 1979, Wikimedia Commons (CC BY 4.0)

Organizace si mohou vybrat postavu z připravené knihovny. Vlastní podobu vytváří systém z referenčního obrázku a má při tom zachovat rysy člověka, výtvarný styl nebo identitu postavy. Google ji povoluje jen schváleným zákazníkům. Oznámení nepopisuje podmínky schválení ani postup, kterým firma ověřuje právo k použité tváři.

Avatar přepíná mezi 97 jazyky

Live Avatar spojuje řeč, obraz a text v jednom průběžném rozhovoru. Google uvádí 97 jazyků a tvrdí, že model při přechodu mezi nimi přizpůsobí pohyb rtů i výraz tváře bez postupného rozcházení zvuku s obrazem. V ukázce také agent odbavuje hosta v hotelu: zatímco mluví, na pozadí volá další nástroje a načítá data. Je to předváděcí scénář výrobce, ne nezávislý test přesnosti.

Modelová karta Gemini 3.8 Audio doplňuje meze, které v oznámení nezazní. Vstupní okno má až 128 000 tokenů. Běžné varianty Gemini 3.8 Live mají výstupní okno 64 000 tokenů, s avatarem klesá na 24 000 tokenů. Souvislý rozhovor může trvat jen několik minut. Hodiny nevydrží. Google mezi známými omezeními uvádí také halucinace, občasné zpomalení a časové limity. Znalostní uzávěrka celého modelu je leden 2025.

Neviditelný vodoznak označí obraz i zvuk

Veškerý obrazový a zvukový výstup má nést neviditelný vodoznak SynthID. Ten má pomáhat rozpoznat obsah vytvořený umělou inteligencí. Vodoznak ale divákovi nic neukáže přímo na obrazovce; k jeho přečtení je potřeba odpovídající detekce. Google v oznámení neuvádí viditelný štítek, který by byl součástí každého snímku videa.

Modelová karta popisuje avatar jako další výstup Gemini 3.8 Audio, které stojí na Gemini 3 Pro. Pro bezpečnostní posouzení Google používá výsledky staršího Gemini 3.7 Flash. Podle firmy totiž zvukové varianty 3.8 ani Live Avatar nepřidávají podstatně nové schopnosti a výkon proti tomuto modelu. Pohyblivá tvář je tedy nové rozhraní, ne doklad chytřejšího modelu.

Polidštění modelu může zvýšit důvěru ve špatnou odpověď

Právě rozhraní přitom mění, jak lidé odpověď vnímají. Studie výzkumníků DeepMind z roku 2021 zařadila mezi rizika jazykových modelů jejich polidšťování. Uživatel podle autorů může z lidsky působící konverzace mylně odvodit, že systém má stálou osobnost, empatii nebo spolehlivý úsudek. The Register na ten rozpor upozornil den po oznámení Live Avataru.

Starší práce neposuzovala tuto konkrétní funkci a nedokazuje, že avatar uživatele skutečně mate. Ukazuje však, co samotný SynthID neřeší: označení původu obsahu není totéž jako upozornění, že příjemný hlas a věrohodná mimika nezvyšují správnost odpovědi. Google v modelové kartě dál uvádí halucinace. Avatar je může podat přesvědčivěji, ale neodstraní je.

Zdroje: oznámení Gemini 3.8 Live with Live Avatar, modelová karta Gemini 3.8 Audio, studie Ethical and social risks of harm from Language Models a článek The Register.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Firma Aikido vydala Altar, zmenšenou verzi GLM-5.3 o velikosti 328 GB

    Firma Aikido odstranila z modelu GLM-5.3 88 z 256 směrovaných expertů a stlačila jeho váhy na 328 GB. V interním testu Altar objevil alespoň jednou 23 z 32 známých…

  2. Modely

    Model Venus od Ant Group odkládá úkoly na pozadí čtyřmi novými tokeny

    Skupina inclusionAI zveřejnila dvojici devítimiliardových modelů, které poslouchají i během vlastní řeči a umějí si uprostřed hovoru zadat úkol na pozadí. Ve vahách po…

  3. Modely

    Salesforce u Koa slibuje třikrát méně chyb, studie však číslo neuvádí

    Salesforce 15. září představil Koa, model pro práci s nástroji v Agentforce, který vychází z Nemotronu 3 Super 120B. Produktová stránka mu připisuje třikrát méně chyb a…

  4. Modely

    Model GPT-6 Astra zvládl sedm pokusů ze sta v testu s robotickými rameny

    Zkouška StationeryBench dala dvěma modelům stejná dvouramenná ramena a pět úloh z psacího stolu. GPT-6 Astra od OpenAI splnil zadání v sedmi pokusech ze sta, MolmoAct2…