Přeskočit na obsah
Modely 3 min čtení

Model Venus od Ant Group odkládá úkoly na pozadí čtyřmi novými tokeny

Skupina inclusionAI zveřejnila dvojici devítimiliardových modelů, které poslouchají i během vlastní řeči a umějí si uprostřed hovoru zadat úkol na pozadí. Ve vahách po tom mechanismu zbyly čtyři nové tokeny; zbytek modelu je dotrénovaný MiniCPM-o 4.5 od cizí laboratoře.

Skupina inclusionAI, pod kterou Ant Group vydává své otevřené projekty, zveřejnila 16. září systém Realtime-Venus. Jsou to dva samostatně trénované modely po devíti miliardách parametrů – Omni pro obraz i zvuk, Audio jen pro hlas – a k nim běhové prostředí Harness. Všechno pod licencí Apache 2.0. Technická zpráva vyšla o čtyři dny dřív, 12. září.

Studiový mikrofon na klavíru
Studiový mikrofon. Foto: Will Fisher, Wikimedia Commons (CC BY-SA 2.0)

Ozve se sám a úkol si odloží

Běžný hlasový asistent pracuje na střídačku: domluvíte, on odpoví. Venus podle karty modelu vnímá i během vlastní řeči a rozlišuje, jestli mu člověk skáče do řeči, jen přitakává, nebo mluví na někoho jiného. K tomu se umí ozvat sám, když se ve sledovaném obraze nebo zvuku něco stane – bez toho, aby ho někdo oslovil.

Třetí schopnost je ta, kvůli které celý systém vznikl. Když si hovor vyžádá delší úkol, model vloží do proudu textu značku <delegate> a mluví dál. Úlohu mezitím vyřídí Harness na pozadí a výsledek vrátí zpátky značkou <backend>. Rozhovor se kvůli čekání nezastaví.

Čtyři tokeny, tedy 32 768 parametrů

Karta modelu uvádí, že Venus je upravený MiniCPM-o 4.5, tedy devítimiliardový model čínské skupiny OpenBMB. O kolik se od něj liší, se dá spočítat z hlaviček souborů s vahami, aniž se stáhne jediný gigabajt.

Venus má 9 371 820 434 parametrů, jeho základ 9 371 787 666. Rozdíl je 32 768 parametrů, v přesnosti BF16 tedy 65 536 bajtů.

Ten rozdíl sedí na slovník. Konfigurace Venusu vede 151 752 tokenů proti 151 748 u základu a ty čtyři navíc jsou <delegate>, </delegate>, <backend></backend>. Model nemá svázanou vstupní a výstupní vrstvu, takže každý nový token přibude dvakrát: 4 × 4 096 × 2 je rovno 32 768. Mechanismus, který dal celému systému jméno, zabírá ve vahách zhruba tolik co zaokrouhlovací chyba.

Neplyne z toho, že by byl zbytek vah nedotčený. Otisk sha256 se u všech čtyř souborů proti MiniCPM-o liší a jinak je i rozdělení vah mezi ně – model se dotrénoval, jen se při tom nezměnil jeho tvar. Tím se liší od agentního modelu Atria Dawn, který stál na nezměněné architektuře GLM-5.2.

Z čeho je model poskládaný

Jména tenzorů v hlavičkách prozradí i poměr jednotlivých dílů. Jazykové jádro Qwen3-8B má 8 189 228 032 parametrů, tedy 87,4 % celku. Obrazový kodér SigLIP2 dělá 417 792 240 parametrů (4,5 %), část pro generování řeči 347 696 290 (3,7 %), zvukový kodér z rodiny Whisper 328 196 096 (3,5 %) a resampler 88 907 776 (0,9 %). Všechno v BF16, dohromady 17,46 GiB na jeden model.

Co je převzaté a co vlastní, vypisuje soubor NOTICE: jádro je z MiniCPM-o 4.5, tým si k němu připsal identitu a systémové pokyny, obsluhu výstupu delegování, běh dlouhé videopaměti v adresáři memory_adapter/ a přejmenované moduly, třídy a konfigurace. Je to jedno z mála míst, kde vydavatel modelu rozepisuje vlastní přínos sám.

Hlasová verze má přitom úplně stejnou stavbu jako ta obrazová, 1 414 tenzorů a stejný součet bajtů – včetně obrazového kodéru, o kterém její vlastní karta píše, že se při běhu nepoužívá.

Naměřená čísla jsou zatím jen z vlastní zprávy

Výsledky testů pocházejí z technické zprávy týmu (verze v1 z 12. září) a nikdo je zatím nezopakoval. Omni je podle ní mezi porovnávanými modely pro běh v reálném čase nejlepší v šesti z osmi videotestů: StreamingBench 70,2 %, OVO-Bench 64,7 % a Daily-Omni 81,3 %. Hlasová verze vede podle zprávy na MMAU (78,0 %), MMAU-Pro (63,2 %), Llama Questions (83,8 %) a Speech CMMLU (67,8 %).

Nejvíc zpráva staví na testu Full-Duplex-Bench v1.5. Model podle ní odpoví na 75 % přerušení a v řeči pokračuje v 97 % případů, kdy mu druhá strana přitakává, v 88 %, když mluví na někoho jiného, a v 86 % při hluku v pozadí. V těchhle třech číslech zpráva staví Venus nad Gemini 3.1 Live i GPT-4o. Hodnoty obou konkurentů si ovšem změřil sám vydavatel.

Co to chce a kdo si to zatím vzal

Ke spuštění je podle repozitáře potřeba Python 3.10, CUDA a FFmpeg, kontextové okno má 40 960 tokenů. Váhy jednoho modelu zaberou 17,46 GiB, takže se na kartu s 24 GB vejdou, ale bez velké rezervy na kontext. Přiložený skript download_models.py umí stáhnout jen jeden z obou modelů – kdo si vezme celý repozitář, táhne asi 35 GB.

Zájem je zatím malý. Repozitář na Hugging Face měl 22. září 27 stažení a 56 označení „líbí se“, repozitář na GitHubu 43 hvězd. Otevřenost tomu ale nebrání: licence Apache 2.0 platí na váhy i na kód a komerční použití neomezuje. Jiný čínský model pro současnou práci se zvukem, obrazem i textem, Qwen Omni-Flash, se dá jen kupovat po tokenech; váhy k němu vydavatel nedal.

Zdroje

Počty parametrů, velikosti a otisky souborů jsme spočítali z hlaviček souborů safetensors obou repozitářů; jde o vlastní měření.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Salesforce u Koa slibuje třikrát méně chyb, studie však číslo neuvádí

    Salesforce 15. září představil Koa, model pro práci s nástroji v Agentforce, který vychází z Nemotronu 3 Super 120B. Produktová stránka mu připisuje třikrát méně chyb a…

  2. Modely

    Model GPT-6 Astra zvládl sedm pokusů ze sta v testu s robotickými rameny

    Zkouška StationeryBench dala dvěma modelům stejná dvouramenná ramena a pět úloh z psacího stolu. GPT-6 Astra od OpenAI splnil zadání v sedmi pokusech ze sta, MolmoAct2…

  3. Modely

    Streamovací VibeVoice-ASR od Microsoftu přepisuje řeč i s mluvčím už během nahrávky

    Microsoft vydal 2. září VibeVoice-ASR-Streaming ve dvou velikostech pod licencí MIT. Model vydává přepis po blocích 2,9 s a u každé věty říká, kdo ji řekl, bez…

  4. Modely

    Z trojice modelů Nex-N2.5 chybí na Hugging Face váhy jen prostřednímu Pro

    Nex AGI vydala 8. září rodinu agentních modelů Nex-N2.5 ve třech velikostech a slibuje otevřené váhy. Nejmenší mini má 70 GB v BF16 a největší Max 1,65 TB ve FP8,…