Model Venus od Ant Group odkládá úkoly na pozadí čtyřmi novými tokeny
Skupina inclusionAI zveřejnila dvojici devítimiliardových modelů, které poslouchají i během vlastní řeči a umějí si uprostřed hovoru zadat úkol na pozadí. Ve vahách po tom mechanismu zbyly čtyři nové tokeny; zbytek modelu je dotrénovaný MiniCPM-o 4.5 od cizí laboratoře.
Skupina inclusionAI, pod kterou Ant Group vydává své otevřené projekty, zveřejnila 16. září systém Realtime-Venus. Jsou to dva samostatně trénované modely po devíti miliardách parametrů – Omni pro obraz i zvuk, Audio jen pro hlas – a k nim běhové prostředí Harness. Všechno pod licencí Apache 2.0. Technická zpráva vyšla o čtyři dny dřív, 12. září.

Ozve se sám a úkol si odloží
Běžný hlasový asistent pracuje na střídačku: domluvíte, on odpoví. Venus podle karty modelu vnímá i během vlastní řeči a rozlišuje, jestli mu člověk skáče do řeči, jen přitakává, nebo mluví na někoho jiného. K tomu se umí ozvat sám, když se ve sledovaném obraze nebo zvuku něco stane – bez toho, aby ho někdo oslovil.
Třetí schopnost je ta, kvůli které celý systém vznikl. Když si hovor vyžádá delší úkol, model vloží do proudu textu značku <delegate> a mluví dál. Úlohu mezitím vyřídí Harness na pozadí a výsledek vrátí zpátky značkou <backend>. Rozhovor se kvůli čekání nezastaví.
Čtyři tokeny, tedy 32 768 parametrů
Karta modelu uvádí, že Venus je upravený MiniCPM-o 4.5, tedy devítimiliardový model čínské skupiny OpenBMB. O kolik se od něj liší, se dá spočítat z hlaviček souborů s vahami, aniž se stáhne jediný gigabajt.
Venus má 9 371 820 434 parametrů, jeho základ 9 371 787 666. Rozdíl je 32 768 parametrů, v přesnosti BF16 tedy 65 536 bajtů.
Ten rozdíl sedí na slovník. Konfigurace Venusu vede 151 752 tokenů proti 151 748 u základu a ty čtyři navíc jsou <delegate>, </delegate>, <backend> a </backend>. Model nemá svázanou vstupní a výstupní vrstvu, takže každý nový token přibude dvakrát: 4 × 4 096 × 2 je rovno 32 768. Mechanismus, který dal celému systému jméno, zabírá ve vahách zhruba tolik co zaokrouhlovací chyba.
Neplyne z toho, že by byl zbytek vah nedotčený. Otisk sha256 se u všech čtyř souborů proti MiniCPM-o liší a jinak je i rozdělení vah mezi ně – model se dotrénoval, jen se při tom nezměnil jeho tvar. Tím se liší od agentního modelu Atria Dawn, který stál na nezměněné architektuře GLM-5.2.
Z čeho je model poskládaný
Jména tenzorů v hlavičkách prozradí i poměr jednotlivých dílů. Jazykové jádro Qwen3-8B má 8 189 228 032 parametrů, tedy 87,4 % celku. Obrazový kodér SigLIP2 dělá 417 792 240 parametrů (4,5 %), část pro generování řeči 347 696 290 (3,7 %), zvukový kodér z rodiny Whisper 328 196 096 (3,5 %) a resampler 88 907 776 (0,9 %). Všechno v BF16, dohromady 17,46 GiB na jeden model.
Co je převzaté a co vlastní, vypisuje soubor NOTICE: jádro je z MiniCPM-o 4.5, tým si k němu připsal identitu a systémové pokyny, obsluhu výstupu delegování, běh dlouhé videopaměti v adresáři memory_adapter/ a přejmenované moduly, třídy a konfigurace. Je to jedno z mála míst, kde vydavatel modelu rozepisuje vlastní přínos sám.
Hlasová verze má přitom úplně stejnou stavbu jako ta obrazová, 1 414 tenzorů a stejný součet bajtů – včetně obrazového kodéru, o kterém její vlastní karta píše, že se při běhu nepoužívá.
Naměřená čísla jsou zatím jen z vlastní zprávy
Výsledky testů pocházejí z technické zprávy týmu (verze v1 z 12. září) a nikdo je zatím nezopakoval. Omni je podle ní mezi porovnávanými modely pro běh v reálném čase nejlepší v šesti z osmi videotestů: StreamingBench 70,2 %, OVO-Bench 64,7 % a Daily-Omni 81,3 %. Hlasová verze vede podle zprávy na MMAU (78,0 %), MMAU-Pro (63,2 %), Llama Questions (83,8 %) a Speech CMMLU (67,8 %).
Nejvíc zpráva staví na testu Full-Duplex-Bench v1.5. Model podle ní odpoví na 75 % přerušení a v řeči pokračuje v 97 % případů, kdy mu druhá strana přitakává, v 88 %, když mluví na někoho jiného, a v 86 % při hluku v pozadí. V těchhle třech číslech zpráva staví Venus nad Gemini 3.1 Live i GPT-4o. Hodnoty obou konkurentů si ovšem změřil sám vydavatel.
Co to chce a kdo si to zatím vzal
Ke spuštění je podle repozitáře potřeba Python 3.10, CUDA a FFmpeg, kontextové okno má 40 960 tokenů. Váhy jednoho modelu zaberou 17,46 GiB, takže se na kartu s 24 GB vejdou, ale bez velké rezervy na kontext. Přiložený skript download_models.py umí stáhnout jen jeden z obou modelů – kdo si vezme celý repozitář, táhne asi 35 GB.
Zájem je zatím malý. Repozitář na Hugging Face měl 22. září 27 stažení a 56 označení „líbí se“, repozitář na GitHubu 43 hvězd. Otevřenost tomu ale nebrání: licence Apache 2.0 platí na váhy i na kód a komerční použití neomezuje. Jiný čínský model pro současnou práci se zvukem, obrazem i textem, Qwen Omni-Flash, se dá jen kupovat po tokenech; váhy k němu vydavatel nedal.
Zdroje
- Karta modelu Realtime-Venus, Hugging Face – popis schopností, tabulka dílů, postup spuštění, soubory LICENSE a NOTICE
- Realtime-Venus: A full-duplex interaction system with asynchronous delegation, arXiv 2609.13814v1 – technická zpráva s naměřenými hodnotami
- MiniCPM-o 4.5, Hugging Face – základ, proti kterému se počítal rozdíl
- Realtime-Venus na GitHubu – běhové prostředí Harness a příklady
Počty parametrů, velikosti a otisky souborů jsme spočítali z hlaviček souborů safetensors obou repozitářů; jde o vlastní měření.