Streamovací VibeVoice-ASR od Microsoftu přepisuje řeč i s mluvčím už během nahrávky
Microsoft vydal 2. září VibeVoice-ASR-Streaming ve dvou velikostech pod licencí MIT. Model vydává přepis po blocích 2,9 s a u každé věty říká, kdo ji řekl, bez zvláštního kroku pro rozpoznání mluvčích. Nahrávka smí mít nejvýš osm minut, jazyků je deset a čeština mezi nimi chybí.

Microsoft Research zveřejnil 2. září na Hugging Face modely VibeVoice-ASR-Streaming-7B a VibeVoice-ASR-Streaming-1.5B. Téhož dne vyšla technická zpráva na arXivu a o den později přibyl zápis do repozitáře microsoft/VibeVoice. Karta modelu i repozitář uvádějí licenci MIT. Lednový VibeVoice-ASR přepsal až hodinovou nahrávku najednou a k textu přidal, kdo a kdy co řekl; výsledek ale vydal až po konci nahrávky. Streamovací verze dělá totéž po kouscích, jak zvuk přichází.
Blok 2,9 sekundy a půl sekundy náhledu
Model nečte řeč po vzorcích, ale po latentních snímcích: tokenizéry VibeVoice stlačí zvuk s 24 kHz na 7,5 snímku za sekundu, takže jeden snímek odpovídá 133,3 ms. Soubor preprocessor_config.json udává u obou vydaných modelů chunk_frames: 22 a lookahead_frames: 4, tedy blok 2,9 s a za ním půl sekundy náhledu. Zpráva popisuje i variantu s bloky 15 snímků (2 s), její váhy ale Microsoft nevydal.
Po každém bloku model vypíše věty i se značkou mluvčího. Dřívější zvuk, přepis a přiřazení mluvčích si nechává v kontextu, takže rozpoznání mluvčích (diarizace) není zvláštní krok. Očekávané zpoždění, s jakým věta dostane mluvčího, udává zpráva 2,00 s v ustáleném běhu; na první výstup se čeká celý blok plus náhled, tedy 3,5 s. Před začátkem přepisu jde modelu předat jména a odborné výrazy, v ukázkovém skriptu přepínačem --context_info, stejně jako u lednové verze.
Osm minut, deset jazyků, čeština chybí
Dva údaje, které karta modelu neuvádí, stojí v oddílu omezení technické zprávy. Vydané váhy počítají s nahrávkou nejvýš osm minut. Historie se drží nekomprimovaná a její cena roste s délkou lineárně, takže mez podle autorů dělá cena výpočtu, ne architektura. Lednový model zvládl šedesát minut. I testovací nahrávky proto zpráva ořezává na 480 s.
Jazyků je deset: angličtina, čínština, francouzština, italština, japonština, korejština, němčina, portugalština, ruština a španělština. Lednový VibeVoice-ASR jich uvádí přes padesát. Důvod je v přípravě dat: slova se v nahrávkách časují nástrojem Qwen3-ForcedAligner-0.6B a jazyk, který ten nástroj neumí, do trénování nešel. Čeština mezi deseti jazyky není. Zpráva přiznává i to, že při delším překrývání mluvčích kvalita klesá, protože dekodér musí souběžnou řeč vypsat do jednoho proudu.
Sedm miliard je jen jazykový základ
Rozhraní Hugging Face hlásí u většího modelu 8 674 021 857 parametrů v bfloat16 a osm souborů vah o 17,36 GB, přesně tolik, kolik má lednový VibeVoice-ASR. Přečetli jsme hlavičky všech osmi souborů safetensors rozsahovými dotazy, bez stažení vah, a parametry sečetli po modulech (vlastní výpočet):
- jazykový model 7 070 619 136 a výstupní vrstva 544 997 376, dohromady 7 615 616 512 – na parametr přesně tolik, kolik podle karty na Hugging Face má Qwen2.5-7B, který zpráva jmenuje jako základ;
- akustický tokenizér 687 392 001;
- sémantický tokenizér 344 613 600;
- dva spojovací moduly dohromady 26 399 744.
„7B“ v názvu tedy platí pro jazykovou část, celý model má o miliardu parametrů víc. Menší varianta má 2 814 116 321 parametrů a 5,65 GB. Shodný počet s lednovým modelem sedí na popsaný postup: každou streamovací konfiguraci autoři vzali z nestreamovacího modelu téže velikosti a doladili ji ve dvou fázích, nejdřív na zhruba 420 000 hodinách angličtiny a čínštiny, pak na 13 000 hodinách směsi veřejných sad a syntetických schůzek (50 884 nahrávek, 4 519,6 hodiny).
Srovnání měřil Microsoft sám
Tabulka 1 zprávy staví sedmimiliardový model proti čtyřem streamovacím službám, kterým autoři posílali zvuk ve stejných blocích 2,9 s. Průměr chybovosti (WER, u čínštiny, japonštiny a korejštiny CER) přes pět sad vyšel 24,66 pro VibeVoice, 25,23 pro Gemini 3.5 Transcribe Live, 39,31 pro GPT Realtime Whisper, 40,55 pro GPT Live Transcribe a 41,39 pro ElevenLabs Scribe v2 Realtime. Náskok před Gemini dělá hlavně čínská sada AISHELL-4 (22,76 proti 30,09). Na schůzkách AMI ze vzdáleného mikrofonu je Gemini lepší (27,18 proti 29,81) a vede i v japonštině (16,54 proti 27,85), němčině (16,96 proti 21,83) a italštině (12,98 proti 17,00).
V přiřazení mluvčích zpráva srovnává model s Azure ConversationTranscriber a Google Cloud Speech-to-Text a hlásí nejlepší nebo shodně nejlepší výsledek ve dvanácti ze třinácti nastavení; Google v tomhle režimu podle tabulky umí jen angličtinu. U jednoho mluvčího je obrázek střízlivější. Na LibriSpeech je Voxtral-Mini-4B-Realtime lepší (1,88 a 4,10 proti 2,33 a 6,49) a průměr čtyř sad 5,76 je o setinu před modelem X-ASR. Všechna čísla naměřili autoři vlastním postupem a nikdo jiný je zatím nezopakoval.
Provoz přes vLLM
Repozitář má zásuvný modul pro vLLM s WebSocketem /v1/stream. Každý blok znovu použije mezipaměť klíčů a hodnot všech bloků před ním, takže sezení nesmí přeskakovat mezi replikami a datový paralelismus dokumentace vylučuje. Zpráva udává na jedné kartě A100 s 80 GB pod vLLM 146 až 208 ms na dvousekundový blok, tedy faktor reálného času nejvýš 0,104. Měřila to ale na konfiguraci s bloky 15 snímků, kterou Microsoft nevydal; jak rychle běží vydaná verze s bloky 2,9 s, ve zprávě nestojí.
O lednovém VibeVoice-ASR jsme psali při srovnání osmi modelů přepisu na indické sadě Monsoon. Streamovací verze indické jazyky neumí, takže na téže sadě zatím není co měřit.
Zdroje
- Karta modelu VibeVoice-ASR-Streaming-7B a 1.5B na Hugging Face včetně
config.json,preprocessor_config.jsona hlaviček souborů vah - VibeVoice-ASR-Streaming Technical Report, arXiv:2609.02812, 2. září 2026
- Dokumentace streamovacího modelu v repozitáři microsoft/VibeVoice
- Karta modelu Qwen2.5-7B na Hugging Face
- AI Weekly: VibeVoice-ASR Ships 1.5B and 7B Open Weights, 3. září 2026