Přeskočit na obsah
Modely 4 min čtení

Streamovací VibeVoice-ASR od Microsoftu přepisuje řeč i s mluvčím už během nahrávky

Microsoft vydal 2. září VibeVoice-ASR-Streaming ve dvou velikostech pod licencí MIT. Model vydává přepis po blocích 2,9 s a u každé věty říká, kdo ji řekl, bez zvláštního kroku pro rozpoznání mluvčích. Nahrávka smí mít nejvýš osm minut, jazyků je deset a čeština mezi nimi chybí.

Mikrofony v podcastovém studiu SPNN
Streamovací model vypisuje přepis po blocích a u každé věty přidá, kdo ji řekl. Foto: Myotus, Wikimedia Commons (CC BY 4.0)

Microsoft Research zveřejnil 2. září na Hugging Face modely VibeVoice-ASR-Streaming-7BVibeVoice-ASR-Streaming-1.5B. Téhož dne vyšla technická zpráva na arXivu a o den později přibyl zápis do repozitáře microsoft/VibeVoice. Karta modelu i repozitář uvádějí licenci MIT. Lednový VibeVoice-ASR přepsal až hodinovou nahrávku najednou a k textu přidal, kdo a kdy co řekl; výsledek ale vydal až po konci nahrávky. Streamovací verze dělá totéž po kouscích, jak zvuk přichází.

Blok 2,9 sekundy a půl sekundy náhledu

Model nečte řeč po vzorcích, ale po latentních snímcích: tokenizéry VibeVoice stlačí zvuk s 24 kHz na 7,5 snímku za sekundu, takže jeden snímek odpovídá 133,3 ms. Soubor preprocessor_config.json udává u obou vydaných modelů chunk_frames: 22lookahead_frames: 4, tedy blok 2,9 s a za ním půl sekundy náhledu. Zpráva popisuje i variantu s bloky 15 snímků (2 s), její váhy ale Microsoft nevydal.

Po každém bloku model vypíše věty i se značkou mluvčího. Dřívější zvuk, přepis a přiřazení mluvčích si nechává v kontextu, takže rozpoznání mluvčích (diarizace) není zvláštní krok. Očekávané zpoždění, s jakým věta dostane mluvčího, udává zpráva 2,00 s v ustáleném běhu; na první výstup se čeká celý blok plus náhled, tedy 3,5 s. Před začátkem přepisu jde modelu předat jména a odborné výrazy, v ukázkovém skriptu přepínačem --context_info, stejně jako u lednové verze.

Osm minut, deset jazyků, čeština chybí

Dva údaje, které karta modelu neuvádí, stojí v oddílu omezení technické zprávy. Vydané váhy počítají s nahrávkou nejvýš osm minut. Historie se drží nekomprimovaná a její cena roste s délkou lineárně, takže mez podle autorů dělá cena výpočtu, ne architektura. Lednový model zvládl šedesát minut. I testovací nahrávky proto zpráva ořezává na 480 s.

Jazyků je deset: angličtina, čínština, francouzština, italština, japonština, korejština, němčina, portugalština, ruština a španělština. Lednový VibeVoice-ASR jich uvádí přes padesát. Důvod je v přípravě dat: slova se v nahrávkách časují nástrojem Qwen3-ForcedAligner-0.6B a jazyk, který ten nástroj neumí, do trénování nešel. Čeština mezi deseti jazyky není. Zpráva přiznává i to, že při delším překrývání mluvčích kvalita klesá, protože dekodér musí souběžnou řeč vypsat do jednoho proudu.

Sedm miliard je jen jazykový základ

Rozhraní Hugging Face hlásí u většího modelu 8 674 021 857 parametrů v bfloat16 a osm souborů vah o 17,36 GB, přesně tolik, kolik má lednový VibeVoice-ASR. Přečetli jsme hlavičky všech osmi souborů safetensors rozsahovými dotazy, bez stažení vah, a parametry sečetli po modulech (vlastní výpočet):

  • jazykový model 7 070 619 136 a výstupní vrstva 544 997 376, dohromady 7 615 616 512 – na parametr přesně tolik, kolik podle karty na Hugging Face má Qwen2.5-7B, který zpráva jmenuje jako základ;
  • akustický tokenizér 687 392 001;
  • sémantický tokenizér 344 613 600;
  • dva spojovací moduly dohromady 26 399 744.

„7B“ v názvu tedy platí pro jazykovou část, celý model má o miliardu parametrů víc. Menší varianta má 2 814 116 321 parametrů a 5,65 GB. Shodný počet s lednovým modelem sedí na popsaný postup: každou streamovací konfiguraci autoři vzali z nestreamovacího modelu téže velikosti a doladili ji ve dvou fázích, nejdřív na zhruba 420 000 hodinách angličtiny a čínštiny, pak na 13 000 hodinách směsi veřejných sad a syntetických schůzek (50 884 nahrávek, 4 519,6 hodiny).

Srovnání měřil Microsoft sám

Tabulka 1 zprávy staví sedmimiliardový model proti čtyřem streamovacím službám, kterým autoři posílali zvuk ve stejných blocích 2,9 s. Průměr chybovosti (WER, u čínštiny, japonštiny a korejštiny CER) přes pět sad vyšel 24,66 pro VibeVoice, 25,23 pro Gemini 3.5 Transcribe Live, 39,31 pro GPT Realtime Whisper, 40,55 pro GPT Live Transcribe a 41,39 pro ElevenLabs Scribe v2 Realtime. Náskok před Gemini dělá hlavně čínská sada AISHELL-4 (22,76 proti 30,09). Na schůzkách AMI ze vzdáleného mikrofonu je Gemini lepší (27,18 proti 29,81) a vede i v japonštině (16,54 proti 27,85), němčině (16,96 proti 21,83) a italštině (12,98 proti 17,00).

V přiřazení mluvčích zpráva srovnává model s Azure ConversationTranscriber a Google Cloud Speech-to-Text a hlásí nejlepší nebo shodně nejlepší výsledek ve dvanácti ze třinácti nastavení; Google v tomhle režimu podle tabulky umí jen angličtinu. U jednoho mluvčího je obrázek střízlivější. Na LibriSpeech je Voxtral-Mini-4B-Realtime lepší (1,88 a 4,10 proti 2,33 a 6,49) a průměr čtyř sad 5,76 je o setinu před modelem X-ASR. Všechna čísla naměřili autoři vlastním postupem a nikdo jiný je zatím nezopakoval.

Provoz přes vLLM

Repozitář má zásuvný modul pro vLLM s WebSocketem /v1/stream. Každý blok znovu použije mezipaměť klíčů a hodnot všech bloků před ním, takže sezení nesmí přeskakovat mezi replikami a datový paralelismus dokumentace vylučuje. Zpráva udává na jedné kartě A100 s 80 GB pod vLLM 146 až 208 ms na dvousekundový blok, tedy faktor reálného času nejvýš 0,104. Měřila to ale na konfiguraci s bloky 15 snímků, kterou Microsoft nevydal; jak rychle běží vydaná verze s bloky 2,9 s, ve zprávě nestojí.

O lednovém VibeVoice-ASR jsme psali při srovnání osmi modelů přepisu na indické sadě Monsoon. Streamovací verze indické jazyky neumí, takže na téže sadě zatím není co měřit.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Z trojice modelů Nex-N2.5 chybí na Hugging Face váhy jen prostřednímu Pro

    Nex AGI vydala 8. září rodinu agentních modelů Nex-N2.5 ve třech velikostech a slibuje otevřené váhy. Nejmenší mini má 70 GB v BF16 a největší Max 1,65 TB ve FP8,…

  2. Modely

    Dvě tabulky slovníku zabírají v modelu MiniCPM5-2B pětinu parametrů

    Skupina OpenBMB vydala 6. září model MiniCPM5-2B pro běh na koncových zařízeních. Z jeho 2 516 756 480 parametrů připadá 534 773 760 na dvojici tabulek, které převádějí…

  3. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  4. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…