NVIDIA měřila nový diarizační model u šesti z osmi sad proti jiným referenčním štítkům
NVIDIA vydala 23. září model Nemotron 3 Diarization, který v nahrávce rozliší až osm mluvčích a zvládne to i za běhu. Proti předchozí verzi klesla chybovost v průměru o 41 %. U šesti z osmi testovacích sad ale firma měřila proti jiným referenčním štítkům, než jaké k těm sadám patří původně. Do karty modelu to napsala, do oznámení na blogu ne.
Diarizace je úloha, která z nahrávky vyčte, kdo kdy mluvil. Rozpoznávání řeči přepíše slova, diarizace k nim přiřadí mluvčího, a teprve spojení obojího dá zápis, ze kterého se pozná, kdo co na schůzce slíbil. NVIDIA k tomu 23. září 2026 vydala model Nemotron 3 Diarization s volnými vahami.

Model má 100 milionů parametrů a jeho jádrem je enkodér s 31 vrstvami. Na vstupu bere jednokanálový zvuk se vzorkovací frekvencí 16 kHz, na výstupu dává pro každých 10 ms osm čísel: pravděpodobnost, že je právě aktivní první, druhý až osmý mluvčí. Kanály se řadí podle toho, kdo se v nahrávce ozval dřív, takže označení zůstávají stabilní i po dlouhé odmlce. Jména to nejsou a model je nezjišťuje; „speaker_2“ znamená druhý hlas v pořadí, nic víc. O streamovaném přepisu s rozlišením mluvčích jsme psali u modelu VibeVoice-ASR od Microsoftu.
Čtyři doporučená nastavení, jedno nedoporučené
Táž váhová sada obsluhuje offline i běh naživo. Rozdíl dělá vyrovnávací paměť vstupu: než model spustí výpočet, počká si na 30,4 s, 1,04 s, 0,64 s, nebo 0,32 s zvuku. Kratší čekání znamená rychlejší odpověď a vyšší chybovost. Karta modelu k tomu dodává jednu větu, kterou přetisky vynechávají: technicky model zvládne i 80 ms, jenže nejnižší doporučené nastavení je 0,32 s. Uvedené hodnoty navíc počítají jen nabíraný zvuk, ne vlastní výpočet, síť ani přepis.
O kolik klesla chybovost
Přesnost se měří chybovostí diarizace (DER) a NVIDIA ji vypsala pro osm testovacích podmínek proti svému předchozímu streamovacímu modelu diar_streaming_sortformer_4spk-v2.1. Při vyrovnávací paměti 1,04 s klesla na sadě DIHARD III z 19,60 na 13,18 %, na CALLHOME-Part2 z 11,31 na 10,29 % a na NOTSOFAR1 MHM z 22,12 na 7,70 %. Nevážený průměr osmi relativních poklesů vychází na 41 %; firma sama upozorňuje, že je to průměr relativních zlepšení, ne jedno číslo spočítané ze všech nahrávek dohromady.
Šest sad má jiné referenční anotace než dřív
Chybovost diarizace se počítá proti referenci, tedy proti souboru, ve kterém je ručně vyznačeno, kdo kdy mluvil. Karta modelu má u každé testovací sady sloupec s tím, odkud reference pochází. U DIHARD III a CALLHOME-Part2 stojí „Original“. U zbylých šesti podmínek, tedy u AliMeeting, AMI a NOTSOFAR1, odkazuje na cizí veřejné repozitáře nttcslab-sp/diar-forced-alignment a popcornell/FastMSS, kde jsou hranice řeči dopočítané strojovým zarovnáním.
Důvod NVIDIA uvádí: původní anotace těch tří sad vznikly kvůli přepisu, ne kvůli přesnému měření po rámcích, takže jako řeč označují i delší ticho uvnitř promluvy. Systém, který to ticho pozná správně, je pak trestán za zmeškanou řeč, která tam není. Karta z toho vyvozuje závěr sama: výsledek naměřený proti jiné referenci je jiný pokus a s čísly v kartě se přímo porovnat nedá.
Vlastní dopočet z tabulek karty ukazuje, kam to zlepšení připadá. U dvou sad s původními štítky je průměrný relativní pokles 20,9 %, u šesti sad s dopočítanou referencí 47,7 % (vstupní čísla jsou hodnoty DER při 1,04 s uvedené výš, vzorec je rozdíl dělený starší hodnotou). Obě řady měřila NVIDIA proti týmž referencím, takže srovnání starého a nového modelu mezi sebou platí. Co z něj neplyne, je srovnání s cizími systémy na těch šesti sadách.
V oznámení na blogu ta věta není
Doprovodný text na blogu Hugging Face, který model představuje, má vlastní oddíl o měření přesnosti. Jmenuje v něm toleranci hranic i to, že se překrývající řeč započítává, a vypisuje obě čísla. O referenčních anotacích v něm nepadne ani slovo: výrazy „forced alignment“, „reference label“ ani „RTTM“ se v celém textu nevyskytují. Kdo čte jen oznámení, tuhle podmínku měření nemá odkud vzít.
Kde je nový model horší
Tabulky nejsou jednosměrné. Na podmnožině CALLHOME se dvěma mluvčími má Nemotron při vyrovnávací paměti 30,4 s chybovost 5,98 % proti 5,68 % u starší verze, tedy o něco horší; blog to přiznává rovnou v textu. Na celé sadě CALLHOME-Part2 je přitom nový model lepší. Přesnost určení počtu mluvčích na sadě AMI MHM navíc klesla z 93,75 na 87,50 % a o té už oznámení mlčí. Rychlost naopak vyskočila: při nejkratším nastavení a zpracování po jedné nahrávce zvládne nový model 12,5násobek délky zvuku za jednotku času proti 8násobku u předchůdce, se zkompilovaným grafem 54násobek proti 21.
Nezávislé číslo je zatím předběžné
Jediný údaj, který nepochází od výrobce, je pořadí v žebříčku Diarization-Bench projektu VoiceArena. Model tam vede s chybovostí 14,72 % proti 19,3 % u druhého v pořadí, měřeno na 139 anglických rozhovorech o délce zhruba 22 hodin, mezi dvanácti systémy v sedmnácti nastaveních. I tady platí výhrada a uvádí ji NVIDIA sama: jde o první kolo, které se může změnit, až VoiceArena dokončí celé vyhodnocení a statistické porovnání dvojic.
Váhy jsou ke stažení pod licencí OpenMDW 1.1 a karta u nich uvádí, že je model připravený pro komerční i nekomerční použití. Samostatný soubor s textem licence v repozitáři není, stojí jen v kolonce hlavičky karty. Vedle vah tam leží čtyři krátké dokumenty o zaujatosti, soukromí, bezpečnosti a vysvětlitelnosti a podkarta diarization_evaluation.md, která předepisuje třináct údajů, jež má každý uvést spolu s naměřeným číslem. Reference je v tom seznamu taky.
Zdroje
- Karta modelu Nemotron 3 Diarization na Hugging Face, včetně tabulek DER a soupisu testovacích sad
- Know Who Spoke When, oznámení NVIDIE na blogu Hugging Face z 23. září 2026
- Karta srovnávacího modelu diar_streaming_sortformer_4spk-v2.1
- Repozitář nttcslab-sp/diar-forced-alignment a popcornell/FastMSS s dopočítanými referencemi