Přeskočit na obsah
Modely 4 min čtení

NVIDIA měřila nový diarizační model u šesti z osmi sad proti jiným referenčním štítkům

NVIDIA vydala 23. září model Nemotron 3 Diarization, který v nahrávce rozliší až osm mluvčích a zvládne to i za běhu. Proti předchozí verzi klesla chybovost v průměru o 41 %. U šesti z osmi testovacích sad ale firma měřila proti jiným referenčním štítkům, než jaké k těm sadám patří původně. Do karty modelu to napsala, do oznámení na blogu ne.

Diarizace je úloha, která z nahrávky vyčte, kdo kdy mluvil. Rozpoznávání řeči přepíše slova, diarizace k nim přiřadí mluvčího, a teprve spojení obojího dá zápis, ze kterého se pozná, kdo co na schůzce slíbil. NVIDIA k tomu 23. září 2026 vydala model Nemotron 3 Diarization s volnými vahami.

Stolní mikrofon na desce stolu
Stolní mikrofon pro nahrávání rozhovoru více lidí. Foto: roland, Flickr (CC0)

Model má 100 milionů parametrů a jeho jádrem je enkodér s 31 vrstvami. Na vstupu bere jednokanálový zvuk se vzorkovací frekvencí 16 kHz, na výstupu dává pro každých 10 ms osm čísel: pravděpodobnost, že je právě aktivní první, druhý až osmý mluvčí. Kanály se řadí podle toho, kdo se v nahrávce ozval dřív, takže označení zůstávají stabilní i po dlouhé odmlce. Jména to nejsou a model je nezjišťuje; „speaker_2“ znamená druhý hlas v pořadí, nic víc. O streamovaném přepisu s rozlišením mluvčích jsme psali u modelu VibeVoice-ASR od Microsoftu.

Čtyři doporučená nastavení, jedno nedoporučené

Táž váhová sada obsluhuje offline i běh naživo. Rozdíl dělá vyrovnávací paměť vstupu: než model spustí výpočet, počká si na 30,4 s, 1,04 s, 0,64 s, nebo 0,32 s zvuku. Kratší čekání znamená rychlejší odpověď a vyšší chybovost. Karta modelu k tomu dodává jednu větu, kterou přetisky vynechávají: technicky model zvládne i 80 ms, jenže nejnižší doporučené nastavení je 0,32 s. Uvedené hodnoty navíc počítají jen nabíraný zvuk, ne vlastní výpočet, síť ani přepis.

O kolik klesla chybovost

Přesnost se měří chybovostí diarizace (DER) a NVIDIA ji vypsala pro osm testovacích podmínek proti svému předchozímu streamovacímu modelu diar_streaming_sortformer_4spk-v2.1. Při vyrovnávací paměti 1,04 s klesla na sadě DIHARD III z 19,60 na 13,18 %, na CALLHOME-Part2 z 11,31 na 10,29 % a na NOTSOFAR1 MHM z 22,12 na 7,70 %. Nevážený průměr osmi relativních poklesů vychází na 41 %; firma sama upozorňuje, že je to průměr relativních zlepšení, ne jedno číslo spočítané ze všech nahrávek dohromady.

Šest sad má jiné referenční anotace než dřív

Chybovost diarizace se počítá proti referenci, tedy proti souboru, ve kterém je ručně vyznačeno, kdo kdy mluvil. Karta modelu má u každé testovací sady sloupec s tím, odkud reference pochází. U DIHARD III a CALLHOME-Part2 stojí „Original“. U zbylých šesti podmínek, tedy u AliMeeting, AMI a NOTSOFAR1, odkazuje na cizí veřejné repozitáře nttcslab-sp/diar-forced-alignment a popcornell/FastMSS, kde jsou hranice řeči dopočítané strojovým zarovnáním.

Důvod NVIDIA uvádí: původní anotace těch tří sad vznikly kvůli přepisu, ne kvůli přesnému měření po rámcích, takže jako řeč označují i delší ticho uvnitř promluvy. Systém, který to ticho pozná správně, je pak trestán za zmeškanou řeč, která tam není. Karta z toho vyvozuje závěr sama: výsledek naměřený proti jiné referenci je jiný pokus a s čísly v kartě se přímo porovnat nedá.

Vlastní dopočet z tabulek karty ukazuje, kam to zlepšení připadá. U dvou sad s původními štítky je průměrný relativní pokles 20,9 %, u šesti sad s dopočítanou referencí 47,7 % (vstupní čísla jsou hodnoty DER při 1,04 s uvedené výš, vzorec je rozdíl dělený starší hodnotou). Obě řady měřila NVIDIA proti týmž referencím, takže srovnání starého a nového modelu mezi sebou platí. Co z něj neplyne, je srovnání s cizími systémy na těch šesti sadách.

V oznámení na blogu ta věta není

Doprovodný text na blogu Hugging Face, který model představuje, má vlastní oddíl o měření přesnosti. Jmenuje v něm toleranci hranic i to, že se překrývající řeč započítává, a vypisuje obě čísla. O referenčních anotacích v něm nepadne ani slovo: výrazy „forced alignment“, „reference label“ ani „RTTM“ se v celém textu nevyskytují. Kdo čte jen oznámení, tuhle podmínku měření nemá odkud vzít.

Kde je nový model horší

Tabulky nejsou jednosměrné. Na podmnožině CALLHOME se dvěma mluvčími má Nemotron při vyrovnávací paměti 30,4 s chybovost 5,98 % proti 5,68 % u starší verze, tedy o něco horší; blog to přiznává rovnou v textu. Na celé sadě CALLHOME-Part2 je přitom nový model lepší. Přesnost určení počtu mluvčích na sadě AMI MHM navíc klesla z 93,75 na 87,50 % a o té už oznámení mlčí. Rychlost naopak vyskočila: při nejkratším nastavení a zpracování po jedné nahrávce zvládne nový model 12,5násobek délky zvuku za jednotku času proti 8násobku u předchůdce, se zkompilovaným grafem 54násobek proti 21.

Nezávislé číslo je zatím předběžné

Jediný údaj, který nepochází od výrobce, je pořadí v žebříčku Diarization-Bench projektu VoiceArena. Model tam vede s chybovostí 14,72 % proti 19,3 % u druhého v pořadí, měřeno na 139 anglických rozhovorech o délce zhruba 22 hodin, mezi dvanácti systémy v sedmnácti nastaveních. I tady platí výhrada a uvádí ji NVIDIA sama: jde o první kolo, které se může změnit, až VoiceArena dokončí celé vyhodnocení a statistické porovnání dvojic.

Váhy jsou ke stažení pod licencí OpenMDW 1.1 a karta u nich uvádí, že je model připravený pro komerční i nekomerční použití. Samostatný soubor s textem licence v repozitáři není, stojí jen v kolonce hlavičky karty. Vedle vah tam leží čtyři krátké dokumenty o zaujatosti, soukromí, bezpečnosti a vysvětlitelnosti a podkarta diarization_evaluation.md, která předepisuje třináct údajů, jež má každý uvést spolu s naměřeným číslem. Reference je v tom seznamu taky.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Gemini 3.8 Live dostal avatar pro firemní agenty

    Google přidal k modelu Gemini 3.8 Live obrazový výstup, který mluvenou odpověď převádí do pohybu přednastavené nebo vlastní postavy. Live Avatar od 24. září běží v…

  2. Modely

    Firma Aikido vydala Altar, zmenšenou verzi GLM-5.3 o velikosti 328 GB

    Firma Aikido odstranila z modelu GLM-5.3 88 z 256 směrovaných expertů a stlačila jeho váhy na 328 GB. V interním testu Altar objevil alespoň jednou 23 z 32 známých…

  3. Modely

    Model Venus od Ant Group odkládá úkoly na pozadí čtyřmi novými tokeny

    Skupina inclusionAI zveřejnila dvojici devítimiliardových modelů, které poslouchají i během vlastní řeči a umějí si uprostřed hovoru zadat úkol na pozadí. Ve vahách po…

  4. Modely

    Salesforce u Koa slibuje třikrát méně chyb, studie však číslo neuvádí

    Salesforce 15. září představil Koa, model pro práci s nástroji v Agentforce, který vychází z Nemotronu 3 Super 120B. Produktová stránka mu připisuje třikrát méně chyb a…