Exposanten login
AI Insider 23 september 2026

NVIDIA Nemotron 3: Leiderschap in Diarization Technologie

NVIDIA Nemotron 3: Leiderschap in Diarization Technologie

NVIDIA's nieuwe spraakherkenningsmodel, Nemotron 3, heeft zijn plek veroverd op de toppositie in de Voice Arena, met een Diarization Error Rate (DER) van 14,72%. Deze evaluatie omvatte zowel live als opgenomen gesprekken en vond plaats binnen een vergelijkend onderzoek van 12 systemen over 139 Engelstalige gesprekken, goed voor ongeveer 22 uur audio. Door gebruik te maken van tijdstempels per sprekerkanaal verhoogt het model de bruikbaarheid van zoekfuncties en samenvattingen, terwijl het ondersteuning biedt voor tot acht sprekers in één opname.

Met resultaten die significant beter zijn dan de meeste andere systemen, toont Nemotron 3 een relatieve verbetering van 24 procent ten opzichte van het op één na beste systeem, dat een DER van 19,3 procent behaalde. Bij het testen op verschillende condities, zoals in-person en online opnames, laat het model consistente prestaties zien, met een gemiddelde daling van de DER van 41 procent over acht benchmarks. Ondanks enkele nuances in de twee-sprekersubset, waarin de baseline soms beter presteert, overtreft het overall de verwachte resultaten.

Het model maakt gebruik van verschillende configuraties met input-buffers die variëren van 0,32 tot 30,4 seconden, waarmee het de prestaties optimaliseert voor echte toepassingen. Met een indrukwekkende throughput van 15.113x bij een batchgrootte van 32 op een NVIDIA RTX PRO 5000, is Nemotron 3 een sterke kandidaat voor geavanceerde spraakherkenning en verwerking. De technologie zet audio om in Mel-spectrogramkenmerken en ondersteunt veelgebruikte indelingen als .wav en .mp3, en is compatibel met de meest recente NVIDIA GPU-generaties.

Bovendien introduceert NVIDIA een nieuwe pre-diarized transcription API in Argmax Pro SDK 3, die het eenvoudiger maakt voor ontwikkelaars om vooraf sprekers te scheiden voordat spraakherkenning plaatsvindt. Dit is bijzonder nuttig bij complexere gesprekken met overlapping, maar het model kent ook zijn beperkingen, zoals verminderde prestaties bij langere opnames of bij hoge omgevingsgeluiden. De trainingsgegevens waren divers, met een combinatie van publieke en gelicentieerde conversaties, wat bijdraagt aan de bredere toepasbaarheid van het model.

Lees het volledige artikel van AI Insider.