Brève

Nvidia publie un modèle de diarisation gratuit

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.

Intégrer ce passage sur votre site

Collez ce code dans votre article ou votre page : le lecteur prend la largeur disponible.

Thème

Transcription avec les sources de chaque passage

Ondine

Nvidia publie Nemotron 3 Diarization, un modèle d’environ 100 millions de paramètres dont les poids sont accessibles librement, selon The Decoder. Il reconnaît jusqu’à 8 locuteurs au sein d’une même conversation et repère aussi les prises de parole simultanées, lorsque plusieurs voix se superposent. Il fonctionne sur des enregistrements comme sur de l’audio en direct : l’identification des voix peut donc s’appliquer à un échange déjà capté ou à un flux en cours de traitement. Associé à un système de reconnaissance vocale tel que Parakeet, il peut produire une transcription où les segments sont attribués à des étiquettes anonymes de locuteurs, par exemple speaker_2, plutôt qu’à des identités réelles. Sur Diarization-Bench, le modèle affiche un taux d’erreur de 14,72 %, contre 19,3 % pour le système qui le suit au classement de VoiceArena. Ce test comptabilise notamment les voix qui se chevauchent et les décalages aux changements de locuteur ; il mesure donc à la fois les erreurs sur les prises de parole simultanées et celles qui surviennent au passage d’une voix à une autre. Dans une comparaison sur 8 scénarios, avec un tampon audio de 1,04 seconde, Nemotron 3 Diarization réduit en moyenne de 41 % le taux d’erreur de son prédécesseur, Streaming Sortformer.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.