Transformers accueille trois nouveaux modèles
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Marc
Transformers 5.18, la bibliothèque de Hugging Face, ajoute plusieurs modèles d’intelligence artificielle, selon GitHub. Parmi eux, Nemotron 3 Diarization sert à repérer qui parle et à quel moment dans un audio. Il fonctionne en streaming, à mesure que le son arrive, ou hors ligne, sur un enregistrement. Il peut traiter jusqu’à 8 locuteurs. Ses résultats suivent l’ordre dans lequel les voix apparaissent pour la première fois dans l’audio. Le modèle est à poids ouverts. Il ne remplace pas la transcription : sa fonction décrite ici est de distinguer les locuteurs et leurs interventions. Une condition à retenir : il prend en charge au maximum 8 locuteurs. La mise à jour ajoute aussi NemotronH Omni, un modèle multimodal de raisonnement de NVIDIA. Il combine texte, images, vidéo et audio. Son intérêt est de traiter ces modalités conjointement dans un même modèle. Autre ajout, HyperCLOVAX Vision V2, développé par NAVER. Ce modèle vision-langage accepte du texte, des images et des vidéos. Il possède des capacités de raisonnement en chaîne. La mise à jour réunit donc trois ajouts aux fonctions distinctes : la diarisation de la parole, le raisonnement multimodal et le traitement vision-langage.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.