Google présente deux modèles Gemini 3.8 de synthèse vocale
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
- Google présente deux modèles Gemini 3.8 de synthèse vocale
Transcription avec les sources de chaque passage
Ondine
Google DeepMind annonce mercredi Gemini 3.8 Flash TTS, conçu pour créer des voix personnalisées et diriger leur interprétation, ainsi que Gemini 3.8 Flash-Lite TTS, destiné aux usages à grand volume, comme le doublage et les agents vocaux. Le premier modèle transforme des instructions en langage naturel en voix, dans plus de 100 langues et dialectes, et donne accès à plus de 2 000 voix prêtes à l’emploi. La réplication d’un profil vocal peut partir d’un échantillon de 30 secondes ; elle s’accompagne d’une vérification du consentement, du filigrane SynthID et de justificatifs C2PA. Les deux modèles permettent aussi de régler l’interprétation ligne par ligne, de mettre en scène des dialogues à deux voix et de produire des contenus longs. Une fonction de remixage de voix est également annoncée, mais elle reste à venir. Au classement général du Voice Design Benchmark de Hume AI, Flash TTS obtient le score de 71,4 et la première place ; en modélisation des accents, son score atteint 60,8. Flash TTS se concentre sur la création et la direction de voix, tandis que Flash-Lite TTS est destiné aux usages à grand volume, notamment le doublage et les agents vocaux.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.