Google présente deux modèles de synthèse vocale
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
- Google lance deux modèles de synthèse vocale, dont un pour créer des voix à partir de descriptions
Transcription avec les sources de chaque passage
Ondine
Google présente mercredi Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale, selon The Decoder. Le premier vise notamment les usages créatifs et permet de fabriquer une voix à partir d’une description textuelle qui précise son rôle, son accent ou ses caractéristiques vocales. Le second est conçu pour produire de la parole à moindre coût et à grande échelle, tandis que les deux modèles prennent en charge plus de 100 langues. Ils peuvent aussi suivre des indications de jeu pour chaque réplique, générer un dialogue à deux voix depuis un seul script et ajouter des sons comme des rires ou des soupirs. Google propose en parallèle plus de 2 000 voix préréglées, et un outil de clonage peut créer un profil à partir d’un échantillon vocal de 30 secondes. Pour ce clonage, Google exige que la personne concernée enregistre un consentement oral et que sa voix corresponde à l’échantillon utilisé. L’entreprise indique enfin que les extraits générés portent un filigrane SynthID inaudible ; les modèles sont accessibles via Gemini API et Google AI Studio. Un accès par Gemini Enterprise API doit suivre, et Google a aussi annoncé Voice Remixing, une fonction destinée à modifier le timbre, la hauteur, le tempo et l’accent des voix préréglées, mais qui n’est pas encore disponible.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.