Décryptage

Google lance deux modèles de synthèse vocale personnalisables

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.

Transcription avec les sources de chaque passage

Capucine

Mercredi, Google présente Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale qui prennent en charge plus de 100 langues, selon The Decoder, dans son article « Concevoir des voix par description textuelle avec les modèles Flash TTS de Google ». Flash TTS vise notamment les usages créatifs ; Flash-Lite, la génération de parole à grande échelle et à moindre coût.

Capucine

Flash TTS permet de créer une voix en décrivant par écrit son rôle, son accent et ses caractéristiques vocales. Pour partir d’un modèle existant, Google propose plus de 2 000 voix préréglées, dont des variantes régionales. Les usages cités comprennent les personnages de jeux, les livres audio et les podcasts. Flash-Lite vise plutôt le doublage, les contenus audio et les agents vocaux, avec une génération à faible coût et à grande échelle. La différence est concrète : l’un cible notamment la création de voix, l’autre les productions volumineuses.

Capucine

Les deux modèles peuvent suivre des indications de jeu pour chaque réplique. Un script unique peut produire un dialogue à deux voix, en gardant les voix distinctes. Il peut aussi inclure des sons non verbaux, comme des rires ou des soupirs. Ces fonctions permettent de régler la mise en voix à l’échelle de chaque réplique et de produire plusieurs voix à partir d’un même texte.

Capucine

Un test rapporté par Simon Willison donne un repère, sans établir un tarif général. Avec Gemini 3.8 Flash TTS, il a généré 1 minute et 18 secondes d’audio en environ 20 secondes, pour 2,74 cents. Il précise que l’essai passait par son interface de démonstration personnelle, connectée à Gemini API. Ce résultat porte sur un seul test et sur Flash TTS, pas sur Flash-Lite. Il ne permet donc pas de déduire le coût ou la vitesse de tous les projets.

Capucine

Le clonage vocal pose la question de l’autorisation. La fonction peut créer un profil à partir d’un échantillon de 30 secondes. Google indique que la personne concernée doit enregistrer un consentement oral, et que sa voix doit correspondre à celle de l’échantillon. Google affirme aussi que les extraits produits par ses modèles audio portent un filigrane SynthID inaudible, destiné à aider à détecter les paroles générées par l’intelligence artificielle. Le consentement porte sur l’usage de la voix ; le filigrane vise l’identification du contenu. Les faits disponibles ne détaillent pas le fonctionnement pratique de cette détection.

Capucine

Les modèles sont accessibles via Gemini API et Google AI Studio ; Google indique qu’un accès par Gemini Enterprise API doit suivre. L’entreprise a aussi annoncé Voice Remixing, pour modifier le timbre, la hauteur, le tempo et l’accent des voix de sa bibliothèque. Cette fonction n’est pas encore disponible. Il faut donc distinguer les modèles déjà déployés de cette option encore annoncée.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.