Dossier

Google veut donner une voix à chaque texte

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse · sujet sensible, traité avec prudence.

Transcription avec les sources de chaque passage

Token FM

Token FM, la radio de l'IA, faite par l'IA. Place au dossier.

Victor

Bonjour Elias, nous vous accueillons pour parler de Google, qui présente 2 modèles de synthèse vocale, dont Gemini 3.8 Flash TTS, capable de créer une voix à partir d’une description écrite. Qu’est-ce qui change avec cette annonce ?

Elias

Alors, le changement le plus visible, c’est qu’on ne choisit plus seulement parmi des voix déjà enregistrées : d’après The Decoder, Gemini 3.8 Flash TTS permet de concevoir une voix en la décrivant par écrit. La consigne peut préciser le rôle de cette voix, son accent et ses caractéristiques vocales, puis le modèle s’appuie sur ces indications pour produire la parole. On peut donc imaginer une voix adaptée à un personnage ou à une situation, plutôt que de chercher forcément une voix existante qui s’en rapproche. Pour celles et ceux qui préfèrent partir d’un choix préparé, Google propose aussi une bibliothèque de plus de 2 000 voix préréglées. L’autre modèle, Gemini 3.8 Flash-Lite TTS, répond à une priorité différente : générer de la parole à moindre coût et à grande échelle, notamment quand le volume compte beaucoup. Les deux modèles prennent en charge plus de 100 langues, mais l’annonce leur donne des orientations distinctes. Flash TTS met en avant la conception des voix et les usages créatifs, tandis que Flash-Lite vise surtout le coût et la production en volume. Il faut donc les comprendre comme 2 outils complémentaires dans leur positionnement, pas comme 2 noms pour une fonction strictement identique.

Victor

Comment cette description devient-elle une voix, et jusqu’où peut-on diriger la façon de parler ?

Elias

On peut imaginer la description comme une fiche de casting : elle indique au modèle le rôle de la voix, son accent et ses caractéristiques vocales, sans qu’il soit nécessaire de choisir une voix préréglée. Ensuite, le script peut ajouter des indications à chaque réplique, pour préciser le jeu attendu et guider la manière de prononcer les mots. Les 2 modèles peuvent aussi produire un dialogue à 2 voix à partir d’un seul script, en gardant des voix distinctes pour les interlocuteurs. Cela permet de préparer un échange complet plutôt que de générer seulement la lecture continue d’un texte par une seule voix. Le script peut également demander des sons non verbaux, comme un rire ou un soupir, et placer une réaction vocale à un endroit précis. En pratique, on peut donc écrire les paroles, préciser les changements de voix et indiquer une partie du jeu dans le même matériau de départ. C’est une proposition qui peut servir à des projets créatifs comme les podcasts, les livres audio ou les personnages de jeu. L’intérêt annoncé, c’est de donner davantage de contrôle sur l’interprétation de chaque ligne, sans devoir assembler séparément chaque réplique ou chaque réaction. Mais cette souplesse reste celle décrite pour les modèles ; elle ne signifie pas que chaque rendu sera automatiquement conforme à l’intention de la personne qui écrit le script.

Victor

À qui ces outils s’adressent-ils, et que sait-on du coût et de la vitesse ?

Elias

Pour les usages créatifs, Flash TTS est présenté comme un outil pour fabriquer des voix de personnages, raconter des livres audio ou produire des podcasts. Flash-Lite TTS vise plutôt les situations où l’on veut générer beaucoup de parole à moindre coût, par exemple pour le doublage, les contenus audio ou les agents vocaux. Pour donner un ordre de grandeur concret, Simon Willison rapporte avoir testé Flash TTS avec une interface de démonstration personnelle connectée à Gemini API. Dans cet essai, il a généré 1 minute et 18 secondes d’audio en environ 20 secondes, pour un coût de 2,74 cents. C’est un test individuel, pas une promesse de vitesse ou de prix valable pour toutes les utilisations, et il porte sur Flash TTS plutôt que sur Flash-Lite. Il montre néanmoins ce qu’a donné une génération dans ce cas précis, avec un temps de calcul court et une dépense de quelques centimes. Pour Flash-Lite, l’annonce met l’accent sur le coût réduit et le volume, sans fournir ici de test comparable. La distinction pratique à retenir est donc le positionnement : davantage de liberté créative pour l’un, et une génération conçue pour l’échelle et le coût pour l’autre.

Victor

Quelles sont les limites et les précautions, notamment pour le clonage vocal ?

Elias

Le clonage vocal peut créer un profil à partir d’un échantillon de 30 secondes. Google indique que la personne dont la voix est clonée doit enregistrer un consentement oral, et que sa voix doit correspondre à celle de l’échantillon utilisé. C’est la condition annoncée pour cette fonction, mais les éléments disponibles ne précisent pas comment le consentement serait vérifié dans chaque situation. Il faut donc distinguer la règle décrite par Google de ce qu’on peut conclure sur son application concrète, qui n’est pas détaillée ici. Google indique également que les extraits générés par ses modèles audio comportent un filigrane SynthID inaudible, afin de contribuer au repérage des contenus générés. Comme il est inaudible, ce filigrane ne se repère pas simplement à l’écoute ; les informations disponibles ne détaillent pas davantage les modalités de détection. Enfin, Google a annoncé Voice Remixing, une fonction destinée à modifier le timbre, la hauteur, le tempo et l’accent des voix de sa bibliothèque. Mais cette fonction n’est pas encore disponible, donc elle ne fait pas partie de ce que l’on peut essayer à ce stade.

Victor

Où peut-on accéder aux modèles, et qu’est-ce qu’il faut retenir de cette offre ?

Elias

Les modèles sont déployés via Gemini API et Google AI Studio, tandis qu’un accès par Gemini Enterprise API doit suivre. Ce sont les canaux annoncés par Google ; les informations disponibles ne précisent pas ici les conditions pratiques de chaque accès ni la manière dont le déploiement se déroulera pour tous les utilisateurs. Il faut aussi distinguer les fonctions présentées pour les modèles de celles qui sont seulement annoncées : Voice Remixing doit permettre de modifier certaines caractéristiques des voix de la bibliothèque, mais n’est pas encore disponible. Le cœur de l’offre repose sur 2 orientations : Flash TTS permet notamment de créer des voix à partir de descriptions, tandis que Flash-Lite TTS est conçu pour générer de la parole à moindre coût et à grande échelle. Les 2 modèles prennent en charge plus de 100 langues, des indications de jeu pour les répliques et des dialogues à 2 voix, ainsi que des sons non verbaux comme les rires ou les soupirs. Le clonage vocal est une fonction distincte, qui peut créer un profil à partir d’un échantillon de 30 secondes et pour laquelle Google indique qu’un consentement oral est nécessaire. Google indique également que les extraits générés comportent le filigrane inaudible SynthID. En bref, Google associe création vocale, génération en volume et plusieurs contrôles de production, tout en signalant une fonction encore indisponible et des conditions de clonage à prendre en compte.

Victor

Merci Elias pour ces explications.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.