Dossier

Google présente 2 modèles Gemini de synthèse vocale

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse · sujet sensible, traité avec prudence.

  • Google présente deux modèles Gemini 3.8 de synthèse vocale

Transcription avec les sources de chaque passage

Token FM

Token FM, la radio de l'IA, faite par l'IA. Place au dossier.

Victor

Bonjour Elias, Google DeepMind annonce 2 nouveaux modèles Gemini de synthèse vocale : l’un pour créer et diriger des voix, l’autre pour produire à grande échelle. Qu’est-ce qui change avec cette annonce ?

Elias

D’après Google DeepMind, 2 modèles Gemini 3.8 se partagent désormais des usages différents de la synthèse vocale. Gemini 3.8 Flash TTS est conçu pour créer des voix personnalisées et guider leur interprétation, alors que Gemini 3.8 Flash-Lite TTS vise les productions à grand volume, comme le doublage et les agents vocaux. Flash TTS fonctionne à partir d’instructions en langage naturel : on peut décrire le rôle, l’accent ou les caractéristiques vocales souhaitées, plutôt que choisir seulement parmi des réglages prédéfinis. La conception annoncée couvre plus de 100 langues et dialectes, et le modèle donne aussi accès à plus de 2 000 voix prêtes à l’emploi. On peut donc le voir comme un atelier de création et de direction vocale, tandis que Flash-Lite privilégie la production à grande échelle. Ce sont 2 approches complémentaires, mais elles ne répondent pas au même besoin : l’une met l’accent sur la création et le détail de l’interprétation, l’autre sur les usages nombreux et répétés.

Victor

Concrètement, comment l’utilisateur dirige-t-il la voix et son interprétation ?

Elias

Avec Flash TTS, la première étape consiste à décrire la voix souhaitée en langage courant, en précisant par exemple son rôle, son accent et ses caractéristiques. Le choix peut se faire parmi plus de 2 000 voix prêtes à l’emploi, ou passer par la création d’une voix personnalisée dans plus de 100 langues et dialectes. Une fois les voix choisies, les 2 modèles permettent de régler l’interprétation ligne par ligne, avec des indications sur le ton, le rythme et les nuances expressives. Le principe ressemble à une direction de jeu : une consigne peut préciser comment une réplique doit être portée, puis la suivante peut recevoir une autre intention, sans imposer la même lecture à tout le texte. Les modèles peuvent aussi mettre en scène des dialogues à 2 voix et générer des contenus longs, ce qui élargit leur usage au-delà de phrases isolées. La direction se déroule donc au niveau de chaque ligne, et pas seulement par un choix général appliqué uniformément à toute la production.

Victor

À qui ces modèles s’adressent-ils, et quels volumes ou usages Google met-il en avant ?

Elias

Les 2 modèles s’adressent à des besoins distincts dans la création audio. Flash TTS vise notamment la conception de voix de personnages et leur direction, avec des exemples d’usages comme les jeux, les livres audio et les podcasts. Il peut également servir à créer des voix personnalisées pour des expériences audio cohérentes. Flash-Lite TTS est présenté pour des besoins à grand volume, notamment le doublage, la création de contenus audio et les agents vocaux. La distinction porte donc à la fois sur le type de travail et sur l’échelle de production : l’un privilégie la conception fine d’une voix et de son interprétation, l’autre la production de nombreux contenus. Le catalogue annoncé de Flash TTS comprend plus de 2 000 voix prêtes à l’emploi, et la personnalisation s’étend à plus de 100 langues et dialectes.

Victor

Quelles sont les limites à garder en tête, notamment pour la réplication d’une voix ?

Elias

Google indique que Flash TTS peut reproduire un profil vocal à partir d’un échantillon de 30 secondes, pour une voix que l’utilisateur possède ou qu’il a le droit d’utiliser. Le dispositif annoncé comprend une vérification du consentement, un filigrane SynthID et des justificatifs C2PA, destinés à documenter le contenu généré. Ce sont les protections décrites dans l’annonce ; leur présence ne suffit pas, à elle seule, à établir leur efficacité dans toutes les situations. Pour évaluer le modèle, l’annonce lui attribue la première place au classement général du Voice Design Benchmark de Hume AI, avec un score de 71,4, et un score de 60,8 en modélisation des accents. Ces scores portent sur ce benchmark précis et ne permettent pas de conclure à une supériorité pour toutes les langues ou tous les usages. Enfin, le remixage d’une voix existante est présenté comme une fonction à venir, et non comme une option déjà disponible.

Victor

Pour finir, qu’est-ce qu’il faut retenir de cette annonce ?

Elias

À retenir, Google DeepMind annonce 2 modèles complémentaires : Flash TTS pour créer des voix personnalisées et diriger leur interprétation, Flash-Lite TTS pour des productions à grand volume. La personnalisation annoncée pour Flash TTS couvre plus de 100 langues et dialectes, avec plus de 2 000 voix prêtes à l’emploi. Les 2 modèles proposent un contrôle ligne par ligne, des dialogues à 2 voix et la génération de contenus longs, ce qui permet d’agir sur la manière dont chaque partie d’un texte est interprétée. La réplication d’un profil vocal peut, selon l’annonce, partir d’un échantillon de 30 secondes ; elle est associée à une vérification du consentement, à SynthID et à des justificatifs C2PA. Les résultats communiqués au benchmark de Hume AI constituent un repère sur les performances revendiquées, pas une garantie de résultat identique pour chaque langue et chaque projet. Et le remixage de voix reste annoncé comme une fonction à venir. Le point central, c’est donc la combinaison d’une direction plus précise pour les créateurs et d’une option orientée vers les usages à grande échelle.

Victor

Merci Elias pour ces explications.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.