Dossier

Google veut mieux coordonner les agents pour créer des récits vidéo cohérents

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse · sujet sensible, traité avec prudence.

Intégrer ce passage sur votre site

Collez ce code dans votre article ou votre page : le lecteur prend la largeur disponible.

Thème

Transcription avec les sources de chaque passage

Token FM

Token FM, la radio de l'IA, faite par l'IA. Place au dossier.

Victor

Bonjour Sacha, Google Research présente un cadre multi-agents pour produire des récits vidéo plus longs et mieux préserver leur continuité visuelle. Qu’est-ce qui est nouveau dans cette approche ?

Sacha

D’après Google Research, ce cadre organise la création de récits vidéo composés de plusieurs plans, en prévoyant comment maintenir la continuité visuelle d’une scène à l’autre. L’enjeu est de limiter les changements involontaires qui peuvent toucher les personnages ou les décors, et de réduire les erreurs qui risquent de se propager dans les étapes suivantes. Les modèles vidéo savent déjà fabriquer des séquences convaincantes, mais construire avec elles une histoire suivie demande de garder des repères communs au fil de nombreux plans. Imaginez un récit où l’on retrouve la même personne dans plusieurs scènes : sa tenue, son apparence et le lieu doivent rester reconnaissables, sauf si l’histoire prévoit un changement. Dans une chaîne de génération, les consignes et les éléments produits à une étape peuvent servir aux suivantes, ce qui rend les petits écarts importants lorsqu’ils s’accumulent. Le cadre cherche donc à traiter la continuité comme une tâche à planifier et à vérifier pendant la production, plutôt que de compter uniquement sur une correction finale.

Victor

Comment cette coordination fonctionne-t-elle concrètement, entre Gemini et Veo ?

Sacha

Le cadre se place au-dessus de modèles comme Gemini et Veo : il les orchestre au lieu de se substituer à eux. Une consigne créative est transformée en étapes de travail, depuis la préparation des prompts jusqu’à l’organisation de la suite des plans, puis à l’amélioration du résultat par des retours successifs. Alors, on peut se représenter une équipe qui garde une vision d’ensemble, tandis que différents rôles s’occupent de préparer les instructions, d’enchaîner les scènes et d’examiner ce qui a été produit. Dans cette comparaison, les agents sont des outils logiciels qui se répartissent des tâches, et non des personnes qui tournent réellement un film. Cette organisation est importante parce que chaque étape peut dépendre des informations préparées avant elle : une description incomplète ou un élément visuel défectueux peut compliquer la génération des plans suivants. Le cadre vise à suivre les éléments du récit et à permettre une amélioration en boucle, plutôt qu’à traiter chaque plan comme une demande entièrement indépendante. Google indique que cette architecture pourrait aussi être utilisée avec d’autres modèles génératifs. Cela décrit une possibilité de conception ; les éléments disponibles ne signifient pas que tous les modèles sont déjà compatibles, ni que la chaîne complète est proposée comme un outil universel.

Victor

Quels sont les rôles de Co-Director et de CANVAS dans cette équipe ?

Sacha

Les travaux réunis sous ce cadre abordent plusieurs parties de la création. Co-Director explore des choix de stratégie créative, de structure narrative et de style visuel, afin de chercher une direction cohérente pour plusieurs plans. D’après AlphaSignal, cette exploration s’appuie sur un algorithme de bandit manchot : il répartit des essais entre différentes options et peut ajuster leur sélection en fonction des résultats obtenus. CANVAS répond à un autre besoin, celui de conserver une mémoire structurée de l’apparence des personnages, des lieux et de l’état des objets. Lorsque ces éléments réapparaissent, le système peut réutiliser ces repères visuels au lieu de repartir sans mémoire commune. Cette fonction vise à aider la continuité, sans signifier que chaque détail restera nécessairement identique dans toutes les générations. Google associe Co-Director à COLM 2026 et CANVAS à EMNLP 2026 ; le cadre mentionne aussi A²RD et VQQA, qui prennent en charge d’autres aspects de la génération et de la révision.

Victor

À qui cela pourrait-il servir, et sait-on déjà combien de temps les vidéos peuvent durer ?

Sacha

Les éléments décrivent des travaux de recherche, et non un produit complet annoncé comme accessible au public. La présentation complémentaire précise qu’aucun produit téléchargeable ne rassemble actuellement toute cette chaîne ; les informations disponibles ne donnent pas non plus de prix ni de conditions d’accès. L’intérêt envisagé pour les créateurs serait de réduire certaines tâches répétitives de coordination, afin qu’ils puissent se concentrer davantage sur les choix de récit et de réalisation. Pour la durée, A²RD est décrit comme un système de génération vidéo autorégressive sur plusieurs minutes, qui alterne extrapolation et interpolation. Autrement dit, il peut faire progresser la séquence tout en produisant des étapes intermédiaires, avec l’objectif d’équilibrer progression et cohérence. Google affirme que ses évaluations ont permis de générer des vidéos de plusieurs minutes, mais les faits disponibles ne fixent pas de durée maximale garantie. Un titre d’AlphaSignal évoque 10 minutes ; cette durée n’est pas confirmée comme une capacité établie du cadre. Il faut donc retenir la portée générale, des récits vidéo de plusieurs minutes dans les évaluations, sans transformer ce titre en promesse précise pour les futurs utilisateurs.

Victor

Quelles sont les limites, notamment quand une erreur apparaît au début de la chaîne ?

Sacha

Une limite importante tient au fait que les étapes sont liées : si un élément préparé en amont comporte une erreur, celle-ci peut affecter les scènes qui en dépendent. Google décrit notamment des dérives visuelles, quand des personnages ou des environnements changent involontairement, ainsi qu’un risque de récit qui cesse d’avancer de façon significative. Dans ce type de chaîne, comprendre d’où vient un défaut final peut être difficile, car il faut retrouver quelle instruction ou quel élément antérieur a contribué au problème. VQQA s’appuie sur des critiques produites par un modèle vision-langage pour réviser les prompts et corriger certaines erreurs de composition. En clair, le modèle fournit un retour destiné à guider la révision des instructions ; cela ne garantit ni que chaque défaut sera repéré, ni que chaque correction sera juste. Google affirme que ses évaluations montrent une meilleure cohérence entre les plans, une persistance accrue des personnages et une réduction des dérives visuelles et des erreurs propagées. Ces résultats restent ceux des évaluations de Google, et ne suffisent pas à établir que les difficultés disparaissent dans tous les scénarios.

Victor

Et qu’est-ce qu’il faut retenir sur la sécurité et la portée réelle de cette annonce ?

Sacha

À retenir, Google présente une architecture qui coordonne plusieurs agents autour de Gemini et de Veo, plutôt qu’un nouveau modèle vidéo unique. Co-Director explore des options créatives, CANVAS conserve des repères visuels, A²RD contribue à la génération de séquences de plusieurs minutes et VQQA aide à réviser certains prompts. Cette répartition vise une difficulté concrète : une histoire composée de nombreux plans doit garder des éléments reconnaissables tout en continuant à progresser. Google indique que le cadre hérite aussi de mécanismes de sécurité des modèles utilisés, notamment du filigrane SynthID. La présence de ce filigrane ne permet pas, à elle seule, de conclure que toutes les questions de sécurité ou tous les usages sont couverts. De même, les résultats de cohérence avancés sont issus des évaluations de Google, et la durée de 10 minutes évoquée dans le titre d’AlphaSignal n’est pas confirmée comme une capacité établie. La portée de l’annonce est donc celle d’un cadre de recherche qui tente de mieux suivre le fil visuel d’un récit long, en répartissant le travail entre des outils spécialisés.

Victor

Merci, Sacha, pour ces explications.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.