Comment Google veut rendre cohérentes les vidéos longues générées par intelligence artificielle
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Théa
Google Research présente jeudi un cadre multi-agents conçu pour produire des récits vidéo de plusieurs plans en maintenant mieux la cohérence des personnages et des décors. Il orchestre des modèles comme Gemini et Veo. Les évaluations de Google font état d’une meilleure continuité et de vidéos de plusieurs minutes.
Théa
Le défi, c’est de passer d’un extrait réussi à un récit qui tient dans la durée. Les modèles peuvent produire des séquences de qualité, mais il faut aussi conserver les mêmes personnages, lieux et objets d’un plan à l’autre. Dans une chaîne d’étapes séparées, une consigne ou un élément visuel imparfait peut influencer la suite. L’apparence des personnages peut dériver, les décors changer, ou le récit perdre sa progression.
Théa
Le cadre ne remplace pas les modèles qui génèrent les images. Il ajoute une couche d’orchestration qui transforme les consignes créatives en étapes de travail : préparer les prompts, enchaîner les plans, puis examiner et améliorer le résultat. Google indique que cette architecture peut aussi fonctionner avec d’autres modèles génératifs.
Théa
Quatre travaux se partagent ces tâches. Co-Director explore des choix de stratégie créative, de structure narrative et de style visuel sur plusieurs plans. CANVAS conserve des repères sur l’apparence des personnages, les lieux et l’état des objets, pour les retrouver lorsqu’ils réapparaissent. L’un aide à coordonner les choix du récit ; l’autre maintient une mémoire visuelle commune.
Théa
A²RD et VQQA interviennent dans la génération et la révision. A²RD construit la vidéo au fil des étapes, en alternant extrapolation et interpolation pour équilibrer progression et cohérence. VQQA s’appuie sur les critiques d’un modèle qui analyse images et texte. Elles servent à réviser les prompts et à corriger certaines erreurs de composition.
Théa
Pour les créateurs, l’enjeu est de réduire les ruptures de continuité et le travail de correction entre les plans. Le cadre vise aussi à limiter la propagation d’une erreur en amont. Les agents prennent en charge des tâches répétitives, comme la coordination des prompts et l’amélioration visuelle en boucle, à partir de consignes créatives humaines.
Théa
Les résultats restent ceux des évaluations présentées par Google. Ils font état d’une meilleure cohérence entre les plans, d’une persistance accrue des personnages et d’une réduction des dérives visuelles et des erreurs propagées. Ils ne démontrent pas que ces problèmes disparaissent dans tous les usages.
Théa
La durée exacte mérite aussi d’être distinguée. AlphaSignal décrit A²RD comme un système de génération de vidéos de plusieurs minutes, mais son titre évoque 10 minutes. Les éléments disponibles ne confirment pas cette durée comme une capacité établie du cadre. Google annonce bien la génération de vidéos longues, sans confirmer cette mesure précise.
Théa
Google indique que le cadre hérite aussi de mécanismes de sécurité des modèles utilisés, dont le filigrane SynthID. Co-Director est annoncé pour COLM 2026 et CANVAS pour EMNLP 2026 ; A²RD et VQQA complètent l’ensemble. À retenir : la cohérence des récits longs repose ici sur plusieurs agents qui planifient, gardent des repères visuels et révisent les séquences.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.