Un personnage porte un manteau rouge dans le premier plan. Trois scènes plus tard, son visage a changé, le manteau a disparu et le décor ne ressemble plus à celui qu’il vient de quitter. Les générateurs de vidéo savent produire des séquences spectaculaires, mais ces faux raccords trahissent encore les récits plus longs. Dans une présentation publiée le 24 septembre 2026, Google Research expose plusieurs travaux destinés à garder le même fil visuel et narratif d’un plan à l’autre.
L’enjeu dépasse la simple durée d’une vidéo. Pour raconter une histoire, il faut se souvenir de ce qui a déjà été montré : l’apparence d’un personnage, la position d’un objet, l’état d’une pièce ou le déroulement d’une action. Les chercheurs proposent de confier cette mémoire et une partie du contrôle qualité à des systèmes coordonnant des modèles comme Gemini et Veo. Leur démonstration la plus longue atteint dix minutes, mais il s’agit de résultats de recherche, pas de l’annonce d’un nouveau service accessible au public.
Pourquoi assembler de beaux clips ne suffit pas
Un modèle de génération vidéo peut réussir un plan isolé et échouer dès qu’il faut revenir, plusieurs scènes après, dans le même salon. Les changements indésirables ne concernent pas seulement les visages : un accessoire peut muter, une porte changer de place ou un personnage reprendre une action qu’il avait terminée. Chaque erreur risque ensuite de contaminer les plans suivants.
Dans un tournage classique, le script, le storyboard, les repérages et le suivi des raccords donnent à l’équipe une mémoire commune. Une chaîne de requêtes indépendantes à un générateur n’a pas naturellement cette vue d’ensemble. Google Research reformule donc le problème : au lieu de demander seulement « quel est le prochain plan ? », ses systèmes suivent aussi « que sait-on déjà de ce monde ? ».
Quatre pièces pour garder le récit sur ses rails
L’annonce regroupe quatre approches de recherche complémentaires. Elles ne constituent pas, à ce stade, un bouton unique capable de fabriquer automatiquement un film fini.
Un « codirecteur » pour fixer la direction générale
Co-Director organise le travail en étapes : choix d’une direction créative, préparation d’un storyboard, production des images, de la vidéo et du son, puis examen du résultat. Plusieurs agents logiciels se répartissent ces tâches. Un système d’évaluation renvoie ensuite des remarques à la chaîne de production afin d’améliorer les nouvelles versions.
Dit plus simplement, il joue le rôle d’un plan de travail partagé : les plans ne sont plus générés comme autant de commandes sans lien entre elles. L’étude qui décrit Co-Director a été déposée en avril 2026 ; la publication de septembre en propose une mise en perspective avec les autres travaux de l’équipe.
Une mémoire visuelle pour retrouver les mêmes personnages
CANVAS conserve des repères sur les personnages, les lieux et les objets. Quand une scène revient dans un décor déjà rencontré, le système peut récupérer ses références visuelles au lieu de réinventer l’endroit. Dans une séquence de cambriolage de musée montrée par Google, l’intérêt devient concret : le visiteur, l’objet convoité et la salle doivent rester identifiables malgré les changements de plan.
Dans les évaluations rapportées par les auteurs de CANVAS, la continuité des arrière-plans progresse de 21,6 %, celle des personnages de 9,6 % et celle des accessoires de 7,6 % par rapport à leur meilleur système de comparaison. Ces chiffres portent sur des tests de storyboard définis par les chercheurs ; ils ne mesurent pas la qualité de toutes les vidéos que pourrait produire un utilisateur.
Produire plus longtemps, puis vérifier les défauts
A²RD génère la vidéo par segments et met à jour, après chacun d’eux, une mémoire des événements et des éléments visuels. Le système peut faire progresser l’intrigue, puis revenir aux références antérieures lorsqu’un lieu ou un personnage réapparaît. Google montre un film expérimental de dix minutes pour illustrer cette méthode. Dans leur prépublication de mai, les auteurs annoncent, selon les tests, jusqu’à 30 % de gain en cohérence visuelle et 20 % en cohérence narrative face aux méthodes comparées.
Enfin, VQQA examine les vidéos produites en posant des questions précises sur leur contenu : le bon personnage tient-il toujours le bon instrument ? L’objet conserve-t-il sa forme et sa matière ? Les réponses servent à reformuler la consigne et à générer une nouvelle version. Ce n’est pas une retouche directe des pixels : le système choisit parmi plusieurs essais celui qui respecte le mieux la demande initiale.
Ce que ces résultats changeraient pour les créateurs
La continuité est une dépense de temps souvent invisible. Dans la publicité, la formation ou la fiction courte, produire plusieurs plans cohérents exige aujourd’hui de nombreuses reprises et des contrôles humains. Si ces méthodes tiennent leurs promesses hors du laboratoire, elles pourraient réduire ce travail répétitif et laisser davantage de place au rythme, au cadrage et à l’écriture.
Il faut toutefois distinguer démonstration, mesure et usage réel. Les évaluations présentées par Google s’appuient sur des scénarios et des critères précis, dont certains bancs d’essai créés pour ces recherches. Une vidéo de dix minutes réussie démontre une possibilité ; elle ne dit rien, à elle seule, du coût de calcul, du taux d’échec sur des projets variés ou de la facilité avec laquelle un réalisateur pourrait corriger un choix créatif. Google ne donne pas ici de date de disponibilité d’un outil intégrant l’ensemble de ces travaux.
La question des contenus trompeurs accompagne aussi toute amélioration de la vidéo synthétique. Google indique que sa chaîne, lorsqu’elle s’appuie sur Gemini et Veo, bénéficie de protections comme le marquage SynthID. Ce marquage aide à identifier des contenus générés, mais ne remplace ni les règles de diffusion ni le jugement éditorial sur leur contexte.
Le vrai progrès se jouera au montage
La prouesse technique n’est plus seulement de fabriquer un beau plan. Elle consiste à faire en sorte que le plan suivant respecte ce que le spectateur vient de voir, tout en faisant avancer l’histoire. Les travaux présentés par Google dessinent une voie crédible : planifier, mémoriser, générer, vérifier et recommencer. Leur intérêt se mesurera lorsque des créateurs pourront garder la main sur ce cycle, avec des résultats reproductibles et un coût connu.
Références
- Google Research, « Automating coherent long-form video generation », 24 septembre 2026.
- Song et al., « Co-Director: Agentic Generative Video Storytelling », arXiv, avril 2026.
- Mondal et al., « CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding », arXiv, avril 2026.
- Do Xuan Long et al., « A²RD: Agentic Autoregressive Diffusion for Long Video Consistency », arXiv, mai 2026.
- Song et al., « VQQA: An Agentic Approach for Video Evaluation and Quality Improvement », arXiv, mars 2026.

