研究到创作 · 视频连贯性

AI 短片切个镜头,钢琴手就变成了小提琴手

Google 把错误版与修正版并排放出。沿着这次角色错位,看视频怎样被检查、重做,以及研究演示离日常创作工具还有哪一步。

Google 9 月 24 日整理了多镜头视频研究。这里展示的是研究团队的 8 秒对照片段;本站核对了原视频画面,没有复现生成过程。原文没有提供普通用户直接使用 VQQA 的入口。

本文目录3 个章节

两帧都像演出,连起来却变了人

Google Research 的八秒对照视频在同一个画面里放了两种结果。起初,左右两边都是女性坐在钢琴前、男性拿着小提琴;切到后一个镜头,左侧基础生成里的女性改为拉小提琴,右侧修订版仍让她弹琴、男性拉琴。单看一帧未必会意识到问题,顺着镜头看,角色与乐器的对应关系就断了。

这是一段研究示例,展示的是一次可见的错位与修正,不代表所有乐器、人物或长片都能稳定修好。原视频可从开头看到第五秒,再暂停检查两位演奏者各自做了什么。

Google 并排演示开头:左右画面均为女性弹钢琴、男性持小提琴。
Google Research 原视频约 1.5 秒的画面。左为基础生成,右为 VQQA 修订;角色分工此时仍相似。 · 打开大图
稍后左侧女性改拉小提琴,右侧女性继续弹钢琴、男性拉小提琴。
同一演示约 5 秒的原始画面。切镜后的角色和乐器关系,需要与前一个画面一起看;点击图片可放大。 · 打开大图
来源与延伸阅读

它先检查哪里错了,再重新生成

研究方法叫 VQQA。它不会直接擦掉错误画面里的小提琴,而是根据最初的创作要求提出视觉核对问题,用视觉语言模型指出结果哪里没有对上,再调整提示词生成新候选。最后还会把多个候选重新对照原要求,选择较好的一段,不默认最后一次尝试就是最好。

对创作者可借鉴的是检查顺序:做多镜头短片时,先记下谁负责什么、角色穿着和道具位置,再逐镜核对这些关系有没有延续。这里是从研究得出的编辑思路;Google 的文章没有公布这段示例每次重做的耗时、费用,也没有把 VQQA 作为现成视频按钮开放。

来源与延伸阅读

从一处穿帮,看到长片的下一道难题

同一篇 Google Research 文章还介绍了另外几种研究:CANVAS 用角色、地点和物件状态来维持跨镜头的视觉记忆,A²RD 按片段延伸长视频,另有从整体故事意图组织分镜的 co-director。它们分别处理规划、记忆、生成和检查,不是一款已经交给普通用户的一键长片工具。

这也帮助我们分清不同的短片做法:Opus 5.5 专题中的作品主要让模型写动画代码、组织制作工具;这里研究的是生成画面拼成故事后,人物和动作能否保持一致。接下来值得看的,是创作者在真实项目里能否减少返工,而不只是研究片段变漂亮。

来源与延伸阅读