Google Research 在 2026 年 9 月 24 日公布了一项名为 AI Video Co-Director 的长视频生成方案。官方演示中最吸引眼球的标签,是它在底座模型 Gemini 与 Veo 之上,直接跑出了一支长达 10 分钟 的多镜头样片。在外界普遍认为视频扩散模型依然卡在单段数秒、长程叙事必然崩溃的当下,这像是一次突然的技术突跃。

但只要翻开支撑这套系统的四篇核心论文就会发现,Google 并没有在底层解决视频扩散模型的长时程注意力衰减难题。它本质上是一场精巧而昂贵的工程妥协:放弃对生成底座进行模型微调,转而在模型外围搭建由四套独立 Agent 构成的编排治理层,用暴力搜索、记忆检索与多轮质检,硬生生把碎裂的短镜头缝合成连续剧卷。

学术拼盘与宣传滤镜下的真实边界

官方博文将 AI Video Co-Director 描摹成一个无缝运转的一体化 AI 导演,但在技术实现上,它是由分别投往 COLM 2026 与 EMNLP 2026 等顶会的四个分立研究拼装而成。这四项组件从未在同一个端到端基准上跑过联合测试,甚至各自锁定的战场也完全不同。

最能说明这种断层的是核心调度框架 Co-Director。在官方构建的 GenAd-Bench 广告评测集里,Co-Director 在 400 个虚构品牌场景下拿到了 81.4 分 的自动化均分,并在 50 个场景的人类主观打分中拿下 3.96 分(满分 5 分),压过了原生 Veo 3.1 的 3.71 分、Kling 3.0 Omni 的 3.59 分、Wan 2.6 的 3.48 分,以及学术界此前的 MovieAgent(3.22 分)。可这项优异成绩的实际测试设定,仅仅是 4 个镜头、总长 12 秒 的商业短片,根本没有涉及多分钟级别的叙事压力。

官方口径与技术文本的裂缝还出现在数据规格上。Google 宣传博客中声称长时程连续性基准 LVBench-C 包含 120 个评测场景,而在其子项目 A²RD 原论文的统计表里,该基准被明确切分为 50 个 3 分钟、50 个 5 分钟与 25 个 10 分钟测试集,实际总计为 125 个场景。

AI Video Co-Director 宣传口径与技术实测剥离 对外宣传聚合概念 系统定位:10 分钟端到端商用连贯视频 调度方式:全自动免训练导演中枢 成本宣称:单片段生成小于 0.5 美元 落地状态:完整套件一键交付 论文底层切片实况 Co-Director 仅测 12 秒短广告(4 镜头) CANVAS 核心验证对象为静态分镜脚本 0.5 美元排除了 5 候选片段的高昂扩散算力 开源库代码不全,无第三方联合端到端复现

四套外挂机制:用算力编排代偿扩散模型短板

在处理多镜头长视频时,行业面临的核心瓶颈始终是主体漂移与上游单点错误扩散到全片的级联失效。为了锁住特征,字节跳动与南洋理工的 StoryMem 倾向于针对底座做 LoRA 微调,新加坡国立大学 Show Lab 的 MovieAgent 则给每个角色单独定制 LoRA 权重,而 AutoStudio 甚至只能退回静态图像序列。

Google 的路线彻底转向了免微调外挂治理。整个体系在生成底座上压了四道安全阀:

一是将创作规划转化为多臂老虎机(MAB)搜索。Co-Director 的调度中枢在策略、叙事和美学选项中动态试错,配合多模态大模型评委打分反馈,以此摆脱纯人工写提示词的不稳定性。

二是引入外挂静态记忆库 CANVAS。它在分镜推演中建立视觉锚点,在场景回跳时精准提取角色、背景与道具。在 ContinuityEval 评测中,CANVAS 比基准模型分别取得背景一致性提升 21.6%、角色一致性提升 9.6%、道具一致性提升 7.6%。然而这篇发表于 EMNLP 2026 的论文测试重点完全在静态分镜图上,并未覆盖动态镜头中的连续运动。

三是负责拼出 10 分钟样片的 A²RD 自回归扩散架构。它在每段视频生成时执行检索、合成、精炼、更新的闭环。在 1 分钟 VBench-Long 设定下,A²RD 的镜头间角色一致性拿到 0.7353,高于 VideoMemory 的 0.5729,叙事连贯性从 0.6717 升至 0.8987。

四是质量纠偏闭环 VQQA。它通过多模态模型对画面生成问答评语,把视觉缺陷反向转化为语义梯度去重写提示词。在 CogVideoX-5B 上的测试显示,经过平均 1.245 轮 优化与约 7.23 次 审查调用,T2V-CompBench 得分提升 11.57 个百分点,VBench2 提升 8.43 个百分点。

免微调 Agent 编排流水线拓扑结构 Co-Director MAB 多臂老虎机 分镜脚本与分工 GenAd: 81.4 分 CANVAS 持久视觉记忆池 静态特征锚点比对 背景一致性 +21.6% A²RD 核心管线 自回归循环渲染 记忆外推与内插 输出 10 分钟样片 VQQA 纠偏 VLM 视觉质检问答 提示词语义梯度修正 全局最优剪辑选取

隐形成本黑洞与落地现实

所谓长视频生成的突破,往往只是把模型内部无法消化的混乱,转嫁给了外部无上限的重试算力。

A²RD 在论文中给出了极具诱惑力的数字:单片段成本低于 0.50 美元。但这处陈述设立了一个严苛的统计口径:这项费用仅涵盖 Agent 推理与编排自身的开销。论文随后坦承,它明确排除了每个片段生成多达 5 个候选视频与 5 帧图像 的底层高昂扩散渲染。

真实工业账本恰恰埋在这些被剔除的开销里。VQQA 每一轮改写都要反复调用大视觉模型审查,系统采用全局择优机制,意味着大量生成的候选废片在后台被直接抛弃。如果加上 CANVAS 检索庞大特征库的额外负载,渲染一部逻辑勉强连贯的 10 分钟视频,其背后的综合推理账单远非普通中小团队所能承受。

CANVAS 论文作者在文末指出了更深层的问题:整套系统缺乏物理交互与运动规律建模。它能保证角色从第三分钟走到第八分钟时帽子颜色不换,却管不住人物跨过门槛时的肢体穿模。从分镜图的画风锚定,到真实物理时空内的动作连续,中间横亘着外挂 Agent 无法填补的鸿沟。

开源社区的动作折射出业界的疑虑。第三方复现项目 OpenCanvas 虽然搭出了类似 CANVAS 的分镜工作流,但因更换了底座模型,无法复现官方披露的指标。A²RD 官方开源仓库目前也未完全公开其核心数据集与完整可运行脚本,行业至今拿不到可供独立复现的端到端系统。

  • 风险.商业视频团队切勿盲目以 10 分钟样片为标准承接客户预算,当前方案依赖极端昂贵的多选一重试,真实落地更适合 15 秒内的分镜锁脸,而非整段长片直出。

随着底层视频大模型的迭代节奏在物理真实性前放缓,Google 拿出的这套组合拳说明,头部科技公司正在将竞争焦点从单纯卷模型参数,转移到用工作流工程榨取既有模型残值。对于影视广告制作方而言,这类编排框架能提高 15 秒短片的产出胜率;但对于期待一键直出电影的长视频工业化而言,算力账本与物理断层依然是横在眼前的坚硬现实。