Runway 在 2026 年 9 月 3 日端出的研究预览模型 GWM Worlds 2,把视频生成推到了实时交互的牌桌前。这家在同年 2 月刚拿到 3.15 亿美元融资、估值冲到 53 亿美元的公司,拿出的核心底牌叫 WorldPrompt,宣称能一边以 720p 24 FPS 输出画面并同步流式生成 48 kHz 音频,一边允许人用事件流像打游戏一样介入场景。

不少人直觉认为,只要帧率到了每秒 24 帧,靠一段提示词直接生成 3A 游戏和具身智能训练场的日子就不远了。但看懂这套系统的工程底色就会发现,视频模型走向交互仿真并非单纯堆算力,屏幕上流动的视听连续性,与真正具备因果规律的虚拟物理世界之间,横亘着完全不同的底层规则。

撕开 24 FPS 假象:帧率不是控制延迟

GWM Worlds 2 能在连续时间线上跑起来,关键在于输入协议 WorldPrompt 的双层结构。一层是持久世界上下文,提前锁死第一帧、场景布局、材质和重力设定;另一层则是带起止时间、目标对象与运镜位移的时间戳事件流。

WorldPrompt 双层输入与生成管线 持久世界上下文 · 锁定环境基底首帧 · 空间布局与材质表征 · 预设物理法则倾向 时间戳事件流 · 启止时间戳对齐 · 角色动作与轨迹输入 · 运镜六自由度位移 自回归因果推断 · 滑动 KV 缓存窗口 · 720p 24 FPS 视频流 · 48 kHz 音频帧对齐

Runway 将原本一次性生成完整视频的双向扩散模型,后训练成了自回归扩散模型。全局 Token 只走自注意力,音视频与文本 Token 则对当前帧与前序帧做因果注意力推断,逐帧向后咬合。但这套漂亮的数字掩盖了核心落差:24 FPS 意味着单帧画面渲染耗时必须压缩在 41.7 毫秒之内,但它绝不等于你的键盘按下去到屏幕反馈的实际控制延迟。

端到端控制要经过输入捕获、语言解释、扩散步骤去噪与流式解码。官方技术说明里对单会话推理硬件规格、去噪步数和输入到生效的端到端毫秒延迟只字未提。在 Runway 的内部测试里,提前排布好的事件流画面质量显著好于稀疏的实时键盘按键。原因很简单,实时轻微敲击无法提供足够强的新场景先验信息,画面缺乏方向,容易陷入几何模糊。

滑动缓存的代价值:无限生成的健忘症

为了避免 GPU 显存随时间线性堆叠到炸裂,Runway 引入了滑动 KV 缓存机制,旧帧会不断被丢出注意力窗口。

靠遗忘旧帧换取无限流式生成,代价就是场景空间记忆的必然褪色。

这让模型在纸面上拥有了无限生成的续航,但也给整个虚拟空间种下了渐进式健忘症。如果你在一个房间里向左转身一百八十度,原本身后的柜子和门窗就会被逐帧抛出注意力之外;当你再转回身时,模型只能依赖残存的隐式先验去重新脑补。这种机制只能制造瞬时的视听流动,而无法建立稳定的物体恒常性。

传统游戏引擎之所以可信,是因为 Unreal 或 Unity 维护着一个包含刚体坐标、碰撞包围盒与布尔状态的确定性状态机。WorldPrompt 无论写得多像代码,本质依然是提示词诱导而非逻辑赋值。你在提示词里写下一句设定重力,模型并非真的运行了牛顿运动定律求解器,只是在统计概率上模拟重物下坠的视频纹理。面对反事实推断,比如一个足球砸向门框弹出的诡异角度,纯靠视频分布训练出来的模型极难稳定还原真实的力学反弹。

  • 风险.自回归视频流缺乏几何坐标约束,随着镜头旋转与交互时长增加,物体形变与场景拓扑漂移不可避免。

路线之分:流式像素与空间记忆的博弈

目前世界模型赛道并未收敛到同一套解法,几家头部团队的分歧恰恰暴露了纯像素路线的局限。

主流神经世界模型架构路径对照 Runway GWM Worlds 2 · 纯像素端到端自回归 · 滑动窗口控显存 · 视听极佳,长程失真 Google DeepMind Genie 3 · 720p 24 FPS 密集记忆 · 视觉一致性约 1 分钟 · 交互时长仅限数分钟 World Labs RTFM · 单张 H100 显卡运行 · 3D 位姿索引与显式检索 · 主打空间永续一致性

Google DeepMind 的 Genie 3 同样做到了 720p 24 FPS,但选择老老实实写明局限,视觉记忆大概只能维持 1 分钟,整套交互在数分钟后就会因为误差累积而失序。李飞飞联合创立的 World Labs 则在 RTFM 上走了一条完全不同的路,放弃纯粹依赖因果注意力的滑动遗忘,改用基于 3D 摄像机位姿的显式空间检索,试图用结构化的三维记忆对抗漂移。哪怕是 720p 22 FPS 的 Odyssey-2 Pro,也在试图寻找生成与保真之间的边界。

行业迄今没有任何公认的第三方基准来量化各家在 p95 响应时延、动作生效时间以及几何漂移率上的真实差距。Runway 笃信尺度定律,认为更大的模型和海量视频能够让物理规律从逐帧预测中自然涌现;但如果一个系统没有确定性符号状态作为锚爪,光靠像素自回归去拟合动力学,在面对严苛的机器人 Sim-to-Real 场景或重度数值游戏时,注定难以跨越真实世界的因果门槛。


终局前瞻:它不是游戏引擎的替代者

不能苛求一个研究预览版解决所有物理难题。GWM Worlds 2 与 WorldPrompt 的真正价值,不在于立刻端出一个无缝替代虚幻引擎的工具,而在于重新定义了互动叙事的生成成本。

过去做一段分支剧情演示,开发者需要搭建网格、绑定骨骼、烘焙材质、调试镜头逻辑;现在借助时间戳事件流,创作者可以在极短时间内拉起一段带有自然运镜和环境音效的高清动态样本。它对游戏外围的 NPC 行为草演、电影前期分镜动态化,提供了极高密度的信息产出。

  • 结论.世界模型短期内吃不掉引擎底层,但会成为最先击穿交互叙事原型的超快渲染层。

这场竞争的下半场不会看谁先喊出无限时长,而是看谁先公开真实的动作到响应毫秒数,谁能在 10 分钟后转回原点时,依然让那扇门立在最初的位置。