视频生成模型要在画面里呈现真实世界,常在最基础的物理规律上露怯。黄油像油漆一样抹开,实心小球径直穿墙而过,水流凭空倒灌。来自 NVIDIA、麻省理工学院(MIT)与牛津大学的研究团队拿出一套名为 Physis-Lang 的框架,试图证明修正这些崩坏现象不需要引入额外的三维数值或隐空间信号,单靠语言本身就能完成物理规则的矫正。在 2026 年 9 月 29 日的 Physics-IQ Verified 公开排行榜快照中,搭载该方案的 Cosmos3-Super 拿下了 48.2±1.4% 的测试成绩,将原生 Cosmos3-Nano 提升约 6 个百分点,并在多项公开评测中压过了 Google 的 Veo 3.1。

但这绝非世界模型在物理底层机制上的终局胜利。把跑分拆解到具体测试维度会发现,所谓的登顶与领先存在严格的限定条件。这项研究更真实的价值,在于展示了一套极度工业化的高阶文本先验与数据逆向工程,如何用极低的边际成本帮扩散模型应付复杂的物理评测。

用自然语言给像素补课:Physis-Lang 怎样重构物理提示

传统视频生成的提示词往往只描述发生了什么,从不交代为什么发生。提示词写下一块黄油随着温度升高而融化,扩散模型能学会黄油化开的视觉渐变,却对热传导、重力和黏稠度一无所知。Physis-Lang 做的核心改动,是在原本的基础标注外强行挂载两个文本字段:一个是详细罗列受力实体、因果关联与时间演化规律的物理推理模块,另一个则是专门描述反常识后果的负向提示词,比如在石头入水场景里明确写明石头不会漂浮在水面。

为了让庞大的视频库都配上这种因果文本,团队搭建了一个自演化闭环。系统用冻结参数的 GPT-5.5 担任标注员,Gemini-3.1-Pro 担任物理评判员,双方在一个包含 273 条人工核验断言的开发集上反复博弈。评判员逐条核对因果陈述的精确率与召回率,驱动演化代理重写提示指南,最终在包含 3,794 条人工断言的 PhysCapBench 上将标注准确度打磨至 87.82 分。

Physis-Lang 物理因果自演化与训练流程 自演化闭环 GPT-5.5 标注生成 Gemini-3.1-Pro 批评 9 轮迭代优化规则 数据定向筛选 诊断模型物理缺陷 检索针对性视频 沉淀 183K 样本集 模型轻量微调 双字段文本注入 注意力层 LoRA 训练 网络架构零改动 端侧小模型蒸馏 Qwen3-VL-4B 蒸馏 生成 PhysThinker 单次微调成本趋零

拿到成熟的文本标注逻辑后,团队反向诊断当前视频生成常见的受力崩溃类型,从图库中定点检索出 112K 匹配片段,与清洗后的样本汇编为 183K 物理导向视频数据集。整个微调过程不动底座架构,仅在注意力层挂载轻量 LoRA 参数。这种完全依靠文本引导的方案甚至不需要重新训练模型,仅仅在推理阶段给原生 Cosmos3-Nano 加上物理因果与排他提示,就能在物理基准测试中拔高 5.62 分。

48.2 分背后的统计口径:击败 Veo 3.1 的真实切片

在对外宣传与技术报告的醒目位置,Cosmos3 凭借这一框架斩获了物理评测榜首并大胜 Google 的 Veo 3.1。但如果对照基准测试的完整榜单记录,事实存在明显的语境限制。

首先,Cosmos3-Super 拿下的 48.2% 成绩,仅仅是 Physics-IQ Verified 榜单里的图生视频(I2V)单项分,绝非整个基准的绝对头名。在信息量更连贯的视频生视频(V2V)赛道中,当前榜首被 Magi-1 与 GeoPhys 组合占据,成绩达到 58.2±1.8%,即便是 Cosmos3-Super 自身的 V2V 测试得分也有 50.8±2.2%。

Physics-IQ Verified 各赛道实际跑分对照 Magi-1 + GeoPhys (V2V 榜首) 58.2% Cosmos3-Super (V2V 赛道) 50.8% Cosmos3-Super + Physis-Lang (I2V 头名) 48.2% Cosmos3-Nano + Physis-Lang (I2V) 43.3% Google Veo 3.1 Lite / Fast (I2V 公开成绩) 31.8% / 30.0%

其次,被作为核心靶子对照的 Veo 3.1,在榜单上的受测对象并非全尺寸主力模型。Physics-IQ Verified 公开收录的实测记录对应的是 Veo 3.1 Lite(31.8±0.3%) 与 Veo 3.1 Fast(30.0±0.5%) 这两款主打推理效率的轻量变体。拿满血微调的 Cosmos3 旗舰版本对比竞品的边缘轻量版本,本身就带有选拔基准时的倾斜。

基准本身的稳定度同样需要审视。Physics-IQ Verified 这一测试集此前经历过严格审计,曾系统性修正了 57.6% 的原始样本错误,每次校准都会带来全行业模型排名的剧烈洗牌。而在原文列举的 PhyGenBench 与 VideoPhy-2 对比中,官方公开排行榜至今并未收录 Physis-Lang 或 Veo 3.1 的测试记录,这些领先数字基本属于研究团队基于开源测试集在内部环境离线复现的结果。在缺乏第三方统一沙盒仲裁的情况下,各家模型实际测试时往往套用了各自最优的 Prompt 与推理管线,评测环境变量从未做到完全对齐。

用语言对齐评分体系,往往比让神经网络学会时空因果来得容易得多。
  • 提醒.测试榜单的分数跃升不能等同于物理引擎的数值可靠度,多数指标仅反映生成画面对特定视觉语言多模态评分器的契合程度。

语义对齐还是动力学突破:工业捷径的现实代价

Physis-Lang 的成功,与其说是视频扩散模型在牛顿力学模拟上迈出了一大步,不如说是对当前基于多模态大模型(VLM)打分机制的精确迎合。当评测基准主要依赖视觉语言模型来审视画面是否穿模时,给视频生成器喂入包含严密物理词汇的提示词,模型自然会优先渲染那些最容易被判定为合规的显性特征。这是高水平的语义对齐,但并不代表模型底层掌握了质量守恒或纳维-斯托克斯方程。

对产业界而言,这项方案最具吸引力的地方不在于物理理论突破,而在于把工业落地的改造成本打到了极低水平。按照传统路径,构建高保真仿真环境或重新训练三维物理网络耗资巨大。而 Physis-Lang 框架不仅可以在不改动底座权重的情况下通过 LoRA 快速迁移,团队甚至通过知识蒸馏,把原本调用商业大模型需要花费 24.12K 美元的 API 账单,压缩至开源 4B 模型(PhysThinker-C 与 PhysThinker-U)的 0.12K 美元,在完全本地化部署下更是趋近于零。

  • 结论.影视特效与游戏过场制作团队可以直接借用这套提示策略降低穿模返工率,但具身智能与自动驾驶团队切勿将其生成的视频直接作为端到端决策的仿真环境。

对于需要真实世界物理闭环的机器人团队来说,语言描述带来的物理感依然脆弱。哪怕黄油的形态在画面里不再像油漆,小球也没有在视线里直接穿透砖墙,但只要底层依然是由概率采样的潜空间扩散驱动,不可预测的微观穿模与受力失衡就依然潜伏。文本因果是一剂见效极快的退烧药,但通往真正世界模型的路,依然绕不开底层神经动力学的硬骨头。