加州AI初创公司Odyssey正式向公众开放了其世界模型Odyssey-3的在线交互预览版。伴随这次上线,团队抛出了一组扎眼的战报:基础模型规模为140亿参数(14B),在物理理解测试Physics-IQ中拿下66.1分的高分登顶,并且能在极低感官延迟下,用同一套模型驱动机械臂、无人机以及在《GTA V》中自主驾驶。

但在华丽的演示视效背后,这项技术距离真正支撑具身智能与高精度仿真仍有巨大断层。仔细核对官方提交到开源社区的测试代码与原始数据可以发现,所谓66.1分的历史纪录,建立在规避基准评测规则的8选1优选采样之上;而实测中一转头建筑物就变形移位的空间失忆,也暴露了当前扩散自回归模型在物理常识与空间记忆上的根本短板。

跑分登顶背后的选美游戏

在物理评测Physics-IQ Verified的榜单上,Odyssey-3 Pro的66.1分确实引人注目。这项包含198个物理实验案例、在16 fps帧率下检验流体、光学、热力学因果推演的基准,是目前衡量视频生成是否理解真实物理规律的标尺之一。然而,这一顶分并非常态输出。

官方在GitHub代码仓库提交的记录显示,66.10分来自单次运行中的best-of-8采样策略。评测系统针对同一个物理命题生成8条候选视频,再通过特定奖励算法与共识筛选挑出最符合物理规律的一条。如果严格按照Physics-IQ官方规则——要求单模型进行4次独立运行并报告标准差——Odyssey-3 Pro的真实基准均分其实是63.37 ± 0.63。

Physics-IQ 评测口径与真实基线对比 宣称顶分(单次 8 选 1 采样) 66.10 依赖 WMReward 最优解筛选 规范基准(4 次独立测试均分) 63.37 真实波动区间 ± 0.63 分

至于基础版本的Odyssey-3,其常态4次运行均分为61.56 ± 1.20,单次最优筛选得分也仅为64.43。换言之,厂商在公关口径中展示的物理直觉,是经过候选池过滤后的特例。在实际部署或在线交互中,推理系统根本无法为每一帧画面先生成8个平行宇宙再做择优,用户拿到的大概率是均线水平的物理模拟。

宣传中引发误解的不仅是物理跑分。Odyssey在对外演示中提及的每小时1美元成本,实际上是对AMD MI355X GPU机架折旧与电力消耗的纯硬件成本估算,绝非外部开发者可以直接采购的API定价。其对公服务条款仍沿用Odyssey-2标准,商业调用的真实账单远未明朗。

实时手感流畅,但转头就会世界失忆

撇开打榜水分,运行在轻量版Odyssey-3 Flash上的在线演示,确实展现了可观的交互体验。用户输入文本提示词后,可以在832 × 480分辨率下通过第一人称或第三人称视角实时探索环境。

视觉因果预测不等于三维空间记忆,镜头回转处尽是破绽。

模型底层采用自回归扩散架构,利用前序帧与即时键盘输入预测下一帧像素。由于跳过了传统三维引擎的复杂几何管线,它的响应延迟感知极低,操作跟手度良好。但多位独立测试者的实测迅速戳破了虚拟世界的完整性幻象:该系统存在严重的物体恒存性缺陷。

当玩家操控镜头向左旋转180度后再转回原位,原本处于视野中央的建筑外观、门窗结构甚至整条街道,往往会发生不可逆的变形或位移。自回归视流预测器是在顺应时间轴生成看似合理的图像流,它的大脑里没有一个固定存在的全局三维坐标系。

自回归扩散世界模型的因果塌陷路径 输入即时动作 视流连续推进 前向时序连贯 视角偏转移开 特征脱离潜空间 缺乏全局几何网格 回望场景畸变 物体位置重构错乱 三维恒存性断裂

在游戏娱乐中,这种空间失忆尚可被视作技术未熟期的画面穿帮;但在Odyssey试图进军的具身智能领域,这是致命缺陷。如果机器人回头观察一次周围环境,原本定位的桌角位置就发生了漂移,任何基于世界模型内部状态展开的动作规划都将瞬间失效。

  • 风险.纯视流生成的像素连续性不能等同于物理因果闭环,在缺乏三维锚定与显式世界记忆的前提下,用其训练物理实体的动作容错率极低。

避重就轻的排位赛与工程现实

在行业竞争的横向对照中,Odyssey选择了一套精致的披露策略。在学术界通用的综合基准WorldMark评估里,官方声称在四个分类中斩获三项第一。但若查看其在第一人称真实场景(First-Person Real)的细分成绩,Odyssey-3拿下80.6分,不仅没有夺冠,还落后于Lyra 2.0的84.4分以及AlayaWorld的83.0分,仅位列第三。

更关键的缺席在于行业真正对标的龙头。Google DeepMind早前推出的Genie 3支持720p分辨率下每秒20至24帧的生成,在WorldMark评估中公认具备极高的短时一致性。然而在Odyssey官方公布的评测对照表里,Genie 3并未被纳入横向对比,两家机构在这个关键指标上呈现出某种刻意的交错。

评估维度 / 竞品模型Odyssey-3 Pro行业领先基准(Lyra / Genie 3)实测关键限制
Physics-IQ Verified 均分63.37 ± 0.6366.10(仅限 8 选 1 采样)依赖候选视频后处理打分
WorldMark 第一人称写实80.6 分84.4 分(Lyra 2.0 领先)真实质感与视线遵循度仍有差距
生成画质与帧率规范720p(Pro)/ 480p(Flash)720p @ 20-24 FPS(Genie 3 规范)缺乏全链路硬件延迟公开基准
空间世界记忆(恒存性)镜头重置易发生形变业内普遍面临长程衰减瓶颈纯自回归视流预测的固有短板

Odyssey展示了用数十小时数据驱动机械臂纠错、或者两小时GTA数据无缝迁移到《荒野大镖客2》骑马的惊艳案例,甚至联合瑞士机器人厂商Flexion进行人形机器人运动控制开发。但在所有前瞻演示中,决定工业可用性的硬指标——端到端控制延迟、控制对齐精度与硬碰撞容错率——全部隐匿于剪辑精良的视频流后。

  • 建议.对于急需仿真训练数据的机器人与具身Agent团队,Odyssey-3可以作为廉价的视觉数据扩增场,但不宜将其视为闭环运动控制的物理引擎替代品。

在AMD斥资82亿美元收购World Labs、各路资本争相下注世界模型的关口,Odyssey-3的开放公测确实拉低了公众体验交互生成的门槛。但从刷榜的数学游戏到现实的物理世界,横亘在自回归像素网络与真正因果引擎之间的,不是几块GPU的算力差距,而是一座关乎三维空间真实记忆的认知高墙。