曾推出 Reka Core 的初创团队 Reka AI 近期发布了名为 Rho-1 的研究预览模型。这个 19B 参数 的全模态模型做了一次激进尝试:把文本、图像、视频、机器人动作以及本体感觉完全放进同一个神经网络和共享上下文窗口里,彻底抛弃了工具调用和下游专有控制网络。

用同一套权重既“预测摄像头看到的未来像素”,又“输出驱动机械臂的电机关节轨迹”,这是学术界多年来渴望的物理世界模型终极形态。然而,把多模态技术栈彻底压平的背后,是极为苛刻的工程折中。

技术栈分野:模块级联架构 vs Rho-1 单模型坍缩 主流级联方案 (如 NVIDIA Cosmos) 语言模型规划 (LLM Task Planner) 世界模型/扩散仿真 (World Model) 边缘动作策略执行 (Action Policy) 特点:模块解耦、工业级可控、接口有损耗 Rho-1 极简一体化方案 单一 19B 神经网络 • 共享 KV Cache 与注意力空间 • Next-Token + Flow-Matching 联合训练 • 统一处理文本、像素与电机轨迹 特点:消解层级接口,但控制延迟与泛化承压

320 张卡炼出的技术栈坍缩

在传统的机器人与多模态系统中,架构通常是拼接式的。大语言模型处理高阶常识与任务拆解,视频或扩散模型用来构想下一步画面,底层的动作策略网络再根据指令去算机械臂的每个关节角度。各模块各司其职,代价是接口转换带来的信息衰减,以及难以压缩的流水线级联延迟。

机械臂齿轮与控制排线被精简压平,直接熔入单颗硅芯片(剖面示意)
机械臂齿轮与控制排线被精简压平,直接熔入单颗硅芯片(剖面示意)

Reka AI 在题为《Rho-1: Collapsing the Multimodal Stack》的报告中,试图终结这种模块割裂。他们仅使用 320 张 NVIDIA H100,花费约三个月时间,训练出这个 19B 参数的模型。

模型采用了分流的理解与生成架构,将自回归的 Next-Token Prediction 与用于连续生成的 Flow-Matching 目标结合。它的文本、图像、视频、动作和本体感觉共享同一个注意力状态空间与 KV Cache。为了绕开具身智能领域极度匮乏的高质量真实机械臂轨迹数据,Reka 自研了一套逆动力学模型,从普通互联网视频中反向提取动作控制信号。

但天下没有免费的算力午餐。当模型试图把所有模态硬塞进单一权重时,分辨率首当其冲。Rho-1 原生视频输出分辨率当前上限仅为 672×384。这很难称得上是高质量视觉,它更像是一个为了验证可行性而设定的妥协指标。

撕开 0.79 倍实时的障眼法

宣传材料中最具吸引力的指标,是基础模型约 0.79× 实时的视频生成速度,以及蒸馏后在 1 秒左右输出 5.3 秒视频剪辑的能力。不少人据此推断,初创团队做出了可以直接毫秒级控制物理机器人的廉价模型。

工作台右侧随时间推移发生物理波纹扭曲,呈现长程生成漂移
工作台右侧随时间推移发生物理波纹扭曲,呈现长程生成漂移

这里的概念偷换显而易见。

关键指标横切面:生成性能与物理控制的落差 0.79× 基础视频生成速度 视频帧渲染指标 ~6.0s 流式生成启动延迟 远超实时伺服容限 8 步 蒸馏去噪迭代步数 原版本为 99 步 672×384 原生视频分辨率上限 精度折中明显

0.79× 实时和蒸馏加速属于视频流媒体渲染范畴。实测数据里,Rho-1 的流式生成启动延迟大约需要 6 秒,生成第一个视觉片段耗时约 7.0 秒。把去噪步数从 99 步硬砍到 8 步的蒸馏版虽然能实现 1 秒出片,但这依然是块状离散生成。

真正的物理机器人控制需要的是高频闭环。如果一个机械臂在移动中遇到碰撞或意外阻碍,它必须在几十毫秒甚至几毫秒内调整扭矩与动作,而不是花几秒钟重新规划一段连续视频。

更关键的是稳定度。官方材料坦承,Rho-1 存在显著限制:生成超过 30 秒 的视频时会出现长时程结构漂移,比如周围房间布局逐渐变形失真;视频的时序定位不稳定,复杂的环境编辑指令也相对脆弱。如果连虚拟环境中的空间一致性都会在半分钟内走样,它驱动的物理实体在现实中也很难保持连续精确。

  • 风险.将视频生成的连续性误读为机器人控制的高保真度,极易低估现实世界对毫秒级伺服与接触力觉反馈的严苛要求。

世界模型的三条分歧路

当我们将 Rho-1 放在具身智能与世界模型的宏观图谱中对照,行业内的路线裂痕正变得愈发鲜明。

三款测试台分别代表纯仿真沙盒、外挂工业夹爪与一体化原型机(示意图)
三款测试台分别代表纯仿真沙盒、外挂工业夹爪与一体化原型机(示意图)
模型路线核心定位输出规格与基准表现软肋与落地点
Reka Rho-1极简端到端一体化19B 参数 / 672×384 / LIBERO 定性演示缺乏标准化成功率数据,未开源与提供 API
Google Genie 3高保真交互仿真环境720p / 24 FPS 实时世界生成作为环境模拟器使用,不直接输出电机策略
NVIDIA Cosmos工业级解耦部署体系32 个动作块耗时 1.53 秒 / RoboLab 22.9% 成功率链路较重,依赖专用边缘硬件生态适配

Google Genie 3 走的是模拟器路线,追求生成 720p、24 FPS 的虚拟环境,让其他智能体在其构建的数字沙盒中试错,本身并不直接负责转动马达。

NVIDIA 的 Cosmos 方案则坚定站在模块化工业落地这一侧。Cosmos 3 Edge 在专用的 Jetson AGX Thor 硬件上运行,生成 32 个动作块仅耗时约 1.53 秒,能覆盖约 2.13 秒的物理运动。更重要的是,NVIDIA 在 120 项 RoboLab 仿真任务中拿出了 22.9% 的闭环成功率(Nano 版本为 36.8%),给出了可量化的工程基线。

而 Rho-1 既没有 Genie 3 的高分辨率世界沉浸感,也拿不出像 Cosmos 那样的标准化评测体系。官方仅展示了 LIBERO 仿真套件的定性演示,未公布可供复现的任务成功率表格,更没有 Sim-to-Real 的实机验证。

截至目前,业内在 Rho-1、Genie 3 与 Cosmos 之间并不存在第三方统一评测。它们的控制频率、任务套件和硬件形态完全脱节。Rho-1 当前没有开源模型权重,也没有提供商业 API,其官方定位非常克制——一个在受限算力下的功能性概念验证。

纸上得来终觉浅,从像素中推理出的世界,永远缺少一块阻力。

逆动力学从互联网人类视频中扒动作,确实规避了高昂的摇优示教成本,但也绕开了物理交互中最沉重的部分。2D 视频里看不到接触力、摩擦力和形变刚度,人类手臂与机械臂也有着截然不同的运动学构型。仅凭视觉外观脑补出的运动轨迹,面对真实的工业公差与重力,往往不堪一击。

  • 结论.Rho-1 证明了多模态注意力底层打通的理论可行性,但它要从概念验证走向可用工具,必须跨过从视觉流媒体到物理伺服这道最难跨越的工程天堑。