Apptronik的人形机器人Apollo 2在官方演示里收到一句指令:把浇水壶放进底层货架的绿色收纳箱。它自己走到桌边,捡起壶,迈步走到货架前,精准放下。
这段视频不是这次发布最该被记住的东西。真正值得记的是官方给出的一个数字:换一个机器人身体,只需要几个小时、通常少于200个示例。这个数字,才是判断"通用机器人"能不能规模化复制的关键指标——驱动它的是Google DeepMind刚发布的Gemini Robotics 2系列。
三个模型,分工在哪
DeepMind这次一口气放出三款模型,各管一段:
| 模型 | 负责什么 | 开放状态 |
|---|---|---|
| Gemini Robotics 2(VLA) | 视觉+语言转动作,控制全身、灵巧双手、二指夹爪 | 仅早期合作伙伴 |
| Gemini Robotics ER 2 | 多步任务规划、自我纠错、多机协作调度 | 已上线Google AI Studio,公开可试 |
| Gemini Robotics On-Device 2 | 本地运行不依赖网络,继承"动作迁移"能力 | 仅早期合作伙伴 |
三者里,只有ER 2真正对外开放。VLA和端侧模型还锁在合作伙伴名单里,离商用有一段距离。
全身动起来了,精度还没跟上
上一代模型基本只管上半身、桌面级任务。这次不一样。
Apollo 2能走路、弯腰、蹲下,配上22自由度的五指手,能打结、能封拉链袋。搭配二指夹爪的Franka Duo平台,也能做紧密装箱这类精细活。
官方也承认,速度和精度还没到能用的水平。这句坦白比演示视频更值得记下来。
安全层面新增了ASIMOV-Agentic基准:能不能拒绝危险调用、遇到不确定时主动请求人工介入、有人靠近时自动安全停机。这三项测试的都是"出错时怎么收场",而不是"能不能干得更快"。
限制也很明确:官方展示的低成本适配只发生在Dexmate、SO101、Trossen这类结构相近的双臂平台上,不等于任意形态、任意任务都能这么便宜迁移。全身人形机器人的走路和抓取,现在仍由VLA主模型直接生成动作,还没轮到这套低成本适配逻辑。
这次数字对谁有用
做人形机器人本体的团队,可以先申请ER 2的合作伙伴资格,用它的多步规划和纠错能力接一遍现有产线的任务流程,但VLA和端侧模型还没开放,规模部署的决策不必急在这一步。
关注AI产品化的读者,值得留意的不是Apollo 2走了几步,而是"数小时+200示例"这个成本结构能不能在更多本体上复现。如果能,机器人行业过去最贵的环节——每换一个机型就要重新采集数据、重新调参——就有了被摊薄的可能。
接下来最该看的三件事:VLA和端侧模型什么时候对早期合作伙伴之外开放、ER 2在真实场景下的成功率数据会不会公开、以及"少于200个示例"能不能在结构差异更大的机型上复现。这三个问题现在都没有答案。
《道德经》讲"合抱之木,生于毫末",通用机器人的地基,现在更像是在打毫末的阶段。ER 2开放试用是一小步,VLA和端侧模型还锁在合作伙伴名单里,速度、精度、真实环境下的成功率,一样都没有公开数据。
演示视频永远比实际部署乐观。这次进展是真的,但离"机器人真的能进厨房",还差一层独立可验证的数字。
