Google DeepMind在2026年7月30日发布新一代机器人具身推理模型Gemini Robotics ER 2,通过Gemini API和Google AI Studio向开发者开放。这次更新没有去拼抓取精度或运动速度,而是解决机器人最容易卡壳的地方:任务干到一半,它到底知不知道自己干到哪一步了。
官方给出的数字是:进度分类准确率57.4%,关键时刻识别准确率91.3%、平均误差0.96秒,执行速度比上一代ER 1.6提升到4倍。这些数字都来自DeepMind自有评测集,还没有第三方复现或开放场景的验证。ER 2更像一个调度员——负责判断和下指令,机械臂怎么拧螺丝、轮子怎么走位,仍交给底层的VLA模型或导航API去执行。
边看边判断,57.4%不等于"接近一半会错"
上一代ER 1.6靠静态画面判断任务成不成功,ER 2改成盯着连续视频流判断。机器人可以一边拧灯泡一边确认拧到了几成,不用等动作全部结束才回头检查。
进度分类测试把视频按进度分成五档,从0-20%到80-100%。ER 2跑出57.4%的准确率,官方称超过ER 1.6和其他前沿模型。五档随机蒙对的概率是20%,57.4%明显超过瞎猜,但材料没说清这些错误是判断偏差一档还是完全判断反了,这一点目前还看不清。
关键时刻识别测的是模型能不能精准找到"该停手"的那一帧,比如咖啡倒到八分满该停。ER 2的准确率是91.3%,平均误差0.96秒,执行速度也提到了4倍。
- 风险.57.4%的进度分类准确率,五档随机蒙对约20%,ER 2确实明显超过瞎猜。但开放场景比实验室评测复杂得多,机器人团队接入前得先想清楚容错怎么兜底。
官方还公布了另一组对比:在真实VLA、模拟VLA、人工遥操作三种控制模式下,ER 2都优于ER 1.6,也优于其他前沿模型。
| 控制模式 | ER 2 vs ER 1.6 | 评测来源 |
|---|---|---|
| 真实VLA | 官方称更优 | DeepMind自有评测 |
| 模拟VLA | 官方称更优 | DeepMind自有评测 |
| 人工遥操作 | 官方称更优 | DeepMind自有评测 |
这张表看着全面,但三行结果全部来自DeepMind自己搭的评测环境,没有第三方基准参与打分。
大脑负责判断,动作还是外包给别人
ER 2从设计上就没打算做端到端的动作模型。DeepMind把它放在"高层",负责理解指令、规划步骤、调用工具,具体的抓取、行走、转向仍然要甩给VLA模型、导航API或其他底层控制系统。
演示视频里,ER 2调度Boston Dynamics的Spot完成了一次"取爆米花"的指令。靠的是Spot自带的导航和机械臂API,ER 2只管拆解任务、判断时机。
多机器人协作的例子换成了Apptronik的人形机器人Apollo 2和Franka F3 Duo。两台形态完全不同的机器人靠共享的语义理解对齐动作,轮式机器人管室内平地,人形机器人管复杂地形和精细操作。分工听起来合理,但两套硬件、两套控制栈对接的成本,材料里没有给答案。
ER 2判断得越来越准,但决定机器人动作快慢的,还是别人家的模型。
机器人团队和采购方,分别该怎么接
对机器人产品和工程团队,值得做的是拿Gemini Live API跑一遍任务编排的原型。低延迟双向流适合先验证ER 2判断进度、切换步骤的能力,但要提前设好容错阈值,准备好57.4%准确率之外的兜底逻辑。
同时要单独评估一件事:ER 2和团队现有VLA模型、导航栈的适配成本。官方演示用的是Spot、Apollo 2、Franka F3 Duo这类已知硬件,换一套自家机器人,接口和调试工作量不会自动消失。
对工业自动化的采购和技术决策者,更现实的做法是先别动。官方演示和自家跑分,不等于产线上的延迟表现、故障率和维护成本都已经验证过。企业级的Gemini Enterprise Agent Platform目前还是私有预览,没有公开报价,拿它做采购决策为时过早。
接下来值得盯的,是DeepMind会不会公开评测集细节、有没有第三方团队复现这些数字,以及Enterprise Agent Platform什么时候给出价格和真实产线延迟数据。这几项没有着落之前,"高层大脑更聪明了"和"机器人能规模化替换人力"之间,还有一段没打通的路。
