Google DeepMind给旗下机器人大模型Gemini Robotics升级到了第二代,这次改的不是对话能力,是身体。上一代模型只管机器人的上半身,弯腰、下蹲、走路这类下肢动作它管不了;新的Gemini Robotics 2把控制范围铺到了脚尖到指尖,官方说法是“whole-body motions”,全身协同。
演示视频里,Apptronik的人形机器人Apollo 2能弯腰从矮架子上取东西,也能拧开灯泡、把垂直垃圾袋扎紧、把Ziploc袋封好——这些对人来说随手就来的动作,对机器人是新技能。但Google自己也说了一句实话:机器人现在的动作速度还不够快。这句坦白,比演示视频本身更值得琢磨。
新模型多会了什么
核心变化是全身协同:机器人可以边走边下蹲边伸手取物,而不是像上一代那样下半身只能配合固定站姿。配套升级的还有手部——五指灵巧手能完成拧灯泡、扎袋口这类需要精细力度控制的动作,这在过去的人形机器人演示里不常见。
负责“大脑”那部分的Gemini Robotics ER(embodied reasoning,具身推理)也同步升级到ER 2。它现在能识别一个任务什么时候算开始、什么时候算完成,能撑更长的多步骤任务,还能指挥不同型号的机器人协同作业——演示里Apollo 2给Google自家的双臂机器人下指令,两台机器人一起把工具收进箱子完成车库整理。Google把这一版称为“迄今最安全的机器人模型”,理由是它能识别人靠近、触发安全工具调用、让机器人停下来。
演示很完整,门槛还在
这些视频拍得流畅,但流畅本身就是筛选后的结果——官方演示天然是挑过的最佳案例,不能当成机器人已经能在真实场景里稳定重复。Google在公告里自己写明:机器人“运动速度还有提升空间”。这句话说得轻,分量不轻:人形机器人要真正干活,不是能不能完成一个动作,而是能不能在合理时间内、以可预测的稳定性反复完成。
能演不等于能用,这中间隔着速度、稳定性和真实场景验证三道坎。
- 风险.目前公开的都是官方挑选的最佳演示片段,速度、成功率、真实环境下的稳定性均未经独立验证。
控制权比手脚更重要
这次更新里最容易被忽略的一条,是端侧模型(Gemini Robotics On-Device)的升级——它能在机器人本体上离线运行,不依赖网络连接。这听起来是技术细节,实际决定的是部署方式:断网能不能干活、指令延迟有多低、谁掌握这套系统的更新和权限。
人形机器人这两年的叙事一直围绕硬件——谁的关节转得更快、谁的手指更灵活。这次Google交出的答案,是把重心放在控制层:一个统一的全身运动模型,一个负责推理的具身模型,一个能离线跑的端侧版本。工欲善其事,必先利其器——但器怎么设计、怎么运行、数据流向哪里,从来是规则制定者说了算,不是使用者能选的。硬件公司负责造身体,Google负责决定这身体怎么想、怎么动。这才是真正该盯住的变量:机器人硬件的门槛正在被磨平,控制层的话语权,正往少数几家模型公司手里聚集。
