2024 年 5 月,宇树发布人形机器人 G1,起售价 9.9 万元。机器人身体正在变便宜,关节、传感器和运动控制也越来越成熟。可把机器放进仓库、厨房或家庭,它依然常常不知道下一步该做什么。
身体先到了,大脑还在路上。
机器人模型公司如今喜欢用“GPT-2 阶段”描述自己:模型开始出现泛化能力,训练规模继续扩大,也隐约能看见统一模型控制多种机器人的可能。这个判断有技术依据,但也很适合融资。两者不能混为一谈。
GPT-2 只是阶段比喻
OpenAI 在 2019 年发布 GPT-2。它有 15 亿参数,已经能生成连贯文本,却没有形成后来 ChatGPT 那种稳定产品、用户反馈和商业分发。
机器人行业借用这个说法,指向一个具体变化:过去要为每台机器人、每项任务单独编程,现在开始训练视觉—语言—动作模型,也就是 VLA。模型看画面、听指令,再输出机器人的动作。
几条公开路线已经很清楚:
| 模型或产品 | 发布时间 | 做了什么 | 仍缺什么 |
|---|---|---|---|
| RT-2 | 2023 年 7 月 | Google DeepMind 把视觉、语言知识迁移到机器人动作 | 公开展示集中在有限平台和任务 |
| OpenVLA | 2024 年 6 月 | 开放模型与训练路线,降低研究团队进入门槛 | 换机器人后仍要处理数据和控制差异 |
| π0 | 2024 年 10 月 | Physical Intelligence 尝试用一个通用策略完成多类操作任务 | 长时间稳定性和部署成本仍待验证 |
| Helix | 2025 年 2 月 | Figure 展示语言指令驱动双手协作和物体操作 | 公司演示不能替代第三方测试 |
这些进展说明,机器人模型确实在摆脱“一台机器配一套程序”的老路。模型开始理解陌生物体、组合指令,也能把不同任务放进同一套训练框架。
但行业并没有统一的“GPT-2 分数”。各家公司使用的机器人、场景、任务难度和成功标准都不同。有人按单次成功算,有人按连续运行算;有人允许人工复位,有人不说明接管次数。
所以,“走出 GPT-2 阶段”可以描述方向,不能充当性能认证。
机器人数据比文字贵得多
语言模型能快速扩张,一个重要原因是互联网已经积累了海量文本。机器人没有这样的现成矿藏。
一段文字训练失败,损失的是算力。一条机械臂轨迹采错,可能撞坏设备、打翻物体,还要真人重新布置现场。不同机器人的关节数量、相机位置、夹爪结构也不一样,数据很难直接通用。
这带来三道现实约束:
- **数据昂贵.** 遥操作、真实机器采集和人工标注都要付钱。
- **评测割裂.** 同样叫“叠衣服”,衣物材质、摆放方式和容错标准可以完全不同。
- **错误有物理后果.** 聊天机器人答错一句可以重试,机器人挥错一次手臂就可能伤人或停线。
“纸上得来终觉浅”,放在这里很贴切。模型在视频里学会了杯子是什么,不代表机械手知道该用多大力度抓住杯沿。
硬件也没有退出问题清单。电池续航、减速器寿命、末端执行器、维修成本和安全认证,都会影响部署。把全部瓶颈都归到“机器人缺大脑”,方便讲故事,却低估了机电系统和现场运营的难度。
自动驾驶走过一条相似的路。早期演示很快,真正拉开差距的却是接管率、长尾场景和运营成本。机器人不完全等同于自动驾驶:室内低速设备的风险通常更低,任务边界也更容易限定。但两者重复了同一个规律——从“能完成一次”到“每天稳定完成”,中间隔着漫长的工程账。
企业该买结果,不该买演示
这轮模型进步最直接影响两类人:机器人团队和准备采购机器人的企业。
机器人团队会把更多预算投向数据采集、仿真、遥操作和部署工具。单纯追逐更大的模型,意义有限。没有持续回收失败案例的能力,模型升级一次,现场问题还会原样回来。
企业采购更需要克制。看到机器人完成叠衣、分拣或搬运,不应立刻问“模型有多大”,而该追问下面几项:
| 采购观察项 | 应要求的答案 |
|---|---|
| 任务成功率 | 是否包含物体位置变化、光线变化和陌生物品 |
| 人工接管 | 每小时需要几次接管,谁负责复位 |
| 连续运行 | 能稳定工作多久,而非最佳演示持续多久 |
| 部署成本 | 是否需要改造工位、重采数据、安排现场工程师 |
| 单位经济性 | 完成一次有效任务的总成本,能否低于人工方案 |
如果你正在考虑采购,最现实的动作不是预订一台“通用机器人”,而是先挑一个边界明确、重复频率高、失败代价低的任务做试点。要求供应商提供连续运行记录,并把人工接管和停机时间写进验收条件。
我更在意的也不是下一段更流畅的演示视频。真正的分水岭有三个:模型能否迁移到新场景,人工接管能否持续下降,部署成本能否随着项目增加而下降。
只要每到一个新仓库都要重新采集数据、驻场调试,所谓通用模型仍是一支昂贵的项目团队。机器人“大脑”确实比前几年聪明了,但它的 ChatGPT 时刻,要等普通客户不懂模型也能稳定使用时才算到来。
