在San Leandro的一个仓库里,训练师戴着头显,从摇摇欲坠的积木塔里抽木块。头显上有摄像头,记录他的第一视角——这在机器人训练数据采集里已经不新鲜。真正让人多看一眼的是,头显里还嵌了脑电传感器,实时记录他抽木块那一刻的脑波。
这是Encord正在跑的一次试验:能不能靠"意图、错误、惊讶"这类脑活动信号,给机器人训练数据打上更有用的标签。目前这只是一次小规模内部测试。数据要先跑过客户的机器人模型看效果,能不能起作用还没定论,公司也没说要不要扩大规模。这次试验真正值得注意的,是它暴露出的老问题:机器人缺的不是又一个模型故事,是能规模化制造的高质量物理数据。
速读:仓库里在造什么数据
Encord原本给机器视觉公司做数据标注和模型评估工具。客户开始用端到端学习训练机器人抓取、操作类任务后,公司发现一个更根本的麻烦:市面上没有足够的训练数据,只能自己动手造。
现在San Leandro基地同时在跑四类数据:
| 数据类型 | 采集方式 | 主要目的 |
|---|---|---|
| 第一视角多机位视频 | 训练师戴摄像头做日常操作,倒咖啡、叠筹码、插拔网线 | 让模型看懂完整操作过程 |
| 主从遥操作机器人 | 一台机械臂由人直接控制,另一台跟着模仿 | 采集机器人视角的动作数据 |
| 肌电信号 | 手臂绑传感器,捕捉肌肉电活动 | 补上摄像头拍不全整只手的细节 |
| 脑波试验 | 与德国公司Zander Labs合作测脑活动状态 | 试验能否判断该调用更高算力推理 |
每段视频还配密集动作标注,比如"右手拧紧螺栓",方便基于大模型的机器人系统理解画面里发生了什么。
数据不是抓来的,是造出来的——谁会因此改主意
物理AI常被拿来跟大语言模型比。LLM靠抓取整个互联网文本起家,边际成本很低,大部分开销是抓取和清洗,不需要额外付费雇人。机器人操作数据没有这样的"互联网"可抓:自动驾驶公司自建数据尚且难规模化,纯视频又缺真实世界的精度和触感反馈。
Encord机器人学习负责人Vineeth Velmurugan估算,想真正突破这道墙,需要接近YouTube视频语料五倍的数据体量。这不是行业公认数字,只是他基于团队观察给出的判断,但方向明确:数据规模要求已经从"大"变成"巨大"。
更贵的是密集标注。Velmurugan估算,标注完整的密集动作数据,价值可能是粗糙第一视角数据的100倍,生产成本也要高出约20倍——这组数字同样来自他一人的估算,不是外部审计或第三方验证的结果。账面上看划算,但这仍是真金白银,要在现实世界里一段一段花出去。
对机器人和物理AI从业者,这意味着采购这类数据前,最好先等客户机器人模型跑出验证结果,而不是先押注脑波标签这类还没证明有效的新变量。对关注AI基础设施和商业模式的读者,值得盯的不是模型发布会,是谁能把物理数据的采集成本压下来——这才是决定谁能规模化训练机器人的真实门槛。
这套逻辑最先压在人形机器人公司、仓储自动化厂商,以及想让机械臂精细操作数据中心线缆的团队身上。任务精度要求越高,越依赖这类专门制造出来的数据,越难靠爬取现成素材解决。
接下来看什么
真正决定进度的,是三个还没有答案的问题:客户机器人模型跑Encord数据后效果如何、脑波标签能不能重复出可验证的性能提升、密集标注的成本能不能随规模摊薄。这三项目前都没有公开结果。
脑波标签目前只是一次未经验证的试验,Encord自己也没说它已经证明能提升机器人表现,更谈不上"读心"——它测的是大脑活动整体强弱,不是具体想法。数据稀缺不代表模型架构不重要,两者更像同一道墙上的两块砖,谁先垒好,谁先决定进度。
