第三方评测机构Robocurve用同一套开源代理框架Inspect Robots,让OpenAI的GPT-6 Astra控制YAM机械臂做两件事:把红色积木放进碗里,把圆形拼图片嵌进凹槽。放置任务里,Astra 20次成功19次,成功率95%,对手Anthropic的Fable 5.1只有40%,更早的Fable 5仅1次;Astra单次成本0.94美元、耗时2.5分钟,都比Fable 5.1的2.12美元、6.8分钟低出一截。奇怪的是,OpenAI从没把Astra叫做机器人模型。
放置任务碾压,拼图任务一起卡壳
Astra的优势不是全面的。拼图嵌入任务上,它和Fable 5.1战成平手,都是10%,而且都在触到凹槽的最后一步停住不动——这个细节比放置任务的分差更值得琢磨,后面再说。
| 任务 | 模型 | 完成率 | 单次成本 |
|---|---|---|---|
| 放置任务 | GPT-6 Astra | 95% | $0.94 |
| 放置任务 | Fable 5.1 | 40% | $2.12 |
| 拼图任务 | GPT-6 Astra | 10% | $1.36 |
| 拼图任务 | Fable 5.1 | 10% | $2.18 |
Astra的正职是电脑操作和网络安全,不是机械臂
GPT-6 Astra于2026年9月3日发布,OpenAI给它的官方定位是通用型电脑操作、浏览、编程、网络安全和科研模型:API定价每百万token输入10美元、输出50美元,上下文窗口105万token,还是OpenAI首个在Preparedness Framework下触及“Critical”网络安全能力门槛、并被广泛部署的模型。这份系统卡和发布材料里,完全找不到“机器人操控”四个字。
Robocurve做的事,是把这个跟机械臂毫无官方关系的通用大模型,套进Inspect Robots这套代理策略里,硬塞进机械臂控制的角色。它能跑通,本身就是一次意外的能力泛化展示,而不是厂商官宣的产品能力验证。
通用模型越界干活,比专用模型精进更值得追问
如果这个结果站得住,它挑战的其实是行业里一个默认前提:机器人操控需要专门训练的VLA模型。一个足够聪明的通用大模型,配上合适的代理框架,好像也能干。这个判断的分量,远大于两家公司谁分高分低。
这份成绩单的地基并不厚实
同一评测团队此前测试Fable 5.1时,自己承认过几个硬伤:只用了单一测试台,没做物体位置随机化;打分由单一人工评分员完成,没有交叉校验;披露的token是线路层请求响应数据,不是计费token,所谓“每次运行成本”本质是估算,精确到分反而容易给人错误的确定感。Fable 5还在18/20的放置试验里耗尽了20次调用上限——它输得难看,可能一部分是被调用次数卡住了脖子,不完全是能力问题。
- 风险.这些局限没有理由在这次Astra对比里消失——单台测试、单人评分、成本估算的问题原样保留,读者拿这份表格当“Astra全面领先”的铁证,风险不小。
拼图卡在同一步,说明瓶颈可能不在语言模型
真正有意思的信号,是拼图任务里两个模型都停在完全相同的最后一步:够到凹槽,但插不进去。如果差距纯粹来自推理能力,Astra在放置任务上的优势应该延续过来,但它没有。这更像是共享的物理瓶颈——末端执行器的精度、视觉定位的误差——卡住了所有基于当前范式的模型,而不是语言模型本身谁更聪明。
对押注专用机器人模型的创业公司来说,这个结果值得盯,但盯的不该是“通用模型要来抢饭碗”,而是“标准化的代理框架正在让跨模型比较变得容易”,游戏规则本身在变。对OpenAI而言,这只是一次意外的数据点,没有任何迹象表明Astra会被正式推向机器人赛道;对Anthropic来说,Fable在放置任务上输得明显,但拼图任务的平手说明它没有全面掉队。接下来该看的,是Robocurve会不会换个测试台、加大样本量、引入独立评分,把这个结论重新跑一遍。
