上周OpenAI发布了GPT-6 Astra,官方定位是全球最智能、最对齐的模型,已经进驻ChatGPT Work、Codex和API。发布稿里最抓人的三个数字是:Excel建模速度比2023年微软Excel世界锦标赛冠军快四倍,Terminal-Bench 4.0跑分57.9%,内部安全基准上"意外操作"比上一代GPT-5.6 Sol少89%

单看这几个数字确实漂亮。但把它们和独立评测机构、竞品Claude Fable 5.1的成绩放到一起,故事没那么单边——Artificial Analysis Intelligence Index上两者是53:53的平局,这不是全面领先,更像是两个各有专长的旗舰模型打了个平手。

发生了什么:computer use成了新战场

Astra的卖点不是聊天能力,是"计算机操作"——直接在没有API的桌面应用、浏览器、Excel里点击、输入、执行任务。这是OpenAI和Anthropic争夺企业"数字员工"市场的核心战场,此前GPT-5.6 Sol、Fable 5.1已经在OSWorld、Terminal-Bench等agent基准上交过手。

OpenAI这次给出的OSWorld 2.0成绩是72.6%(约40分钟/任务),对比自家上一代Sol的65.7%(约75分钟/任务)。但这只是同门对比,Fable 5.1用的是不同版本的任务集,没法直接横评。"最强计算机操作模型"这句话,证据链目前只完成了一半。

独立跑分:互有胜负,不是碾压

谁真的领先:互有胜负 GPT-6 Astra Terminal-Bench 4.0 57.9% OSWorld 2.0(自家对比) 72.6% ARC-AGI-3头条 99.9% Claude Fable 5.1 LMArena Agent #1 14.51% GDPval-AA v2 1764 SciCode 63% HLE工具模式 65.0% Artificial Analysis Index 53 : 53 平局

Astra在Terminal-Bench 4.0、OSWorld(自家对比)上领先;Fable 5.1在LMArena agent榜、GDPval-AA v2专业知识工作评测(1764对1580)、SciCode(63%对56%)、Humanity's Last Exam工具模式(65.0%对57.2%)上都跑赢Astra。两家公司都在选择性展示对自己有利的基准,这在行业里不算新鲜事,但只看OpenAI官网的读者,会以为Astra是单边领先。

官方发布稿讲的是排名第一,独立跑分讲的是势均力敌。

定价迷思:真正省钱的是被忽略的那一款

定价迷思:标准价一样,缓存价差4倍 标准价格相同 $10 / $50 Astra = Fable 5.1 Sol只要 40% $4 / $20,原文几乎没提 缓存价格 × 4 Fable 5.1 $0.25 vs Astra $1

OpenAI发布稿说Astra"占据成本效率前沿的大部分份额",暗示它比Fable 5.1更划算。但标准API价格上,两者完全一样:每百万输入token 10美元、输出50美元。真正便宜四成的,是原文几乎没提的GPT-5.6 Sol,输入输出价格只要4美元和20美元。

如果任务是重复调用、长上下文缓存命中率高的场景,Fable 5.1的缓存输入价格是每百万token 0.25美元,只有Astra(1美元)的四分之一。OpenAI每千次工具调用还要另收2.5美元,截图也按模型token价格计入输入成本——真实账单可能比宣传价高出不少(Anthropic的computer use工具本身也有开销,一次初始化的工具定义就要消耗约4500个输入token,按Fable 5.1费率算已经接近0.045美元,还没算截图和输出)。

  • 结论.任务复杂度决定该用哪个模型,不是厂商的排名话术。默认路由用便宜的Sol,只有真正复杂的多步骤任务才交给Astra或Fable 5.1。

满分成绩的水分,和一句轻描淡写的警示

Astra在ARC-AGI-3上打出99.9%的头条成绩,接近满分。但在标准复现测试里,这个数字掉到62.7%——说明"近乎满分"高度依赖OpenAI自己设定的测试配置,换一套复现方式就打回原形。

ARC-AGI-3:换个测法,成绩腰斩 头条配置 99.9% 标准复现 62.7%

发布稿里还有一句容易被划过去的话:Astra是第一个触及OpenAI《预备框架》"关键网络安全能力阈值"的模型。这句话被包装成"我们加强了防护"的正面叙事,但反过来读,字面意思是这个模型的网络攻击能力,已经强到需要被单独列入高风险管控名单。OpenAI提到了训练模型遵守安全边界、提升抗绕过能力、部署自动化拦截等措施,这些防护有没有经过外部审计,原文没有交代。

  • 风险.computer use直接操作真实业务系统,一旦权限判断失误,误删数据或越权分享面板的代价由企业自己承担。

谁该盯紧这件事

企业采购决策者面对的不是"要不要上Astra",而是"用哪个模型跑哪类任务"。安全和合规团队要关注的不是Astra变强了多少,而是它被列入关键网络安全能力阈值之后,新推出的管理员权限控制——限制网站/应用访问、管理上传下载——能不能真正兜住computer use在真实系统里越权操作的风险。这一点目前还看不清,只能等更多企业实际部署后的反馈。