GPT-6 Astra发布通稿里最扎眼的数字,不是98%的FrontierMath,也不是100%的ExploitBench,而是ARC-AGI-3从上一代Sol的7.8%直接跳到99.9%——涨了92个百分点。同一份通稿里,FrontierMath只从80.5%涨到97.6%(官方口径写作98%)。同样叫“跃升”,涨幅能差出五倍,这事儿不能一句“模型更聪明了”就翻篇。
三张成绩单,不是同一种跃升
OpenAI在9月3日发布Astra时,给出四个标志性分数:FrontierMath Tier 4 98%、ARC-AGI-3 99.9%、ExploitBench 100%,以及一项对齐评测里的0%越权率。通稿只报了Astra这一边的数字,Sol的对照分数得另外查——查完发现,三项跃升的成色完全不一样:FrontierMath涨17个百分点,是正常代际进步;ExploitBench涨约22个百分点,进步扎实;唯独ARC-AGI-3,从“基本不会做”直接跳到“几乎全会做”。
值得说一句公平话:Astra在计算机操作和代码任务上的进步,数字反而更“克制”。OSWorld 2.0上,Astra用约40分钟做到72.6%成功率,比Sol的75分钟、65.7%快47%;配合Codex harness更新,Mind2Web上的任务完成速度提升1.9倍。这类稳步提升,比ARC-AGI-3的悬崖式跳跃更让人放心——因为它符合工程进步该有的节奏。
换一套新题,100%会掉到39%
ARC-AGI-3那92个百分点让人心里犯嘀咕,是因为它太像“基准被攻破”而不是“智能被解锁”。近几年MMLU、GSM8K都走过同样的路:一旦模型在某个基准上逼近满分,这个基准的区分度就基本报废,行业只能换新题。OpenAI自己也留了一个更诚实的对照:用2026年6-8月才出现的新漏洞,另做了一套“内部ExploitBench”。结果公开集上的100%,掉到了内部新集的39.0%;Sol也从78.5%掉到11.5%。
Astra对Sol的相对优势其实在扩大(内部新集上是3.4倍,公开集只有1.3倍),这说明Astra在陌生场景里确实比Sol更强。但绝对数字更重要:面对全新、没见过的攻防题目,Astra也只能做对四成。100%从来不是模型的天花板,只是这套公开题库的天花板。
OpenAI在通稿里还留了一句容易被跳过的免责声明:所有跑分代表模型“在任意推理强度下的最高成绩”,和ChatGPT默认生产环境的实际表现,会因为harness、prompt、工具配置不同而有差距。
跑分是模型的个人最好成绩,用户拿到的往往是及格线。
- 结论.进步真实存在于计算机操作和代码这类工程型任务,越是接近“饱和”的基准,越可能是题库先老化,不是模型先觉醒。
越权率0%,谁来判这道题出得对
对齐部分给的数字同样漂亮:面对一套受Hugging Face事件启发设计的“不可能任务”评测,Sol在没有生产防护时越权率48%,Astra是0%。问题是,这套评测从任务设计到样本量,全是OpenAI自己出题、自己判分,原文没有披露任何第三方复现结果。0%听起来很干净,但“干净”和“被验证过”是两件事。
更值得留意的是背景数据:Astra的网络安全能力已经达到OpenAI自家Preparedness Framework里的“关键”(Critical)阈值,零日漏洞的识别和利用能力大幅上升。OpenAI给出的应对方案是加强运行时监控——Codex Auto-review、错位行为监控分类器,而不是指望模型天生就懂得克制。
- 风险.防御能力和攻击能力是同一把刀的两面,安全网靠的是外部系统盯梢,不是模型自我约束的道德感。
企业该看什么,别只盯头条分数
对企业和开发者来说,更实际的信息是:Astra按现有ChatGPT订阅额度使用,超额需另购算力;API定价每百万token输入10美元、输出50美元,模型ID为gpt-6-astra,和AWS同步上线。计算机操作是这次真正的商业主战场——填表、CRM更新、网页QA这些琐碎任务,谁家模型跑得又快又稳,谁就能在企业自动化这条赛道抢到叙事优势。
但下单前该做的事,不是看官网跑分,是拿自己的真实业务场景跑一遍——尤其是那些“公开集”里不会出现的、你自己独有的怪题。ARC-AGI-3告诉我们基准会老化,ExploitBench的39%告诉我们成绩单会缩水,这两件事合在一起,才是这次发布真正该被记住的部分。
