OpenAI公布了GPT-6 Astra,并开始向少量组织开放。接下来几天,ChatGPT Plus、Pro、Business、Enterprise用户,以及API和AWS渠道都将陆续获得访问权限。API价格定在输入每百万Token 10美元、输出每百万Token 50美元,与Claude Fable 5和5.1的报价相同。
这款模型最抢眼的数字是ARC-AGI 3的99.9%。但这个数字不能脱离测试方式单独阅读:ARC Prize披露的结果显示,Astra使用OpenAI定制的“Provider Adapter harness”时达到99.9%,花费约1.9万美元;换回默认测试框架,成绩降至62.7%,花费反而约2.6万美元。真正值得报道的变化,不是“模型突然接近满分”,而是模型本身与运行框架的边界,已经成为评测结果的一部分。
Astra的优势很明确:复杂编码、安全任务和长上下文
OpenAI公布的材料把Astra定位成高价、高能力模型,重点落在几个需要持续推理的场景:
| 测试或指标 | GPT-6 Astra | 对照结果 | 备注 |
|---|---|---|---|
| ARC-AGI 3,Provider Adapter | 99.9% | 默认框架62.7% | 两种测试框架,成本分别约1.9万美元和2.6万美元 |
| ExploitBench | 100% | GPT-5.6 Sol为78.5% | OpenAI披露 |
| ExploitGym | 42.4% | GPT-5.6 Sol为30.3% | OpenAI披露 |
| SRE-Bench二进制逆向,四次内 | 99.2% | GPT-5.6 Sol为68.7% | OpenAI披露 |
| OpenAI八针长上下文测试 | 256K–512K为100% | — | 512K–1M为96.3% |
这些成绩说明,Astra至少把资源集中在了几个高价值难题上。
安全任务的提升尤其明显。ExploitBench达到100%,SRE-Bench在四次尝试内达到99.2%,这类表现对安全研究、漏洞分析和运维自动化团队有现实吸引力。长上下文成绩也很强:在OpenAI自己的八针测试里,256K到512K Token区间保持100%,512K到1M区间仍有96.3%。
但这里有一层容易被忽略的条件。上表中的安全成绩和长上下文成绩主要来自OpenAI披露,第三方对Astra的独立实测还不足。原始信息的作者也明确表示,自己尚未拿到模型进行体验。因此,读者现在能确认的是“公开测试结果很强”,还不能确认它在真实代码库、企业文档和长时间运行中同样稳定。
99.9%背后,评测框架也在参与推理
Provider Adapter并非普通的测速外壳。ARC-AGI的说明称,它会在多次请求之间保留不透明的推理状态,并通过压缩处理更长的对话,让模型能够复用此前的工作。
这会改变测试的含义。
如果一个任务允许系统保留中间推理、压缩上下文、反复调用模型,那么测到的就是“模型加记忆机制、状态管理和调用策略”的综合能力。对真实的Agent产品来说,这种组合当然有价值;开发者本来就会使用缓存、上下文压缩和多轮重试。把这些能力排除在外,反而未必符合产品现实。
问题在于,99.9%这个数字很容易被公众理解成“裸模型能力”。而默认框架的62.7%说明,Astra的成绩对运行方式高度敏感。两者相差37.2个百分点,已经不是小幅波动。它更适合被写成“OpenAI配置的一套推理系统在ARC-AGI 3上达到99.9%”,不适合直接写成“Astra本体达到99.9%”。
这也是它和上一代GPT-5.6 Sol、以及Claude Fable 5之间最重要的比较限制:
- OpenAI称Astra在多数自报基准上高于Fable,但这些结果首先是厂商自己的测试。
- Artificial Analysis的Intelligence Index给Astra打出61分,与GPT-5.6 Sol相同,比Claude Fable 5.1的最高配置低5分。
- 在Coding Agent Index中,Astra的最高推理力度与GPT-5.6 Sol成本大致相当,分数高2分;按任务计算,报道认为它达到与Claude Fable 5相近的成绩,但成本不到后者一半。
这组结果没有导向“谁全面胜出”。它更像是两种产品取向的对照:Astra试图把高强度编码Agent的单位任务成本压下来,Fable 5.1在综合智能榜单上仍占上风。榜单的配置、fallback、任务分布和延迟数据没有完全展开,采购团队不能只拿一个分数作结论。
对开发者和企业,先试用再迁移
对安全团队、逆向工程人员和大型代码库维护者,Astra值得进入测试清单。尤其是那些已经在使用Agent、愿意接受多轮调用,并且按任务结果而非单次请求计费的团队,Provider Adapter体现的状态复用能力可能比裸模型跑分更有用。
但动作不应是立刻替换现有模型。更稳妥的做法是拿自己的任务做一轮小规模对照:
- 同一批代码修复、测试生成和故障排查任务,分别跑Astra、Claude Fable 5和现有模型。
- 同时记录成功率、重试次数、响应延迟和总Token消耗。
- 把“默认API调用”和“带状态复用的Agent流程”分开核算。
- 对安全场景增加人工复核,避免把高分误当成可直接上线的自动化权限。
价格也需要按完整任务成本理解。Astra的API报价是输入每百万Token 10美元、输出每百万Token 50美元。输出价格是输入价格的5倍;如果Agent反复生成长代码、分析报告或修复方案,账单增长会很快。一次任务便宜,不等于整个工作流便宜。
普通ChatGPT订阅用户则不必因为99.9%立刻升级。模型会在Plus、Pro、Business和Enterprise中逐步开放,但具体使用额度、默认模型切换方式和高峰期延迟,公开信息还不够完整。真正影响日常体验的,往往是这些细节,而不是实验室里最漂亮的那一列数字。
Astra目前最可信的判断是:它可能是一个很强的编码和安全Agent组件,也可能是OpenAI用系统工程把模型成绩推到高位的一次展示。两者并不矛盾。接下来最该看的,是独立测试能否复现高分,以及默认API在真实任务里的成功率、延迟和总成本。若只能靠定制框架维持领先,99.9%会留在发布会材料里;若普通开发者也能稳定获得接近的结果,Astra才算真正改变了模型采购的账本。
