OpenAI在自家博客披露一组对比数据。GPT-5.6 Sol在ARC-AGI-3的公开任务子集上,只改了两个API设置,得分从13.3%涨到38.3%,输出token降到约六分之一。
这组数据能说明的是:公开跑分很大程度上取决于评测框架怎么配置,而不只是模型能力强弱。它不能证明模型本身没有短板——这是OpenAI自己搭的测试环境,不是Arc官方或第三方复核的结果。
13.3%到38.3%:两个口径不能混着看
GPT-5.6 Sol在ARC-AGI-3全部任务上的官方成绩是7.8%,上一代GPT-5.5只有0.4%。这次实验测的是其中的公开任务子集,跟7.8%不是同一个口径,不能直接换算。
| 测试框架 | 分数 | 说明 |
|---|---|---|
| 官方通用框架 | 13.3% | 公开任务子集,丢弃推理+滚动截断 |
| Responses API生产配置 | 38.3% | 保留推理+compaction,输出token降至约1/6 |
| 人类测试者平均(估算) | 约48% | RHAE基线,据官方人类测试日志推算 |
38.3%离人类水平近了不少,但还没追上。RHAE衡量的是智能体摸索规则的效率,不是简单的通关率。
分数翻三倍的是框架,不是模型的推理能力——OpenAI没改模型一行代码。
保留推理和compaction,为什么差距这么大
官方通用框架每走一步,就把模型这一步的私有推理全部丢掉。模型能看到自己做过什么,看不到当时怎么想的。结果是每走一步都要重新猜规则。
Responses API只要传入上一次的response ID,就能让推理状态跨轮保留。这里的“保留推理”只是模型内部记住自己的思考过程,不是把思维链展示给用户看。
官方框架的上下文超过17.5万字符,就直接砍掉最早的记录,模型对游戏前期摸索出的规律会跟着失忆。compaction换成保留关键信息的压缩方式处理超限上下文,模型记性更好,也不用总在快满的上下文里工作——这也是输出token降到六分之一的原因之一。
| 维度 | 官方通用框架 | ChatGPT/Codex生产配置 |
|---|---|---|
| 设计目标 | 统一,方便跨模型比较 | 贴近真实产品体验 |
| 推理状态 | 每步丢弃 | 跨轮保留(传入response ID) |
| 超限上下文处理 | 滚动截断,砍最早记录 | compaction,保留关键信息 |
| 本次得分 | 13.3% | 38.3% |
Arc官方坚持用统一框架,理由是这样能让不同模型的比较更公平,也更容易暴露短板。OpenAI在ChatGPT和Codex里从不这么裸跑模型,会针对每个模型专门调设置。两种思路都有自己的道理,这次实验只是把差距第一次量化摆了出来。
OpenAI在文章里还提到一个例子:研究者Ethan Mollick近期在Codex里,让GPT-5.6 Sol通关了一款训练数据截止之后才发布的游戏《Slay the Spire 2》的每日挑战。针对模型特性调好的生产配置,和为了公平刻意做成统一、不带工具的评测框架,展现出来的模型能力可能完全是两回事。
对开发者和评测团队意味着什么
用OpenAI API搭智能体的开发者,如果还在用老的Chat Completions API,这两项设置用不了,得先迁移到Responses API。迁移后要传入response ID串联多轮对话,让推理状态跨轮保留——这意味着服务端要保存更多会话状态,对数据留存有要求的场景,得先确认好留存策略。输出token降到约六分之一,不代表账单跟着降到六分之一,原文没给完整的输入token消耗和推理成本,别急着按这个比例做预算。
模型选型和评测团队,拿一个所有厂商通用的简化框架跑分,测出来的可能不是模型的真实水平,而是这个框架本身有多"较真"。更现实的做法是同时保留两组分数:通用框架的分数用来横向比模型,贴近生产配置的分数用来估算模型部署后的实际表现。只看一个数字做采购决定,容易被框架本身的设置带偏。
别把38.3%当成GPT-5.6在ARC-AGI-3上的"官方成绩"到处引用。它只是公开任务子集在特定生产配置下跑出的数字,不是Arc官方或第三方复核结果,也不能直接理解成模型推理能力真的提升了三倍。
接下来值得盯的,是Arc官方要不要针对生产级配置也出一条对照榜单。如果只有OpenAI自己公布这组数字,模型之间还是没法在同一把尺子上比。
