OpenAI在自家博客披露一组对比数据。GPT-5.6 Sol在ARC-AGI-3的公开任务子集上,只改了两个API设置,得分从13.3%涨到38.3%,输出token降到约六分之一。

这组数据能说明的是:公开跑分很大程度上取决于评测框架怎么配置,而不只是模型能力强弱。它不能证明模型本身没有短板——这是OpenAI自己搭的测试环境,不是Arc官方或第三方复核的结果。

13.3%到38.3%:两个口径不能混着看

GPT-5.6 Sol在ARC-AGI-3全部任务上的官方成绩是7.8%,上一代GPT-5.5只有0.4%。这次实验测的是其中的公开任务子集,跟7.8%不是同一个口径,不能直接换算。

测试框架分数说明
官方通用框架13.3%公开任务子集,丢弃推理+滚动截断
Responses API生产配置38.3%保留推理+compaction,输出token降至约1/6
人类测试者平均(估算)约48%RHAE基线,据官方人类测试日志推算
同一模型,三种分数 官方通用框架 13.3% ARC-AGI-3公开任务集 丢弃推理+滚动截断 Responses API设置 38.3% 保留推理+compaction 输出token降至约1/6 人类测试者平均 约48% RHAE基线(估算) 官方人类测试日志推算 指标:RHAE(相对人类行动效率) · 均为GPT-5.6 Sol,同一批公开任务

38.3%离人类水平近了不少,但还没追上。RHAE衡量的是智能体摸索规则的效率,不是简单的通关率。

分数翻三倍的是框架,不是模型的推理能力——OpenAI没改模型一行代码。

保留推理和compaction,为什么差距这么大

官方通用框架每走一步,就把模型这一步的私有推理全部丢掉。模型能看到自己做过什么,看不到当时怎么想的。结果是每走一步都要重新猜规则。

Responses API只要传入上一次的response ID,就能让推理状态跨轮保留。这里的“保留推理”只是模型内部记住自己的思考过程,不是把思维链展示给用户看。

官方框架的上下文超过17.5万字符,就直接砍掉最早的记录,模型对游戏前期摸索出的规律会跟着失忆。compaction换成保留关键信息的压缩方式处理超限上下文,模型记性更好,也不用总在快满的上下文里工作——这也是输出token降到六分之一的原因之一。

维度官方通用框架ChatGPT/Codex生产配置
设计目标统一,方便跨模型比较贴近真实产品体验
推理状态每步丢弃跨轮保留(传入response ID)
超限上下文处理滚动截断,砍最早记录compaction,保留关键信息
本次得分13.3%38.3%
两处开关,改的是什么 官方通用框架 每步动作后 丢弃全部私有推理 上下文超17.5万字符 滚动截断,砍最早记录 模型每步都要重新猜规则 输出token更多 13.3% Responses API设置 传入response ID 推理状态跨轮保留 用compaction压缩 替代滚动截断 模型记得此前学到的规律 输出token降至约1/6 38.3%

Arc官方坚持用统一框架,理由是这样能让不同模型的比较更公平,也更容易暴露短板。OpenAI在ChatGPT和Codex里从不这么裸跑模型,会针对每个模型专门调设置。两种思路都有自己的道理,这次实验只是把差距第一次量化摆了出来。

OpenAI在文章里还提到一个例子:研究者Ethan Mollick近期在Codex里,让GPT-5.6 Sol通关了一款训练数据截止之后才发布的游戏《Slay the Spire 2》的每日挑战。针对模型特性调好的生产配置,和为了公平刻意做成统一、不带工具的评测框架,展现出来的模型能力可能完全是两回事。

对开发者和评测团队意味着什么

用OpenAI API搭智能体的开发者,如果还在用老的Chat Completions API,这两项设置用不了,得先迁移到Responses API。迁移后要传入response ID串联多轮对话,让推理状态跨轮保留——这意味着服务端要保存更多会话状态,对数据留存有要求的场景,得先确认好留存策略。输出token降到约六分之一,不代表账单跟着降到六分之一,原文没给完整的输入token消耗和推理成本,别急着按这个比例做预算。

模型选型和评测团队,拿一个所有厂商通用的简化框架跑分,测出来的可能不是模型的真实水平,而是这个框架本身有多"较真"。更现实的做法是同时保留两组分数:通用框架的分数用来横向比模型,贴近生产配置的分数用来估算模型部署后的实际表现。只看一个数字做采购决定,容易被框架本身的设置带偏。

别把38.3%当成GPT-5.6在ARC-AGI-3上的"官方成绩"到处引用。它只是公开任务子集在特定生产配置下跑出的数字,不是Arc官方或第三方复核结果,也不能直接理解成模型推理能力真的提升了三倍。

接下来值得盯的,是Arc官方要不要针对生产级配置也出一条对照榜单。如果只有OpenAI自己公布这组数字,模型之间还是没法在同一把尺子上比。