英国人工智能安全研究所(UK AISI)正式宣布接入 EvalEval 联盟的数据基础设施,将其主导的前沿大模型评测细节与算力配置,完整呈现在 Evaluation Cards 平台中。
这批数据并非一份普通的跑分榜单,而是直接配套了 AISI 首席研究员 Jessica McFadyen 等人主笔的论文《How Inference Compute Shapes Frontier LLM Evaluation》。评测完整记录了 Claude Opus 4/4.5/4.6 与 GPT-5/5.2/5.4 等六款前沿主力模型在 HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0 五项关键基准以及两项网络安全测试(Cyber CTFs、The Last Ones)下的每一步交互轨迹。长期以来,模型研发方习惯用单一静态高分宣示领先,但真实工业场景中,评测结果已演变成受推理代币预算、反馈环境与提示词工具共同驱动的高维函数;当评测不再披露算力代价,所谓跑分便沦为纸面玄学。
算力边际递减与反常的采样陷阱
在很长一段时间里,工业界普遍默认推理时代币用量越大、模型反复思考越多,输出结果就会成比例变强。然而在 AISI 披露的这组跨代对比中,无节制堆砌推理预算很快触及天花板。
在模拟真实软件工程修复的 SWE-Bench Pro 测试中,当单次任务推理预算从约 1600 万 Token 拔高到 3000 万 Token 时,六款模型的平均解题率仅微幅增加了 0.27 个百分点。这意味着消耗近乎翻倍的算力成本,最终仅仅买来统计学意义上的噪音。在数学基准 FrontierMath 上,虽然将预算从 100 万 Token 拉升至 1000 万 Token 换来了 11.67 个百分点的平均提升,但其背后的标准差高达 ±10.99 个百分点,波动剧烈到难以作为可靠工业指标。
更值得注意的是采样机制带来的负收益。行业惯常使用多次采样取并集(pass@10)来掩饰单次推导的失误。在各基准的最大预算阈值下,并行采样带来的平均收益已十分微弱:FrontierMath 上仅从 0.625 升至 0.653,SWE-Bench Pro 从 0.673 增至 0.701,Terminal-Bench 2.0 则从 0.657 攀升到 0.720。但在 FrontierMath 的极限预算测试中,GPT-5.2、Claude Opus 4.6 与 GPT-5.4 甚至出现了 pass@10 准确率反向低于 pass@1 的反常现象。
盲目堆积推理 Token 不但无法买来稳态逻辑,反而会诱发模式崩塌。
这一反直觉的结果直接戳破了单纯依靠算力暴力求解的神话。当推理链条过度拉长,或者在错误路径上多次采样时,模型更容易产生上下文累赘和自相矛盾的验证误差。
从黑盒跑分转向三层评测工程
评测一个大语言模型早已不再是给几道选择题打分的考卷测试,而是演变成分立的三层工程体系。
首先是 AISI 内部运行的 Inspect AI,它构成了底层的执行与沙盒环境,负责记录模型调用终端命令、读写文件和处理工具报错的原始交互日志。其次是 AISI 针对高昂算力成本开发的统计工具层:HiBayES 框架引入分层贝叶斯建模来矫正长尾误差,而自适应早停工具 OptStop 可以在不显著改变最终得分估计的前提下,在 Inspect 评测中直接节省 57% 至 97% 的冗余试验轮次。
最上层的 EvalEval 联盟及其 Every Eval Ever(EEE)模式,则扮演了统一数据契约的角色。此前即使两家机构都公布了 SWE-Bench 结果,也会因为一家接入了外部单测环境、另一家限制了推理 Token 上限而完全丧失横向对比的意义。EEE 规范兼容了 Inspect AI、HELM 和 lm-evaluation-harness 的输出,将繁杂的评测配置转化为包含复现性、完备性、来源追踪与可比性这四维信号的标准化 Evaluation Cards。
截至 2026 年 9 月 21 日,EvalEval 平台已经收录了来自 49 家报告机构的 8,818 个模型与 675,584 条评测结果,覆盖 1,444 个单一基准和 2,689 个切片数据集。评测行业正在搭建一套类似学术临床试验的元数据登记制度。
协议落地后的现实变量
虽然这套标准化工具填补了执行记录与元数据规范的缺口,但它并不等于解决了基准测试的所有顽疾。
AISI 在 2026 年 7 月 16 日修订的论文第三版中明确提醒,其实验采用了固定的题目子集、统一的 ReAct 脚手架架构、特定的上下文压缩算法以及多次重复提交策略。换句话说,即便 Evaluation Cards 能够精确对齐各模型的参数配置,其绝对得分依然不能被直接搬移到第三方公开榜单上去排座次。EEE 模式解决的是评测过程的透明度与可复现性,但基准题目本身的题目泄露、数据污染以及评测指标与现实生产力脱节的问题,并不会因为套上规范的元数据卡片而自动消失。
- 风险.若监管部门将尚未消除方差的基准分数直接作为准入门槛,可能导致模型厂商反向针对固定评测脚手架进行过拟合优化。
对于企业采购方与模型研发团队而言,这套开源机制带来的最直接改变,是刺破了厂商在发布会上单向输出的打榜数字。评估一个新模型的真实代价,必须同步考量它在特定准确率下的算力开销折线;离开推理预算谈性能领先,已经失去参考价值。
