第三方评测机构Artificial Analysis这两天更新了它的Intelligence Index——业内用来给大模型排座次的主流榜单之一。这次更新叫v4.2,距离v4发布才过去8个月。最扎眼的改动是:私有held-out测试集的权重从v4.1翻了一倍,升到40%。同时新增两个评测——考察多周知识工作能力的AA-Briefcase,和跨4592页PDF的长文档推理测试GDP.pdf,顺手把已经被"刷穿"的GPQA Diamond请出了榜单。

结果上,Claude Fable 5.1继续领跑,GPT-6 Astra紧随其后,比上一代GPT-5.6 Sol涨了4分,在AA-Briefcase上更是跳了约85个Elo点。听起来是一次教科书式的"防作弊升级"。但拆开看,这次更新暴露的问题,可能比它解决的问题更值得聊。

私有化挡住了什么,又挡不住什么

评测圈这些年一直在跟"古德哈特定律"死磕:一个基准一旦被当成优化目标,它就不再是好的度量工具。GPQA Diamond的饱和就是活案例——分数涨得太快太齐,说明模型早就在训练环节吃透了它的套路。SWE-bench、ARC-AGI这些同行的解法都是同一个方向:把测试题藏起来,不公开答案,防止训练数据里混进考题。

AA这次把held-out权重拉到40%,逻辑也是这套。问题在于,secrecy解决的是"抄答案"这一种作弊方式,解决不了另一种:实验室可以反复提交不同版本、不同推理强度、不同工具链配置,靠榜单反馈一点点调优模型在这几个私有测试集上的表现。这种"自适应过拟合"不需要看到答案,只需要看到分数就够了。AA自己的方法论文档也承认这一层风险——只是原文没展开讲。

  • 风险.私有化只是把作弊的门槛从"训练数据污染"挪到了"反复提交调参",而不是真正消除了刷分空间。

GDP.pdf的"私有"标签,和它公开的事实

这次最有意思的反差出现在GDP.pdf身上。文章把它和AA-Briefcase并列,归为"private test sets to prevent gaming"的阵营。但GDP.pdf是Surge AI做的,它的100个PDF任务、提示词和评分标准是完全公开发布的,压根不是私有集。

那它26%到33%的低通过率是从哪来的?答案藏在它的筛选设计里:GDP.pdf刻意只保留"至少两个前沿模型失败"的对抗性难题子集。换句话说,这个分数低不是因为模型处理专业文档的能力普遍差,而是题目本身是从一堆题里挑出来专门"卡"模型的那部分。拿这个分数去推断"AI处理长文档能力薄弱",是在错读一个精心设计的筛子。

GDP.pdf:叫"私有防刷榜",实为公开对抗集 文章里的叙事 归类为"private test set" 用于"防止gaming" 低分=模型能力有限 实际情况 100个PDF+评分标准全公开 题目经"两模型以上失败"筛选 低分=难题被刻意挑出来

AA自己复现GDP.pdf时也没有照搬Surge的原始协议——用了自家的LiteParse预处理文档,给视觉模型加了页面图像,允许五次尝试,还用特定的GPT模型来打分。AA自己的说明也提到,这套结果不能直接和Surge的原始榜单互换。评测的评测,同样存在方法论选择空间,这一层原文没有细说。

谁是"最强",要看你问的是哪个维度

榜单上另一个容易被忽略的地方是:GPT-6 Astra在Cost per Task帕累托前沿和token效率前沿上表现突出,原文把它包装成一次全面反超。但外部检索到的独立榜单快照(标注版本为v4.1.1,和文章的v4.2存在版本出入)显示,在相同智能分数区间里,GPT-5.6 Sol的成本效率反而明显更优。

这不是说谁在造假,而是"综合智能分第一"和"每单位成本产出的智能"本来就是两把不同的尺子。企业采购团队如果只看榜首头衔,很容易把"分数最高"直接等同于"最该买",却漏掉了成本这条线。

榜首会变,尺子的口径不变才是关键

版本号从v4到v4.1再到v4.2,8个月里改了三轮,AA自己也预告v5会进一步提高held-out占比。对企业技术决策者来说,这意味着任何一次"跑分快照"都只是某个时间点、某个版本口径下的结果,拿去做长期选型对比,风险不小于拿一份过期的价目表去谈判。评测机构在追前沿模型的速度,前沿模型也在追评测机构的漏洞,两边其实都在打同一场指标优化的仗。