Benchmark Radar统计了32份frontier模型的model card,覆盖11家机构、79个基准,报出一串听着很唬人的数字:Arena-Hard最高分95.6,满分100,只剩4.4分头部空间;MATH-500最高98分,只剩2分;DeepSeek自家模型26天内AIME从39.2冲到79.8,涨了40.6分。乍看像是模型正在逼近能力天花板。

还有一组数字更耐人寻味:BrowseComp、MRCR、SWE-bench Pro等6个基准被至少4家机构采用,却没有一份文档能读出验证分数——BrowseComp被11家提到,分数依旧空白。报告了不代表可比,可比了也不代表基准本身没坏,这才是这份统计真正该被追问的地方。

头部空间还是尺子钝了

2026年一项针对60个大模型基准的系统研究发现,近一半基准已出现饱和迹象,越老的基准越容易饱和,光靠不公开测试集也拦不住。MATH-500是2021年MATH数据集里抽出的500题老题,同年一项训练语料分析发现,某实验室的数学训练数据里与MATH-500精确或近似重合的比例高达76.6%。这不能证明每个模型都被这么污染,但足以说明这道题混进训练管线有多容易。剩2分头部空间,更像是题目见得太多,而不是能力逼近上限。

Arena-Hard同理。它的v2版本靠GPT-4.1、Gemini 2.5这类LLM当裁判打分,本质是"裁判偏好一致度",不是客观能力指标。裁判偏好一旦稳定,头部空间自然收窄,这跟模型是否真的更聪明是两回事。

DeepSeek那40.6分的跳跃也该打个问号。AIME一年只有I、II两场,各15题,合起来30题,单题正确率变化就能造成6.67或3.33个百分点的波动。这一跳里有多少是真实进步、有多少是小样本噪声,统计本身给不出答案。

剩余头部空间,还是尺子钝了 4.4分 Arena-Hard空间 LLM裁判打分 2分 MATH-500空间 2021年老题 76.6% 训练语料重合率 2026年研究

报告了,不等于能比

Benchmark Radar的统计单位是"文档提没提到某个基准",不管厂商测的是同一件事还是同名不同物。这恰恰是frontier model card体系最大的坑。

OpenAI在GPT-5.6 System Card里明确写了:评测协议、评分标准一变,新旧分数就不可比,这是少见的主动认怂。Google DeepMind的Gemini 3.6 Flash model card附带独立方法论说明页,是几家里做跨厂商对比最干净的一份。

对比之下,Anthropic曾在Claude Sonnet 5发布后修正过一版BrowseComp图表,原因是方法论跟自家标准的千万token agentic-search设置不一致——连头部实验室自己都会在同一基准上用错设置。Qwen3.6-27B的SWE-bench Pro成绩用的是自行"修正"过的任务集,具体清单没公开,外界既没法复现,也没法拿去跟别家比。DeepSeek-V4 Pro/Flash的model card表格铺得很宽,三种推理模式都报了分,但安全、偏见、红队测试这类披露明显更薄。

报告了,不等于能比 Anthropic BrowseComp图表 方法论不一致 发布后被修正 标准是千万token agentic-search Qwen SWE-bench Pro成绩 任务集经refined 清单未公开 Qwen3.6-27B 外界难复现
报告了同一个基准名字,不代表在量同一件事。

谁在信这份表,接下来该看什么

还有一层这份统计自己也没说清楚:Benchmark Radar究竟怎么界定"11家机构",32份文档具体是哪些,这些方法论细节目前很难在公开渠道独立核实。孔子说"名不正,则言不顺",放到基准报告上,同一个基准名字下测的是不是同一件事,统计者自己有没有把方法交代清楚,都在这四个字管的范围里。

  • 风险.采购和选型如果只看"报告了几个基准""分数多高",很容易把饱和度当成公信力,把统计噪声当成进步。

真正值得盯的,是那些还没被玩坏的新基准:APEX-Agents目前只有3家机构报告,AutomationBench、DeepSearchQA、PostTrainBench各2家,都还在早期扩散阶段,区分度大概率还在。它们能不能撑过厂商定制化和裁判依赖这两关,比GPQA Diamond这种10家机构都报的"标准答案"更值得追踪。

饱和基准 vs 新兴基准 GPQA Diamond 10家 Terminal-Bench 8家 HLE 8家 SWE-bench V. 8家 APEX-Agents 3家 AutomationBench 2家
  • 结论.厂商自证体系下,报告频次是公关行为的产物,可比性和抗污染能力才是真正的稀缺品。