一篇刚被ICML 2026收录的论文,把AI圈心里都清楚但没人量化过的事摆到了台面上:分析了60个语言模型基准、用14项跟饱和相关的属性去检验,发现近一半基准已经饱和——分数挤在天花板附近,模型之间分不出高下。更扎眼的是第二个发现:决定一个基准能不能扛住饱和的,不是它的测试集有没有公开,而是有没有经过专家精心策展。这个结论,跟整个行业过去几年的应对思路是错位的。
饱和是怎么发生的
基准饱和不是新话题。MMLU、GSM8K、HumanEval这些老牌基准,这两年被吐槽得最多的就是分数趋同——头部模型跑出来的成绩挤在同一个区间,榜单失去区分度。业内通常把锅甩给训练数据污染:测试题混进了训练语料,模型不是在推理,是在回忆。
这篇论文的价值,是把"饱和"这件事从直觉吐槽变成了可测量的东西。它发现饱和率随基准年龄增长而上升——基准活得越久,越容易被喂饱。这符合直觉,古人讲"其兴也勃焉,其亡也忽焉",用在基准的生命周期上也挺贴切:一个新基准刚发布时区分度极强,厂商蜂拥去刷分,不出两三年,分数就挤到顶,再难分高下。
谁受影响,业界怎么应对的
饱和不是抽象概念,它直接影响三类人:基准设计和维护机构要重新评估策展流程和寿命预期;模型厂商对外宣传的"跑分领先",可能建立在一个早就分不出高下的榜单上;媒体和投资人看榜单做判断时,很容易把噪音当成差距。
过去几年,行业里已经长出一套"抗饱和"设计谱系,几乎清一色朝着一个方向走——把测试集藏起来或者持续更新:LiveBench靠不断发布新题降低污染风险;FrontierMath用专家原创、不公开的数学题配私有评测;GPQA的题目由领域专家撰写并验证;ARC-AGI依赖隐藏评测集;SWE-bench因为刷分争议衍生出更严格的verified版。这套逻辑背后的假设很朴素:测试集公开=会被模型记住=迟早饱和,所以私有化是唯一解药。
论文打的这一拳,打在哪儿
论文的发现恰恰在质疑这个假设。它说:抗饱和能力真正相关的变量是专家策展——题目设计、难度校准、审核机制这些"人工打磨"的环节,而不是测试集是否对外公开。换句话说,一个精心设计、由专家把关的公开基准,可能比一个仓促拼凑的私有基准更耐用。
- 洞见.如果这个结论站得住,"私有化=防饱和"就不是唯一正解,行业里大量为了防泄露而牺牲透明度、增加成本的私有评测方案,价值需要重新掂量。
我不太买账的是把这个发现简单读成"公开基准也能一直用"。论文说的是策展比公开性更能预测寿命,不等于公开性完全不重要——两者更像是叠加因素,而不是互相替代。检索能确认的行业实践,只是外围的印证,不能直接当成论文分析的60个基准清单本身,论文具体判定哪些基准已经饱和、判定标准怎么量化,目前公开材料里还看不清,得等论文披露完整清单和ICML现场讨论。
换个评测方式,也不是万能药
即便认可专家策展的价值,也不该把宝全押在"静态基准换成动态评测"上。Chatbot Arena式的人类偏好投票,常年被批评存在选择偏差、对话术和自信语气的系统性偏好、模型身份不透明、还可能被针对性优化。这说明脱离静态基准转向人类偏好或动态刷新,本身也带着新的系统性缺陷,不是一次性解药。
防泄露治标,策展才是治本,但治本也治不了全部病。
饱和也不完全等同于失效。一个基准分数封顶,可能是设计老化,也可能是模型能力真的超过了它能测出的天花板——这两种情况对厂商和媒体的意义完全不同,前者该换榜单,后者该换一批更难的题。接下来真正值得盯的,是论文能不能公开那份具体的饱和基准清单,以及MMLU、GSM8K这类还在被广泛引用的老基准,会不会因此被正式标注"过期"。
