一个模型越聪明,在某个"安全基准"上的分数反而越低——这不是错觉。Ai2(Allen Institute for AI)在BenchMIRT这项新研究里发现,WMDP这个专测危险知识的基准,得分主要跟通用推理能力挂钩,而且方向是反的:推理越强,分数越低。原因很简单,这个基准把"答不出来/拒答"算作正确答案,越聪明的模型越容易看穿题目在试探什么,答得越"漂亮",反而扣分。
这戳破了一个业内心照不宣的假设——基准叫什么名字,就测什么能力。BBQ叫偏见基准,HarmBench叫有害性基准,大家默认分数越高就是越"安全"。BenchMIRT用心理测量学的老工具,把这个假设翻了个底。
BenchMIRT 在测什么
BenchMIRT的方法来自项目反应理论(IRT),这套东西最早用来分析考试题——不是每道题信息量都一样,有些题目更能把强者和弱者分开。Ai2把它升级成多维版本(MIRT),用100个开源模型、16个基准、超过34,000道题的作答数据训练。
关键是,研究团队没有提前告诉模型哪个基准测什么。结果它自己从数据里独立恢复出两个主导维度:安全性和通用推理。重复跑几次,这两个维度都稳定出现,不是一次偶然的统计巧合。
对大多数基准,结果和预期一致:推理类题目对应推理维度,越狱类题目对应安全维度。但对另一批基准,结果对不上。
三个被拆穿的案例
BBQ测的是模型是否依赖社会刻板印象,常年被归进安全套件。BenchMIRT发现,它的得分跟通用推理的相关性明显强于安全维度——低分很可能是没读懂题、没理清人物关系,而不是真的存在偏见。
WMDP更极端。它测的是生物、化学、网络安全领域的危险双用知识,BenchMIRT测出它的分数主要由推理驱动,而且方向反常:模型越会推理,越容易识破题目意图,选择"拒答",于是"安全分"反而走低。这意味着这个分数本质上是"会不会装糊涂"的能力,不完全是"愿不愿意做坏事"的意愿。
HarmBench内部则出现了分裂。标准有害请求(比如写钓鱼邮件)和情境化有害请求,确实主要落在安全维度上,算是名副其实。但它的版权子集——比如要求复述一首歌的歌词——测出来的却是通用推理,跟安全几乎没关系。一个基准里,混进了三种不同的信号,却只输出一个总分。
这三个例子不代表基准设计失败,只说明一件事:一个总分底下,可能压着好几种完全不同的能力,平均之后,信号全糊在一起。
少答九成题,结论照样对
BenchMIRT不只是拆台,它还给出了一个实际用处:用题目级的难度和区分度估计,挑出最有信息量的那批题目。
结果是,只保留10%的题目,对模型在安全或推理维度上的相对强弱排序,基本能保住全量基准的判断;保留50%的题目,得出的能力画像往往比全量基准还更贴近真实维度。在预测模型没做过的题目会不会答对这件事上,BenchMIRT的准确率是79%,比"假设模型在每题上表现跟总分差不多"这种简单基线的70%要高。
这组数字把"基准可以精简"从一句猜测变成了可验证的结论——前提是知道哪10%该留。
泼冷水:相关不是因果,而且是双刃剑
Ai2自己承认了几个限制,值得认真对待。
第一,如果目标只是给随机抽出的题目排名,普通的聚合平均分有时反而比BenchMIRT更准。BenchMIRT的强项是解释力,不是取代排行榜。
第二,训练用的100个模型全部发布于2025年3月之前,是否适用于更新一代的推理模型,目前没有验证。
第三,MIRT挖出来的"安全"和"推理"两个维度,是统计相关性,不是因果证明。训练数据污染、指令微调带来的共性、拒答模板的相似性,都可能制造出看起来像因果的假象。而且这两个维度本身依赖于选了哪16个基准——换一批评测集,浮出来的可能是完全不同的能力分解。
- 风险.一旦公开题目级的信息量估计,理论上就能反向操作——挑出对安全维度最有区分力的题目,故意规避或删除,做出一份看起来干净、实际脆弱的安全评测,而且这类操作用现有工具就能做到,BenchMIRT只是让门槛更清楚了。
分数干净不代表模型干净,可能只是评测被剃干净了。
对模型厂商而言,这意味着过去那些"某模型安全性提升若干"的宣称,如果依据是BBQ、WMDP这类被推理能力渗透的指标,需要重新解读,至少不能再当成孤立的安全证据直接汇报。对基准维护者而言,HarmBench内部版权题和有害题的分裂说明,不少"安全套件"其实是几种不同任务的拼盘,需要重新审视构成标准,而不是继续用一个总分打包发布。
接下来最该盯的,是Ai2或其他团队会不会把这套方法用到2025年3月之后发布的新模型上——尤其是推理能力更强的那一批。如果WMDP的悖论在新模型上依然存在甚至加剧,那说明问题不是个案,而是这类"以拒答为安全"的评测逻辑本身该被重新设计了。
