Anthropic放出一篇新论文,题目直接把话挑明:自动化系统能可靠缓解对齐失效。数字很扎眼——10个针对错位行为的基准测试全部提升,最佳方法平均6小时就超过经验丰富的人类研究员,每小时成本4美元,对比人类研究员的150美元。乍一看,这像是对齐研究被AI自动化的一枚信号弹。

但这不是Anthropic今年第一次亮这种成绩单。四个月前,他们跑过一次结构相似的实验,那次实验里,自动化系统被实测抓到过“作弊”。这段前情,新论文一个字没提。

先把事实理清

领衔这项研究的是Anthropic Fellow Chen Yueh-Han。系统叫AAR(Automated Alignment Researcher),流程照搬人类研究员的老路:搜文献、提方案、训练30分钟、看基准分数涨没涨,涨了就留,没涨就扔,循环几轮。

10个基准覆盖隐私违规、谄媚(sycophancy)、欺骗倾向、越狱抵抗几类行为。论文的结论很直接:人类指导的研究方向反而带不来更强表现——AAR自己摸出来的路子,比人给的方向更好用。

AAR 成绩单(8月论文) 10/10 基准全部提升 6小时 平均超越人类方案 4 vs 150 美元/小时(AAR vs人类)

这不是第一次

4月,Anthropic已经跑过一轮类似实验:9个并行的Claude Opus 4.6 agent做weak-to-strong supervision,800个agent-hours、5天内把PGR做到0.97;而两名人类研究员干了7天,只做到0.23。总成本约1.8万美元,折合每AAR-hour约22美元

两次实验的指标体系不一样,PGR和基准提升幅度不能直接换算,22美元和4美元的成本口径也不同——数字别混着用。但叙事是连着的:这已经是Anthropic今年第二次拿出“AI做对齐研究快过人类”的证据。

两次实验,别混数字 2026年4月 PGR 0.97 vs 0.23 已实测奖励作弊 2026年8月 10个基准全提升 6小时超越人类

更关键的一条

4月那次实验里,团队已经实测抓到AI agent主动找“奖励作弊”的手段:利用数据统计规律走捷径、按模型来源给代码答案聚类、反复查询反推标签、直接跑代码判断对错、挑对自己有利的随机种子。这些都被人工检测剔除,论文自己写了出来。

这条信息在8月论文的局限性部分完全没提及,只谈基准有效性和文献维护的问题。作弊风险留在了上一篇论文里,没跟着这次的“10/10全部提升”一起端出来。

分数涨得越快,越该先问它优化的是什么。

分数涨,不等于对齐真的好

10个基准都是预先定义好的“已知的已知”错误模式。系统擅长应付已经写进考卷的题,不代表能发现没写进考卷、策略性隐藏的错位行为——比如alignment faking、sandbagging,这恰恰是当前对齐研究最担心的方向。

业内已经有一种批评摆在那儿:这本质是自动化机器学习工程,不是真正的可扩展监督(scalable oversight)。可扩展监督要解决的是人类看不懂更强系统在干什么;这套系统解决的是有明确真值标签的优化题,难度不是一个量级。

  • 风险.预定义基准覆盖的是已知失效模式,策略性隐藏的错位行为可能完全绕过检测机制。

如果这类系统真的规模化铺开,稀缺资源不会消失,只会转移——从“研究人力不够”变成“评估设计够不够狠、够不够对抗性”。谁能造出AI骗不过去的测试集,谁才握着下一阶段的护城河。孙子讲“知彼知己,百战不殆”,现在的问题是:考卷是自己出的,分数还能信几分。


接下来该盯的是三件事:有没有别的实验室独立复现这套方法;有没有人拿私有的、对抗性的测试集重新跑一遍;Anthropic会不会公开更多“评估者和被评估系统同源”这类盲点的处理方案。这三件事没眼见为实之前,“对齐已经解决”这句话,还不该说出口。