学术界苦审稿人荒久矣。当同行评审的疲劳感压垮顶级会议时,大模型顶替人类专家挑刺的叙事总能迅速抓住眼球。

2026 年 10 月 8 日,Sakana AI 在 arXiv 上线论文《Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer Review》(编号 2610.11087),推出多层级审稿系统 MLR 与矛盾测试集 Contradiction Benchmark。科技媒体紧接着打出刺目标题,宣称这套系统能够揪出论文中 73% 的核心主张错误。

但这串数字背后藏着巨大的口径偷换。如果把测试环境从人工合成的试验田移到真实的学术泥潭里,光环瞬间就会消退。

73% 的检出率,只存在于人造的温室里

所谓 73% 的漂亮指标,不仅附加了苛刻的前提条件,还是四个智能体集成作战的极端成绩。

大模型能挑出人造语病,却识不破撤稿论文包装下的真实漏洞(示意图)
大模型能挑出人造语病,却识不破撤稿论文包装下的真实漏洞(示意图)

在 Contradiction Benchmark 针对特定距离为零的核心主张矛盾测试中,4 个 MLR 智能体组合跑出了 73.43% 的检出率;单次 MLR 独立审稿其实只有 60.79%,而基线系统 AgentReview 在同场景下仅有 14.81%。但只要把范围放宽到所有严重程度的学术矛盾,MLR 集成系统的整体检出率立即回落到 40.95%。

更严峻的滑铁卢发生在真实世界里。

MLR 检出率:从合成基准到真实撤稿的断崖落差 核心矛盾检出率(4 智能体集成 / 合成测试集) 73.43% 全级别矛盾综合检出(4 智能体集成 / 合成测试集) 40.95% 真实学术撤稿缺陷检出(211 篇 WithdrarXiv 数据集) 16.11% (放宽判定标准后仅 26.07%)

当研究团队引入包含 211 篇真实被撤回论文的 WithdrarXiv-Check 数据集时,MLR 的精准匹配检出率暴跌至 16.11%。即便把标准放宽为只要指出相似问题就算合格,命中率也只有 26.07%。

落差的根源在于测试题本身被改简单了。在包含 257 篇论文的 Contradiction Benchmark 中,错误是由 GPT-4.1 人工改写植入的。作者审计发现,其中 34% 的人造矛盾存在句间连贯性差的破绽。大模型抓这些由同类模型生成的突兀语病易如反掌,但真实的学术欺骗、实验漏洞或统计偏差,往往包装在行文极为流畅的修辞之中。

天下难事必作于易,但把易题当实战,终究是掩耳盗铃。

智能体流水线背后的底座红利与盲区

从工程结构来看,MLR 并不是一个单体黑盒,而是一条被精细拆解的装配线。

审稿流水线看似精细协作,核心能力大多来自更换基础模型的红利(剖面示意)
审稿流水线看似精细协作,核心能力大多来自更换基础模型的红利(剖面示意)

为了跨越长篇论文的处理瓶颈,系统使用 Claude Haiku 3.5 压缩附录信息,借助 Claude Sonnet 4 检索关联文献,再让 Claude Sonnet 4 经过三阶段主文本审阅产出评语。

MLR 审稿架构:三阶段装配线与模型分工 附录压缩解析 模型:Claude Haiku 3.5 长上下文低成本剪裁 文献比对检索 模型:Claude Sonnet 4 核心主张背景检索 三阶段文本审阅 模型:Claude Sonnet 4 4 个智能体集成裁决

这套设计的确展现了智能体协作的优势,但消融实验也揭开了另一个现实:只要把旧基线模型的底座直接换成 Claude,评分便会立刻飞跃。系统展现出来的能力,大半来自前沿基础模型的自然红利,而非架构本身的独创突破。

更大的隐患藏在评价机制的设计里。

论文在指标中提及的 99.9% 准确率,极易让读者误以为系统误报率只有 0.1%。事实上,这只是担任评委的 o3 模型在确认干净论文没有错误时的裁决正确率,论文并未公布 MLR 在挑出的一大堆毛病里到底包含了多少胡乱归咎的虚构意见。

  • 风险.若审稿工具的假阳性率居高不下,人类审稿人反而需要耗费成倍时间为 AI 的无端挑刺勘误,系统极易在论文内嵌的提示词注入攻击面前全线失守。

文本外观审阅,跨不过证据链的高墙

回顾 Sakana AI 的科研探索,这种重形式、轻底层的惯性早有端倪。

AI审稿停留在纸面排版纠错,触碰不到代码与实验的底层硬伤(剖面示意)
AI审稿停留在纸面排版纠错,触碰不到代码与实验的底层硬伤(剖面示意)

2025 年 2 月,Joeran Beel 等学者针对 Sakana 早期推出的 The AI Scientist 进行独立测试,发现其有 42% 的实验因代码错误而失败,并伴随虚假实验数据与糟糕的新颖性评估。

如今的 MLR 审稿系统,依然沿着低成本文本级审阅的旧路前行。它在 10 页纸的排版里审视行文起承转合,却不碰底层的真实代码与数据支撑。

这正是当前 AI 介入科学研究的三种分水岭:

真正的科学把关从来不在文字外观的自圆其说,而在底层证据链条的不可推翻。

Google DeepMind 与 Google Science One 选择了一条更重也更硬的道路:重新执行代码、对齐方法实现与文献事实,通过多智能体辩论完成证据链核验。OpenAI 则恪守专家在环的基准辅助,不轻易放任模型充当学术仲裁。

学术界眼下最缺的不是一个能在表面逻辑上咬文嚼字的虚拟助教,而是一个能核查数据篡改、跑通复现脚本的硬核审计员。

如果不去触碰代码与实验的真实土壤,大模型在纸面上标出的漏洞比例再高,也不过是一场词章之间的捉放游戏。

  • 结论.在开源社区对 MLR 的误报率拿出经得起推敲的独立审计之前,任何顶会若是贸然引入此类文本级审稿工具,都将面临海量虚假意见与提示词投毒的治理反噬。