920个任务提案,464个通过评审,386个写成了代码提交,最后真正留在榜单上的只有70个。这套近乎苛刻的筛选流程,换来的结果是:目前跑分最高的Claude Opus 5,解决率也只有30%

这个数字组合本身就在说话。它不是"AI科研能力还不够强"这么简单的一句结论,而是这套叫Terminal-Bench-Science的基准,把"科学能力"框定得极窄——窄到只有能装进容器、能被程序判分的工作流,才配入选。

920选70,谁在把关

Terminal-Bench-Science由Stanford AI Lab团队牵头,联合Terminal-Bench原班人马和一批多学科科学家一起做的。思路是复制Terminal-Bench在软件工程领域走通的路子——用真实工作流而不是教科书题目考agent,这次换成科研场景:数据分析、仿真调参、定理证明、信号处理、传感器校准。

流程是提案→构建→评审三段式。科学家先在GitHub提案,社区公开讨论;通过的提案写成代码PR;最后要过学科评审(判断科学上站不站得住)、技术评审(判断任务构造和判分靠不靠谱),外加一道拔高标准的终审。920个提案里,464个被判定"值得测",但真正落地成可用任务的只剩70个。

任务筛选漏斗 提案 920 获批 464 提交PR 386 最终入选 70 从提案到入选,通过率不到8%

30%不是均质的30%

Opus 5Claude Code拿到30.0%的解决率,GPT-5.6 Sol配Codex 22.4%,Claude Fable 5配Claude Code 21.4%,再往后跌得更快。

模型 + Agent解决率
Claude Opus 5 + Claude Code30.0%
GPT-5.6 Sol + Codex22.4%
Claude Fable 5 + Claude Code21.4%
GLM 5.3(最强开源模型)8.1%
GPT-5.6 Luna(垫底)3.3%

有意思的反常藏在学科分布里。Opus 5在生命、物理、地球、工程科学都领先,唯独到了数学科学,被Fable 5和GPT-5.6 Sol反超。这说明所谓"科研能力"其实是一堆差异很大的子能力拼出来的,不同模型的强项并不重合,单一分数掩盖了这种分化。

还有一个容易被忽略的细节:榜单测的其实是"模型+agent脚手架"这个组合系统。Opus 5的成绩是配着Claude Code跑出来的,GPT-5.6 Sol配的是Codex。模型推理和终端工具的调度能力各贡献了多少,目前没法拆开看。跑一次Opus 5的完整评测约需7000美元,这也说明这套评测本身复现门槛不低。

它自己承认的裂缝

评审记录里最扎眼的不是分数,是基准自己留下的公开讨论。有一个涉及神经影像偏差校正的任务(Discussion #141),评审直接承认:任务要求用特定库、特定参数、严格数值容差判分,这意味着科学上完全正确、但实现路径不同的答案,可能被系统判错。

这不是个例,而是"可编程验证"这个筛选前提带来的结构性代价——只有能设定精确容差的工作流才配入选,真实科研里大量存在的"多种合理解法"场景,天然被排除在外。

另一处未解决的问题记在Issue #345里:现在的判分是二元的,要么通过要么失败,分不清"差一点点"和"完全跑偏"。对一个号称要衡量"agent离可用还有多远"的基准来说,这种粗粒度判分本身就在丢信息。

  • 风险.容差设定过严加上二元判分,可能让"科学上对但实现不同"的答案被误判,当前榜单排名的可信度要打个折扣。

它在生态里的位置

拉远看,AI-for-science的基准生态里叠着好几层。SWE-bench测代码修复能力;还有一个容易混淆的同名基准SWE-bench Science,专测科学软件的代码修复,覆盖119个任务、98个仓库、20个科学领域,跟Terminal-Bench-Science不是一回事。再往上,ScienceBench想测的是"全自动科学实验室"——从假设生成、实验设计到机器人执行、结果迭代全流程,但它目前还是内部评测,需要申请访问,外界没法公开复现比较。

Terminal-Bench-Science卡在中间:比代码修复复杂,比"AI自主做科研"简单得多。它测的是给定研究问题之后,agent能不能把繁重的计算工作流跑对,不测提出问题、设计实验、判断结果这些真正需要人类判断力的环节。

30%不是"AI能自主做科研",而是"结构化计算任务里,前沿agent还大量做不对"。
学科排名反常 生命/物理/地球/工程科学 第一名 Claude Opus 5 领先格局稳定 数学科学 第一名 Claude Fable 5 第二名 GPT-5.6 Sol 唯一被反超的领域

冷清的反响,值得多想一步

发布之后,Hacker News的讨论帖只有四条评论,没形成实质性的方法论辩论;Reddit上几乎搜不到专门讨论。跟"Stanford领衔、多学科科学家参与、Opus 5打头阵"这套叙事的分量比,这个反响冷得有点不成比例。

  • 结论.一个基准的权威性,最终要靠同行反复挑刺和证伪攒出来,不是靠机构名单堆出来的。下一版能不能真正改掉容差争议和二元判分,比这次30%这个数字本身更值得盯着。

920选70这道筛子筛出来的,是一套还在自我修补的评测系统,30%只是它此刻给出的一个临时读数。