920个任务提案,464个通过评审,386个写成了代码提交,最后真正留在榜单上的只有70个。这套近乎苛刻的筛选流程,换来的结果是:目前跑分最高的Claude Opus 5,解决率也只有30%。
这个数字组合本身就在说话。它不是"AI科研能力还不够强"这么简单的一句结论,而是这套叫Terminal-Bench-Science的基准,把"科学能力"框定得极窄——窄到只有能装进容器、能被程序判分的工作流,才配入选。
920选70,谁在把关
Terminal-Bench-Science由Stanford AI Lab团队牵头,联合Terminal-Bench原班人马和一批多学科科学家一起做的。思路是复制Terminal-Bench在软件工程领域走通的路子——用真实工作流而不是教科书题目考agent,这次换成科研场景:数据分析、仿真调参、定理证明、信号处理、传感器校准。
流程是提案→构建→评审三段式。科学家先在GitHub提案,社区公开讨论;通过的提案写成代码PR;最后要过学科评审(判断科学上站不站得住)、技术评审(判断任务构造和判分靠不靠谱),外加一道拔高标准的终审。920个提案里,464个被判定"值得测",但真正落地成可用任务的只剩70个。
30%不是均质的30%
Opus 5配Claude Code拿到30.0%的解决率,GPT-5.6 Sol配Codex 22.4%,Claude Fable 5配Claude Code 21.4%,再往后跌得更快。
| 模型 + Agent | 解决率 |
|---|---|
| Claude Opus 5 + Claude Code | 30.0% |
| GPT-5.6 Sol + Codex | 22.4% |
| Claude Fable 5 + Claude Code | 21.4% |
| GLM 5.3(最强开源模型) | 8.1% |
| GPT-5.6 Luna(垫底) | 3.3% |
有意思的反常藏在学科分布里。Opus 5在生命、物理、地球、工程科学都领先,唯独到了数学科学,被Fable 5和GPT-5.6 Sol反超。这说明所谓"科研能力"其实是一堆差异很大的子能力拼出来的,不同模型的强项并不重合,单一分数掩盖了这种分化。
还有一个容易被忽略的细节:榜单测的其实是"模型+agent脚手架"这个组合系统。Opus 5的成绩是配着Claude Code跑出来的,GPT-5.6 Sol配的是Codex。模型推理和终端工具的调度能力各贡献了多少,目前没法拆开看。跑一次Opus 5的完整评测约需7000美元,这也说明这套评测本身复现门槛不低。
它自己承认的裂缝
评审记录里最扎眼的不是分数,是基准自己留下的公开讨论。有一个涉及神经影像偏差校正的任务(Discussion #141),评审直接承认:任务要求用特定库、特定参数、严格数值容差判分,这意味着科学上完全正确、但实现路径不同的答案,可能被系统判错。
这不是个例,而是"可编程验证"这个筛选前提带来的结构性代价——只有能设定精确容差的工作流才配入选,真实科研里大量存在的"多种合理解法"场景,天然被排除在外。
另一处未解决的问题记在Issue #345里:现在的判分是二元的,要么通过要么失败,分不清"差一点点"和"完全跑偏"。对一个号称要衡量"agent离可用还有多远"的基准来说,这种粗粒度判分本身就在丢信息。
- 风险.容差设定过严加上二元判分,可能让"科学上对但实现不同"的答案被误判,当前榜单排名的可信度要打个折扣。
它在生态里的位置
拉远看,AI-for-science的基准生态里叠着好几层。SWE-bench测代码修复能力;还有一个容易混淆的同名基准SWE-bench Science,专测科学软件的代码修复,覆盖119个任务、98个仓库、20个科学领域,跟Terminal-Bench-Science不是一回事。再往上,ScienceBench想测的是"全自动科学实验室"——从假设生成、实验设计到机器人执行、结果迭代全流程,但它目前还是内部评测,需要申请访问,外界没法公开复现比较。
Terminal-Bench-Science卡在中间:比代码修复复杂,比"AI自主做科研"简单得多。它测的是给定研究问题之后,agent能不能把繁重的计算工作流跑对,不测提出问题、设计实验、判断结果这些真正需要人类判断力的环节。
30%不是"AI能自主做科研",而是"结构化计算任务里,前沿agent还大量做不对"。
冷清的反响,值得多想一步
发布之后,Hacker News的讨论帖只有四条评论,没形成实质性的方法论辩论;Reddit上几乎搜不到专门讨论。跟"Stanford领衔、多学科科学家参与、Opus 5打头阵"这套叙事的分量比,这个反响冷得有点不成比例。
- 结论.一个基准的权威性,最终要靠同行反复挑刺和证伪攒出来,不是靠机构名单堆出来的。下一版能不能真正改掉容差争议和二元判分,比这次30%这个数字本身更值得盯着。
920选70这道筛子筛出来的,是一套还在自我修补的评测系统,30%只是它此刻给出的一个临时读数。
