METR最新一份研究给"AI正在加速科学发现"这句话泼了盆冷水。它把网络安全、数学、AI研究本身三个领域摆在一起比较,结果是网络安全领域出现明显加速,数学领域进展模糊难以量化,而AI优化自己研究方法这件事,目前找不到任何可测的加速信号。同期出现的两项工具性研究——SPADE和Hawkeye——则从另一个角度佐证了这个判断:能力提升不是齐头并进,而是先在少数任务上出现"相变",其余领域仍在原地打转。
这对判断AI进展有直接意义:笼统说"AI又变强了"没有意义,得先问是哪一种任务。
网络安全领跑,AI搞科研自己却没进步
METR的观察对象是cURL、OpenSSL、Firefox、Microsoft等具体项目,加上NVD、OSV这类聚合漏洞数据库——它们在2026年的漏洞报告数量比2025年明显跳升。数学领域的证据更暧昧:某些方向的arXiv投稿一年内翻倍,Smale问题列表中的雅可比猜想、Green问题列表的第44题(halving sieve)等难题也相继被解出,但研究者自己承认,现在下"这是持续趋势"的结论还太早。
最冷的是AI优化AI研究这一项。METR考察了CIFAR-10、Hutter压缩、Gurobi混合整数规划、MIPLIB、nanoGPT、Stockfish、矩阵乘法指数这七个基准,只有nanoGPT和CIFAR-10能看到LLM可归因的进展,速度也远低于网络安全和数学领域。
需要提醒的是,漏洞报告数量增加不等于漏洞发现效率真的提升——报告变多也可能混入更多噪音,METR给出的是相关性观察,不是因果证明。
环境和内核变成新杠杆,但都靠人工打底
如果模型自己搞科研还没突破,那另一条路径是给模型造更好的"练功场"和更趁手的工具。这正是SPADE和Hawkeye在做的事。
SPADE由华盛顿大学、斯坦福、卡内基梅隆等九所高校团队开发,让同一个模型轮流扮演两个角色:环境设计师用Python代码生成可执行的游戏化训练场景,推理智能体去解这些题目,奖励靠"有无提示"的表现差值来估算。在Qwen3-30B-A3B上用GRPO训练400轮后,游戏类环境套件平均得分较基线高8.1分,比最强的固定环境基线也高出5.3分,工具调用类环境同样有提升。
Hawkeye出自哈佛、斯坦福、Together AI和Caltech团队,目标是让写GPU内核的编程智能体自己摸清硬件特性,尽量少依赖专家介入。它的核心是一套人工整理的单元测试库,把专家写的参考内核和硬件性能指标打包成可复用的知识。测试覆盖NVIDIA Ampere、Hopper、Blackwell和AMD MI350,跨BF16、FP8、NVFP4、MXFP4多种精度:在torch.compile能直接调用cuBLAS、cuDNN等成熟库的场景,Hawkeye打平或超过;在torch.compile无法处理的新型注意力变体上,相对Flash Linear Attention库的专家Triton内核,几何平均加速达到18.9倍。
- 结论.下一阶段能力提升的杠杆,正从"模型本身变聪明"转向训练环境和硬件适配工具的质量。
- 风险.两套系统的基准都绑定特定模型、精度和工作负载组合,换个场景未必复现,18.9倍不能外推到所有GPU任务。
SPADE的作者自己也承认,这套自博弈机制没法让模型突破环境设计师所用基础模型的想象边界——是圈定范围内的自我改进,不是脱离人类知识的无限递归。Hawkeye的所有优化同样建立在人工编写的单元测试和参考内核之上,本质是把专家经验打包复用,不是AI凭空发现新算法。
能加速的先被工具喂饱,能测量的先被拿来说事。
对模型训练团队和GPU软件工程师来说,SPADE的代码和模型checkpoint已经开源,Hawkeye框架也公开可用,值得拿自己的场景实测一遍,而不是照搬论文里的数字下结论。对普通用户,这些进展目前只停留在训练管线和内核优化层面,还构不成"AI已经能自主做科研"的证据。
机器权利之争,是立场之争,不是科学结论
同一期通讯里,研究者Julian Togelius公开了自己2025年写下的"信仰危机"文章,担心AI成功后人类才智会变得不再重要;另一位研究者Taylor Belrose则撰文反对给AI系统赋予权利,理由是"AI永远不可能拥有意识,无论它表现得多么聪明"。
这些都是研究者的个人立场和哲学论证,不是科学界已经解决的事实。放在这期讨论AI能力分化的背景下看,它更像一句提醒:Hawkeye能把内核跑出18.9倍加速,SPADE能自己造训练环境,这些都是任务层面的能力提升,和"AI有没有意识、该不该有权利"是两件完全不同的事,不该混为一谈。
