物理学者兼科学博主 Matt von Hippel 前不久向 AI 实验室公开下战书:别在基准测试里空转,真有本事就用普通学者负担得起的算力,算一算粒子物理振幅学里卡了多年的难题。一个月后,Anthropic 给出回应,宣布 Claude 在其内部研发的科研框架下,完成了平面 N=4 超杨-米尔斯理论(SYM)中的九圈六粒子 MHV 散射振幅计算。
散射振幅是粒子物理预测亚原子反应概率的核心工具,也是检验大型强子对撞机(LHC)实验数据与探寻新物理的标尺。但在微扰理论展开中,圈数每往上叠一层,相互作用的复杂度和代数系统的维数就呈指数暴增。在真实的物理预测中,人类计算大多停留在两到三圈,极为罕见的最高精度纪录也仅到五圈。为了突破解析极限,理论物理学家往往在数学对称性极高、抵消项极多的玩具模型里打磨自举(bootstrap)技术。
这一次,Anthropic 宣称将原本被学术界视为算力天堑的九圈计算,压缩在学术预算之内交了卷。
从五年算力天堑到单周跑通
九圈不是一个随意的台阶。此前 Matt von Hippel 在该方向的积累主要停留在六圈与七圈的六胶子振幅自举,而九圈应力张量形状因子在密歇根大学科学挑战图谱中长期挂着公开未解的标签。
按照英国杜伦大学学者在此前研究中给出的推算,若采用传统代数软共线自举方法,八圈计算曾在数十核 CPU 上跑了超过两周。随着微扰阶数攀升,组合爆炸会让系统规模膨胀约 135 倍,推算到九圈需要约 270 周(约 5.2 年)的等效 CPU 算力。面对这种量级,绝大多数研究组在立项阶段就会直接放弃。
Anthropic 的实际开销撕开了这个算力假象。整个任务消耗了约 1,000 至 2,000 美元的模型 API 成本,并在 96 核 CPU 上持续运行了一周时间。
这中间并不存在黑魔法。在图形表示自举中,九圈涉及 43,017 个新的 f-graph 系数,此前学界十圈关联函数的工作已经为八圈和九圈系数提供了强约束。Claude 实际上完成了一次极高效率的工程实现:借助 Python 的 SymPy 库重构求解脚本,同时交替尝试了原始自举法与基于形状因子的间接路径。它没有去硬解那个膨胀了上百倍的原始线性方程组,而是把成熟的物理约束与剪枝策略转化成了严丝合缝的代码执行流。
驱动飞轮的是外部执行架,不是模型顿悟
公共讨论最容易滑向两个极端:要么把这当成通用人工智能攻克基础物理的开端,要么贬低为普通的代码补全。两者的认知落差都在于忽视了中间那层脚手架。
这次执行核心不是网页端那扇单薄的对话窗口,而是 Anthropic 配套的专用科研执行框架 Claude Science。它的本质是一个带严格规约的外部工具调度系统(Harness),把大语言模型与计算机代数系统、图同构检测库以及线性求解器绑在一起,形成自动纠错的闭环。
[物理边界与自举规则] ──> [Claude 编写并调试代数脚本] ──> [SymPy / 96核CPU求解器] ──> [一致性校验闭环]
当研究员发出计算六粒子平面 N=4 SYM 九圈振幅的初始指令后,后续互动主要是让它在无人干预下持续推进。模型在这个体系里扮演的角色,是一个不眠不休、懂规范且极具耐心的超级科研助理。它熟练运用高级软件工程经验重构了学术界惯用的计算代码,但驱动推导的底层物理逻辑,全部来自振幅学界数十年来沉淀的既有自举规则。
- 结论.大模型在基础科学里的首要价值,不是凭空发明新理论,而是用现代工程规范重构学术界积习已久的低效计算管线。
孤本结果与复现争议
九圈答案落地后,学术界的态度相当复杂。理论物理学家 Lance Dixon 负责核验了该结果,主要通过将求得的振幅关联到九圈形状因子并比对已知的物理约束完成交叉检验。但必须指出,这并非全流程独立盲审复算。
与此同时,中国科学院的何颂、井吉荣与李想团队,此前曾通过人类主导框架结合 AI 辅助,独立推导出了该振幅的符号(symbol)。这一成果构成了关键的部分交叉检验,但全函数依然未被第三方完全重现。
一套未开源代码、未被第三方端到端盲测复算的计算,在严格意义上仍是学术孤本。
目前 Anthropic 并未公开发布分发该计算程序。完整的九圈全函数在物理现实中仅仅被跑通了一次。
- 风险.在缺乏开源代码与第二套独立复现体系的前提下,把特定高对称玩具模型的单次工程成功外推到真实强相互作用计算,存在明显的包装放大风险。
工欲善其事,必先利其器。N=4 超杨-米尔斯理论因为极端优美的超对称性,成为了绝佳的算法试验场,但它与充斥着杂乱非阿贝尔规范场、夸克质量与对称性破缺的真实量子色动力学(QCD)之间,隔着巨大的理论鸿沟。在玩具模型里成立的符号自举,到了对撞机真实数据前往往寸步难行。
Anthropic 这次交卷确实展示了前沿工程力量进入传统学术领地时的降维冲击:它证明人类专家在过去因为工具落后而高估了多少障碍,也证明一个设计精良的科研 Harness 足以在几天内抹平学界数年的算力预估。但这更像一场高质量的工程突击,物理学的大厦并未因此动摇地基。接下来真正的分水岭,不在于模型跑分又高了几分,而在于这套工作流能否开源给同行独立复算,以及它是否有能力跨出玩具模型,去啃下真实标准模型里的硬骨头。
