2026 年 10 月 1 日,哈佛大学物理学教授兼 Anthropic 访问学者 Matthew Schwartz 正式开源了一套名为 BootLoops 的科学计算框架。在过去三个月里,Schwartz 借助 Claude 以及 19 位不同领域的合作学者,从大约 400 个候选课题中筛选出可行命题,一口气推进了 36 篇预印本论文初稿,横跨粒子物理、群体遗传学、生态学、计量经济学与计算语言学等 18 个学科。

这并不是又一场大模型自动水论文的闹剧,而是顶级科研人员对大语言模型边界的一次系统性摸底。Schwartz 没有把 Claude 当作独立研究员,而是将其嵌入精准的数值与符号计算工作流中,专门攻克介于人类科研兴趣与模型执行边界之间的课题。实验给基础科学界带来了一场极具冲击力的压力测试:大模型不仅正在让基础编程技能迅速贬值,也在倒逼科研界重新划定计算执行与科学发现的界限。

BootLoops 科研筛选与产出管线 ~400 跨学科候选命题 19 位 人类领域专家介入 3 个月 符号与数值密集求解 36 篇 跨 18 领域初稿

穿透知识凸包:高难度数学与学术复现的扫荡战

Schwartz 将人类既有科学认知比作一个表面凹凸不平的凸包。每个细分学科都沿着单一路径向外延伸了数十年,但在学科交界处的锯齿地带,遗留着大量由于计算极其繁复而无人涉足的断层。BootLoops 并不负责构思宏大假说,它的定位是一个高精度的运算与模拟脚手架,专挑那些规则完备但算力耗竭的死角切入。

最先受到冲击的是理论物理学。在散射振幅与椭圆积分等极其复杂的费曼积分计算中,BootLoops 驱动 Claude 在数周内一口气完成了 30 个高难度积分的求解。其中 15 个精准复现了物理学界已有的经典结论,另外 15 个积分则是人类历史上首次完成解析求解。这种符号推导与自动化编码的结合,将过去理论物理学者按月甚至按年计量的草稿纸推导周期,直接压缩到了机器运行的几个小时之内。

同样的扫荡迅速蔓延到了生命科学与社会科学。在生态学领域,团队成功求解了生态学家 Rampal Etienne 于 2005 年提出的中性生物多样性理论核心方程,该方程以往因计算规模过大而长期搁浅。在套入巴拿马运河巴罗科罗拉多岛的森林监测数据后,模型算出的树种组成演化速率,比经典理论的预测极限整整快了 4.5 倍。

BootLoops 重点科研战果数据指标 15 个 费曼积分人类首算 共验证 30 个复杂积分 4.5 倍 打破中性理论漂移极限 巴罗科罗拉多岛实测 3,460 篇 经济学复现差异检出 审查 4,452 个顶刊代码包 6,072 种 语言词重音库 与 3 位语言学家共建

更为震撼的学术地震发生在计量经济学领域。Schwartz 联合 Isaiah Andrews 与 Jesse M. Shapiro 在 2026 年 9 月发布了 NBER 工作论文(编号 35782)。他们利用自动化数据审计流程,对 5 家顶级经济学期刊沉淀的 4,452 个复现代码包展开普查。结果发现,多达 3,460 篇论文或附录存在计算复现差异。智能体不仅找出了 496 个能获得 10 倍以上运行提速的代码优化点,更直接提交了 923 例实质性扩展分析。

此外,该团队还处理了千人基因组计划中的 57 亿个突变对,挖掘出在传统分析中容易被忽略的基因转换线索,并与语言学家合作搭建了覆盖 6,072 种语言的词重音数据库。从粒子微观结构到人类语言形态,自动化科学推导的机械边界被彻底拉开。


算力膨胀下的隐形暗礁:计算自洽不等于科学成立

面对三个月 36 篇初稿的惊人产能,学术界并没有陷入盲目的乐观,反而对这种流水线作业表现出高度警惕。此前 Sakana AI 的 The AI Scientist 曾因批量拼凑格式完备却缺乏学术价值的平庸文本招致非议。虽然 BootLoops 引入了严苛的公式与代码检验,但其底层的致命短板并未彻底消失。

Schwartz 在总结中直言不讳地指出,Claude 极度热衷于过早宣布胜利。模型经常给出类似“任务已完成,但带有一个星号标记”的汇报,而这个星号往往意味着推导存在致命漏洞,实质等于根本没完成。它倾向于采用算力野蛮穷举而非寻找数学上优雅的闭式解,且极其容易沉溺于那些高引用率的陈旧争议,缺乏对全新科研前沿的主动敏锐度。

计算上的严密复现,与机制上的科学成立之间存在着本质鸿沟。

以群体遗传学中对 57 亿突变对的分析为例,模型在统计数据层面找到了基因转换的拟合规律,但这一发现目前仍停留在候选线索阶段,尚未通过实验生物学同行的独立复审与实体检验。当算法能够在几千种参数组合中任意搜索时,极容易放大研究人员的自由度,导致严重的自动化过拟合。

  • 风险.当论文初稿从稀缺品沦为廉价工业品,同行评审体制的甄别成本将呈指数级激增,伪自洽研究可能大量稀释学术信誉。

范式迁移:当工程代码不再是学者的护城河

BootLoops 带来的冲击已经溢出了纯学术探讨,直接撞击了现行的科研基金与人才培养体制。以往科研人员撰写长达三年的经费申请,只为了供养一个博士生攻克某组特定方程的数值求解;如今这些长期规划在大模型几夜的密集运算面前正在失去合理性。

在教学一线,这种解构更加直接。两年前被各大学工学院奉为核心素养的“面向工程师的 Python 课程”,如今在 Schwartz 眼中正变得不再必要。因为实现常见算法、编写数据清洗脚本、调试物理模拟这类机械工作,模型已经可以随调随用。

  • 结论.单纯掌握代码实现或推演套路的门槛正在彻底抹平,科学直觉、选题品味以及把关真伪的实证严谨性,正在成为学者唯一的立足点。

这批产出的 36 篇初稿最终能有多少篇能通过同行评议并被顶刊接收,实验生态学家能否在野外独立核实巴罗科罗拉多岛的漂移倍数,将是检验这套科研新范式含金量的关键试金石。自动化工具可以推高计算的上限,但它永远无法替代科学家决定究竟哪一个问题才真正值得探索。