当任何人花费几百美元算力就能生成一篇足以发表在顶级期刊的数学手稿时,纯数学这座曾被视为人类智力最高堡垒的学科,正迎来根本性的体制震荡。2026年9月14日,数学家Daniel Litt发表长文,直指AI让证明与人类理解发生严重断裂;如果大学与研究机构依旧死守以主定理证明和论文发表为主的评价体系,人类的数学认知甚至数学本身的发展将陷入事实上的停滞。

这不再是杞人忧天的思想实验。技术演进抹平能力鸿沟的速度远超学界预期:三年前AI连基础算术都会出错,到2025年7月,Google DeepMind的Gemini Deep Think在第66届国际数学奥林匹克(IMO)中斩获35分(满分42分),直接从自然语言题干输出自然语言证明,获官方协调员认证达到金牌水平。同月,OpenAI通用推理模型也在同套试题取得35分的内部评测等效金牌。到了2026年,AI推演迅速越过竞赛解题,正面切入科研前沿。

从竞赛解题到科研推演的能力跃迁 2023年 · 算术阶段 连加法都出错 基础逻辑链断裂 2025年7月 · 竞赛分水岭 35 / 42 IMO金牌认证水平 2026年 · 科研推进 攻克开放猜想 Aletheia与Astra落地

机器形式化过剩与人类解释力稀缺的对冲

技术突破真实发生,但其边界往往被公关修辞放大。回顾两家巨头在2026年的科研战绩:5月20日,OpenAI通用推理模型自主反驳了平面Erdős单位距离猜想;8月1日,其公布的Astra系统在球堆积、编码理论、格密码学与极值组合学等领域交出10项长期悬案突破,并整理出Lean形式化证明证书。DeepMind亦在论文中推出智能体Aletheia,在700个Erdős猜想的半自主评估中化解了4个开放问题,并自主撰写算术几何论文。

这些成果并不意味着AI已攻克黎曼猜想这类世纪难题。First Proof与TaoBench等专业基准测试表明,现有系统高度依赖Mathlib已有的符号库定义,其攻克的开放问题多集中在特定离散与组合数学分支。更深层的矛盾在于证明生产力的通胀:机器能够以极低成本输出成千上万页在形式系统内毫无瑕疵的定理推导,但这些推导如同黑箱,无法自动转化为人类对深层数学结构的顿悟。

学术生产要素的价值转移 工业化贬值要素 • 繁冗引理的手工拼装 • 边缘猜想的形式化查漏 • 符号逻辑的形式推演成本趋零 高度稀缺核心价值 • 辨明问题重要性的品味 • 概念框架的宏观搭建与压缩 • 人类学者间的深度交流与理解

过去数百年间,数学界将证明定理作为衡量学者能力的唯一代称,其制度逻辑建立在定理极度稀缺的基础之上。然而,当算力把论文制造变成流水线,白纸黑字的推导不再等同于作者真正理解了背后的脉络。

产出海量形式上正确的真命题并不困难,真正稀缺的是告诉世界它为何重要。

巨头路线分歧下的学术基础设施隐忧

面对数学推演,两家头部机构走出了截然不同的演进路径。Google DeepMind依靠强化学习结合形式化验证环境,强调系统在Lean等交互式定理证明器中的闭环检验,追求逻辑零漏洞;OpenAI则倚重通用推理大模型配合海量搜索与外接代码验证,事后再将推演成果翻译为形式化证明证书。

两条技术路径虽然形态不同,却共同对学术生态构成了两层现实制约:

维度Google DeepMind 路线OpenAI 路线
技术基石神经符号结合、Lean专业形式化验证通用推理大模型、大规模外接搜索
验证机制强依赖交互式定理证明器即时闭环自然语言草稿后置转化为Lean证书
考核局限高度受限于Mathlib库内现存的形式化定义面对新定义容易泛化不足,依赖外部核验
开源状态工具框架开源,核心模型算力闭源成果以白皮书披露,基础设施完全专有

纯数学曾是所有自然科学中最廉价、门槛最低的阵地,只要纸笔即可推演。但在当下的竞赛格局中,解决某些悬案的代价已经演变为算力倾注。开源社区花费数年积累的Mathlib形式化资产,正在成为科技巨头训练私有模型的免费养料,而产出顶级推演所需的数据中心资源却被牢牢锁在商业机构的高墙之内。一旦高校无法复现商业系统的推演路径,以公开透明为基石的同行评议制度便名存实亡。

  • 风险.公立数学研究对商业机构不透明算力的依赖加剧,可能导致基础理论的学术优先权被专有平台深度垄断。

莱顿宣言背后的学术评价体制防线

学术界并非无动于衷。2026年6月,国际数学联盟(IMU)在国际数学家大会上推动签署了《莱顿人工智能与数学宣言》(Leiden Declaration)。这份宣言明确确立了基本防线:重申数学的核心旨归在于人类的智力理解,明确人类必须对数学结论承担全部学术责任,要求无条件披露推演中的技术细节,并明确拒绝将AI列为学术论文的正式作者。

未来数学研究与人才培养新秩序 黑板研讨文化 • 线下高频研讨班 • 现场即兴逻辑推演 • 破除黑箱文本迷信 高压口头答辩 • 论文退居考察次席 • 聚焦概念迁移能力 • 验证真正理解水位 议题品味确立 • 提出深远猜想 • 组织研究共同体 • 判定命题美感价值

这一宣言标志着制度反扑的起点。受到直接冲击的是全球高校的青年学者与博士生群体:以往通过手工组装复杂技术细节来水论文的生存方式已被机器彻底截断。如果几百美元就能生成一篇博士论文量级的文本,学位授予的核心凭证就必须发生转移。

学界正在摸索一套退守策略,重估那些机器无法取代的环节。博士考核的重心开始转向严苛的深度答辩,考官不仅审查结论的真伪,更通过陌生案例测试学生能否阐释推导细节;学术会议与聘用环节将减少对预印本数量的依赖,转向黑板前的面对面交锋。

  • 建议.青年学者应迅速跳出机械证明引理的低效竞争,将训练重心转向提出未知问题、提炼数学直觉与跨领域概念传播。

当算力承担了形式推演的杂役,人类数学家正在被迫找回这门古老学问最初的模样:聚在黑板前相互质疑,确认彼此是否真正理解了宇宙运行的规律。