一句提示,一天半没人管,黎曼猜想的下界被往前推了一大截——这是Anthropic本周公布的一次实验,听起来像是AI攻克了百年数学难题。但翻到官方原话,故事没有标题写的那么大。
更值得琢磨的其实不是结果,是过程。一名没受过专业数学训练的Anthropic员工,只说了一句“认真试试证明它”,然后放手让模型自己跑了大约一天半。中途没人盯着子代理们在干什么。这种近乎无监督的科研方式,比一个数学结论更让人心里咯噔一下。
一天半里发生了什么
过程拆开看很简单:员工提示模型“认真尝试证明”黎曼猜想,随后放手不管。模型自己拆解任务,协调了60个子代理,测试了650个不同思路,消耗约3100万token——这不是笼统的“算力很大”,是实打实的推理开销,相当于模型高强度自言自语了一整天半。
最后,两个子代理提出了关键数学思路,十三个为它们贡献灵感,三十个尝试但没成功,十三个负责核对论证站不站得住,最后两个把结果写成论文初稿。全程经Anthropic内部两名数学家确认,并用开源证明助手Lean做了形式化验证。
黎曼猜想没被证明,只是下界往前挪了一截
“黎曼猜想”和“进展”这两个词摆一起,很容易让人脑补成AI已经摸到证明的边。Anthropic自己的研究页面用词谨慎得多:结果是黎曼zeta函数的一个新下界,不是猜想本身的证明。克莱数学研究所那笔一百万美元悬赏,依然没人能领。
下界往前推,意味着“猜想在这个范围内成立”的区间变大了——这是黎曼猜想研究里常见的渐进式进展,过去数学家靠传统方法也推进过。AI这次特殊的地方是速度和路径:没人指定具体思路,全靠模型自己试错、淘汰、收敛。
这不是孤例,是今年AI数学的连续剧
把这次实验放进2026年的时间线看,就没那么孤立。今年以来,多个Erdos问题被AI模型解决;OpenAI公布内部模型“Astra”证明的十项数学结果;Anthropic另一支团队证伪了存在已久的雅可比猜想。黎曼zeta函数这次的下界改进,是这条连续剧的最新一集,不是突然冒出来的孤立事件。
节奏在变快是真的。模型能力和推理成本一起往上堆——那3100万token就是代价——换来的是数学界过去要靠人年甚至人生去啃的问题,被压缩到一天半。
谁来对这份证明负责
数学圈对这套打法不是一片叫好。今年六月,一批数学家联署《莱顿宣言》,担心AI会侵蚀“可归因证明”的传统:真正的证明应该能落到具体作者头上,作者要为其正确性负责。菲尔兹奖得主Timothy Gowers在回应里唱了反调,他觉得如果未来数学定理不再和某个数学家的名字绑定,也未必是坏事——就像星星大多没有以天文学家命名,天文学照样往前走。
这次的黎曼结果恰好卡在两种立场中间。确认它的是Anthropic内部两名数学家,不是外部同行评审。
- 风险.目前公开的确认仅来自Anthropic内部数学家,外部同行评议尚未出现,论文和Lean代码库是否公开也没有答案——“内部认可”和“学界认可”不是一回事。
数学的信,从来靠同行盯着算,不是靠算力自证。
3100万token能不能称得上一次重量级的数学发现,取决于谁来验收。以前一个证明要经得起同行反复挑刺才算数,现在实验室自己出题、自己算、自己判自己对不对,速度先赢了一局,信任还没跟上。
一天半跑出一个新下界,听着像神话。但神话讲完之后,还得有人拿着放大镜把每一步重新走一遍。在那之前,“进展”这两个字,最好加个引号。
