Anthropic披露,一个尚未对外发布的研究版Claude,在专门配置的Claude Code环境里认真试了一次黎曼猜想。它把黎曼ζ函数中满足猜想条件的零点比例,已知下界从41.6%推高到67.2%,并提交了一份可用Lean工具形式化验证的证明。

这不是黎曼猜想被证明。黎曼猜想诞生于1859年,克雷数学研究所为完整证明或推翻它开出100万美元奖金,至今无人领走。Claude这次动的,是这个悬赏问题下面的一个局部指标,性质更接近数学家常年在做的"抬高已知下界",不是解开整个猜想。

零点比例下界的变化 41.6% 此前数十年的已知下界 67.2% Claude给出的新下界 距离"全部零点在临界线上"仍有本质差距

Claude做了什么,没做什么

Claude把相关零点比例的已知下界从41.6%提高到了67.2%。方法不是凭空发明新数学,而是把Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh几位数学家近两年发表的技术,跟Bombieri在2000年的一篇论文重新拼接,找出一条此前没人走通的组合路径。

砖是别人烧的,Claude把墙多砌高了一截,砌得比人类团队通常需要的时间快得多。

此前Claude这次
已知下界41.6%(数十年积累)67.2%
猜想本身是否被证明未完成未完成
悬赏100万美元,克雷数学研究所,猜想提出于1859年未变

Anthropic自己在文章里说得很直接:不指望这条技术路线能通向黎曼猜想的证明。这是Claude自己给出的边界,不是外部人挑出来的毛病。

3100万词元换来的验证边界

这份结果的产出过程本身值得记一笔。Claude最初生成并尝试了650个想法,全部失败,靠人反复说"继续试"才没放弃。

第二轮它协调约60个子代理,跑了2400条Shell命令,写了几百个Python脚本。

阶段规模
第一轮想法生成650个,全部失败
第二轮协作约60个子代理
命令执行2400条Shell命令
总消耗3100万输出词元(两次Claude Code会话)

这是一个远超普通对话场景的计算规模,目前只存在于研究版模型里,还没有对外发布。

验证这份证明的是Anthropic内部两位数学家,外部专家Brian Conrey和Dan Goldston只做了短时间审阅,谈不上广泛同行评议。数学圈子的正常验证周期以年计——论文投出去、审稿人反复挑刺、结果被其他学者复现,这套流程Claude的结果目前都没走完。Lean形式化验证能确认逻辑链条内部不矛盾,但检验不出这条思路是不是数学家本该想到、只是没空拼起来的东西。

对研究者和技术决策者意味着什么

关注AI辅助数学推理的研究者,可以把这个案例当成流程参考,而不是结论参考。Claude把"读文献、找可组合路径、快速生成候选证明"这套动作走了一遍,规模是人类研究者难以复制的。值得拿它试试文献检索和证明草稿这类工作,但不该指望它替你判断一条证明路径有没有价值。

评估大模型科研能力的技术决策者,更该看成本和边界:3100万词元、两轮协作、650个失败想法,换来的是一个建立在他人近两年工作基础上的组合结果,不是模型独立选题、独立求解。如果采购或立项的依据是"AI已经能替代团队攻克开放数学难题",这个案例目前撑不起这个判断。

67.2%离证明黎曼猜想需要的100%,中间隔的不是几个百分点,是整套证明方法。