Anthropic披露,一个尚未对外发布的研究版Claude,在专门配置的Claude Code环境里认真试了一次黎曼猜想。它把黎曼ζ函数中满足猜想条件的零点比例,已知下界从41.6%推高到67.2%,并提交了一份可用Lean工具形式化验证的证明。
这不是黎曼猜想被证明。黎曼猜想诞生于1859年,克雷数学研究所为完整证明或推翻它开出100万美元奖金,至今无人领走。Claude这次动的,是这个悬赏问题下面的一个局部指标,性质更接近数学家常年在做的"抬高已知下界",不是解开整个猜想。
Claude做了什么,没做什么
Claude把相关零点比例的已知下界从41.6%提高到了67.2%。方法不是凭空发明新数学,而是把Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh几位数学家近两年发表的技术,跟Bombieri在2000年的一篇论文重新拼接,找出一条此前没人走通的组合路径。
砖是别人烧的,Claude把墙多砌高了一截,砌得比人类团队通常需要的时间快得多。
| 此前 | Claude这次 | |
|---|---|---|
| 已知下界 | 41.6%(数十年积累) | 67.2% |
| 猜想本身是否被证明 | 未完成 | 未完成 |
| 悬赏 | 100万美元,克雷数学研究所,猜想提出于1859年 | 未变 |
Anthropic自己在文章里说得很直接:不指望这条技术路线能通向黎曼猜想的证明。这是Claude自己给出的边界,不是外部人挑出来的毛病。
3100万词元换来的验证边界
这份结果的产出过程本身值得记一笔。Claude最初生成并尝试了650个想法,全部失败,靠人反复说"继续试"才没放弃。
第二轮它协调约60个子代理,跑了2400条Shell命令,写了几百个Python脚本。
| 阶段 | 规模 |
|---|---|
| 第一轮想法生成 | 650个,全部失败 |
| 第二轮协作 | 约60个子代理 |
| 命令执行 | 2400条Shell命令 |
| 总消耗 | 3100万输出词元(两次Claude Code会话) |
这是一个远超普通对话场景的计算规模,目前只存在于研究版模型里,还没有对外发布。
验证这份证明的是Anthropic内部两位数学家,外部专家Brian Conrey和Dan Goldston只做了短时间审阅,谈不上广泛同行评议。数学圈子的正常验证周期以年计——论文投出去、审稿人反复挑刺、结果被其他学者复现,这套流程Claude的结果目前都没走完。Lean形式化验证能确认逻辑链条内部不矛盾,但检验不出这条思路是不是数学家本该想到、只是没空拼起来的东西。
对研究者和技术决策者意味着什么
关注AI辅助数学推理的研究者,可以把这个案例当成流程参考,而不是结论参考。Claude把"读文献、找可组合路径、快速生成候选证明"这套动作走了一遍,规模是人类研究者难以复制的。值得拿它试试文献检索和证明草稿这类工作,但不该指望它替你判断一条证明路径有没有价值。
评估大模型科研能力的技术决策者,更该看成本和边界:3100万词元、两轮协作、650个失败想法,换来的是一个建立在他人近两年工作基础上的组合结果,不是模型独立选题、独立求解。如果采购或立项的依据是"AI已经能替代团队攻克开放数学难题",这个案例目前撑不起这个判断。
67.2%离证明黎曼猜想需要的100%,中间隔的不是几个百分点,是整套证明方法。
