推理模型这两年密集拿金牌。2025年多次达成IMO金牌级战绩,几个月前Google DeepMind联手陶哲轩,用AI重新发现或改进了67道横跨数学分析、组合、几何、数论的难题解法。据公开报道,一个通用推理模型还一次性解出了离散几何里悬置多年的“单位距离问题”。这些都是真实成绩,没人否认。
但同一批模型身上,还有一件更怪的事:把它写出来的“思考过程”删掉三成到六成,答案往往不变。有研究干脆把正确的思路整段换成错误或毫无意义的文字,模型照样答对。它到底是真在一步步算,还是恰好蒙对了答案?
能算对题,不等于会那样想
2024年NYU一篇论文发现,把思维链整段换成毫无意义的省略号,模型在简单数学题上正确率反而更高。文字内容本身可能根本不重要。
亚利桑那州立大学Kambhampati团队走得更远。他们把模型自己生成的正确思考痕迹,整个替换成错误或无关的文字,模型在正式推理任务上的表现没有明显下降。
2025年东北大学和加州大学伯克利分校拆解了几款开源前沿推理模型。数学基准测试里,30%到60%的“思考步骤”删掉之后,答案几乎不受影响。这些步骤看着像在推理,更像是可以随手扔掉的脚手架。
三件事叠在一起,指向同一个结论:模型答对了,不代表它写下的思路忠实反映了内部计算,也不代表那段文字对最终答案起了因果作用。正确率和可审计性,从来是两回事。
谁在把“能用”讲成“像人”
OpenAI的Sébastien Bubeck把此前对推理模型的质疑称为“过时训练缺陷导致的错误结论”,还坚持说单位距离问题的证明公开了思维链,模型就是像人一样在推理。严格说,公开的是两位专家用另一个模型改写过的摘要,不是原始记录。OpenAI、Google DeepMind、Anthropic都没有公开过原始思维链。
Kambhampati说得更直接:“很多能力主张是先喊出来,指望它以后变成真的。这不是科学,是投资。”这句话点出分歧的根子——学界要的是可解释、可审计的机制,厂商要的是能撑住估值叙事的“类人推理”故事。
他自己给出一种解释:推理模型本质上还是语言模型,“思考文字”起的作用不是记录推理,而是把相关词汇塞进上下文窗口,帮模型在训练语料的高维空间里近似检索出看着对的答案。介于死记硬背和真正推理之间,但更偏前者。
醉翁之意不在酒。思考token的意思,可能不在它写了什么道理,而在于它把上下文喂饱了。
这也是为什么“负面证据”不能无限外推。被测试的多是较旧或开源模型,最新闭源旗舰的原始思维链外界拿不到。现有结论目前只能证伪“模型像人一样一步步想清楚再写下来”这种简单说法,不能证伪模型本身有推理能力。
还有一件事容易被混着说:不是所有“数学正确”都靠同一套机制撑着。
| 路线 | 正确性靠什么撑 | 代表 | 能否证明“模型真的会推理” |
|---|---|---|---|
| 纯语言模型推理 | 模型自己生成的思维链自证 | 冲IMO金牌的通用推理模型 | 现有证据不足以下结论 |
| 外部验证系统 | Lean等形式化证明器把关 | AlphaProof一类 | 正确率有软件背书,不代表纯CoT模型也行 |
前者只能自证,后者有软件兜底。把两条路线的结果混在一起讲“AI会推理”,是这场争论里最容易偷换的一步。
这事对你意味着什么
如果你是正在评估推理模型可不可信的开发者或决策者,眼下最实际的动作是:别把模型自己写的思维链当成安全审查或事实核查的证据链。没有外部验证器兜底时,它更像一段“看起来像推理”的文本,不是可回溯的日志。需要确定性的场景,优先靠Lean这类能形式化验证的方案兜底,而不是相信模型的自我陈述。
如果你只是关注大模型能力边界的技术读者,接下来该盯的不是又跑出哪个新基准分数,而是有没有研究者直接拿最新闭源旗舰模型做同样的删除、替换实验。现在的负面结论大多测的是旧模型或开源模型,谁先把这套实验搬到最新闭源系统身上,谁的结论才真正有分量。
回到开头那个怪现象:删掉大半思考步骤,答案照样对。这不代表AI在骗人,更可能是它压根没打算靠那段文字“思考”。金牌是真的,黑箱也是真的,这两件事从来不矛盾——只是别再把删了也不影响结果的文字,当成审计报告来读。
