一篇在数学和AI圈子里流传的博客文章提出一个反直觉判断:AI解数学题变强,不是因为它更聪明,而是因为它拥有一个远超人脑的外部工作记忆——能同时装下整道题、几百个中间方程、几条已经放弃的思路。这个类比很漂亮,作者甚至把AI比作"被机器放大的冯·诺依曼"。但拿实际的基准测试一验证,裂缝立刻露出来:上下文窗口拉得越长,数学准确率有时反而更低。
这说明记忆假说抓住了一部分真相,但不是全部真相。记忆容量大是数学表现变好的必要条件,不是充分条件——这才是读者真正该记住的判断。
人脑记不住,纸笔和上下文窗口能
认知心理学里一个常被引用的估计是,成年人的核心工作记忆容量只有3到5个有意义的组块。专家靠"组块化"把复杂结构压缩成一个概念单元,但这只是压缩信息密度,没有突破容量上限。写在纸上、算在草稿本上,本质是把生物学限制甩给外部介质。
大模型的上下文窗口就是一个放大版的草稿本:能装下的不是几个组块,而是数万到十几万个token。心理学研究(如Alloway团队的儿童追踪研究)也证明,工作记忆在控制IQ之后,仍能独立预测数学表现——这给"记忆本身是变量"提供了心理学依据。
上下文拉长,数学准确率反而往下掉
MathHay基准的数据打破了"记忆越多,能力越强"的朴素推论。GPT-4o在32K token上下文下的最高准确率为54.38%;Gemini-1.5-Pro-002在64K下是52.30%,拉到128K反而降到51.26%。窗口更大,答案没有更准,反而更容易走偏。
GSM-Symbolic的实验更扎心:只在数学应用题里塞进一句逻辑上无关、但看起来相关的从句,某些模型的准确率最高能暴跌65%。模型没有丢失信息,它只是被多余的"噪音记忆"带偏了方向。
记忆够用不等于推理正确,这中间还差一步验证。
- 风险.窗口越大不代表检索越准,无关信息越多,模型走偏的概率反而上升。
记忆要能被"用起来",才真的算数
真正支持原文假说的,是另一类实验:给推理模型配上Python解释器和一份持久的文本草稿本,让它能反复读写、验证中间结果。这类"工具增强"模型在各难度谜题任务上都稳定优于没有外部工作空间的普通模型——这比心理学类比硬得多,是原文机制唯一拿得出的直接证据。
区别在于:MathHay和GSM-Symbolic里那种"被动堆长"的记忆没用,能反复调用、交叉核对的交互式记忆才有用。存储只是第一步,检索和验证才是决定成败的后两步。
- 结论.记忆假说需要拆成三层——能不能装下、能不能找回、能不能核对,缺一不可,单靠上下文长度回答不了这三个问题。
IMO金牌证明的是记忆,还是算力堆量?
DeepMind的AlphaProof和Gemini Deep Think在国际数学奥林匹克上拿到过瞩目成绩,常被拿来当作"AI已具备顶尖数学家水平"的证据。但这份成绩至少有三种解释:外部记忆容量的优势、训练数据里大量结构相似题目带来的"套路迁移"、以及远超单个人类选手的推理时间与算力投入。三者很难被干净地分开。
以陶哲轩为代表的数学家一直提醒,竞赛题的解答和开放式数学研究之间隔着一条大鸿沟——奥赛题目本身高度结构化,恰好是"外部符号工作空间"最擅长的战场,换成需要提出全新猜想的研究性问题,记忆优势就没那么好用了。
另一个容易被忽略的坑,是把"人类工作记忆3~5个组块"和"AI上下文token数"直接拿来做数量级对比。两者衡量的根本不是同一维度的能力,认知科学界对这类类比一向谨慎——一个漂亮的比喻,不该被当成一个可以直接相除的公式。
对普通读者来说,该盯的不是"AI又拿了金牌"这类标题,而是有没有实验能把"记忆容量"和"推理策略质量"这两个变量真正拆开。目前能看到的基准测试,答案还是:记忆帮了大忙,但没有它想象中那么万能。
