把两个十多位的大数字相加,还要强行要求模型直接吐出纯英文单词结果,这种测试更像一场严苛的裸体心算压力测试。

开源开发者 Simon Willison 最近在本地 DGX Spark 设备上,使用 llama.cpp 跑了一遍量化版 Qwen3.8-27B-Q4_K_M。他复现了此前 Colin Fraser 针对 GPT-4o 做过的算术实验,结果呈现出极其刺眼的两极分化:在彻底关闭推理的 5,070 次测试中,模型综合数值准确率仅有 23.57%;而一旦开启中等思考模式,169 组样本中模型拿下了 167 组正确,准确率跃升至 98.8%。

Qwen3.8 27B 单词加法基准测试对照 关闭推理模式 样本量:5,070 组(每格 30 组) 23.57% 高位数(10-13位)暴跌至 6.44% 格式合规率 96.17%,算得规整但算不对 开启中等推理 样本量:169 组(每格 1 组) 98.8% 167 / 169 命中,仅失手 2 例 自发展开逐位对齐与进位草稿

表面上看,这似乎又是思考模型碾压传统模式的标准戏码。但剥开热力图的数据表象,背后的工程机理与评测逻辑远比单纯的准确率涨跌复杂。

自回归的物理锁链与草稿纸效应

在关闭推理的测试里,模型并非从头烂到尾。面对 1 到 3 位数的简单加法,模型的准确率高达 97.04%,同时交出了 96.17% 的格式遵循度。真正的断崖式崩塌发生在操作数长度超过 10 位之后,数值准确率一路暴跌至 6.44%。

这种衰减并非偶然。标准的自回归 Transformer 模型在生成每一个 Token 时,前向传播层数与计算步数是固定死的。当 Prompt 明确要求不准输出多余字符、必须直接给出英文单词答案时,模型实际上被剥夺了所有的工作记忆。它不仅要在脑内完成两位数、三位数的对齐,还要把自右向左产生的进位累加一路缓存到高位,最后再翻译成从高位开始拼写的英文单词。

缺乏中间缓冲的纯心算,是在用恒定的单步算力强行对抗线性的进位深度。
思考模式对工作记忆的补齐链路 输入大数操作数 如 13 位对 13 位整数 直接索要英文单词 无演算空间即心算崩溃 内置思考链(CoT) 自发对齐:重排大数对齐列 逐位推进:从低位加到高位 外部存储:Token 充当进位存储器 最终单词输出 提取演算终态 翻译为纯英文单词 准确率拉升至 98.8%

从 Willison 记录的推理日志可以清晰看到,一旦开启推理,模型立刻写出类似算草的痕迹:先将两个大数垂直对齐,再从个位逐位向左计算进位。思考链生成的每一个 Token,本质上就是一张草稿纸,为自回归网络提供了类似图灵机纸带的工作状态。这不是模型学会了高等数学,而是工程上通过增加时间与 Token 成本,把单步计算缺陷转化为状态机累加。


强行闭眼的评测偏差

如果认定这次测试证明了模型不开推理就毫无数学能力,那就掉入了评测设计的陷阱。

Qwen3.8 的官方架构默认在思考模式下运行,并在底层原生支持 reasoning_effort 级别调节。非思考模式对这个系列而言,属于被人工干预后的特殊运行态,而不是单纯的低成本运行分支。强行关闭推理,相当于把长跑选手的双腿绑住,再测试其平地跳跃的高度。

在 Qwen 官方的评估体系中,无工具心算与支持 Python、计算器的工具调用原本就分属两条评测轨道。工业界使用语言模型处理现实业务,从来不会把多位数算术交给大模型心算,而是通过 Agent 调用 Python 解释器或外部计算器完成。

社区基准测试的数据更能说明问题:Qwen3.8-27B 在 MATH-500 测试集上的整体准确率为 86.4%,但如果排除掉推理停滞样本后,准确率会直接升至约 94%。这意味着决定模型最终解题分数的关键,往往不是其底层数学表征的上限,而是它的推理终止机制与控制状态。

  • 提醒.剥离思考链且禁用外部工具的基准测试,本质上是极端条件下的纯心算与指令压制测试,不能直接等同于模型的真实综合数学能力。

生产落地的隐形变量

把评测拉回真实的部署环境,另一个常被忽视的变量是推理框架与系统栈的稳定性。

Willison 跑出的 98.8% 成绩建立在单用例单次采样(169 组)的前提下。在实际工程中,Qwen3.8 展现出较强的推理技术栈敏感性。在社区反馈与 Issue 讨论中,该模型在设置超高推理强度(xhigh)配置时,偶尔会出现空最终回答的异常,而这类失效率在 LM Studio、llama.cpp、vLLM 以及官方 API 服务之间的表现并不一致。

不同后端引擎在处理超长上下文解码、KV Cache 管理和长思考链截断机制上的策略差异,会直接介入模型的最终表现。在本地硬件上部署量化版模型(如 Q4_K_M),除了要承受单次推理耗时的几何级拉长,还要直面推理栈本身的偶发抖动。

盲目追求无思考模式下的高精度,是对自回归计算特性的误解;而盲信思考模式全知全能,则容易忽视推理时延与系统栈稳定性的工程代价。理解了草稿纸的物理意义,才能在工程实践中把算力用在刀刃上。