GLM-5.2用大约400亿激活参数,在AIME 2026上拿到99.2%;Qwen3.5把这个数字压到170亿,拿了91.3%;DeepSeek V4-Flash的激活参数只有130亿。放在三年前对比,GPT-4传闻用了2800亿激活参数,却几乎解不出一道AIME赛题。这组数字很容易得出一个结论:实验室正在用更少的参数换更强的推理。方向大体没错,但把这几个数字拆开核对,每一个都有一层没被讲清的说明——三家的AIME成绩用的评测尺子并不一样,业内常引用的DeepSeek某个高分其实来自它的Pro版本而不是Flash,而被拿来证明"小模型幻觕率高达八成"的那个数字,分母里本来就没打算算进正确答案。

三个AIME分数,三套评测尺子

GLM-5.2的99.2%来自官方744B总参数/40B激活参数的checkpoint,评测协议允许模型最多生成16.38万token生成量,并用GPT-5.5 Medium当裁判。Qwen3.5的397B总参数/17B激活参数版本拿到91.3%,推荐用思考模式、最多输出8.19万token,但官方卡片对评测细节的披露不如GLM完整。DeepSeek V4-Flash是284B总参数/13B激活参数,可它公开的评测表里压根没有AIME 2026这一项,只报了HMMT 2026和IMOAnswerBench。行业里流传的94.6分,实际出自激活49亿参数的V4-Pro,不是Flash。三份成绩单的裁判模型、token预算、题目集合都不统一,拿来拼成一条"参数越少分数越高"的曲线,更像方向对、精度不够。

激活参数量对比 每token激活参数,单位:十亿 GPT-4(2023,传闻) 280 GLM-5.2 40 Qwen3.5 17 DeepSeek V4-Flash 13
  • 风险.跨厂商AIME对比缺乏统一协议,数字好看但未必能直接叠成一条曲线。

MoE把知识和推理拆成了两笔账

支撑这套叙事的技术前提是混合专家架构。模型可以有几百亿甚至更大的总参数用来存长尾知识,但每次推理只唤醒其中一小部分专家,这部分才是激活参数。原文引用的"每参数2比特知识容量"来自Physics of Language Models系列论文,但这个数字是在某个事实被模型看过约一千次的条件下测出来的;换成只出现过一百来次的冷门知识,容量会掉到每参数1比特左右。也就是说,"知识必须占用大量参数"这句话是有弹性的经验值,不是物理定律。Phi-4用140亿参数、大量合成教科书数据训练出好数学、差冷知识的组合,印证的是训练数据决定去留,不是参数容量的铁律。

"幻觕率80%"是怎么算出来的

Artificial Analysis给Qwen3.5 4B和9B的知识基准打出80%到82%的幻觕率,原文把它读成"模型不知道答案时几乎都在编"。这个指标的分母是错误加部分正确加未作答,不包含答对的题目——按同一口径倒推,4B的全题错误率大约七成,不是八成,差距不算小。放在同一个尺子下,如果给Gemini 2.5 Pro的SimpleQA成绩也套用这套公式,数字会飙到97%以上,因为这套指标更多反映的是模型敢不敢"弃答",不是它到底记住了多少事实。原文引用Gemini 2.5 Pro在SimpleQA拿53%,检索到的官方与学术数据是55.3%到55.6%,差距大概率来自SimpleQA原版和Verified版口径不同,不是同一份成绩单。

幻觕率量的是模型敢不敢答,不是它记不记得。
两组数字,拆开看不一样 原文引用 拆解后 Qwen3.5 9B 幻觕率 80% 全题错误率 约70% Gemini 2.5 Pro SimpleQA 53% 官方/学术口径 55.3-55.6%

知识挪到检索层,账不是白算的

把知识外置给检索和工具调用,确实能让错误变得可查——模型引用一份文档,文档错了可以直接改,不用等下一次训练。但这不是免费的置换。检索本身会读错源、会把两份资料拼错,新的失败模式从"编造"变成"引错",对普通用户未必更容易分辨。企业如果打算用小模型加RAG取代大模型内嵌知识,在医疗、法律、金融这类容错率低的场景,更该关心的不是模型幻觕率降没降,而是检索链路本身有没有被验证过。

  • 结论.知识外置能让错误可查,但检索链路本身尚未证明足够可靠。

接下来值得盯的,是各家会不会统一AIME这类竞赛基准的评测协议,以及消费级显卡上跑"高推理、低知识"模型配检索的产品,能不能在这两年真正落地。目前看到的还只是方向,不是成品。