Multiverse Computing说自己把GPT-OSS 120B压缩到60B参数、再量化到4-bit(MXFP4)之后,这个又小又便宜的模型在9项基准里赢了自己的全精度版本7项。量化本该掉点,这次却涨了,听起来像是把常识倒过来讲。但论文里还藏着第二张对照表——同一个4-bit模型跟真正没被压缩过的120B原始教师模型比,大多数基准还是输的,长上下文任务上差了7个多百分点。
“愈合”为什么在这里失灵
行业里给压缩模型“治病”通常有两套方案。QAT(量化感知训练)把假量化算子塞进前向传播,接着重跑一遍SFT、RLHF那一整套后训练,成本高,练久了还容易失控。QAD(量化感知蒸馏)图省事,直接拿一个冻结的全精度教师做KL蒸馏,前提是教师和学生架构得一样。
问题出在“架构压缩+量化”这个双重损失场景。模型先剪掉了层、头、神经元,再quantize,此时唯一能当教师的,只有那个压缩后又恢复出来的BF16 checkpoint——它自己就是一个有损近似。拿它当老师,学生的精度天花板直接被锁死在这个checkpoint的水平。这是此前一直没人正面解决的问题。
QAH赢的是谁
Multiverse的解法是换教师:不用那个已经打折的BF16 checkpoint,而是直接用未压缩的120B原始模型做蒸馏对象。教师和学生连架构都不一样,输出分布是架构无关的,尺寸不匹配也不影响迁移。
赢了对照组,未必赢了真正的对手。
| 基准 | vs BF16(60B) | vs 120B教师 | 说明 |
|---|---|---|---|
| AA-LCR(长上下文) | +7.4 | −7.3 | 提升最大,也是仍落后最多的项目 |
| AIME2025(数学) | +5.6 | −3.7 | 题量仅30题,波动可能不小 |
| LiveCodeBench(代码) | +1.0 | +0.5 | 论文自己也说这点差距可能是噪声 |
| MMLU-Pro(知识) | −0.2 | −4.2 | 唯一对BF16也没赢的基准 |
还有一层细节容易被忽略:那个被叫做“全精度”的120B教师,大部分MoE权重本身已经是MXFP4,只有少数张量留在BF16。QAH的优势更可能来自教师容量更大,而不是精度更高——这跟标题暗示的“4-bit打赢16-bit”不是一回事。
比准确率更扎实的发现
在更小的9B模型上,Multiverse做了QAH和QAT的直接对照,这部分数据反而比主实验更有说服力。
两种方法的峰值几乎相同,差别在于QAH达峰快、过峰不崩,QAT达峰慢、过峰即塌。这个稳定性差异对部署决定更实际:QAT checkpoint得靠留出集小心早停,QAH练够了直接上线也不容易漂移。
另一个原文没提的发现更值得留意:同样做MXFP4训练,用FSDP2分片的效果明显好于DeepSpeed ZeRO-3,GPQA-Diamond上差了将近9分。论文没解释机制,只是默认后续都用FSDP2——这说明训练基础设施的选择本身可能是被低估的变量,值得单独验证,不该被这篇论文的主线盖过去。
- 结论.QAH真正站得住的贡献,是把达峰步数压到QAT的七分之一,而且过峰不掉分,这对生产环境的部署风险是实打实的减少。
- 风险.论文缺少QAH与QAD的直接对照实验,核心论点“教师选原始模型更好”目前仍是推断,没有实证消融;主实验又是单次运行,没有置信区间,AIME只测了30题。
把这篇论文拆开看,技术贡献和营销结论其实是两件事。4-bit模型系统性地跑赢自己的BF16版本,这个结论站得住,而且解释得通——蒸馏对象换成原始教师之后,学生拿到的是恢复阶段没来得及给的监督信号。但“压缩4-bit模型反超全精度原版”这句话,如果读者理解成打败了120B原始模型,那就想多了:真正的原始模型在大部分基准上仍然领先,长上下文任务领先了7分多。
古人讲过犹不及,放这里也合适:结论抢跑了,证据链还没跟上。论文没做的事也不少——没有跨模型家族、跨量化格式的验证,压缩算子是自家专有技术,外部复现不了,也没给出实际部署的吞吐量、延迟或能耗数据。对想照着这套方法做压缩的团队来说,能确定抄的是“换教师”这个思路和它带来的训练稳定性;至于“4-bit真的能比全精度更强”,还得等更多独立复现和更严格的消融实验来验证。
