Multiverse Computing说自己把GPT-OSS 120B压缩到60B参数、再量化到4-bit(MXFP4)之后,这个又小又便宜的模型在9项基准里赢了自己的全精度版本7项。量化本该掉点,这次却涨了,听起来像是把常识倒过来讲。但论文里还藏着第二张对照表——同一个4-bit模型跟真正没被压缩过的120B原始教师模型比,大多数基准还是输的,长上下文任务上差了7个多百分点。

“愈合”为什么在这里失灵

行业里给压缩模型“治病”通常有两套方案。QAT(量化感知训练)把假量化算子塞进前向传播,接着重跑一遍SFT、RLHF那一整套后训练,成本高,练久了还容易失控。QAD(量化感知蒸馏)图省事,直接拿一个冻结的全精度教师做KL蒸馏,前提是教师和学生架构得一样。

问题出在“架构压缩+量化”这个双重损失场景。模型先剪掉了层、头、神经元,再quantize,此时唯一能当教师的,只有那个压缩后又恢复出来的BF16 checkpoint——它自己就是一个有损近似。拿它当老师,学生的精度天花板直接被锁死在这个checkpoint的水平。这是此前一直没人正面解决的问题。

QAH赢的是谁

Multiverse的解法是换教师:不用那个已经打折的BF16 checkpoint,而是直接用未压缩的120B原始模型做蒸馏对象。教师和学生连架构都不一样,输出分布是架构无关的,尺寸不匹配也不影响迁移。

赢的是谁:两个对照组 对比对象:60B BF16 checkpoint 7/9 基准上占优 长上下文 +7.4 数学 +5.6 知识类 -0.2 对比对象:120B原始教师 多数落后 长上下文 -7.3(最大差距) 代码 +0.5(论文称或为噪声) 知识类 -4.2
赢了对照组,未必赢了真正的对手。
基准vs BF16(60B)vs 120B教师说明
AA-LCR(长上下文)+7.4−7.3提升最大,也是仍落后最多的项目
AIME2025(数学)+5.6−3.7题量仅30题,波动可能不小
LiveCodeBench(代码)+1.0+0.5论文自己也说这点差距可能是噪声
MMLU-Pro(知识)−0.2−4.2唯一对BF16也没赢的基准

还有一层细节容易被忽略:那个被叫做“全精度”的120B教师,大部分MoE权重本身已经是MXFP4,只有少数张量留在BF16。QAH的优势更可能来自教师容量更大,而不是精度更高——这跟标题暗示的“4-bit打赢16-bit”不是一回事。

比准确率更扎实的发现

在更小的9B模型上,Multiverse做了QAH和QAT的直接对照,这部分数据反而比主实验更有说服力。

训练曲线:QAH稳,QAT崎 平均分 QAH 约100步达峰 54.9 QAT 约700步达峰 54.6 1200步掉近19分 0步 1200步

两种方法的峰值几乎相同,差别在于QAH达峰快、过峰不崩,QAT达峰慢、过峰即塌。这个稳定性差异对部署决定更实际:QAT checkpoint得靠留出集小心早停,QAH练够了直接上线也不容易漂移。

另一个原文没提的发现更值得留意:同样做MXFP4训练,用FSDP2分片的效果明显好于DeepSpeed ZeRO-3,GPQA-Diamond上差了将近9分。论文没解释机制,只是默认后续都用FSDP2——这说明训练基础设施的选择本身可能是被低估的变量,值得单独验证,不该被这篇论文的主线盖过去。

  • 结论.QAH真正站得住的贡献,是把达峰步数压到QAT的七分之一,而且过峰不掉分,这对生产环境的部署风险是实打实的减少。
  • 风险.论文缺少QAH与QAD的直接对照实验,核心论点“教师选原始模型更好”目前仍是推断,没有实证消融;主实验又是单次运行,没有置信区间,AIME只测了30题。

把这篇论文拆开看,技术贡献和营销结论其实是两件事。4-bit模型系统性地跑赢自己的BF16版本,这个结论站得住,而且解释得通——蒸馏对象换成原始教师之后,学生拿到的是恢复阶段没来得及给的监督信号。但“压缩4-bit模型反超全精度原版”这句话,如果读者理解成打败了120B原始模型,那就想多了:真正的原始模型在大部分基准上仍然领先,长上下文任务领先了7分多。

古人讲过犹不及,放这里也合适:结论抢跑了,证据链还没跟上。论文没做的事也不少——没有跨模型家族、跨量化格式的验证,压缩算子是自家专有技术,外部复现不了,也没给出实际部署的吞吐量、延迟或能耗数据。对想照着这套方法做压缩的团队来说,能确定抄的是“换教师”这个思路和它带来的训练稳定性;至于“4-bit真的能比全精度更强”,还得等更多独立复现和更严格的消融实验来验证。