直接把大语言模型中间切掉一半,不给任何微调补偿,模型通常会当场精神错乱。

在过去的深度剪枝实践里,这种粗暴的结构手术往往伴随着惨烈的性能崩塌。但 Multiverse Computing 最近公布的一项成果打破了常理:他们把 Llama-3.3-70B-Instruct 的 80 个 Transformer 模块直接剪掉 40 个,在完全无需重训练的前提下,MMLU 基准测试拿下了 76.9 分,仅比原模型 82.2 分下滑 5.3 分。

Llama-3.3-70B 零样本 50% 深度剪枝 MMLU 表现对照 稠密原始模型 82.2 分 CBO 物理二阶法 76.9 分 Block Influence 54.0 分 传统无恢复 SLEB 50.1 分 (均分) Norm ratio 基准 27.4 分

作为参照,采用主流启发式评分的 Block Influence 在同等砍半条件下跌到了 54.0 分,Norm ratio 方法跌穿至 27.4 分;在先前的 50% 结构剪枝基准横测中,无恢复训练的 SLEB 五项基准平均准确率只有 50.13%,BlockPruner 也仅有 49.43%,比原版 Dense 模型的 79.94% 损失约 30 个百分点。

Multiverse 给出的解释带着浓重的理论物理色彩:传统剪枝大多属于平均场近似,假定每一层对网络的影响互不干扰,而他们将层与层之间的相互作用引入公式,建模为全连接自旋玻璃(Ising glass)的能量极小化受限优化。听上去像是一场优雅的降维打击,但若是顺着数学推演和实验细节往深处看,这项惊艳战报里其实塞了不少耐人寻味的工程妥协。

量子外衣之下,干活的是经典搜索

这篇论文最引人注目的标签,是物理学与量子启发算法。

算法实际只在单张经典显卡上运行,并未使用量子硬件
算法实际只在单张经典显卡上运行,并未使用量子硬件

团队为每个模块残差路径设置一个二值变量,保留为 0,剔除为 1。随后通过二阶泰勒展开构建相互作用矩阵,把选层问题转为数学上的受限二进制优化。官方叙事里,这套体系能无缝对接量子退火与 QAOA。

但回到真实的计算底座,量子硬件根本没有登场。大模型候选解的实际搜寻,是借助单张 GPU 上运行的经典禁忌搜索在数秒内完成的。

物理隐喻包装了算法框架,真正起效的却只是经典离散优化的数学补丁。

理论推导本身也存在断层。论文声称构建了损失函数的 Hessian 矩阵,利用对角线衡量单层重要性、非对角线刻画层间耦合。但在实操中,计算真 Hessian 代价过高,团队实际采用的是外积近似,即半正定的经验 Fisher 矩阵。这不仅丢失了损失曲面的真实曲率信息,而且将门控变量直接从 0 变到 1,变动幅度达到负一,早已大幅偏离了微扰展开赖以成立的微小邻域。

此外还要厘清一个概念:论文提及的 50% 压缩特指移除 80 个 Transformer 模块中的 40 个,并不等同于模型总参数、显存占用或磁盘文件体积整体缩减一半。嵌入层、头尾变换和非模块组件依然完整保留。


激发态后验挑选,暴露出脆弱的泛化边界

如果说近似数学是工程上的权衡,那么候选解的选择方式则直击其理论叙事的痛点。

跑分最高的结构并非理论最低能级,而是人工挑选的激发态(示意图)
跑分最高的结构并非理论最低能级,而是人工挑选的激发态(示意图)

在自旋玻璃模型里,能量最低的基态理应对应最佳模型结构。但实际测试中,跑分最高的往往不是理论基态,而是能谱里的激发态。在 Llama-3.1-8B 实验中打败基态的是第 17 激发态,在 Nemotron 混合架构中胜出的是第 22 激发态。

物理叙事与工程落差:三处关键分歧 选态悖论 理论:基态对应最优 实测:基态往往落败 依赖第 17/22 激发态 存在后验挑选质疑 算力外衣 宣传:量子退火求解 内核:单卡禁忌搜索 秒级经典算法完成 经验 Fisher 代替曲率 分布敏感 校准集采用 OpenHermes MMLU 达 71.8 分 换 LMSYS 跌至 63.0 换 WikiText 退化至随机

当能量函数的极小值无法稳定指示下游精度,论文只得承认候选态经过了人工筛选。这也带来了潜在风险:研发人员是否借由激发态的丰富组合,在下游跑分榜上完成了隐蔽的后验过拟合?若剥离人工挑选,完全交由能量排序自动决策,这套算法的表现可能会大打折扣。

更严峻的问题在于算法的鲁棒性。

  • 风险.该方法对校准数据集表现出极端的分布敏感,在 Qwen 测试中,采用 OpenHermes 校准时 MMLU 为 71.8 分,换用 LMSYS 跌到 63.0 分,而换用 WikiText 则直接崩溃至接近随机猜测。

数据分布稍有偏离,精心计算的层间耦合能量函数便全面失灵,这暴露出泰勒展开在复杂跨域任务下的局限。

工业天花板与开源专利墙

退一步看适用区间,物理剪枝并没有展现出通吃的能力。

硬性剔除中间层模块,直接破坏了模型复杂推理的长逻辑链条(示意图)
硬性剔除中间层模块,直接破坏了模型复杂推理的长逻辑链条(示意图)

在 10% 到 30% 的中低压缩比例下,二阶耦合的收益微乎其微。当剪去 30% 模块时,该方法 MMLU 为 79.5 分,甚至略逊于 Block Influence 的 80.9 分。它的所有亮眼数字,完全堆砌在 40% 以上的极端压缩场景。

但在真实部署环境里,工程师如果需要压缩大模型,第一选择永远是成熟的 4-bit 量化甚至带蒸馏的轻微调。量化保留了所有网络深度的非线性表达,而硬生生砍掉一半模块,即使静态跑分尚可,其推理逻辑链在长文本复杂任务中的连贯性仍要打上问号。

  • 建议.在评估结构剪枝时,务必考察端到端推理延时与量化兼容性,而非单纯看层数缩减比例。

这套代码虽然在 GitHub 公开,但打上了专利待审的非商业科研标签,截至检索索引时仅有 3 次提交、1 颗星与 0 个 Issue,尚无第三方成功独立复现。

引入自旋玻璃给模型压缩开辟了有意思的数学视角,它证明了层与层之间的非独立关联确实存在。但若想把这个带着量子光环的物理模型变成工业界通用的基础工具,它还得先越过经验近似、后验调优和严苛的分布偏差这三道坎。