深度学习这栋大厦建在反向传播之上已经四十年,终于又有人声称要拆掉承重墙。

QLabs 不久前公开了一篇研究与开源代码,推出名为 Dust 的零阶优化算法。作者宣称这是业内第一个无需反向传播、仅凭前向扰动就能在 Transformer 预训练上匹敌甚至超越梯度下降的方案。在官方图表里,它的计算效率比此前最顶尖的演化策略算法 EGGROLL 高出10^3到10^4倍,甚至出现了超参数量越大反而更省种群的反常特征。消息传开后,不少人将其视作萨顿所谓苦涩教训的又一次胜利:抛弃解析求导的精巧先验,用通用搜索和暴力计算重构底层。

但若仔细翻完技术细节,这篇看似离经叛道的论文更像是一场极为精巧的借壳上市。

偷梁换柱:用自回归并行拼凑梯度

传统演化策略之所以无法用于大模型预训练,症结在于参数维度灾难。动辄几亿、几十亿个权重参数,在权重空间盲目抖动无异于大海捞针;即便如 2025 年提出的 EGGROLL 用低秩扰动压缩开销,每一次评估依然需要实打实跑一次前向传播,种群规模一旦拉大,算力立刻见底。

Dust 的聪明之处在于彻底放弃权重空间扰动,转而把高斯噪声注入线性层的激活输出。它利用 Transformer 的自回归特性,在每个 token 产生激活时独立扰动,再依据该 token 处的损失变化发放奖励加权。在单次前向传递中,序列里的成千上万个 token 就地化身为独立的虚拟种群。

更值得玩味的是它的数学落点。线性层权重的梯度估计,最终写成了输入向量与扰动估计误差的外积求和。这在形式上与标准反向传播的梯度表达式完全一致,唯一的区别仅在于误差项是靠前向扰动蒙特卡洛采样拼出来的,而非沿着计算图反向链式回传。

从权重黑盒到激活虚拟种群的路径迁移 传统演化策略(如 EGGROLL) 空间维度:在庞大权重矩阵中直接加噪 采样成本:每个种群成员独占单次前向 扩展死穴:16000 种群仍难匹敌梯度基线 算力与参数量深度绑定,高维即坍塌 Dust 激活空间局部扰动 空间维度:在隐层输出注入微量扰动 采样成本:序列内数千 Token 即虚拟种群 工程代价:靠架构特性拟合梯度外积 打破参数绑定,但退化为专用特化方案

说得直白一点,Dust 根本不是那种通杀离散环境、黑盒强化学习的通用演化搜索,它重度寄生在自回归因果注意力和逐 Token 损失结构上。它不是埋葬反向传播,而是借 Transformer 的架构特权,在前向阶段生造了一个低维模拟版。

算力天平:省下的显存与隐形的重算

借助这套机制,Dust 确实交出了一组扎眼的数字。在作者的对比推演中,EGGROLL 即便堆到 16,000 的大种群,在 1M 到 20M Token 的测试区间内绝大多数时候都无法打平 Dust 仅设为 64 的种群表现。更为惊人的是容量扩展现象:一个243M参数的模型,在大多数种群规模下的学习效率居然超越了比自己小 120 倍的微型网络。

这在直觉上颠覆了传统认知。过去学界普遍认定参数越多零阶搜索死得越快,而 Dust 展现出超参数化网络或许具备更友好的搜索几何结构。

Dust 宣称的核心实验指标反差 10⁴ 倍 相对 SOTA 演化效率提升 从 1M Token 起推演优势急剧扩大 120 倍 模型容量反常增益跨度 243M 相比极小模型具备更好种群效率 20M 主实验最大 Token 预算 距离万亿级工业预训练仍隔天堑

然而世上没有凭空落下的算力午餐。

所谓零阶算法的跃升,往往只是把反向图的显存账单,转嫁成了前向后缀重算的算力账单。

反向传播的弊端天下皆知:为了求导必须缓存所有中间激活层,导致显存开销居高不下。Dust 避开了反向图,但在计算注意力输出和各层信噪比分配时,为了避免扰动干扰,必须对后续层执行多次重算,同时对注意力头进行额外采样。论文通篇使用种群规模与 Token 吞吐量作横向对比,却对最为关键的 GPU 实际墙钟时间与端到端 FLOPs 语焉不详。

不谈物理时钟与总能耗的所谓效率优势,在严谨的系统工程面前往往经不起推敲。


温室实验:拿常数 SGD 对比的胜局

如果把目光从算法数学公式移开,落到具体的评测基准上,这处温室的边界就更加清晰。

首先是极度缩水的训练规模。Dust 论文的核心主实验,用的是一个仅有 8层、隐层维度512 的玩具级 GPT,整个预训练的最大 Token 预算只有区区 20M Token。即便在所谓的容量扩展测试中用到了 243M 参数,其训练寿命也被草草掐死在 10M Token。而今天任何一个具备实用价值的基础模型,训练步调无一不是以数千亿乃至数万亿 Token 为起步刻度。

更致命的是对照组的选取。Dust 宣称在特定超大种群下跑赢了反向传播,但其对比的基线,居然是带动量且固定学习率的常数 SGD。在现代大模型预训练工业界,带余弦退火学习率调度、配合自适应矩估计与梯度裁剪的 AdamW 早已是标配。用演化策略拼尽全力去击败一个被束缚了手脚的原始梯度基准,这种超越的含金量必须大打折扣。

  • 风险.作者在论文中坦承,随着训练步数与 Token 规模推移,Dust 若想持续咬住反向传播的收敛曲线,所需的种群规模呈现膨胀趋势;这意味着它的长程扩展性尚未得到真正验证。

此外,QLabs 在 GitHub 虽然以 MIT 协议开源了代码仓库,但官方自己在说明文档中注明,该版本属于未包含完整执行优化的精简实现;甚至其论文主页的引用元数据还出现了指向无关论文的低级乌龙。工程细节的隐匿与对照组的妥协,都在提醒行业:切莫过早把学术假说当成产业更替。

范式重构还为时尚早

天下之事,常成于实而溃于华。从学术探索的角度看,Dust 确实给出了一份富有启发性的答卷:它证明了在不依赖反向传播链式法则的前提下,激活空间的局部随机扰动有能力完成深层 Transformer 的信用分配,并展现出大模型容量对探索空间的意外包容。对于神经形态硬件设计、探索不可微推理步骤的算法团队而言,它提供了一条极具价值的分支线索。

但这绝不意味着现代预训练基础设施到了推倒重来的时刻。

在未来的硬件与系统演进中,衡量一个算法生命力的永远不是公式层面的优雅,而是同等电表转速与芯片面积下的损耗产出比。Dust 想要真正撼动反向传播四十年的统治,至少要先走出 20M Token 的安全屋,在现代分布式集群与成熟的 AdamW 体系前,用真实消耗的机时和验证集损失跑完一场硬仗。

在那之前,反向传播大厦的基石依然坚不可摧。