艾伦人工智能研究所(Ai2)发布了开源训练系统 Olmo-core 3,宣称将混合专家模型(MoE)的训练能力直接推入万亿参数区间。官方放出的跑分相当亮眼:在 8 张顶级 NVIDIA B300 上,一套 47B 参数的 MoE 跑出了单卡每秒 52,000 tokens 的吞吐,比先前的旧方案整整提速 2.7 倍。

单看数字容易让人误以为稀疏架构又演化出了什么算力奇迹。但这套被寄予厚望的万亿底座,核心逻辑不是跨越式的算法突破,而是一次迟到的底层工程纠偏。

所谓暴涨,本质是修正架构硬伤

大模型做稀疏化,原本图的是让每个 token 只挑选一小部分专家计算,从而在扩大容量的同时锁死实际计算量。但在分布式硬件上,这个美好的假设极容易被通信开销直接击穿。

依靠单机顶级计算卡与互连硬件压榨出成倍的吞吐跑分
依靠单机顶级计算卡与互连硬件压榨出成倍的吞吐跑分
MoE 训练架构演进:从搬运权重到搬运数据 旧版方案:FSDP 全分片 每个小批次:跨卡反复拉取全量权重 吞吐上限被网络带宽锁死 (1.94万 tokens/s) 重构、分片开销随专家池扩大急剧失控 Olmo-core 3:DDP + 专家常驻 专家权重死锁在单卡,仅动态路由输入数据 8 卡 B300 吞吐跃升至 5.20万 tokens/s 扩至 128 专家、总参数 47B 时,衰减不足 5%

在过去,开发团队常习惯性调用 PyTorch 生态里的全分片数据并行(FSDP)。这套机制对稠密模型极度有效,但在 MoE 场景下堪称灾难:每过一个极小的数据批次,系统就要在卡间频繁汇聚并重新分片全量权重。这就好比让专家们满场飞奔找工人,大部分时间全耗在走廊拥堵上。此前采用 64 个专家的 OLMoE 在实测中暴露出单卡吞吐甚至跑不过同量级稠密模型,根子全在这里。

Olmo-core 3 换掉了这根龙骨。它改走基于 DDP 的路线,将专家组死死钉在对应的 GPU 显存里,转而只在卡间分发经过挑选的少量 token 数据。结合把激活参数维持在约 3.2B(每次仅挑选 4 个专家)、专家池从 8 个扩到 128 个的测试来看,总参数从 4.6B 飙升至 47B,整个系统的训练吞吐下降幅度不足 5%。

此外,新框架引入了 MXFP8 精度支持。在 4 张 B300 上的基准测试显示,这项格式压缩带来了约 21% 的端到端吞吐提升,同时将峰值显存占用从 103 GiB 压到了 95 GiB。从行级专家并行、GPU 常驻路由元数据到分组矩阵乘法(Grouped GEMM),Ai2 把稀疏网络里能抠出来的计算碎屑打磨了一遍。但明眼人都能看出来,这是补上了一门现代分布式系统的必修课。

账单背后的真实顾虑

跑分里的万亿吞吐是一回事,敢不敢押上真金白银又是另一回事。

技术文章把万亿基准与扩展能力放在聚光灯下,但在 Ai2 刚刚完成的大模型研发账单里,现实却展现出另一张面孔。

跨节点通信等待让稀疏计算在纸面省下的算力化为泡影
跨节点通信等待让稀疏计算在纸面省下的算力化为泡影
技术宣传与生产账单的割裂 OLMo 3 32B 研发周期 56 天 预训练/长文本 47天 + 后训练 9天 集群硬成本与吞吐量 275 万美元 1,024 张 H100 / 5.5万亿 token 报告中的 MoE 评估数据 0 份 多机实测与通信数据完全空白

官方发布的最新 OLMo 3 技术报告,全文涵盖的预训练、中训练到对齐流程,核心主角依然是 7B 与 32B 的纯稠密结构。为了烧出这个 32B 模型,团队动用了 1,024 张 H100 显卡,历经约 56 天的长跑,处理了 5.5 万亿 token,耗费算力成本折合约 275 万美元。

令人意外的是,在这份耗资巨万的生产级报告里,完全没有包含任何关于专家并行、跨卡通信开销或 MoE 架构的实测评估数据。

在技术博客里用合成数据打满单机 8 卡的吞吐是一回事,在多节点真实生产集群里把通信矩阵调到收敛是完全不同的另一件事。Ai2 自身也在技术报告里老老实实指出了多项反直觉的暗坑:为了维持专家负载均衡而设定的平衡评分,可能会演变成掩盖失衡的假象;试图按处理 token 的多少去动态调低专家学习率,在整个模型家族里都没收到正面收益;甚至强行把通信与计算放在不同 GPU 流上重叠,很多时候不单没提速,反而拖慢了端到端效率。

  • 提醒.只要集群跨越了单机物理限制,跨卡 All-to-All 通信的实际延迟就会成倍放大,稀疏计算在纸面上省下来的那点算力,很容易在非均质集群的漫长等待中被消耗殆尽。

避不开的英伟达防线与开源暗礁

在工业界,真正垄断 MoE 训练标准的依然是英伟达自家的 Megatron-Core。尽管 Olmo-core 3 试图用更贴近原生 PyTorch 的方式降低分布式开发门槛,但在同等硬件拓扑、模型配置和路由策略下,开源社区至今尚未拿出一份严格对齐 Megatron-Core 的横向基准实测。

关键通信组件仍处于测试版,面临落地调试与生态断层
关键通信组件仍处于测试版,面临落地调试与生态断层

更现实的屏障在于生产落地的最后一公里。

目前 Olmo-core 尝试引入基于对称内存(Symmetric Memory)与 NCCL-RMA 的融合专家并行通信,但核心模块在 GitHub 上依然标注为 Beta 状态,对硬件驱动版本与网络拓扑异常敏感。一旦脱离顶级机房的高带宽互连环境,这套精密组件的调试成本将呈指数级攀升。

与此同时,下游生态的断层依然存在。社区开发者很快发现,训练完成后导出的检查点很难丝滑对接 Hugging Face Transformers 等主流推理栈,官方更缺乏一套公开可直接运行的端到端对齐(SFT/DPO/RL)流水线。对资源捉襟见肘的中小机构来说,如果一个框架只管生火不管做饭,它就很难算得上是一把真正能开箱即用的平权武器。

  • 结论.开源 AI 基建不需要更多停留在随机路由跑分里的万亿神话,后续检验 Olmo-core 3 的唯一硬标准,是看 Ai2 能否基于这套栈,真正预训练并开源出一款高可用、可对齐、可落地的千亿级稀疏权重。