一篇没有署名机构、没有经过同行评审、甚至在arXiv和Google Scholar上都查不到对应记录的个人博客,这两天在AI圈子里被转得挺热闹。作者Alexi Gladstone在博客里提出一个叫Explorative Modeling(简称XM)的训练方法,说自己找到了继数据量、参数量之后的第三条预训练扩展轴,还甩出一串数字:样本效率提升6.2倍,FLOP效率提升4.1倍,参数效率提升47%,在控制任务上甚至能用少至1/256的推理算力追平扩散模型。
数字确实唬人。但把这些关键词丢进学术检索,你会发现它们目前只存在于这一篇博客里,没有任何第三方渠道能核实。
均值坍缩是老问题,XM的解法是"多猜几次"
生成模型的老麻烦是均值坍缩:如果一个提示对应无数种合法答案,比如"画一只狗"能对应上亿张不同的狗图,直接训练模型去预测最优答案,模型学到的会是所有答案的平均值,而平均值往往面目模糊,不像任何真实样本。飞镖游戏里,如果只能猜一次落点,最优策略是猜靶心,可靶心恰恰是飞镖几乎不会落的地方。
现有的自回归模型和扩散模型都是靠"拆步骤"绕开这个坑:把一次性预测拆成很多小步,每步只有一个大致正确的答案。XM换了个思路,把"拆"这件事从生成阶段挪到训练阶段——训练时让模型生成K个候选,只挑离真实数据最近的那个来计算损失。作者称,这样一来模型在推理时依然可以一步到位输出结果,不需要多步扩散或逐词生成,因而是"端到端"的。
数字好看,但目前找不到出处
作者给出的四组核心数字,构成了XM"值得相信"的全部证据。问题是,这些数字对应什么任务、什么模型规模、什么评测口径,博客里并没有展开,公开学术索引里也没有同名论文可供交叉核对。
- 提醒.以上四个数字目前只有作者本人给出,缺少同行评审和第三方复现,读者宜当孤证,不当结论。
best-of-K不是新发明,新意在"敢叫它第三轴"
训练时生成多个候选、只用最优者回传梯度,这个思路在结构化预测和集成学习里并不新鲜,min-over-N loss、multiple-choice learning、variety loss早就讨论过类似的"避免均值坍缩"方案。XM真正的新意,更多在于把这套老技术包装进"预训练可扩展轴"的叙事里——如果这个类比成立,探索次数K就该像数据量、参数量一样,成为团队做预训练资源分配时要考虑的第三个变量。
疗效未经验证之前,叙事框架讲得再漂亮,也只是一家之言。
这个类比是否站得住,取决于两件没写清楚的事:K到底该在什么规模下扩,以及XM是要从头训练的新架构,还是能直接插到现成的扩散、自回归模型上当插件用。博客里都没有给出明确答案。
谁该盯紧后续
如果256倍推理算力节省这个说法能被独立证实,第一批感兴趣的会是靠扩散模型做图像、视频、机器人控制任务落地的团队——推理成本降下来,直接影响部署预算。做预训练研究的团队,则该等一等K值到底怎么定、能不能套用到现成模型上再决定要不要跟进实验。
眼下能做的,是去GitHub上的alexiglad/XM看看代码和权重是不是真的开源可跑,以及这篇工作有没有投稿会议或期刊、有没有独立团队复现。在这些答案出来之前,"第三条预训练轴"这个说法,更适合当作一个待验证的猜想,而不是既定事实。
