125B参数的模型,每个token只激活6B——这是MoE模型的常规操作,不算新闻。真正让人多看一眼的,是阿里官方给出的另一个数字:训练成本只要上一代的九分之一。
这是阿里刚放出来的Qwen3.8-Flash-Next。官方没把它包装成"又一代主力模型",而是直接挑明身份:这是Qwen4架构的早期预览,先把新设计拿出来给社区看。
上一次阿里这么干,是Qwen3-Next对Qwen3.5。那套GDN+门控注意力的混合设计,后来一路沿用到Qwen3.6、3.7、3.8。这次的看点也不在跑分涨了多少,而在这套新设计想解决的问题:长上下文的算力账,能不能从"堆参数"变成"能落地"。
三分钟看懂:改了什么,影响谁
官方给出四处系统性改动:
- 注意力.GDN压缩记忆,QSA(Qwen Sparse Attention)按微块检索,减少长序列计算量
- 残差.门控残差把信息通道从1条扩到4条,缓解深层网络信息被稀释
- 嵌入.新增51B的N-gram Embedding,靠上下文局部模式扩容量,几乎不增加额外计算
- 优化器.换成Muon,配套调整了正交化精度和参数分工
模型本体125B参数,每token只激活6B,外挂一张51B的N-gram嵌入表。这三个数字不是一个体量的东西,不能拿125B去比总参数,也不能拿6B去比激活参数——它们是三层完全不同的结构。嵌入表可以放在主机内存里异步预取,不常驻显存,扩大的是容量,不是同量级的在线计算。
原生支持262K上下文,配合YaRN可扩到1M。云端生产版命名为Qwen3.8-Flash,价格已经标出,但API还没开放。
| 维度 | Qwen3.7-Plus | Qwen3.8-Flash-Next |
|---|---|---|
| 身份 | 现役主力模型 | Qwen4架构早期预览 |
| 训练成本 | 基准 | 官方称约为其1/9 |
| 原生上下文 | 未特别标注 | 262K,YaRN可扩至1M |
| 代码/Agent测评 | 被对比对象 | 官方称多数领先,NL2Repo-Bench等未占优 |
| API价格 | 不在本次对比范围 | 输入0.16美元/百万token,输出0.47美元/百万token(尚未上线) |
榜单上,官方材料显示它在代码类、Agent类、办公任务大多领先Qwen3.7-Plus,但不是全面碾压。NL2Repo-Bench上DeepSeek-V4-Flash-0731反而更高,HLE多学科推理上Claude-Opus-4.6明显领先。这些跑分多数是自建评测集,HLE还用GPT-4o当裁判,拿来当独立验证结论不太合适。
四项改造怎么压成本
最值得展开的是注意力那部分。传统全量注意力要看全部历史token,序列一长,计算和KV缓存访问成本都会往上蹿。
Qwen3.8-Flash-Next的做法是每四层里三层用GDN,把历史压成固定大小的状态。剩下一层用全局注意力做精确检索,不丢关键信息。
QSA给这层全局注意力加了个轻量索引器。先把序列聚合成"微块",在块级别估算重要性,再挑出最相关的区域做注意力计算——省的不只是计算本身,连找重要位置这一步的开销也省了。
官方数字:1M上下文下,QSA的Attention Kernel在Prefill和Decode环节最高分别提速7.6倍和4.9倍。
另一个更扎眼的数字——8.6倍Prefill吞吐——是在1M上下文、90%前缀缓存命中率的特定场景下测出来的。现实里未必总能凑齐这个命中率,不能当成整体推理速度提升8.6倍来理解。
风险提示:所有性能和吞吐数字都来自厂商材料,部分基准是自建评测或使用特定harness。8.6倍加速对应的是高缓存命中的理想场景,不宜泛化到全部推理负载。
我的判断:分水岭在工程兑现,不在参数规模
行业过去两年比参数、比激活量。现在开始比一件更实在的事:同样一份长上下文,能不能用更少的钱撑住。GDN管记忆、QSA管检索、门控残差管信息不丢、N-gram嵌入管低成本扩容,拼在一起,讲的是能不能把长上下文做便宜,跑分只是配角。
这个故事目前只讲了一半。API还没上线,QwenCloud标出的价格是承诺,不是可验证的账单。8.6倍吞吐是特定缓存命中率下的数字,不是通用结论。51B的嵌入参数扩大的是容量,不等于同等量级的在线计算——这笔"便宜"是真便宜还是纸面便宜,要看主机内存预取的延迟能不能被计算真正掩盖。
古人说"兵马未动,粮草先行",这次反过来了。架构和跑分先摆上台面,粮草——真实推理成本和延迟——还得等生产环境跑起来才能核实。
对做架构和推理工程的人,这套GDN+QSA+异步嵌入的组合值得拆开研究,但不必急着照搬——先看权重是否开源,能不能在自己的硬件上复现哪怕一半的加速比。对做Agent和代码工具的团队,262K到1M的上下文听起来诱人,但API价格和延迟都还没兑现,现在最多是把它加进候选评测清单,不必急着把生产流量切过去。
接下来最该盯的变量,是API真正上线后的价格和延迟能不能对得上官方数字,以及第三方能不能在非理想缓存命中率下复现哪怕一半的加速比。这两件事没验证之前,"训练成本降到九分之一"就还是厂商自己的账本。
【锐评】训练账省了九成,推理账还得等真实流量来对账,别急着照单全收。
