125B参数的模型,每个token只激活6B——这是MoE模型的常规操作,不算新闻。真正让人多看一眼的,是阿里官方给出的另一个数字:训练成本只要上一代的九分之一。

这是阿里刚放出来的Qwen3.8-Flash-Next。官方没把它包装成"又一代主力模型",而是直接挑明身份:这是Qwen4架构的早期预览,先把新设计拿出来给社区看。

上一次阿里这么干,是Qwen3-Next对Qwen3.5。那套GDN+门控注意力的混合设计,后来一路沿用到Qwen3.6、3.7、3.8。这次的看点也不在跑分涨了多少,而在这套新设计想解决的问题:长上下文的算力账,能不能从"堆参数"变成"能落地"。

三分钟看懂:改了什么,影响谁

官方给出四处系统性改动:

  • 注意力.GDN压缩记忆,QSA(Qwen Sparse Attention)按微块检索,减少长序列计算量
  • 残差.门控残差把信息通道从1条扩到4条,缓解深层网络信息被稀释
  • 嵌入.新增51B的N-gram Embedding,靠上下文局部模式扩容量,几乎不增加额外计算
  • 优化器.换成Muon,配套调整了正交化精度和参数分工

模型本体125B参数,每token只激活6B,外挂一张51B的N-gram嵌入表。这三个数字不是一个体量的东西,不能拿125B去比总参数,也不能拿6B去比激活参数——它们是三层完全不同的结构。嵌入表可以放在主机内存里异步预取,不常驻显存,扩大的是容量,不是同量级的在线计算。

原生支持262K上下文,配合YaRN可扩到1M。云端生产版命名为Qwen3.8-Flash,价格已经标出,但API还没开放。

维度Qwen3.7-PlusQwen3.8-Flash-Next
身份现役主力模型Qwen4架构早期预览
训练成本基准官方称约为其1/9
原生上下文未特别标注262K,YaRN可扩至1M
代码/Agent测评被对比对象官方称多数领先,NL2Repo-Bench等未占优
API价格不在本次对比范围输入0.16美元/百万token,输出0.47美元/百万token(尚未上线)

榜单上,官方材料显示它在代码类、Agent类、办公任务大多领先Qwen3.7-Plus,但不是全面碾压。NL2Repo-Bench上DeepSeek-V4-Flash-0731反而更高,HLE多学科推理上Claude-Opus-4.6明显领先。这些跑分多数是自建评测集,HLE还用GPT-4o当裁判,拿来当独立验证结论不太合适。

四项改造怎么压成本

最值得展开的是注意力那部分。传统全量注意力要看全部历史token,序列一长,计算和KV缓存访问成本都会往上蹿。

Qwen3.8-Flash-Next的做法是每四层里三层用GDN,把历史压成固定大小的状态。剩下一层用全局注意力做精确检索,不丢关键信息。

QSA给这层全局注意力加了个轻量索引器。先把序列聚合成"微块",在块级别估算重要性,再挑出最相关的区域做注意力计算——省的不只是计算本身,连找重要位置这一步的开销也省了。

官方数字:1M上下文下,QSA的Attention Kernel在Prefill和Decode环节最高分别提速7.6倍和4.9倍。

参数结构:三个数字不是一个体量 125B 主模型参数 Transformer骨架 51B N-gram嵌入 可放主机内存 6B 每token激活 决定实际算力消耗

另一个更扎眼的数字——8.6倍Prefill吞吐——是在1M上下文、90%前缀缓存命中率的特定场景下测出来的。现实里未必总能凑齐这个命中率,不能当成整体推理速度提升8.6倍来理解。

三个加速数字,三个不同场景 Attention Kernel · Prefill 7.6x Attention Kernel · Decode 4.9x 端到端Prefill吞吐 (90%缓存命中) 8.6x 提醒:第三项数字建立在1M上下文+90%缓存命中的特定场景,不能等同于整体推理提速8.6倍

风险提示:所有性能和吞吐数字都来自厂商材料,部分基准是自建评测或使用特定harness。8.6倍加速对应的是高缓存命中的理想场景,不宜泛化到全部推理负载。

我的判断:分水岭在工程兑现,不在参数规模

行业过去两年比参数、比激活量。现在开始比一件更实在的事:同样一份长上下文,能不能用更少的钱撑住。GDN管记忆、QSA管检索、门控残差管信息不丢、N-gram嵌入管低成本扩容,拼在一起,讲的是能不能把长上下文做便宜,跑分只是配角。

这个故事目前只讲了一半。API还没上线,QwenCloud标出的价格是承诺,不是可验证的账单。8.6倍吞吐是特定缓存命中率下的数字,不是通用结论。51B的嵌入参数扩大的是容量,不等于同等量级的在线计算——这笔"便宜"是真便宜还是纸面便宜,要看主机内存预取的延迟能不能被计算真正掩盖。

古人说"兵马未动,粮草先行",这次反过来了。架构和跑分先摆上台面,粮草——真实推理成本和延迟——还得等生产环境跑起来才能核实。

对做架构和推理工程的人,这套GDN+QSA+异步嵌入的组合值得拆开研究,但不必急着照搬——先看权重是否开源,能不能在自己的硬件上复现哪怕一半的加速比。对做Agent和代码工具的团队,262K到1M的上下文听起来诱人,但API价格和延迟都还没兑现,现在最多是把它加进候选评测清单,不必急着把生产流量切过去。

接下来最该盯的变量,是API真正上线后的价格和延迟能不能对得上官方数字,以及第三方能不能在非理想缓存命中率下复现哪怕一半的加速比。这两件事没验证之前,"训练成本降到九分之一"就还是厂商自己的账本。

【锐评】训练账省了九成,推理账还得等真实流量来对账,别急着照单全收。