Simon Willison这次的口气很轻:又一个Qwen模型,他在DGX Spark上跑了跑量化版,画了几张骑自行车的鹈鹕图,挑了张自己最喜欢的贴出来。听着像一次普通的周末把玩。
但Qwen官方给这个模型的定位不轻:Qwen4架构的早期预览。125B参数,每个token只激活6B,这句话本身没什么信息量——直到你把它拆开看架构改了什么、跑分说了什么、部署起来到底多重。这三层拆开,才是这次发布真正值得记的地方。
账面之外的家底
主模型125B参数,激活6B,这是官方给的headline数字。但完整体系还有两块容易被忽略的模块:一个约51B参数的N-gram嵌入表,一个4B参数的多token预测模块。三者加起来接近180B参数。
按FP16存储折算,180B参数对应的体积正好落在官方仓库披露的约360GB完整权重体积上。也就是说,"125B"这个数字从一开始就没算全账——读者如果只记住125B/6B这组对比,会严重低估这个模型真正占多少地方。
原生上下文262144 tokens,通过YaRN可扩展到100万;官方托管的生产版本Qwen3.8-Flash默认就跑在100万上下文并自带工具调用。
四处改动,都在为Qwen4探路
每48层里,每4层重复一次"3组Gated DeltaNet接MoE + 1组Qwen Sparse Attention接MoE"的模式。官方称QSA在百万token上下文下预填充快7.6倍、解码快4.9倍——这类线性注意力和稀疏注意力混着用的路数,本质是在超长上下文场景里省算力。
残差流从传统的单路径改成四条门控残差分支,瓶颈秩320,顺带支持FP8存储。这类改动通常是为了让深层网络训练更稳、信息传得更远。
N-gram嵌入表存了2000万条N-gram条目,放在主机内存里异步预取,不占用MoE式的矩阵乘法开销就把模型容量撑大——相当于给模型加了一层"查表记忆",不用现算。
MoE层每层512个专家,每次只路由10个加1个共享专家,专家中间维度640。这是6B/125B这个超低激活比的直接来源:专家开得多,但每次只请极少数干活。
训练上混用Muon和AdamW,官方还提到一个细节:去掉batch-size warmup后发现,保留这个机制反而要多花18.8%的优化步数、最终效果却没提升,于是直接砍掉。这种"测过发现没用就扔"的态度,比堆参数更值得记一笔。
跑分赢了Claude,但账不能照单全收
官方自报的成绩单里,Qwen3.8-Flash-Next在SWE-bench Pro(62.5)、SWE-bench Multilingual(81.0)、IFBench(81.3)、GPQA Diamond(91.7)、LiveCodeBench v6(91.9)上都超过了Claude Opus 4.6 Max。但在Humanity's Last Exam(35.9)上落后Claude,在NL2Repo-Bench(48.1)上落后DeepSeek-V4-Flash-0731。
这些数字要打个折扣看。CoWorkBench、RecreationBench是Qwen自建的内部评测集,Vision2Web的评测干脆由另一个模型来当裁判——都不是独立第三方跑出来的结果。
- 风险.自报基准、内部评测集、模型裁判评分三种情况混在一张成绩单里,"全面超越Claude Opus"这类结论在独立复现之前只能算参考,不能当结论用。
6B的轻,360GB的重
推理轻,部署重,这是这类超稀疏MoE模型绕不开的现实。Willison用Unsloth的量化版本在DGX Spark上跑,72.5GB的UD-IQ1_S、78.9GB的UD-Q2_K_XL,已经是压到极限的量化——1-bit到2-bit级别。即便这样,单块消费级显卡也塞不下,需要工作站级设备。
推理轻,部署重,这才是MoE真正的门槛。
对本地爱好者来说,6B激活意味着响应快、算力省,但存储和内存的门槛没降;对企业选型的团队来说,跑分好看不等于能直接上线,还得先看独立评测怎么说、再算一遍存储和推理成本。两头都不是"轻量部署"能概括的。
这部预告片,该看什么
Qwen3.8-Flash-Next的意义不在于它本身好不好用,而在于它把Qwen4可能延用的几个决定提前摊开:混合注意力路线、多分支残差、可卸载的记忆模块、更极端的稀疏路由。这几处如果被正式版继承并且经得起独立验证,才算真正定了型。
接下来该盯的是三件事:Qwen4正式版什么时候来、这些跑分有没有第三方复现、以及这套架构会不会被同行采纳成新的默认选择。预告片好不好看不重要,正片能不能撑住,才是真考验。
