2026年9月10日,DeepSeek在Hugging Face上公开了技术报告《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》并同步放出开源权重。在长程Agent动辄调用数十次工具、上下文频繁堆叠至数十万Token的今天,这只拥有763B总参数的多模态巨兽没有继续卷模型做题的上限,而是把刀刃对准了困扰大模型服务商已久的显存墙。
通过因果编码器-解码器架构、跨层稀疏注意力共享与FP4精度量化,该模型将全局键值缓存(KV Cache)压缩到了每Token 890字节。这不仅比上一代V4-Flash缩减了四分之三,更比最早期的V1版本压缩了整整437倍。然而,把闪存和显存开销打穿底线并不等于模型变轻了,这实际上是一套专为超级云端API设计的吞吐怪兽。
架构重构的三级挤压:890字节背后的真实代价
行业对KV Cache的优化此前多停留在局部裁剪,例如滑动窗口或常规分组查询注意力。DeepSeek-V4.1-Flash能够将体积挤压到890字节,核心在于把模型结构从标准Transformer转向类似微软YOCO思想的因果编码器-解码器(CED)解耦。
在40层的骨干网络中,前20层为编码器,后20层为解码器。在输入处理的Prefill阶段,模型仅激活8B参数,只有到生成阶段的Decode过程才会激活16B参数。对于依赖长提示词的前缀复用场景,这意味着前缀输入的大部分位置只需扫过前20层,Decoder直接复用Encoder终态投影生成的全局KV表示。
在层间传递上,模型抛弃了早先的块级高压缩比HCA结构,演变为CSA2机制。整个骨干仅在第2、8、14、20层生成KV状态,配合128-token的滑动局部窗口与Top-512全局候选稀疏索引,大幅减少了在层间重复保存键值向量。
最后一步是极低比特量化。主KV Cache采用E2M1格式的FP4存储,每16个通道分配一个E4M3格式的缩放系数。模型虽然在45T多模态Token上完成了从64K到100万Token的上下文扩展训练,但每增加一个Token,全局缓存增量被死死压制在890字节。
- 结论.将缓存做薄并不单纯靠数值截断,而是把注意力结构、层间依赖与数值精度做了联立求解。
420字/秒的虚实与撤回的下线通告
开源社群最初对该版本的关注始于部分开发者测出的420 Tokens/s极端流速,甚至一度传出官方将下线V4 Pro的消息。但这其实源于概念混淆。
后续第三方的真实测试厘清了这一数字的边界。在OpenRouter聚合端点上,该模型的实际生成速度在47到75 Tokens/s之间;在官方API直连下,解码速度也稳定在121到134 Tokens/s。所谓的420 Tokens/s,本质上是特定集群下高批处理或Prefill阶段的聚合吞吐,并非单请求解码速度。
官方曾在9月14日计划将V4 Pro的流量直接重定向至V4.1-Flash,但遭遇反弹后迅速撤回,两者继续并行服务。这一决策背后的硬指标分歧显而易见:
| 对比维度 | DeepSeek-V4.1-Flash | DeepSeek-V4 Pro | 业务影响 |
|---|---|---|---|
| 峰值未命中输入单价 | 0.30美元/百万Token | 1.32美元/百万Token | Flash调用成本直降77% |
| 峰值输出单价 | 1.20美元/百万Token | 3.96美元/百万Token | 复杂生成任务显著摊薄 |
| 官方支持最大并发 | 2500并发 | 500并发 | 承接高并发批量Agent流 |
| 任务优势区间 | 工具调用、代码编写与多轮对话 | GPQA Diamond、HLE高难推理 | 严谨逻辑任务仍需Pro兜底 |
V4.1-Flash并非要全面替代旗舰。在纯知识密集型与严密科学推理测试上,V4 Pro依然保持领先;而V4.1-Flash的强项全部落在工程与流程性任务上。官方压低输入价格并放开5倍并发,目的是吃下流水线化的长程Agent市场。
架构的精简换来了惊人的吞吐,但知识的纵深依然留在老旗舰的防线里。
614GB显存门槛与框架落地的暗礁
面对890字节的缓存数据,普通开发者最容易产生的误解,是误以为这款模型可以在消费级显卡上运行。
事实恰恰相反。虽然一百万Token的KV Cache在理论上还不到1GB,但模型权重的底座依然沉重。整个系统包含552B的骨干网络参数与约196B稀疏访问的Engram记忆模块,官方标注总参数量达到763B,模型总权重高达510 GB。
根据vLLM的部署规范,要将这套包含4路Single-Pass残差混合与3层DSpark投机解码器的网络跑起来,最低显存预算要求为614GB。它从未打算迎合本地边缘设备,而是服务于那些一次性采购整柜算力、必须在百万Token上下文下同时服务成百上千个会话的云厂商。
极限压缩在工程实现上也展露出了脆弱的一面。在开源代码发布后不久,Hugging Face社区讨论区第41号与第12号Issue就捕获了一个严重的KV Cache索引所有权缺陷:由于层间状态覆盖,未打补丁时CPU测试集上的Prefill与增量Decode输出一致性仅有34/48,直到加入两行边界修正代码后才恢复至48/48。
此外,由于主流推理运行时尚未完全适应CED与CSA2的非对称调度,在应对CPU卸载与复杂FP8布局时频繁出现索引失效。甚至在应用层,社区测试发现该模型在长程任务中产生的外部记忆写入量达到了161 KB,远高于上一代V4-Flash的13 KB,在某些特定工作流中反而对冲了底层节省的部分存储。
- 风险.过早将其引入生产环境的企业,需要承受推理框架尚未稳定、自定义算子极易踩坑的适配动荡期。
从长远来看,DeepSeek-V4.1-Flash更像是一场挂着Flash名义的架构预演。它验证了在巨型MoE架构下,通过大改注意力几何形状来换取吞吐的可行性。只要上游开源框架完成对这种复杂索引调度的驯化,大模型调用的成本账本,就不得不迎来新一轮重算。
