2026年9月10日,DeepSeek在Hugging Face上公开了技术报告《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》并同步放出开源权重。在长程Agent动辄调用数十次工具、上下文频繁堆叠至数十万Token的今天,这只拥有763B总参数的多模态巨兽没有继续卷模型做题的上限,而是把刀刃对准了困扰大模型服务商已久的显存墙。

通过因果编码器-解码器架构、跨层稀疏注意力共享与FP4精度量化,该模型将全局键值缓存(KV Cache)压缩到了每Token 890字节。这不仅比上一代V4-Flash缩减了四分之三,更比最早期的V1版本压缩了整整437倍。然而,把闪存和显存开销打穿底线并不等于模型变轻了,这实际上是一套专为超级云端API设计的吞吐怪兽。

架构重构的三级挤压:890字节背后的真实代价

行业对KV Cache的优化此前多停留在局部裁剪,例如滑动窗口或常规分组查询注意力。DeepSeek-V4.1-Flash能够将体积挤压到890字节,核心在于把模型结构从标准Transformer转向类似微软YOCO思想的因果编码器-解码器(CED)解耦。

在40层的骨干网络中,前20层为编码器,后20层为解码器。在输入处理的Prefill阶段,模型仅激活8B参数,只有到生成阶段的Decode过程才会激活16B参数。对于依赖长提示词的前缀复用场景,这意味着前缀输入的大部分位置只需扫过前20层,Decoder直接复用Encoder终态投影生成的全局KV表示。

DeepSeek-V4.1-Flash 三级动态压缩链路 第一级:CED结构解耦 • 40层前后对半拆解 • Prefill激活仅 8B • Decode激活 16B 输入计算开销直接减半 第二级:CSA2跨层复用 • 仅第2/8/14/20层建KV • 128-token滑动窗口 • Top-512 候选块稀疏 消除层间重复缓存冗余 第三级:FP4精度量化 • 主KV采用 E2M1 FP4 • 16通道配 E4M3 scale • 最终落地 890 B/Token 运行时显存缩至四分之一

在层间传递上,模型抛弃了早先的块级高压缩比HCA结构,演变为CSA2机制。整个骨干仅在第2、8、14、20层生成KV状态,配合128-token的滑动局部窗口与Top-512全局候选稀疏索引,大幅减少了在层间重复保存键值向量。

最后一步是极低比特量化。主KV Cache采用E2M1格式的FP4存储,每16个通道分配一个E4M3格式的缩放系数。模型虽然在45T多模态Token上完成了从64K到100万Token的上下文扩展训练,但每增加一个Token,全局缓存增量被死死压制在890字节。

  • 结论.将缓存做薄并不单纯靠数值截断,而是把注意力结构、层间依赖与数值精度做了联立求解。

420字/秒的虚实与撤回的下线通告

开源社群最初对该版本的关注始于部分开发者测出的420 Tokens/s极端流速,甚至一度传出官方将下线V4 Pro的消息。但这其实源于概念混淆。

后续第三方的真实测试厘清了这一数字的边界。在OpenRouter聚合端点上,该模型的实际生成速度在47到75 Tokens/s之间;在官方API直连下,解码速度也稳定在121到134 Tokens/s。所谓的420 Tokens/s,本质上是特定集群下高批处理或Prefill阶段的聚合吞吐,并非单请求解码速度。

官方曾在9月14日计划将V4 Pro的流量直接重定向至V4.1-Flash,但遭遇反弹后迅速撤回,两者继续并行服务。这一决策背后的硬指标分歧显而易见:

对比维度DeepSeek-V4.1-FlashDeepSeek-V4 Pro业务影响
峰值未命中输入单价0.30美元/百万Token1.32美元/百万TokenFlash调用成本直降77%
峰值输出单价1.20美元/百万Token3.96美元/百万Token复杂生成任务显著摊薄
官方支持最大并发2500并发500并发承接高并发批量Agent流
任务优势区间工具调用、代码编写与多轮对话GPQA Diamond、HLE高难推理严谨逻辑任务仍需Pro兜底

V4.1-Flash并非要全面替代旗舰。在纯知识密集型与严密科学推理测试上,V4 Pro依然保持领先;而V4.1-Flash的强项全部落在工程与流程性任务上。官方压低输入价格并放开5倍并发,目的是吃下流水线化的长程Agent市场。

架构的精简换来了惊人的吞吐,但知识的纵深依然留在老旗舰的防线里。

614GB显存门槛与框架落地的暗礁

面对890字节的缓存数据,普通开发者最容易产生的误解,是误以为这款模型可以在消费级显卡上运行。

事实恰恰相反。虽然一百万Token的KV Cache在理论上还不到1GB,但模型权重的底座依然沉重。整个系统包含552B的骨干网络参数与约196B稀疏访问的Engram记忆模块,官方标注总参数量达到763B,模型总权重高达510 GB

高并发B端模型:显存占用与容量错位 100万Token全局缓存 < 1 GB 动态上下文不再占用HBM 最小部署显存预算 614 GB 8张80G加速卡为起步线 API峰值并发上限 2500 专供企业流水线吞吐

根据vLLM的部署规范,要将这套包含4路Single-Pass残差混合与3层DSpark投机解码器的网络跑起来,最低显存预算要求为614GB。它从未打算迎合本地边缘设备,而是服务于那些一次性采购整柜算力、必须在百万Token上下文下同时服务成百上千个会话的云厂商。

极限压缩在工程实现上也展露出了脆弱的一面。在开源代码发布后不久,Hugging Face社区讨论区第41号与第12号Issue就捕获了一个严重的KV Cache索引所有权缺陷:由于层间状态覆盖,未打补丁时CPU测试集上的Prefill与增量Decode输出一致性仅有34/48,直到加入两行边界修正代码后才恢复至48/48。

此外,由于主流推理运行时尚未完全适应CED与CSA2的非对称调度,在应对CPU卸载与复杂FP8布局时频繁出现索引失效。甚至在应用层,社区测试发现该模型在长程任务中产生的外部记忆写入量达到了161 KB,远高于上一代V4-Flash的13 KB,在某些特定工作流中反而对冲了底层节省的部分存储。

  • 风险.过早将其引入生产环境的企业,需要承受推理框架尚未稳定、自定义算子极易踩坑的适配动荡期。

从长远来看,DeepSeek-V4.1-Flash更像是一场挂着Flash名义的架构预演。它验证了在巨型MoE架构下,通过大改注意力几何形状来换取吞吐的可行性。只要上游开源框架完成对这种复杂索引调度的驯化,大模型调用的成本账本,就不得不迎来新一轮重算。