百万级上下文场景里,Kimi Linear 的解码吞吐最高能到全注意力模型的 6 倍,KV Cache 用量最多砍掉 75%。这两个数字这几年不算稀奇,几乎每个线性注意力方案发布时都会秀一遍类似成绩单。
月之暗面这次多说了一句:在完全相同的训练方案下,这个模型在短上下文、长上下文,还有强化学习扩展场景里,效果全面压过自家的全注意力基线 MLA。效率和效果一起赢,论文才值得多看两眼——但这依然是一份自家团队出的成绩单,还没有外部团队核验过。
数字从哪来:换了一半的注意力层
Kimi Linear 不是纯线性注意力模型,而是一个 MoE 架构,激活参数 3B,总参数 48B。它按层混合两种机制:一部分层用 KDA(Kimi Delta Attention)做线性记忆,一部分层保留 MLA 做全局注意力。
论文的核心对比,是拿这套混合架构,跟结构、数据、训练流程完全一致的全 MLA 模型放在一起跑。几个容易被忽略的限定条件,列在下面:
| 指标 | 数值 | 适用条件 |
|---|---|---|
| 模型结构 | MoE,激活 3B / 总 48B | 逐层混合 KDA 线性层 + MLA 全注意力层 |
| KV Cache 降幅 | 最高 75% | 百万级上下文 |
| 解码吞吐提升 | 最高 6 倍 | 百万级上下文 |
| 对比基准 | 结构、数据、训练流程相同的全 MLA 模型 | 自建基线,尚无外部团队复现 |
75% 和 6 倍都是论文报告的最高值,不是任意长度、任意批量下都能拿到的通用倍率。对比基准也是自己训出来的,不是跨团队、跨硬件的独立复现结果。
KDA 靠什么撑住效果,谁能直接用上
线性注意力的老毛病是记忆容量有限。它把历史信息压进一个固定大小的状态里,序列一长就开始丢东西。KDA 在 Gated DeltaNet 的基础上做了更细粒度的门控,让这个有限状态的记忆用得更精。
工程上,团队为 KDA 写了专用的分块(chunkwise)算法,用一种简化过的 DPLR(对角加低秩)转移矩阵变体,比通用 DPLR 少算很多,也更贴近经典 delta rule。这才是 6 倍吞吐能落地的硬件基础,不是调个参数就能白拿的效率。
团队同时开源了 KDA 计算核、vLLM 推理实现,以及预训练和指令微调后的模型权重。
这对两类人是直接能用的东西。做长上下文架构研究的人,可以拿这套混合比例和 KDA 门控设计做对照组,不用从零验证线性注意力能不能撑住效果。做推理基础设施的人,vLLM 实现和计算核都已经开源,值得先在自己的长上下文负载上跑一轮小规模对比,再决定要不要为百万级上下文场景排产迁移——几千 token 的短上下文任务,省缓存的优势不明显,没必要现在就急着换。
接下来看什么:全注意力还没到退场时候
线性注意力这几年不缺挑战者,RWKV、Mamba、RetNet 都放出过对标全注意力的成绩单,但没有一个真正扛起过旗舰模型的量产任务。其兴也勃焉,其亡也忽焉——这几年被吹起来又沉下去的线性注意力方案不算少,Kimi Linear 想不重蹈覆辙,得过三关。
第一关,是不是能进新一代主力 Kimi 模型:自己团队敢不敢把 MLA 大面积换成这套混合结构,去训真正对外的旗舰产品。第二关,是有没有其他实验室在自己的训练管线里复现出接近的领先幅度,而不是只搬运开源代码跑一遍推理 demo。第三关,是能不能看到更细颗粒度的基准数据——不同上下文长度、不同批量大小、不同硬件下的吞吐和效果曲线,而不是只挑百万上下文这一个最亮的点。
这三关都没过之前,"全面胜过全注意力"这个结论,只能算是月之暗面自己给自己打的分。
