2.8T 参数很抢眼。更反常的是,判断 Kimi K3 是否有部署价值,眼下最缺的恰好不是参数,而是每个 token 到底激活多少参数。

这两个数字管着不同的账。总参数影响权重存储、加载和多机分布;激活参数更接近单次推理的计算量。只公布前者,就像告诉你工厂有多大,却没说每件产品要开动几条生产线。

从 48B 到 2.8T,架构几乎每一层都在改效率

根据这份发布于 2026 年的作者笔记,K3 从 Kimi Linear 的 48B 参数扩展到 2.8T。原作者据此将它称为“当前最大的开放权重模型”。

这两个表述都要留边界。

K3并非把48B架构原样放大近60倍。它沿用了Kimi Linear追求高效推理的方向,但MoE、注意力、位置编码和多模态能力都发生了变化。“最大开放权重模型”也是原作者判断,目前不宜写成行业公认结论。

架构环节Kimi K3 的变化想解决的问题目前仍缺什么
专家模型MoE 转向 LatentMoE在潜在表示中组织专家计算,压低超大模型的激活开销专家数量、路由规则、每 token 激活参数
注意力引入多头潜在注意力与 Kimi Delta Attention减少注意力计算和缓存压力上下文长度、KV Cache 占用、实测吞吐
位置编码完全取消 RoPE,全层采用 NoPE避免显式旋转位置编码带来的约束长上下文稳定性及外推表现
跨层信息流加入注意力残差改善验证损失和下游任务表现收益能否覆盖额外成本
输入类型原生支持多模态统一处理文本与视觉等输入模态范围、数据配比和部署开销

这里最激进的一步是全量 NoPE。

K3不再使用RoPE,所有层都采用NoPE。原作者称,它可能是首个全层这样设计的前沿级模型。“可能”二字不能删:目前材料主要来自单一作者笔记,还需要技术报告、正式发布信息和第三方复现交叉验证。

注意力残差则是一笔明账。据报告,它能稳定改善验证损失和下游表现,代价约为增加4%的训练成本和2%的推理成本。

这个设计很能说明K3的取舍。团队没有把“效率”简单理解成处处做减法,而是愿意支付少量额外计算,换取更稳定的模型质量。是否划算,要看最终收益有多大。只报百分比成本,不报吞吐和任务增益,账仍然没算完。

规模已经够大,决定胜负的是每个 token 的成本

MoE的老逻辑并不复杂:模型可以拥有大量参数,但每次只调用部分专家。仓库很大,订单不必经过每条产线。

LatentMoE把这条路线继续向潜在空间推进;多头潜在注意力试图压缩注意力表示;Kimi Delta Attention则延续线性注意力方向。三项改造指向同一个目标:让2.8T不必对应同等量级的逐 token 计算。

方向合理,结果尚未得到证明。

架构图能说明团队知道问题在哪里,却不能自动推出推理更快、价格更低。真实部署还受专家并行、通信带宽、路由负载均衡、量化精度和硬件利用率影响。一个理论计算量较低的MoE,如果专家频繁跨卡通信,吞吐照样可能被网络拖住。

“兵马未动,粮草先行。”放到超大模型上,粮草就是显存、带宽、电力和机房。参数规模可以写进标题,基础设施账单不会替宣传让路。

目前最需要补齐的是这些数据:

  • 每个 token 激活多少参数,专家如何路由;
  • 权重使用何种精度,需要多少显存和多少张加速卡;
  • 首 token 延迟、持续生成吞吐及并发能力;
  • 上下文长度增长后,缓存占用如何变化;
  • 多模态输入会增加多少显存和延迟;
  • 权重从哪里获取,许可证是否允许目标用途。

最后一项常被忽略。开放权重不等于完全开源,也不自动意味着可以商用。许可证、训练代码、数据披露和模型获取方式尚未明确时,企业不能把“开放”直接写进采购结论。

研究者该拆机制,部署团队先别急着迁移

模型架构研究者最先得到的是一份路线样本。

LatentMoE、全量NoPE、潜在注意力和注意力残差被放进同一套前沿级架构,本身就提供了新的消融研究对象。研究团队接下来该做的,不是重复2.8T这个数字,而是拆开验证:NoPE在长上下文里是否稳定,注意力残差的2%推理成本换来了多少增益,Kimi Delta Attention在哪些序列长度上开始占优。

评估部署成本的技术决策者则应暂缓迁移承诺。

没有激活参数、显存需求、硬件配置和吞吐数据,团队无法估算单 token 成本,也无法判断现有集群能否承载。更现实的动作是先建立测试清单,等待可下载权重、许可证和第三方推理框架支持,再用自家请求长度、并发量和多模态比例跑基准。

原生多模态还会抬高评估门槛。文本任务表现好,不代表图文混合请求也有理想的延迟和成本。企业如果主要跑文本,没有必要仅凭“原生多模态”迁移;真正处理文档、图表和视觉问答的团队,才需要把跨模态质量与额外算力放在一张表里比较。

大模型行业走到2.8T,规模竞赛并未结束,只是越来越难单独构成优势。K3真正需要兑现的,是让庞大参数在有限硬件上高效流动。下一张关键图也不该再是架构图,而应是激活参数、显存、吞吐和价格表。