Hugging Face上的Kimi K3页面,标题喊着“全球首个开放3T级模型”。往下翻到底,计划发布的文件数量写着一个数字:1。
页面状态标着“Upcoming release”——预告,不是发布。距离官方写下的发布日期2026年7月27日,还有将近八个月。这八个月里,能核验的信息只有这一页文字,没有模型卡,没有基准分数,没有许可证条款。
发生了什么
关键信息压缩成几行:
- 计划发布时间.2026年7月27日
- 官方定位.全球首个开放3T级模型(官方口径,未附可核验参数)
- 架构关键词.Kimi Delta Attention、Attention Residuals
- 目标场景.长程编程、知识工作、多步推理
- 预告能力.工具调用、浏览、多步规划、仓库级代码理解
- 计划发布artifact数量.1
页面显示的等待关注人数接近两千,这只是一个实时数字,不是模型能力的证据,过几天再看可能已经变了。
3T说的是总参数还是激活参数,页面没说
这件事最该较真的地方,是“3T”这个词本身。它可以指总参数,也可以指MoE架构里实际参与计算的激活参数。两种口径,推理成本能差出一个数量级,页面里没有一个字说清楚。
公开可比的参照是DeepSeek-V3——总参数6710亿,实际激活参数约370亿。拿这个当尺子,Kimi K3的两种可能长这样:
| 口径 | 参照对比 | 部署含义 |
|---|---|---|
| 3T是总参数 | 比DeepSeek-V3总参数大4倍以上 | 显存需求可能冲到数百GB甚至TB级,单机很难扛 |
| 3T是激活参数 | 比多数开源MoE模型的激活参数高出一个数量级 | 推理成本高但仍在工程可控范围,考验路由效率 |
古人讲“名不正,则言不顺”。一个规模说法要站得住,总得先把口径讲清楚——现在这四个字,还只是一个待验证的说法。
谁会受影响,该怎么做
大模型开发者和基础设施团队:现在不用急着改基础设施选型。可以先做一件事——评估这两种口径各自需要的适配工作,总参数路线要算显存预算,激活参数路线要看MoE路由框架兼不兼容。等许可证和模型卡出来,再决定要不要投入迁移资源。
关注开源模型竞争的读者:“全球首个”这句话先别写进任何行业格局判断。开放权重不等于完全开源,训练数据、训练代码、训练流程是否公开,页面一个字没提。这个说法能不能成立,要等模型卡和许可证条款出来后才算数。
接下来盯什么
三件事没有兑现之前,这条新闻只能算预告:
- 模型卡和基准分数——验证3T到底是什么口径性能站不站得住
- 许可证条款——决定这是能落地的开源模型还是一个好看的技术展示
- 部署工具链和量化版本——决定普通团队能不能用得起
页面现在显示的计划发布artifact数量是1。等这个数字变成模型卡、许可证文本、基准分数三项都齐了,才是这条新闻真正的下半场。八个月说长不长,但历史上“全球首个”这种说法从来不缺,缺的是兑现速度。
