Kimi K3 上周四发布的时候,权重其实还没放出来——按月之暗面当时给出的时间表,要等到7月27日才公开。可网上关于"这模型到底比闭源落后几个月"的争论,已经先吵起来了。几乎同一个周末,Qwen 宣布下一代旗舰模型会走开放权重路线,是个不小的转弯;世界人工智能大会上,官方讲话也把开源列为技术方向之一,但没给出具体执行细节。三件事凑在一起,比任何一次单独的模型发布都更值得掰开说。
发生了什么
- Kimi K3.前端和部分研究分析任务上口碑不错。有播客主持人提到,让它去分析 Reddit 讨论数据,它自己扒了此前没人留意的几个板块,还发现一个规律——某些模型在 Reddit 上被讨论的时间,往往比下载量真正起飞早一两个月。这种"自己找角度"的能力,其他几家前沿模型都没表现出来。但代码能力上,边界情况(edge case)覆盖不如顶级闭源工具,国内服务器加上访问量太大,响应速度也明显更慢——不到"没法用",但会拖慢节奏。
- **GLM 5.2** 权重同样没正式放出,但托管接口已经能跑到两三百 token/秒,不少人已经把它当日常"打杂"模型用,清理类任务体验接近 Sonnet 档位。
- Qwen 下一代旗舰确认开放权重,但开放权重不等于完全开源,训练数据、代码、许可证具体开放到什么程度,目前没有细节。
- 蒸馏争议还在发酵.外界一直怀疑部分中国模型的能力提升来自对闭源模型输出的蒸馏训练,但目前没有实锤,只能算悬而未决。
差距背后,是基建和后训练的门槛
每次开源模型发布,都有人要给"落后几个月"钉一个具体数字,但基准测试提供方和榜单太多,选哪个基准,结论能差出好几倍。更有用的区分是:哪些基准和真实的高频用法相关——agentic coding、电脑操作类任务;哪些基准反映的是长尾边界场景,这恰恰是 Claude、GPT 这类顶级闭源模型还占优势的地方。
- 提醒.开放权重不等于随时能规模化微调——数百B参数的模型,光加载权重就要动用整机架级别的算力,后训练和推理优化都得重新趟一遍。
以前中国开源模型跑完一轮RL训练,几小时到一周内就能放出权重,社区几乎立刻就能上手微调。这次到了500B-700B这个参数量级,情况变了:光是把权重加载进显存就是硬门槛,后训练和推理优化要花的时间明显拉长。好在开源生态这一年专业化了不少——推理服务商能提前拿到权重做适配,vLLM 补丁经常发布当天就绪,不再是一年前那种"权重一扔、大家自己想办法"的局面。
权重公开,不等于立刻能打。
真正拉开差距的,不是月份
"落后几个月"这个问法本身就在掩盖真问题。它把差距简化成一个跑分数字,却漏掉了模型从"权重放出"到"变成能用的产品"之间那段真正决定胜负的距离。
- 结论.比某个跑分差几个月更该盯的,是资本效率、后训练能力、部署基础设施这三件事谁先跑通。
关于中国实验室为什么这么能打,一个流传的说法是它们把资本转化成算力、数据、人才的效率更高——但这只是猜测,原因说不清楚:可能是人才培养方向更贴合训练大模型这类问题,可能是算力和人力成本本身就更低,也可能只是目标设定不同。有 Kimi 的工程师曾在社交媒体上回应说,他们不追求推前沿,只想追上去——这是一种目标收窄,而不是技术奇迹,却可能实实在在省下大笔训练成本。这个假设目前站不住脚也推不翻,值得继续盯着看。
开放权重的承诺、企业的发布计划、国家层面的政策表态,是三件不同的事,不该混着读。官方讲话是方向信号,不是执行方案;Qwen的开放权重是企业动作,不代表整个行业的开放程度都在同步提高。
古人说"兵马未动,粮草先行",打仗先看后勤,不是先看谁的旗帜插得早。开源模型这一轮的胜负手,也不在权重放出的那一天,而在后训练团队和部署商能多快把它变成真正好用的东西。Kimi K3 的权重到写完这篇文章时都还没公开,这件事本身,就是最好的注脚。
