Kimi K3在ExploitBench上拿到32%的分数,超过此前最能打的开源权重模型GLM-5.2的24%。但同一张成绩单上还有另一个数字:0/41——面对同一批漏洞,它一次都没能做到任意代码执行。这份由英国AISI和美国CAISI联合发布的初步评估,把Kimi K3的网络攻防能力摆在一个尴尬又值得较真的位置:比开源同行强,离美国前沿闭源模型还有明显距离,而这份评估本身,又建立在一堆需要读小字才能看懂的限定条件上。
速读:两套测试,四个数字
- Kimi K3于2026年7月16日发布,计划7月27日开放权重。
- ExploitBench(41道漏洞利用题):Kimi K3得分32%,GLM-5.2得分24%;但Kimi K3的任意代码执行(ACE)成绩为0/41,顶尖模型平均能做到20/41。
- Cyber Range "The Last Ones"(32步企业网络攻击链):Kimi K3平均走到第17步,GLM-5.2平均第11步,美国最强模型平均第28.5步。
- 10次尝试里,Kimi K3完整攻破了1次。
分水岭:超过同行,不等于逼近前沿
32%对24%,17步对11步,Kimi K3确实把开源权重模型的水位线往上推了一截。但同一张表里,美国前沿模型的ACE成功率是Kimi K3的无穷倍(20/41 对 0/41),TLO靶场通关率是6/10、7/10,对Kimi K3的1/10。开源阵营里的第一名,依然被闭源阵营的门槛甩开一大截。
这个对比也不是同条件横评。美国闭源模型测试时关闭了系统级安全护栏,为的是测出能力上限,公开可用版本并没有这么放开。Kimi K3因为托管方式的限制,只接受了一套选择性评估。它的总体能力分数只靠ExploitBench一个基准撑起来,置信区间自然比其他模型更宽——不是说数字不可信,是说这张成绩单还没到能拍板的程度。
- 结论.Kimi K3的总体能力估计只来自41道题的单一基准,置信区间比同批模型更宽,现在下"追平"或"逼近"美国前沿的结论都还早。
1/10的完整攻破率听着不高,但这道靶场没有主动防守,不因为触发警报而扣分,还预设了一条攻击路径——现实里的企业网络不会这么配合。
- 风险.TLO靶场无主动防守、无告警惩罚、有预设攻击路径,1/10的通关率放到真实企业网络里,大概率会更低,而不是更高。
真正该盯的不是Kimi K3有没有追上美国模型,是它已经能在拿到初始访问权限后,独立摸完一条完整的攻击链,而且七月底就要把权重公开发出去。技术扩散这件事,历史给过提醒:火药配方谁先写在纸上不重要,谁先把它摊开在桌面上,谁就改变了战场的门槛。开源权重模型现在做的,就是把"自动化网络攻击"这件事的下限,一点点往下摊平。
追平闭源模型不算什么大新闻,把攻击门槛往下拉,才是真正该记的一笔。
对安全团队和治理机构来说,这份评估最有用的部分不是排名,是提醒:能力上限还没到,可靠性还很脆弱,但下限已经在往危险的方向挪动,而挪动的速度,眼下比谁跑第一更值得盯着。
