Moonshot AI上周发布的Kimi K3,在Artificial Analysis新推出的智能体知识工作基准AA-Briefcase上拿到1543 Elo,仅次于Fable 5的1574分,是目前记录到的第二高分。
这个分数比上一代K2.6的816分高出727分。但同一份报告里还有另一组数字:单个任务平均要花10.57美元,平均耗时56.4分钟。分数亮眼,账单也沉重,这才是这次评测真正值得看的地方。
K3强在哪里,弱在哪里
AA-Briefcase是Artificial Analysis自建的私有测试集,题目模拟现实中的复杂知识工作:处理成堆输入文件,交付表格、演示文稿、界面草图,再按正确性、分析质量、呈现质量合成一个Elo分数。
它测的是"能不能把活干完",不是通用对话能力。拿这个分数直接套用到所有业务场景并不成立。
| 模型 | AA-Briefcase Elo | 任务通过率 | 分析质量Elo | 呈现质量Elo |
|---|---|---|---|---|
| Fable 5 | 1574 | 56% | 1744 | — |
| Kimi K3 | 1543 | 51% | 1754 | 1471 |
| GPT-5.6 Sol | 1501 | 41.8% | — | 1660 |
| Claude Sonnet 5 | 1388 | 42.3% | — | — |
| Claude Opus 4.8 | 1347 | — | — | 1492 |
K3的分析质量Elo达到1754,比Fable 5还高10分,说明它拆解复杂输入、给出正确判断的能力确实上了台阶。
短板在呈现。K3的呈现质量Elo只有1471,低于GPT-5.6 Sol的1660,也不及Opus 4.8的1492。它更会"想",不太会"包装"——分析对了,最后交出来的表格或演示文稿观感会打折扣。
高分背后的账单
分数第二,成本却是同批模型里最高的一档。推手是三件事叠在一起:轮次多、输出多、第一方Kimi API本身速度不快。
K3平均要跑83轮才能收工,Fable 5是67轮,GPT-5.6 Sol只要50轮。输出token用量也从K2.6的4.2万涨到12万。
官方定价是每百万输入/输出token 3美元/15美元,缓存token有90%折扣。但轮次和输出量一高,折扣也兜不住总账单,单任务平均10.57美元。
时间成本更明显。平均56.4分钟跑完一个任务,大约是Fable 5的2.5倍。
对谁有影响,该怎么做
技术负责人在评估企业级智能体方案时,K3适合放进两类场景:深度尽调、复杂建模这类容错预算高、单次交付价值也高的任务。输出质量能覆盖掉高昂的调用成本。
不适合放进高频轮询式的通用任务,比如客服问答、批量文档摘要。这类场景10.57美元一次的成本会迅速累积。
产品和业务团队做预算决策时,可以按任务类型分层:把K3限定在低频、高价值的复杂交付上,通用任务继续用更快更便宜的模型。这样能避免把K3当成默认选项,导致API账单失控。
成本和耗时很大程度受首方Kimi API速度和轮次数拖累,不完全是模型能力的固定代价。后续接口优化或第三方部署是否会拉低这个数字,目前还看不到确切时间表,值得持续盯一下Moonshot AI是否推出更快的推理端点。
K2.6到K3这一跳证明了Moonshot AI在复杂知识工作上补齐了短板,分析能力已经能和Fable 5打平。但呈现质量偏弱、成本和时延偏高,这三条限制摆在那里,决定了它现在更像一款高能力小众工具,离能被大规模调用的生产级方案还差一段距离。
