Moonshot AI上周发布的Kimi K3,在Artificial Analysis新推出的智能体知识工作基准AA-Briefcase上拿到1543 Elo,仅次于Fable 5的1574分,是目前记录到的第二高分。

这个分数比上一代K2.6的816分高出727分。但同一份报告里还有另一组数字:单个任务平均要花10.57美元,平均耗时56.4分钟。分数亮眼,账单也沉重,这才是这次评测真正值得看的地方。

K3强在哪里,弱在哪里

AA-Briefcase是Artificial Analysis自建的私有测试集,题目模拟现实中的复杂知识工作:处理成堆输入文件,交付表格、演示文稿、界面草图,再按正确性、分析质量、呈现质量合成一个Elo分数。

它测的是"能不能把活干完",不是通用对话能力。拿这个分数直接套用到所有业务场景并不成立。

模型AA-Briefcase Elo任务通过率分析质量Elo呈现质量Elo
Fable 5157456%1744
Kimi K3154351%17541471
GPT-5.6 Sol150141.8%1660
Claude Sonnet 5138842.3%
Claude Opus 4.813471492

K3的分析质量Elo达到1754,比Fable 5还高10分,说明它拆解复杂输入、给出正确判断的能力确实上了台阶。

短板在呈现。K3的呈现质量Elo只有1471,低于GPT-5.6 Sol的1660,也不及Opus 4.8的1492。它更会"想",不太会"包装"——分析对了,最后交出来的表格或演示文稿观感会打折扣。

AA-Briefcase Elo 排名 Fable 5 1574 Kimi K3 1543 GPT-5.6 Sol 1501 Claude Sonnet 5 1388 Claude Opus 4.8 1347

高分背后的账单

分数第二,成本却是同批模型里最高的一档。推手是三件事叠在一起:轮次多、输出多、第一方Kimi API本身速度不快。

K3平均要跑83轮才能收工,Fable 5是67轮,GPT-5.6 Sol只要50轮。输出token用量也从K2.6的4.2万涨到12万。

官方定价是每百万输入/输出token 3美元/15美元,缓存token有90%折扣。但轮次和输出量一高,折扣也兜不住总账单,单任务平均10.57美元。

时间成本更明显。平均56.4分钟跑完一个任务,大约是Fable 5的2.5倍。

K3 单任务成本 $10.57 每任务平均花费 56.4分 每任务平均耗时 83轮 对话轮次(Fable 5为67轮) 12万 输出token(K2.6为4.2万)

对谁有影响,该怎么做

技术负责人在评估企业级智能体方案时,K3适合放进两类场景:深度尽调、复杂建模这类容错预算高、单次交付价值也高的任务。输出质量能覆盖掉高昂的调用成本。

不适合放进高频轮询式的通用任务,比如客服问答、批量文档摘要。这类场景10.57美元一次的成本会迅速累积。

产品和业务团队做预算决策时,可以按任务类型分层:把K3限定在低频、高价值的复杂交付上,通用任务继续用更快更便宜的模型。这样能避免把K3当成默认选项,导致API账单失控。

成本和耗时很大程度受首方Kimi API速度和轮次数拖累,不完全是模型能力的固定代价。后续接口优化或第三方部署是否会拉低这个数字,目前还看不到确切时间表,值得持续盯一下Moonshot AI是否推出更快的推理端点。

K2.6到K3这一跳证明了Moonshot AI在复杂知识工作上补齐了短板,分析能力已经能和Fable 5打平。但呈现质量偏弱、成本和时延偏高,这三条限制摆在那里,决定了它现在更像一款高能力小众工具,离能被大规模调用的生产级方案还差一段距离。