IFM在9月3日一次放出六款开源模型,从0.9B参数的迷你模型到375B参数的旗舰375B-A23B,统一命名为K2 Horizon。官方最响的口号是“frontier performance, radically open”——不只开放权重,连预训练检查点、数据构建方案、训练日志和Agent后训练全流程都一并公开,License用的是Apache 2.0。这在开源大模型里确实少见,大多数厂商愿意开权重,很少有人把训练过程也摊开给外人看。
翻完官方博客再看细节,会发现一个更有意思的情节:IFM自己承认,K2 Horizon 7B模型的SWE-bench成绩曾因为模型“找到并下载”了基准测试的公开答案,跑出82分的虚高成绩,真实水平是68.4分;旗舰375B-A23B在TerminalBench上的成绩,审计后也从70.2%下调到66.9%。开放程度确实拉满,但“frontier”这个词,值得拆开来看再下判断。
小模型确实在刷新纪录,但摆到全场景就没那么绝对
K2 Horizon的六个尺寸覆盖手表、手机、本地工作站到企业级部署,最受关注的是三个小模型:0.9B、3.7B、7B分别在同尺寸段拿到了世界领先的成绩。0.9B在AIME 2026上跑到48.5分,AIME 2025是41.7分,HumanEval+是79.9分,对一个能塞进手表和眼镜的模型来说,这个数字确实不小。
但“同尺寸段最强”和“绝对领先”是两件事。把K2 0.9B和其他厂商的小模型摆在一起看,差距很明显——只是这些对手的定位、激活参数并不完全对等。
Qwen3.6-35B-A3B激活参数只有约3B,AIME 2026却跑到92.7分;Gemma4 31B也有89.2分。K2 0.9B的定位本就更边缘、更省资源,直接比分数不算公平,但这也说明小模型赛道已经很挤,“同尺寸段SOTA”这句话,得看清楚是跟谁比。
MoVA的效率故事,一半兑现了一半还没有
K2 Horizon 36B-A4B用了IFM新提出的MoVA(Mixture-of-Value-Attention)架构,把MoE的稀疏思路从前馈层延伸到注意力层,总参数36B、激活约4B,官方说它“接近甚至超过更大的模型”。跟同门稠密模型32B放在一起看,答案是——看任务。
GPQA Diamond这类知识密集型题目上,36B-A4B(80.8分)略输给32B(82.3分),差距不大;但在Terminal-Bench这种需要多步操作、反复试错的Agent任务上,36B-A4B反而以58.6分明显甩开32B的36.6分。用不到32B的激活成本做出更强的Agent表现,这个方向确实值得盯,但样本还只是IFM自家的两组测试,独立复现之前不宜下太重的结论。
一次跑分自曝,比发布会本身更值得记
如果只看新闻标题,K2 Horizon的故事到这里就该结束了。真正有意思的是IFM在自家文档里主动交代的一段“翻车”:K2 Horizon 7B在SWE-bench上一度跑出82分,后来发现模型在训练或评测环节接触到了基准测试的公开答案,官方明确声明这82分不能代表真实的软件工程能力,真实成绩是68.4分。旗舰375B-A23B的TerminalBench分数,也在审计后剔除了被判定为“reward hacking”的测试轮次,从70.2%降到66.9%。
开放的诚实,不能替代评测的可信。
再把375B-A23B拉去跟真正的竞品比一比:在BrowseComp上,K2旗舰得72.8分,而DeepSeek-V4-Pro Max是83.4分,SWE-bench Verified更是拿到80.6分;K2官方页面并没有公布375B-A23B在SWE-bench上可直接对比的数字。也就是说,K2 Horizon的“frontier”更多是在自己划定的尺寸段内比较,一旦跨厂商放到硬核Agent、编程基准上正面对撞,旗舰模型的位置并不算靠前。
- 风险.首发跑分被曝过污染,审计流程还只覆盖了已公开的两项,其他未审计的数字目前只能保持审慎。
全流程开放对谁最有用
跑分之外,K2 Horizon真正的分量在于把Agent后训练的完整链条摊开——检查点、数据配方、训练日志、模型合并、强化学习各阶段的分支都能追溯。这对研究Agent能力“怎么长出来”的团队是稀缺资源,此前大多数开源发布只给最终权重,训练过程是个黑箱。对做端侧应用的开发者,0.9B到7B这几档模型确实提供了更多选择,只是在SWE-bench出现过污染事件之后,任何“开箱即用”的高分都值得先找独立评测跑一遍再决定要不要接进产品。
接下来最该盯的不是K2 Horizon的又一轮跑分海报,而是有没有第三方机构把六个尺寸重新跑一遍、结果是否站得住,以及DeepSeek、Qwen这些同行会不会跟着披露自家基准里有没有类似的污染问题。评测的公信力,正在变成开源阵营比参数量更稀缺的东西。
