IBM这次发布的Granite 4.2,没有一款模型拿到跑分冠军。三档体积从3B到30B,权重全部可以下载,找台机器就能自己部署。

反常的地方在训练方式:三档统一给了128K原生上下文,却只让8B和30B学会了用终端、查网页、调工具。3B也能调用工具,但没经过同等强度的专项训练,能力打了折扣。IBM管这次发布叫"推理导向的一代",听起来是技术升级,实际瞄准的是企业对云端账单和限流的焦虑——数据要不要出门,成本能不能算清楚。

三档模型,差在哪一张表看完

规格上下文智能体强化训练部署方式
3B128K无(仅基础工具调用)下载后自托管
8B128K下载后自托管
30B128K下载后自托管

3B拿到的是入场券,不是上岗证。128K上下文三档都给齐了,但真正能独立完成多步工具调用任务的,只有8B和30B。

想用最小模型跑agent任务的团队要留意:3B没接受过专项强化训练,复杂工具链场景建议直接上8B,别指望3B替补上岗。

Granite 4.2 三档模型 30B 128K上下文 智能体强化训练 8B 128K上下文 智能体强化训练 3B 128K上下文 仅基础工具调用 三档均为开放权重、可自托管,非开源发布

"推理"两个字,别想多了

Granite 4.2的"推理",是链式处理:模型把问题拆成多步,一步步把中间结果往下传。这不是人类式的理解或判断,只是更规整的计算流程。

代价很直接:每多一步,响应时间和算力消耗都跟着涨。IBM说的"推理导向",本质是拿延迟换精度。

用在客服应答、代码审查这类容错率低的场景,多等一步值得。用在实时聊天或高并发接口,这笔延迟账得提前算清楚,不然体验会先出问题。

谁该现在跟,谁该再等等

重视数据不出门、想把预算摊成固定成本的企业,值得现在把Granite 4.2拉进评估池——尤其是已经在测Nvidia Nemotron这类本地企业模型的团队,正好可以做横向对比。

按次调用付费、日均请求量不大的独立开发者,未必划算。本地部署的运维成本,可能比省下的token费用还高,不急着换。

云端焦虑 vs 本地承诺 云端前沿模型 按token计费 数据上传第三方 价格/限流由厂商决定 本地开放权重模型 固定硬件投入 数据留在本地 部署节奏自己定 IBM没给出成本对比数据,这是方向判断,不是实测结论

限制也要说清楚:IBM没公布许可证细节,也没给出跑分和实际成本数据。这次发布更像一份方向声明,不是一份可复现的评测报告。

接下来该看的是三件事:许可证条款怎么落地、有没有第三方跑分对比、以及早期部署企业的运维反馈。这三个变量没出来之前,Granite 4.2值得列入候选名单,但还不到下单的时候。

IBM从大型机做到PC再做到云计算,每次转身都不靠单点性能取胜,靠的是让机房里的人觉得踏实。这次开放权重的打法,还是同一套老逻辑——不比谁跑得快,比谁能真正进得了企业机房。