IBM这次发布的Granite 4.2,没有一款模型拿到跑分冠军。三档体积从3B到30B,权重全部可以下载,找台机器就能自己部署。
反常的地方在训练方式:三档统一给了128K原生上下文,却只让8B和30B学会了用终端、查网页、调工具。3B也能调用工具,但没经过同等强度的专项训练,能力打了折扣。IBM管这次发布叫"推理导向的一代",听起来是技术升级,实际瞄准的是企业对云端账单和限流的焦虑——数据要不要出门,成本能不能算清楚。
三档模型,差在哪一张表看完
| 规格 | 上下文 | 智能体强化训练 | 部署方式 |
|---|---|---|---|
| 3B | 128K | 无(仅基础工具调用) | 下载后自托管 |
| 8B | 128K | 有 | 下载后自托管 |
| 30B | 128K | 有 | 下载后自托管 |
3B拿到的是入场券,不是上岗证。128K上下文三档都给齐了,但真正能独立完成多步工具调用任务的,只有8B和30B。
想用最小模型跑agent任务的团队要留意:3B没接受过专项强化训练,复杂工具链场景建议直接上8B,别指望3B替补上岗。
"推理"两个字,别想多了
Granite 4.2的"推理",是链式处理:模型把问题拆成多步,一步步把中间结果往下传。这不是人类式的理解或判断,只是更规整的计算流程。
代价很直接:每多一步,响应时间和算力消耗都跟着涨。IBM说的"推理导向",本质是拿延迟换精度。
用在客服应答、代码审查这类容错率低的场景,多等一步值得。用在实时聊天或高并发接口,这笔延迟账得提前算清楚,不然体验会先出问题。
谁该现在跟,谁该再等等
重视数据不出门、想把预算摊成固定成本的企业,值得现在把Granite 4.2拉进评估池——尤其是已经在测Nvidia Nemotron这类本地企业模型的团队,正好可以做横向对比。
按次调用付费、日均请求量不大的独立开发者,未必划算。本地部署的运维成本,可能比省下的token费用还高,不急着换。
限制也要说清楚:IBM没公布许可证细节,也没给出跑分和实际成本数据。这次发布更像一份方向声明,不是一份可复现的评测报告。
接下来该看的是三件事:许可证条款怎么落地、有没有第三方跑分对比、以及早期部署企业的运维反馈。这三个变量没出来之前,Granite 4.2值得列入候选名单,但还不到下单的时候。
IBM从大型机做到PC再做到云计算,每次转身都不靠单点性能取胜,靠的是让机房里的人觉得踏实。这次开放权重的打法,还是同一套老逻辑——不比谁跑得快,比谁能真正进得了企业机房。
