IBM在2026年8月25日放出了Granite 4.2三档模型(3B/8B/30B)。官方技术博客写得很硬气:从零训练约15T tokens,五阶段预训练把上下文拉到512K,再叠上SFT和多阶段RL,agentic能力也补齐了。但把官方博客和Hugging Face上的模型卡放在一起读,会发现至少三处对不上号的地方——这比"又发了个开源模型"有意思得多。
从零训练,还是接着4.1往下练?
博客反复强调"trained from scratch"约15T tokens,可30B的模型卡明明白白写着基座是Granite-4.1-30B-Base。也就是说4.2-30B更准确的身份是在4.1基座上继续训练,不是重新起炉灶。两种说法能同时成立,取决于怎么定义"从零":算整条谱系累计消耗的token,15T是真的;算这一代模型单独重新预训练,"从零"就名不副实。企业客户想知道的是"这代模型底子有多新",IBM自己两处口径都没对齐。
512K是宣传出来的,128K才是能用的
参数表写着"上下文扩展至512K tokens",听起来很唬人。往下翻架构配置,序列长度写的是131,072,官方给的vLLM、SGLang示例服务配置,最大上下文也是131,072。512K是额外扩展能力,不是标准出厂设置。本地部署的量化用户反馈更直接:跑到128K时KV cache已经吃掉大量显存,512K在真实硬件上离"能用"还有距离。这跟不少长上下文宣传的套路一样——参数表写的是理论上限,vLLM默认配置写的才是敢真卖给你的东西。
分数摆出来了,社区没买账
推理部分Granite 4.2确实拿得出手:30B在AIME2025到89.17,GPQA到66.41。但往agentic方向走,曲线掉得很快——SWE-Bench Verified 57.00,到Terminal-Bench 2.1只剩29.24。8B更明显,同样四项分别是86.67/64.14/47.67/20.56。SWE-bench Pro上30B是33.29,8B是19.11,被开发者社区认为对一个30B稠密模型偏低。IBM发布时没给出和Qwen、Llama等同期开源模型的横向对比表,这个空白本身就是个态度问题:分数摆出来,比较留给别人猜。
悄悄换回来的架构
再往底层看还有一处没被明说的转向。Granite此前有版本用Mamba2混合架构,图的是推理时的效率;4.2整套回到decoder-only的纯稠密Transformer,GQA+RoPE+SwiGLU,是最保守也最主流的配方。效率优势让位给了生态兼容——纯Transformer在vLLM、SGLang、各种agent框架里适配成本更低,原生工具调用能直接套用OpenAI函数调用格式。这笔账算下来,IBM显然更在乎"能不能无缝接进现有agentic工具链",而不是继续在架构上冒险。
三处落差拼起来,能看出Granite 4.2真正想打的仗不在State-of-the-art。SFT那720万样本、约100B tokens的构成里,agentic数据占到31.6%,SWE子项又吃掉agentic里的69%,说明IBM很清楚企业客户要的是"能跑代码、能操作终端"的agent,不是刷分。但Terminal-Bench的分数已经把这个野心的短板摆出来了。
参数写得漂亮,落地要看能不能扛住实测
- 结论.Apache 2.0许可加数据溯源声明,才是IBM在企业采购桌上真正能打的牌,不是benchmark
- 风险.512K上下文和"从零训练"的说法一旦被企业技术团队自己验证出落差,会直接冲击"企业级可信"的品牌叙事
对开发者和企业选型团队来说,别只看博客里的参数表。真正该做的是自己跑一遍128K以上的长文本、拿SWE-bench或Terminal-Bench的公开任务集测一次agentic表现,再看IBM会不会在后续版本里把"从零训练"和"续训4.1"这两句话捏合成一句诚实的话。这比等它自己澄清靠得住。
