IBM在9月9日发布了新版时间序列预测模型Granite Time Series PatchTST-FM-r2,宣称截至9月8日,它是GIFT-Eval排行榜"可复现、零样本、无测试泄露"类别里,商用许可最宽松的模型中综合表现最好的一个——CRPS、MASE两项指标都排第二。

听起来像一次干净的胜利。但把分数摊开看,这个"第二"跟第一名之间只差了两个百分点出头,而且同一个类别里,至少还有一个模型分数比它更好,却没有出现在IBM的对比图里。

发生了什么

PatchTST-FM-r2是IBM Granite时间序列家族的最新成员,大约385M参数,支持最长8192步上下文,靠99分位数预测头输出概率预测,还能处理缺失值补全。架构上从上一代的标准transformer层,换成了源自语音识别的conformer块——自注意力管长距离关系,时序卷积管局部结构,两边分工。

许可证是这次的重点营销词:Apache-2.0与OpenMDW 1.0双授权,用户随便挑一个,都是商用友好、不限制使用的开放许可。这一点在动辄闭源接口、限制商用的时序模型赛道里,确实是稀缺项。

那个没被拆开看的"第二"

GIFT-Eval是这个领域目前最权威的综合基准,由Salesforce AI Research维护,覆盖近百个数据集,专门区分模型是否零样本、是否可复现、有没有测试泄露。IBM挑的是最干净的那个切片:零样本+可复现+无泄露。

在这个切片里,排第一的是Google的TimesFM-3,MASE 0.667、CRPS 0.456。PatchTST-FM-r2是MASE 0.6846、CRPS 0.467——差距分别是2.6%和2.4%,基本在误差带边缘,谈不上碾压。

更值得追问的是,同一个类别下,EXAONE-Forecast的MASE为0.673、CRPS为0.460,两项指标都优于PatchTST-FM-r2。IBM的对比图里没有出现这条数据。这不代表IBM造假——很可能是许可条件、复现代码开放度或某个过滤维度让EXAONE-Forecast没有进入同一张对比表——但IBM自己的博客没有解释这层筛选逻辑,这就留下了一个没交代清楚的口子。

GIFT-Eval 严格零样本榜:MASE对比 TimesFM-3 0.667(第1) EXAONE-Forecast 0.673(未被IBM列入对比) PatchTST-FM-r2 0.6846(IBM称第2) 数值越低越好;三者差距集中在2-3个百分点内 IBM对比图未纳入EXAONE-Forecast

加上预训练模型,排名会继续往下掉

GIFT-Eval还有一类模型被标注为"预训练"——它们的训练语料里允许包含基准评测集本身的训练部分。理论上这类模型不算严格零样本,但IBM自己在博客里也把它们拉进来做了第二轮比较。

结果是:一旦把这些预训练模型算进去,PatchTST-FM-r2的排名从CRPS第2掉到第3,MASE第2掉到第4。这一段IBM写得很坦诚,没有藏着不说,但放在标题和摘要里的表述,始终只强调"零样本类别第2"和"商用许可类别第1"。

  • 结论.这个SOTA是双重限定的SOTA——限定在零样本切片,又限定在商用许可类别,换一个筛选条件,排名立刻松动。
同一模型,两种筛选口径 只算严格零样本模型 第2 CRPS / MASE 均排第2 纳入允许用评测集训练的模型 第3/4 CRPS第3,MASE第4

真正值得看的不是分数,是许可证

单看精度,PatchTST-FM-r2和TimesFM-3的差距不大,和EXAONE-Forecast谁高谁低甚至说不清楚。这个赛道走到今天,头部几个模型的绝对精度已经很接近,再往上抠一两个百分点,对多数企业场景——需求预测、能源负荷、传感器遥测——未必有可感知的业务意义。

真正的分水岭在许可证。TimesFM系列、Chronos、Toto这些头部模型,多数只开放推理接口,或者许可条款对商用有限制。IBM这次把权重、架构、推理代码、复现基准的全套材料都放出来,还给了双授权选择。对需要本地部署、内部审计、二次训练的企业客户来说,这种"能拿走、能改、能审"的自由度,可能比2%的精度差距更实际。

精度打平的时候,许可证才是真正的竞争力

这也是为什么IBM的博客通篇都在强调"commercial-friendly"这个词,而不是死磕跑分第一。它清楚自己打不过TimesFM-3的绝对精度,于是把战场挪到一个自己占优的维度——开放许可——然后在这个维度里宣布胜利。这不是造假,是一种诚实但选择性的叙事策略。

  • 风险.如果读者只看标题里的"SOTA",很容易把"商用许可类别第一"误读成"全行业绝对第一",这中间的落差需要读者自己补上。

接下来值得盯的,是TimesFM或Chronos是否会推出更宽松许可的版本来应战——如果精度接近的情况下许可证成了决胜项,竞争对手没有理由不跟进。另一件事是GIFT-Eval这类基准会不会因为排名争议,进一步收紧或细化"零样本""可复现"的判定规则。跑分战打到现在,规则本身可能比选手更需要被重新审视。