Google在9月3日更新了旗下AI天气预报模型,新一代WeatherNext 3把预报刷新频率提到每小时一次,还宣称部分降水预测比上一代最高提升60%。这条消息本身值得记录,但真正该拆开看的是那个“60%”——它跟谁比、比的是哪个指标,这才是这次更新里最容易被忽略、也最容易被过度解读的部分。

对普通用户来说,Search、Maps、Gemini里的天气卡片确实会变细。但对整个AI气象圈来说,Google自己给出的这套精度数字,恰好暴露了这个赛道一直没解决的问题:到底谁的AI天气模型更准,目前没有一个独立、统一的答案。

每小时刷新一次,WeatherNext 3到底变了什么

上一代WeatherNext 2每6小时出一次预报,网格分辨率25公里。新模型改成直接摄入地球静止卫星的实时拼接图像,而不是等物理模型算完的分析数据,每小时初始化一次,一天最多24次,主6小时周期的预报能看15天,每小时插补的短期预报可以看到48小时以后。

集合成员数扩到64个,地表变量分辨率最高能到5公里左右(气温、露点这类站点校准变量约0.05度),高空场仍维持在25公里,跟上一代持平——这次升级主要是补地表和短期这两块。

模型已经接进Search、Maps、Gemini、Maps Platform Weather API和Earth Engine。

WeatherNext 3 核心参数 24次 每日初始化次数 64个 集合成员数 5公里 地表最高分辨率 15天 主预报周期

“最高提升60%”说的是哪一种更准

Google给的精度数字不是一个数,是一组数,而且每个数对应的基准完全不同:

对比基准评估指标改善幅度判断
IMERG卫星降水数据CRPS最高60%遥感反演数据,本身误差不小
MRMS雷达降水数据CRPS最高30%覆盖有限,主要在美国
地面雨量计观测CRPS(早期预报)最高10%最贴近真实降雨
数值天气预报基线Brier score/CRPS最高50%跟传统物理模型比

CRPS(连续分级概率评分)是气象界评估概率预报常用的指标,数值越低越好。跟IMERG比降低60%听起来最猛,但IMERG本身也是遥感反演,误差空间大;跟地面雨量计——最贴近真实降雨的观测——比,改善幅度只剩10%左右。越接近真实世界的降雨,Google给出的提升就越小。

面向消费者的那句“提前一天以上降水预报准确率最高提升50%”,是产品层面的综合宣传语,没有对应到上面任何一个单一指标上。

从GraphCast到WeatherNext,自评“胜率”为什么一路走高

Google旗下模型这几代一直在打同一套牌:GraphCast当年宣称在2760个变量/时长组合里89.3%击败当时运营的ECMWF HRES;GenCast接着说自己在1320个目标里97.2%赢了ECMWF ENS,36小时后这个比例升到99.8%;到WeatherNext 2,官方给出的说法是在99.9%的评估组合上占优。

越接近真实降雨,提升幅度就越小

这些百分比不是误差降低了多少,而是“在这么多变量/时长组合里排名更靠前”——跟误差真的降了89%完全是两件事。而且这些对比用的HRES、ECMWF ENS版本,往往是Google训练验证周期里锁定的旧配置,ECMWF自己一直在升级。

NOAA去年做过一个实验:同一套GraphCast架构,用ECMWF的初始条件驱动,表现明显好于用美国GFS初始条件驱动的版本。“AI模型更准”这个结论,很大程度上取决于喂给它的初始数据来自谁,不只是模型本身强不强。

  • 结论.目前不存在独立、统一的AI天气模型排行榜,所谓“更准”多数时候是模型自己说的
自评“胜率”一路走高 GraphCast 89.3% GenCast 97.2% WeatherNext 2 99.9% 三代模型的“胜率”数字一路逼近100%,均为自评结果

RMSE(均方根误差)偏低还有一个陷阱:AI模型倾向于把预报结果抹平,统计误差好看,但会系统性低估强降水和极端风速这类尖峰事件——这恰好是普通人最关心、保险公司和应急部门最在意的部分。


谁真的会用上它,谁不该轻信它

Search、Maps、Gemini的普通用户会看到界面更细、刷新更快,尤其在雨量计稀少的地区体验提升最明显——Google自己点名这些地方主要在美国和欧洲之外。这句判断相对靠谱:那里的预报基线本来就弱,AI补的是数据空白,不是跟顶级模型拼极限精度。

台风路径和强度预测不在这次升级的强项里。WeatherNext 3是全球通用模型,网格再细也到不了专门针对台风核心结构训练的水平。Google给国家飓风中心和亚洲气象机构提供的是另一套专门模型,官方给出的建议依然是:真正的飓风预警,以气象部门自己的专业集合预报为准。

还有一个不该被忽略的细节:新模型能预测100米高度的风速——差不多是风力涡轮机叶片的高度,服务对象是可再生能源发电预测。Google自己的数据中心正在吃掉越来越多电力,把风电、光伏出力算得更准,对Google自己的能源账本也有直接好处,这不完全是无私的技术升级。

  • 风险.强降水和台风强度这类尾部风险场景,AI模型的低误差可能只是把极端值抹平了,不能替代官方预警

面对这类“AI又变强了”的公告,比较靠谱的读法是:先看它对比的基准是什么,再问离真实世界有多远,最后问一句有没有独立第三方验证过——目前的答案基本是没有。