Google在9月3日更新了旗下AI天气预报模型,新一代WeatherNext 3把预报刷新频率提到每小时一次,还宣称部分降水预测比上一代最高提升60%。这条消息本身值得记录,但真正该拆开看的是那个“60%”——它跟谁比、比的是哪个指标,这才是这次更新里最容易被忽略、也最容易被过度解读的部分。
对普通用户来说,Search、Maps、Gemini里的天气卡片确实会变细。但对整个AI气象圈来说,Google自己给出的这套精度数字,恰好暴露了这个赛道一直没解决的问题:到底谁的AI天气模型更准,目前没有一个独立、统一的答案。
每小时刷新一次,WeatherNext 3到底变了什么
上一代WeatherNext 2每6小时出一次预报,网格分辨率25公里。新模型改成直接摄入地球静止卫星的实时拼接图像,而不是等物理模型算完的分析数据,每小时初始化一次,一天最多24次,主6小时周期的预报能看15天,每小时插补的短期预报可以看到48小时以后。
集合成员数扩到64个,地表变量分辨率最高能到5公里左右(气温、露点这类站点校准变量约0.05度),高空场仍维持在25公里,跟上一代持平——这次升级主要是补地表和短期这两块。
模型已经接进Search、Maps、Gemini、Maps Platform Weather API和Earth Engine。
“最高提升60%”说的是哪一种更准
Google给的精度数字不是一个数,是一组数,而且每个数对应的基准完全不同:
| 对比基准 | 评估指标 | 改善幅度 | 判断 |
|---|---|---|---|
| IMERG卫星降水数据 | CRPS | 最高60% | 遥感反演数据,本身误差不小 |
| MRMS雷达降水数据 | CRPS | 最高30% | 覆盖有限,主要在美国 |
| 地面雨量计观测 | CRPS(早期预报) | 最高10% | 最贴近真实降雨 |
| 数值天气预报基线 | Brier score/CRPS | 最高50% | 跟传统物理模型比 |
CRPS(连续分级概率评分)是气象界评估概率预报常用的指标,数值越低越好。跟IMERG比降低60%听起来最猛,但IMERG本身也是遥感反演,误差空间大;跟地面雨量计——最贴近真实降雨的观测——比,改善幅度只剩10%左右。越接近真实世界的降雨,Google给出的提升就越小。
面向消费者的那句“提前一天以上降水预报准确率最高提升50%”,是产品层面的综合宣传语,没有对应到上面任何一个单一指标上。
从GraphCast到WeatherNext,自评“胜率”为什么一路走高
Google旗下模型这几代一直在打同一套牌:GraphCast当年宣称在2760个变量/时长组合里89.3%击败当时运营的ECMWF HRES;GenCast接着说自己在1320个目标里97.2%赢了ECMWF ENS,36小时后这个比例升到99.8%;到WeatherNext 2,官方给出的说法是在99.9%的评估组合上占优。
越接近真实降雨,提升幅度就越小
这些百分比不是误差降低了多少,而是“在这么多变量/时长组合里排名更靠前”——跟误差真的降了89%完全是两件事。而且这些对比用的HRES、ECMWF ENS版本,往往是Google训练验证周期里锁定的旧配置,ECMWF自己一直在升级。
NOAA去年做过一个实验:同一套GraphCast架构,用ECMWF的初始条件驱动,表现明显好于用美国GFS初始条件驱动的版本。“AI模型更准”这个结论,很大程度上取决于喂给它的初始数据来自谁,不只是模型本身强不强。
- 结论.目前不存在独立、统一的AI天气模型排行榜,所谓“更准”多数时候是模型自己说的
RMSE(均方根误差)偏低还有一个陷阱:AI模型倾向于把预报结果抹平,统计误差好看,但会系统性低估强降水和极端风速这类尖峰事件——这恰好是普通人最关心、保险公司和应急部门最在意的部分。
谁真的会用上它,谁不该轻信它
Search、Maps、Gemini的普通用户会看到界面更细、刷新更快,尤其在雨量计稀少的地区体验提升最明显——Google自己点名这些地方主要在美国和欧洲之外。这句判断相对靠谱:那里的预报基线本来就弱,AI补的是数据空白,不是跟顶级模型拼极限精度。
台风路径和强度预测不在这次升级的强项里。WeatherNext 3是全球通用模型,网格再细也到不了专门针对台风核心结构训练的水平。Google给国家飓风中心和亚洲气象机构提供的是另一套专门模型,官方给出的建议依然是:真正的飓风预警,以气象部门自己的专业集合预报为准。
还有一个不该被忽略的细节:新模型能预测100米高度的风速——差不多是风力涡轮机叶片的高度,服务对象是可再生能源发电预测。Google自己的数据中心正在吃掉越来越多电力,把风电、光伏出力算得更准,对Google自己的能源账本也有直接好处,这不完全是无私的技术升级。
- 风险.强降水和台风强度这类尾部风险场景,AI模型的低误差可能只是把极端值抹平了,不能替代官方预警
面对这类“AI又变强了”的公告,比较靠谱的读法是:先看它对比的基准是什么,再问离真实世界有多远,最后问一句有没有独立第三方验证过——目前的答案基本是没有。
