Google在9月3日把自家AI天气预报模型WeatherNext升级到了第3版。最大的变化是,模型开始直接读取卫星拼接图像,预报刷新频率从原来的六小时一次提到了每小时一次。Google官方博客给出的数字很亮眼:提前一天以上的降水预报准确性最高提升50%,个别评估口径甚至到60%。但配套发表的技术论文里,同一类精度提升的实测数字只有19%到20%——这中间的落差,比"摄入卫星数据"这句话本身更值得琢磨。

WeatherNext 3到底改了什么

架构上它沿用了WeatherNext 2的FGN mesh transformer,但输入端多了一路每小时刷新的静止卫星拼接图像。值得留意的是,模型并没有丢掉传统的ECMWF HRES分析场——那是经过完整数据同化流程处理过的大气状态估计,WeatherNext 3依然把它当成主力输入之一。

换句话说,卫星数据是"加"进去的,不是"换"进去的。输出端也升级了:地表气温和露点做到约5公里分辨率,多数降水、云图变量约10公里,高空层变量约25公里,运行时用64个集合成员,主周期能拉到15天预报,临时逐小时运行可覆盖48小时。

WeatherNext 3 输入结构 卫星拼接图像 每小时刷新,新增输入 ECMWF HRES分析场 传统同化产出,仍在用 FGN mesh transformer 64个集合成员 逐小时预报 主周期最长15天 接入Search/Gemini/Maps 结论:是加一路输入,不是甩开传统同化

"摄入原始卫星数据"这句话该打几折

原文标题起了个双关——"Data assimilation is not futile",数据同化没有失效。这句话点破了整个AI天气预报行业的一个共识:几乎所有主流AI模型,包括Google自己的GraphCast、GenCast,还有ECMWF的AIFS,训练和运行时用的都是已经同化好的分析场,不是卫星传回来的原始辐射值。

真正的卫星原始测量需要经过定标、云检测、辐射传输建模、偏差订正一整套复杂流程才能变成可用的大气状态,这个环节至今仍是传统数值天气预报的地盘。剑桥、图灵研究所和ECMWF合作的Aardvark Weather才是少数真正尝试端到端摄入原始观测、自己完成同化的系统,路线上和Google这套完全不同。

数据同化没有被绕过,只是换了一件外衣。

WeatherNext 3的做法更准确的说法是"增强":卫星拼接图像是补充信号,用来填补分析场每六小时才更新一次的空档,让模型能感知到更接近实时的天气变化。这也是为什么它敢把预报频率提到每小时——不是靠自己重新做同化,而是靠多了一路低延迟观测。

官方50%和论文19%,该信哪个

差距最大的地方在数字口径。Google官方博客说降水预报准确性最高提升50%,某些对比IMERG数据的评估口径甚至到60%。但同一时间发表的另一篇论文,评估了一个叫Laxmi的观测训练模型,得出的24小时累积降水CRPS指标,比AIFS-CRPS低19.3%,比ECMWF IFS低20.1%。

同一次升级,两套数字 50~60% Google官方口径 降水/概率评分对比IMERG 19~20% 同行评审论文实测 Laxmi对比AIFS/IFS 极端强降水事件中,论文承认IFS仍更可靠

这不是同一件事情说了两次,而是两套评估口径。企业公告习惯挑最有利的对比基准和指标,同行评审论文更保守,还老实承认在最极端的降水事件上,物理模式IFS依然比AI模型可靠。读数字的时候,公司博客和论文实测不能划等号。

  • 风险.AI天气模型普遍存在把极端事件"抹平"的倾向,集合成员产生的全球平均温度本该稳定却出现波动,说明不确定性校准还不成熟。

谁该盯着这件事

对气象局和ECMWF来说,WeatherNext 3的每小时更新是直接的竞争压力,是否把它纳入业务预报体系是个现实问题。对航空、保险、可再生能源调度这些依赖短期降水预报的行业,更新频率提升是实打实的好处,但极端天气下的可靠性还没有独立验证。

对普通用户,WeatherNext 3已经接入Search、Gemini和Maps,体验上大概率会更顺滑一点,只是这不等于气象学本身被颠覆了。接下来最该看的,是ECMWF、NOAA之类的独立机构会不会拿真实台风、暴雨事件去交叉验证Google这套数字——那才是检验的时候。