2025年飓风季,Hurricane Melissa在牙买加外海几十小时内从普通风暴急速增强,美国国家飓风中心(NHC)提前发出了预警。这次提前量的背后,是Google DeepMind一套叫WeatherNext的AI模型给出的判断。DeepMind现在把这件事写成论文登上《Nature》,同一天把模型代码和权重全部开源。
摆出来的数字确实扎眼:这个模型的三天预报精度,相当于此前模型的两天预报精度。DeepMind自己给出的换算是——约等于十年气象学进步。听起来像一次干净的技术突破,但故事里有一处没被摊开讲:给这个结果打分的人,同时也是这个项目的合作方。
一天提前量是怎么算出来的
先把事实摆清楚。
- 历史代价.过去50年,热带气旋在全球造成超过70万人死亡、1.4万亿美元经济损失。
- 训练底料.模型用近20TB全球大气数据,加上覆盖近5000个历史风暴的IBTrACS数据库端到端联合训练。
- 回测结果.在2023-2024年历史气旋上做基准测试,WeatherNext在路径、强度、风场结构三项指标上平均领先其他模型超过24小时。
- 实战场景.2025年帮NHC提前判断Melissa的快速增强和登陆牙买加,给地面团队多留出关键准备时间。
- 今年的升级.每个气旋跑1000个集合成员,专门用来抓"快速增强"这类小概率但致命的尾部风险。
一个模型,解决了两套物理的矛盾
气旋预测长期分成两个活:路径靠大尺度环流,传统上用粗分辨率全球模型算;强度靠核心附近的局地热力过程,得用高分辨率的专门模型算。两套模型互相不通用,预报员得来回切换、来回核对。
WeatherNext的做法是用一个模型同时啃这两块,靠Functional Generative Networks生成集合预报,一分钟内在单个TPU上跑出15天预测。更反常的一点是:它只用28x28公里的粗分辨率数据,比传统高精度模型粗了差不多百倍,精度反而更高。DeepMind自己也承认这一点"让科学家感到意外",目前还没完全搞清楚原理。这句坦白挺难得——很多论文会把说不清的地方藏起来,这次没藏。
谁来验证"验证"
这是整件事里最值得多问一句的地方。
Melissa案例被反复引用,是这次开源最有说服力的证据。但NHC不是外部第三方,它是《Nature》论文的共同合作机构,也是模型的实际部署方。它一边用这个模型做业务决策,一边又是论文里"证明模型有效"的关键案例来源。这不是说NHC的判断不可信——NHC几十年的业务经验摆在那,不会拿真实预警去配合一篇论文冒险。但从论证结构上讲,这确实是既是运动员又是裁判的安排,只是很少有人会在报道AI科学落地时追问这一句。
论文和开源代码是同一天发布的。这意味着截至目前,外界还没有独立团队用同一套代码、同一批数据把结果重新跑一遍。开源常被读成"已经被验证",但准确说法是"验证的入场券刚刚发出去"。
开源发的是入场券,不是验证书。
- 风险.目前公开的准确率数字全部来自DeepMind与合作方内部回测,独立复现尚未出现,大西洋以外的台风、印度洋气旋区域也还缺同等严谨的评估。
开源之后,谁真的用得上
开源当然是好事,能让更多机构在同一起跑线上检验和改进模型,这一点该肯定。但"能下载"和"能用起来"是两件事。跑千成员集合预报需要一定算力,这对NOAA、Met Office这类大机构不是问题,但对预算有限的中小型气象部门、发展中国家的国家气象局来说,门槛没有想象中那么低。开源许可条款里商业气象服务公司能否自由部署,目前也还没有更多细节。
对照传统体系,HWRF、HAFS、ECMWF-IFS这些物理模型运行了几十年,有一整套业务化流程和责任链条。WeatherNext现在更像是一个強力的补充选项,而不是替代品——至少在独立复现和跨区域验证补上之前,业务系统不太可能把它当唯一依据。
接下来该盯的,是2026年飓风季它在实战里的表现,是不是有独立团队真的把代码跑起来复现出同样的数字,以及它在太平洋、印度洋区域能不能拿出同等分量的证据。技术数字已经摆在桌上,信任还得靠下一轮独立检验去挣。
