针对四个印度城市的一天前IMDAA降雨场预测的ConvLSTM基准测试

arXiv cs.LG 论文

摘要

基于IMDAA再分析数据,对ConvLSTM与更简单的模型在四个印度城市的一天前降雨场预测任务上进行基准测试,发现ConvLSTM并不始终优于FC-LSTM或持续性模型等替代方案。

arXiv:2607.26581v1 公告类型:新 摘要:卷积长短期记忆网络(ConvLSTMs)被广泛用于降水预测,但大部分性能证据来自密集的高频雷达序列。本研究测试了卷积循环是否能在小型日再分析网格上改善一天前降雨场预测。分析了印度季风数据同化与分析(IMDAA)1998-2020年6-9月的班加罗尔、德里、加尔各答和孟买数据。比较了十种朴素、统计、基于树和神经方法,使用纯大气输入以及降雨历史加大气输入。评估了完整场、区域平均降雨、空间异常和高降雨日的性能。 ConvLSTM并不始终优于更简单的替代方案。FC-LSTM在班加罗尔、加尔各答和孟买产生了数值最低的区域平均降雨误差,而持续性模型在德里表现最佳。仅在孟买,ConvLSTM产生了数值最低的空间异常误差,该地区降雨场表现出更强的短期空间连续性,且降雨历史输入改善了所有三种神经架构的性能。然而,ConvLSTM与FC-LSTM之间的差异很小。神经模型低估了降雨量,并在高降雨日预测的阈值超过次数过少,而持续性模型在每个城市都达到了最高的检测性能。事后分析表明,所选模型对最新输入日最为敏感,而在孟买则具有更广泛的近期滞后敏感性。这些发现表明,仅凭网格化输入并不足以证明ConvLSTM的合理性,架构选择应基于在平均、空间和高降雨性能方面的严格基准测试。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 针对印度四城市基于ConvLSTM的次日降雨场预测基准测试  
来源:https://arxiv.org/html/2607.26581  
Tanmay Ghosh  
国家高级研究院,印度科学研究所校区,班加罗尔,印度。[email protected](通讯作者)  
Shaurabh Anand  
Rakesh Gomaji Nannewar  
国家高级研究院,印度科学研究所校区,班加罗尔,印度。[email protected]  
Nithin Nagaraj  
复杂系统项目,国家高级研究院,印度科学研究所校区,班加罗尔,印度。[email protected]  

###### 摘要  

卷积长短期记忆网络(ConvLSTM)被广泛用于降水预报,但大部分性能证据来自密集、高频的雷达序列。本研究测试了卷积递归能否在小型日再分析格点上改善次日降雨场预测。分析了1998–2020年6–9月印度季风数据同化与分析(IMDAA)在班加罗尔、德里、加尔各答和孟买四个城市的降雨场。比较了十种朴素方法、统计方法、基于树的方法和神经方法,使用仅大气变量以及降雨历史加大气变量两种输入。评估了完整场、域平均降雨量、空间异常和高降雨日等性能。ConvLSTM并未一贯优于更简单的替代方案。FC-LSTM在班加罗尔、加尔各答和孟买产生了数值上最低的域平均降雨量误差,而持续性在德里表现最好。ConvLSTM仅在孟买产生了数值上最低的空间异常误差,该城市降雨场还表现出更强的短期空间连续性,且降雨历史改善了所有三种神经架构。但ConvLSTM与FC-LSTM的差异仍然很小。神经模型低估了降雨量级,在高降雨日检测到过少的阈值超限,而持续性在每个城市均实现了最高的检测性能。事后分析表明,所选模型对最新输入日最敏感,而孟买表现出更广的近滞后期敏感性。研究结果表明,仅凭网格化输入并不足以证明ConvLSTM的合理性,架构选择应基于在平均性能、空间性能和高降雨性能上的严格基准测试。  

关键词:ConvLSTM;IMDAA;降雨场后报;预测基准测试;空间异常均方根误差;高降雨检测;可解释人工智能  

## 1 引言  

印度城市的降雨量在每日之间和城市尺度区域上存在显著变化。因此,短时降雨场预测必须同时表示一个区域上的平均降雨量及其空间分布。预测模型未必能同样好地再现这些特性。一个模型可能准确估计域平均降雨量,同时平滑了不同格点间的差异,或者可能保留空间变化而总体降雨量存在偏差。高降雨日的性能也需要单独检验,因为这些日子的出现频率低于干燥和中等条件日,良好的总体性能并不一定意味着对较大降雨量的准确预测。因此,降雨场预测应从降雨量、空间分布和高降雨日性能三个方面进行评估,而不是通过单一汇总指标。  

长短期记忆网络(LSTM)旨在学习序列数据中的依赖关系,而卷积神经网络(CNN)则保留网格化输入中的局部空间关系。卷积长短期记忆网络(ConvLSTM)通过将传统LSTM的全连接变换替换为卷积操作(Shi 等,2015 (https://arxiv.org/html/2607.26581#bib.bib1))来结合这两种功能。ConvLSTM最初是为降水临近预报而开发的,在该场景中,连续的雷达图像显示降雨系统在大范围、高密度采样区域上的移动和发展。后续基于雷达的研究表明,卷积递归模型可以表示降水的时空变化,但也指出了重要局限性。确定性神经预报可能变得越来越平滑,并在较高降雨强度下失去精度(Shi 等,2017 (https://arxiv.org/html/2607.26581#bib.bib2);Ayzel 等,2020 (https://arxiv.org/html/2607.26581#bib.bib3);Ravuri 等,2021 (https://arxiv.org/html/2607.26581#bib.bib4))。因此,针对强度敏感的损失函数、生成模型和额外的大气预测变量已被研究,以改进对较强降雨的表示(Cambier van Nooten 等,2023 (https://arxiv.org/html/2607.26581#bib.bib5);Kim 等,2024 (https://arxiv.org/html/2607.26581#bib.bib6);Zhang 等,2023 (https://arxiv.org/html/2607.26581#bib.bib7))。  

日再分析场提供了与雷达临近预报不同的预测环境。雷达数据集通常包含每几分钟一次、覆盖数百或数千个空间单元的观测,从而可以直接观测降雨系统的移动和发展。日再分析则将这种亚日演变合并为单一场,而城市中心的区域可能只包含少量网格单元。在本研究中,四个城市区域包含9到42个网格单元,间距约为0.12∘。全连接长短期记忆网络(FC-LSTM)在展平后,在每个时间步处理完整场,而ConvLSTM在其递归状态内应用局部卷积操作。当连续降雨场保留连贯的空间模式时,这些操作可能很有用,但当日际空间连续性较弱时,它们可能贡献甚微。  

先前研究还表明,模型排名因地点、输入组合和评估指标而异(Kumar 等,2023 (https://arxiv.org/html/2607.26581#bib.bib8);Pawar 等,2024 (https://arxiv.org/html/2607.26581#bib.bib9);Panda 等,2024 (https://arxiv.org/html/2607.26581#bib.bib10))。因此,通过比较参考预报、统计模型、基于树的模型以及以不同方式表示空间和时间信息的神经架构,来评估ConvLSTM在小型日再分析格点上的相对性能。  

提供给模型的信息也必须与处理这些信息的架构区分开来。先前的降雨场直接提供了关于持续性和近期空间模式延续的信息。大气变量如相对湿度、云量、气压、蒸发和风提供了与后续降雨相关的气象条件信息。如果包含先前降雨后预测改善,这种改善可能源于额外的降雨信息、模型对该信息的使用方式,或输入与架构之间的相互作用。不能单归因于架构。因此,本研究比较了一种仅含大气变量的输入公式与第二种公式,后者在保留相同大气预测变量、预测目标和模型结构的情况下,添加了先前的降雨场。  

预测性能必须与可信的参考预测进行比较。持续性假设下一个降雨场将类似于最近一个场,而日序气候学表示每个格点预期的季节性场。拟合模型可能在某一个参考上有所改善,但在另一个上没有,因此预报技巧的解释取决于所使用的基准(Murphy,1992 (https://arxiv.org/html/2607.26581#bib.bib11))。本研究报告了相对于持续性和气候学两者的性能,并在总结预报技巧时,对每个城市和评估指标使用较低RMSE的朴素参考。  

评估还必须区分预测降雨场不同属性。完整场均方根误差(RMSE)结合了降雨量误差和空间分布误差。域平均降雨量RMSE评估保留网格上的平均降雨量,而空间异常RMSE评估移除了日域平均值后的场内变化。一个模型可能在某属性上表现良好,在另一属性上表现不佳,没有单一指标能捕捉降雨场的所有相关特征(Roberts 和 Lean,2008 (https://arxiv.org/html/2607.26581#bib.bib12);Ebert,2008 (https://arxiv.org/html/2607.26581#bib.bib13))。多尺度邻域验证对大型降水场很有价值,但本文使用的网格包含的单元太少,无法支持跨多个空间尺度的有意义评估。因此,分别报告完整场RMSE、域平均降雨量RMSE和空间异常RMSE。  

平均误差可能掩盖高降雨日上的较差性能。干燥、小雨和中雨日构成了样本的主体,而与较大降雨量相关的误差可能系统性地不同于更常见条件下观察到的误差。因此,一个模型可能实现相对较低的整体误差,同时低估较大降雨量或预测过少的阈值超限。高降雨性能通过连续的误差和偏差度量以及分类检测度量(Stephenson 等,2008 (https://arxiv.org/html/2607.26581#bib.bib14);Ferro 和 Stephenson,2011 (https://arxiv.org/html/2607.26581#bib.bib15))进行单独评估。高降雨日定义为城市特定的训练期域平均降雨量的第90百分位数。它们被描述为高降雨日而非气象极端事件,因为阈值来自研究数据,而非外部定义的极端降雨标准。  

分析使用了印度季风数据同化与分析(IMDAA)区域再分析。IMDAA结合观测数据与数值天气预报和数据同化系统,生成印度季风区域空间完整的气象场(Rani 等,2021 (https://arxiv.org/html/2607.26581#bib.bib25))。其一致的空间和时间覆盖允许对班加罗尔、德里、加尔各答和孟买进行相同的实验。然而,IMDAA降水是再分析产品,而非独立的地表降雨观测。因此,本研究评估的是IMDAA中表示的次日降雨后报预测。它并不评估后报相对于独立雨量计或雷达观测的结果,并且保留场的空间分辨率不支持街道或街区级别的解释。  

在预测性能确定后,应用事后解释方法。使用分组排列以及时间和空间遮挡来检验模型对预测变量组、输入日和网格单元的敏感性,而梯度加权类激活映射(Grad-CAM)为所选ConvLSTM模型中的正激活提供了一个探索性表示(Selvaraju 等,2017 (https://arxiv.org/html/2607.26581#bib.bib19))。这些方法描述了拟合模型的行为,而非降雨的大气原因。归因结果可能随模型参数、输入扰动和解释方法的不同而变化(Adebayo 等,2018 (https://arxiv.org/html/2607.26581#bib.bib20);Ghorbani 等,2019 (https://arxiv.org/html/2607.26581#bib.bib21);Ismail 等,2020 (https://arxiv.org/html/2607.26581#bib.bib22);Bommer 等,2024 (https://arxiv.org/html/2607.26581#bib.bib23))。因此,它们的结果被解释为拟合模型敏感性的度量,而非物理因果关系的证据(O’Loughlin 等,2025 (https://arxiv.org/html/2607.26581#bib.bib24))。  

本研究使用IMDAA区域再分析评估班加罗尔、德里、加尔各答和孟买的次日季风降雨场后报。分别针对各城市的模型使用连续七天的日场来预测下一天的降雨。将ConvLSTM与参考预报、统计模型、基于树的模型、无递归的CNN和FC-LSTM进行比较。分析围绕四个问题展开:拟合模型是否优于可信的参考预报和更简单的替代方案;先前的降雨是否在大气变量之外提供了预测信息;ConvLSTM的相对性能在不同城市之间有何差异,以及观察到的数值模式是否与日际空间连续性的差异一致;基于整体测试期性能的结论是否同样适用于高降雨日。然后使用事后解释方法来检验所选神经模型对预测变量组、输入日和网格单元的敏感性。本研究的贡献在于通过受控评估,确定在小型的日IMDAA降雨场上,ConvLSTM所代表的额外空间递归是否相比更简单的替代方案降低了预测误差。  

## 2 材料与方法  

### 2.1 研究区域与IMDAA数据  

本研究覆盖班加罗尔、德里、加尔各答和孟买。这四个地理上分离的城市提供了对比鲜明的季风降雨环境,用于检验降雨历史和卷积递归在各城市特定区域中的贡献。城市建模是独立的;不同城市的观测数据在模型拟合过程中不进行合并。  

气象场通过NCMRWF再分析数据服务(Rani 等,2021 (https://arxiv.org/html/2607.26581#bib.bib25))从印度季风数据同化与分析(IMDAA)区域再分析获取。数据保留1998年至2020年每年的6–9月季风季节,共计23个季风季节。每天有四个六小时记录,每个变量和网格单元分别汇总,生成每日建模场。准备好的城市提取中相邻格点中心在纬度和经度上相隔0.12∘,对应约12公里的间距。对于每个城市,建模区域包括所准备提取中经纬度坐标的唯一完整矩形集合。保留该矩形内的每一个单元。行政边界仅用作制图叠加,既不用于掩蔽网格单元,也不作为模型预测变量提供。因此,城市提取具有不同的空间维度,且未进行填充以创建统一的网格大小。图1 (https://arxiv.org/html/2607.26581#S2.F1)显示了保留的格点中心和用于制图参考的外部行政边界。  

(图注:图1:各城市特定建模区域和保留的格点中心。虚线外部边界仅用作制图参考,未提供给预报模型。每个矩形坐标区域内的所有单元都被保留。)  

表1 (https://arxiv.org/html/2607.26581#S2.T1)报告了坐标范围、空间维度和时序样本量。  

表1:准备网格的坐标、空间维度和时序样本量。  
注:坐标为十进制下的格点中心;相邻点相隔0.12∘。训练期覆盖1998–2014年,验证期2015–2017年,测试期2018–2020年。每个样本包含七个连续输入日和次日的降雨场目标。对于总降水量,首先对四个六小时记录进行平均,然后

相似文章

物理信息机器学习用于短期洪水预测

arXiv cs.LG

研究人员提出了一种物理信息机器学习(PIML)框架,将水文约束整合到LSTM损失函数中,以改善短期洪水预报,特别是在数据稀缺的情况下。一种“趋势对齐”约束确保了降水与流量趋势之间的一致性,提高了纳什-苏特克利夫效率,并消除了极端事件期间的非物理预测。