评估Transformer和LSTM框架在无资料流域中的预测能力

arXiv cs.AI 论文

摘要

本文利用NOAA国家水模型模拟,评估了仅编码器Transformer和LSTM模型在无资料流域中的径流预测能力。结果显示,LSTM的表现优于Transformer,并且加入下游信息显著提升了两种架构的预测技能。

arXiv:2606.02791v1 公告类型: 新 摘要:流域网络呈现汇聚拓扑结构,多条支流汇入下游河道,整合了多样的上游水文过程。在无资料流域中,缺乏直接观测数据增加了不确定性,并限制了对极端事件的预测能力。本研究利用NOAA国家水模型(NWM)的回顾性模拟,评估了仅编码器Transformer相比LSTM在水文信息有限的情况下对上游径流推断是否具有优势。在仅上游和组合配置中,LSTM在两种配置下的整体表现均优于Transformer模型。加入下游信息进一步提升了所有模型的性能,使中位数NNSE提高了60%以上。我们没有将此视为排行榜式的比较,而是将实验解释为对水文序列推断的架构归纳偏置的测试。结果表明,循环记忆仍然比仅编码器Transformer更适用于这一上游重建任务,而下游水文上下文提供了强大的辅助约束,显著提高了各架构的预测技能。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:41

# 评估Transformer和LSTM框架在未测流域预测中的表现
来源:https://arxiv.org/html/2606.02791

###### 摘要

流域网络呈现汇聚型拓扑结构,多条支流汇入下游河道,整合了来自上游的多样化水文过程。在未测流域中,缺乏直接观测增加了不确定性,并限制了预测极端事件的能力。本研究利用美国国家海洋和大气管理局(NOAA)国家水文模型(NWM)的回顾性模拟,评估了仅编码器Transformer相较于LSTM在有限水文信息条件下进行上游径流推断时是否具有优势。在仅上游和组合两种配置中,LSTM在两种配置下的整体表现均优于Transformer模型。引入下游信息进一步提升了所有模型的性能,中位数NNSE提高了60%以上。我们并未将此视为排行榜式的比较,而是将实验解读为对水文序列推理的架构归纳偏置的测试。结果表明,循环记忆机制仍然比仅编码器Transformer更适用于该上游重建任务,而下游水文上下文作为强大的辅助约束,显著提升了各架构的预测能力。

## I. 引言

利用测流站的径流测量以及利用这些观测数据预测河流流量,构成了现代水文预报的基础。近年来,数据驱动的方法,特别是深度学习(DL)模型,在直接从数据中学习复杂水文关系方面展现出巨大潜力。大型样本数据集的出现极大地支持了这一发展,这些数据集提供了跨越数百个集水区的综合水文气象记录,包括物理属性、气象强迫和径流时间序列的一致信息,从而促进了更稳健和更具泛化能力的模型的开发。

值得注意的是,随着数据密集型机器学习模型的兴起,诸如CAMELS(大型样本研究的集水区属性和气象学)[1]、Caravan[6]、NWM[8]、EStreams[4]等回顾性数据集变得愈发有价值[6]。这些发展促进了深度学习模型的应用,其中长短期记忆网络(LSTM)在预测未测流域径流方面取得了显著成功。Nearing等人[7]证明,LSTM网络可以有效预测未测流域的极端洪水;而Kratzert等人[5]表明,LSTM优于概念模型,且在集水区特征中存在足够的信息来支持在PUB条件下的数据驱动建模。作为一种门控循环神经网络,LSTM旨在缓解标准RNN的梯度消失问题,并通过其单元状态记忆机制更好地保持长期时间依赖性。

Transformer架构在包括自然语言处理、语音识别、计算机视觉和问答在内的各种任务中表现出色,并最近被应用于水文建模。Transformer模型提供了一种替代的序列学习方法,因为自注意力可以在训练期间并行地建模所有可用时间步长上的依赖关系。最近的一些研究强调了Transformer在水文预报中的有效性。Yin等人[13]提出了Transformer-XAJ,一种过程与数据驱动相结合的模型,在区域和未测流域预测中都取得了强劲表现。类似地,Amanambu等人[2]证明,Transformer模型在多个预测时间步长的水文干旱预报中优于LSTM架构。

受LSTM在水文预报中的成功以及Transformer架构在序列建模中日益增长的使用的启发,本研究探讨了基于注意力的模型在未测流域的上游径流推断中是否比循环模型具有实际优势。为指导此项研究,我们寻求回答两个研究问题:
- RQ1:在有限的上游信息条件下,LSTM是否能比仅编码器Transformer更有效地捕获水文响应中的滞后、状态依赖的动态特性?
- RQ2:通过提供网络层级对上游重建的约束,加入下游水文上下文是否会提升各架构的性能?

为回答这些问题,我们:
- 使用NWM回顾性模拟,在受限的仅上游设置下评估循环和基于注意力的架构;
- 量化添加下游水文气象上下文[9]的效果,以及
- 从水文信息可用性和架构归纳偏置的角度解释导致的性能差异。

本研究的目标是评估在有限信息条件下哪种序列建模偏置更适合上游径流推断,以及当下游水文上下文被纳入时这种比较会发生怎样的变化。

参见图注(a)
参见图注(b)

图1:本研究中使用的模型架构:(a) LSTM模型,突出显示了门控机制(ft, it, ot)以及单元状态Ct与隐藏状态ht在径流序列学习过程中的相互作用(Xu等,2020)[12];(b) 用于水文时间序列建模的仅编码器Transformer,包含输入嵌入、位置编码、掩码多头注意力和前馈层(Vaswani等,2017)[11]。

## II. 方法论

鉴于上游和下游径流之间的相互依赖关系,有效建模需要能够捕获时间依赖性和非线性水文行为的架构。本研究考察了两种深度学习方法,一种是基于LSTM的循环模型,另一种是仅编码器Transformer,每种方法利用不同的机制进行序列建模。

**LSTM架构**(图1(a))顺序处理时间序列输入,通过一系列门控操作更新其隐藏状态。遗忘门、输入门和输出门(ft, it, ot)调节每个时间步信息如何被保留、更新和暴露,使模型能够通过内部循环学习时间依赖性。单元状态(Ct)充当显式记忆路径,帮助LSTM在长序列中保持信息。

相比之下,**编码器Transformer架构**(图1(b))用并行自注意力机制取代了循环。该模型并非逐个时间步处理,而是同时计算所有时间步之间的关系,通过多头自注意力层学习序列中不同点之间的关系。Transformer依赖位置编码来表示时间顺序,因为架构本身不固有地捕获此信息。在训练期间,应用因果掩码以确保每个时间步的预测仅关注历史信息,使模型适用于自回归水文预报。静态的集水区属性和动态的时间序列输入通过单独的嵌入层处理后再进行合并,使模型能够利用每个流域随时间变化和空间的特征。

表I:本研究中使用的由类别分组的本文属性(美国国家水文模型回顾性数据集v3.0)。
| 类别 | 属性 | 单位 | 描述 |
| --- | --- | --- | --- |
| 动态强迫 | APCP_surface | mm/s | 累积降水 |
| | precip_rat | mm/hr | 降水率 |
| | TMP_2maboveground | K | 近地表空气温度 |
| | DSWRF_surface | W/m² | 向下短波辐射 |
| | DLWRF_surface | W/m² | 向下长波辐射 |
| | PRES_surface | Pa | 地表气压 |
| | UGRD_10maboveground | m/s | 10米高度东西向风 |
| | VGRD_10maboveground | m/s | 10米高度南北向风 |
| | SPFH_2maboveground | kg/kg | 2米高度比湿 |
| 水文输入 | streamflow | m³/s | 下游流量 |
| 集水区属性 | basin_length | km | 流域多边形长度 |
| | basin_area | km² | 流域多边形面积 |
| | reach_length | km | 河段长度 |
| 目标 | streamflow | m³/s | 上游流量(目标变量) |

## III. 结果与讨论

### III-A. 数据收集与整合

从NWM v3.0数据集获取了1979年2月1日至2023年1月1日(44年)的逐时水文气象数据。使用RouteLink拓扑结构,将美国地质调查局(USGS)的测站与其在美国大陆(CONUS)671个CAMELS流域对应的河段标识符链接起来。根据河流网络连通性识别上游河段,合并流域几何形状以定义上游-下游流域对。包含了动态气象强迫和静态集水区属性(表I),以提供气候和地理环境背景。

本研究使用简单的单河段(n=1)上游配置。对每个流域对,对上游集水区进行空间平均处理气象强迫,并提取下游和上游的逐时流量。所有变量以NetCDF格式存储,并保持时间对齐一致。

### III-B. 数据预处理与训练策略

数据集通过一个结构化的流水线进行处理,包括变量过滤、时间分割、归一化和序列生成。过滤移除了存在大量数据空白的流域;分割生成了训练、验证和测试周期;归一化确保了特征尺度的一致性;序列生成将连续时间序列转换为监督学习样本。

采用70-15-15的时间分割(29年训练、8年验证、8年测试)。静态和动态输入通过全连接网络嵌入(动态输入32单元,静态属性16单元,均使用tanh激活函数和0.1 dropout),并以256长度的输入窗口提供给每个模型。LSTM和Transformer架构均在匹配的实验条件下进行训练以确保可比性。所报告的配置是在相同数据分割、优化器、损失函数、输入窗口和早停规则下选定的可比基线设置,而非通过详尽的架构特定超参数搜索。

**LSTM配置:** 包含一个具有32个隐藏单元的循环层。应用遗忘门偏置3和输出dropout率0.1。静态和动态输入通过全连接层嵌入后传入LSTM,并使用线性回归头预测最终时间步。

**Transformer配置:** 包含一个单一的Transformer编码器层,具有四个注意力头、前馈维度128,以及应用于编码器和位置编码层中的dropout率0.1。使用基于求和的位置编码表示时间顺序,并应用因果掩码,使每个预测仅依赖于历史输入。最终预测通过线性回归头从最后一个编码器状态生成。

**训练设置:** 两个模型均在两种输入设置下预测未来一小时的上游流量:仅上游和上下游组合。输入包括降水、温度、风速、气压和辐射。训练使用AdamW优化器,学习率为1×10⁻⁴,批大小为256,梯度裁剪为1,损失函数为NSE。应用早停法,耐心值为10个epoch,并使用最佳检查点进行测试。实现代码可在此处获取。

表II:用于模型性能评估的评估指标总结。
| 指标 | 描述 | 范围,最佳拟合 |
| --- | --- | --- |
| NNSE | NSE的归一化形式,界限于0到1之间,便于直观解释。 | (0, 1),最佳:1 |
| KGE | 结合相关系数、偏差和变异性进行均衡模型评估。 | (-∞, 1),最佳:1 |
| Pearson-r | 测量模拟和观测径流之间的线性相关性。 | (-1, 1),最佳:1 |
| RMSE | 量化模拟误差的平均幅度;数值越低表明短期拟合越好。 | (0, ∞),最佳:0 |

### III-C. 结果与性能分析

为评估模型行为如何随信息可用性变化,我们在两种不同的输入配置下训练了Transformer和LSTM。仅上游设置代表一种信息受限的情况,即仅根据局地气象强迫和静态流域属性预测上游径流。相比之下,组合设置则增加了下游气象强迫和下游流量作为输入,引入了可能反映相连河段集成水文响应的网络信息信号。这种设计使我们能够测试额外输入是否提高了准确性,以及每个架构如何响应更丰富的水文上下文。

参见图注(a)
参见图注(b)
参见图注(c)

图2:在组合配置下,美国大陆上游测站的观测和模型预测径流空间对比:(a) 观测径流,(b) LSTM预测径流,(c) 仅编码器Transformer预测径流。颜色使用统一的色标表示径流大小(m³/s)。

参见图注(a)
参见图注(b)
参见图注(c)

图3:在组合配置和仅上游配置下模型性能对比。(a) LSTM和Transformer模型的NNSE、KGE、RMSE和Pearson-r的中位数流域级性能,凸显了加入下游信息带来的改进。(b) 达到预设性能阈值(NNSE > 0.75, KGE > 0.50, Pearson-r > 0.70, RMSE < 2.0)的流域百分比。(c) LSTM、Transformer、Informer和CNN-1D模型的NNSE得分累积分布函数(CDF)(组合配置(左)和仅上游配置(右))。注意,RMSE值越低表示性能越好,与其他指标相反。

如表III所示,对于Transformer和LSTM模型,组合配置的表现始终优于仅上游配置。例如,Transformer模型的中位数NNSE从0.56增加到0.90,LSTM从0.56增加到0.93,表明预测精度的显著提升。KGE、Pearson-r和RMSE也观察到类似趋势,表明组合输入增强了稳健性并减少了各流域的误差幅度。在组合设置下,达到NNSE > 0.5的流域百分比也显著增加,对于Transformer从75.21%增加到91.68%,对于LSTM从79.87%增加到93.84%,突显了在更多流域内实现更可靠性能(见图3(b))。

本实验展示了可以从近处恢复多少预测能力。

相似文章

物理信息机器学习用于短期洪水预测

arXiv cs.LG

研究人员提出了一种物理信息机器学习(PIML)框架,将水文约束整合到LSTM损失函数中,以改善短期洪水预报,特别是在数据稀缺的情况下。一种“趋势对齐”约束确保了降水与流量趋势之间的一致性,提高了纳什-苏特克利夫效率,并消除了极端事件期间的非物理预测。

下一代潜在预测变换器 [R]

Reddit r/MachineLearning

微软研究院提出Next-Latent Prediction (NextLat)方法,一种自监督学习方法,训练变换器预测自身下一个潜在状态,从而形成用于推理和规划的紧凑世界模型,并通过自推测解码实现高达3.3倍的推理加速。