评估用于野火后泥石流预测的机器学习模型

arXiv cs.LG 论文

摘要

本文使用美国地质调查局(USGS)流域尺度数据,系统评估了包括TabPFN基础模型在内的15种机器学习模型在野火后泥石流预测中的表现,发现TabPFN取得了最佳性能(威胁评分为0.637),并且合成数据增强能改善大多数模型的性能。

arXiv:2608.05265v1 公告类型:新 摘要:野火后泥石流的预测对于减轻近期火烧区域在强降雨期间对社区、基础设施和资源造成的危害至关重要。然而,由于泥石流与非泥石流事件在特征空间中的重叠、对模型可解释性的需求以及训练数据的有限性,识别可靠的机器学习模型变得复杂。本文通过系统评估机器学习模型在预测性能、特征重要性和合成数据增强方面的表现来应对这些挑战。利用美国西部流域尺度的野火后泥石流事件观测数据,我们比较了15种模型,包括表格先验数据拟合网络(TabPFN)。重复分层交叉验证表明,TabPFN在未增强数据上取得了最高性能,威胁评分为0.637,紧随其后的是最佳的基于树的模型。使用Shapley加性解释(SHAP)来识别驱动预测的特征,结果显示短历时降雨强度和风暴累积量始终排名最高,而燃烧严重程度和地形特征贡献较小。我们进一步使用TabPFN生成的样本来评估合成数据增强,以解决泥石流观测数据稀缺的问题。合成数据增强提高了除CNN外所有模型的性能,其中深度学习模型的平均威胁评分最大增幅为+0.041。通过结合严格的模型基准测试、可解释的特征分析和合成数据增强,这项工作为提高野火后泥石流预测提供了一个综合框架。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:49

# 评估用于野火后泥石流预测的机器学习模型

来源:https://arxiv.org/html/2608.05265

1organization=卡尔加里大学大地测量工程系,城市=卡尔加里,州=AB,国家=加拿大
\cortext[1]通讯作者 徐正森

Yimin Zhu
Zack Dewis
Mabel Heffring
Saeid Taleghanidoozdoozan
Motasem Alkayid
Megan Greenwood
Lincoln Linlin Xu
[email protected]

###### 摘要

野火后泥石流的预测对于减轻强降雨期间近期过火区域对社区、基础设施和资源造成的危害至关重要。然而,为这一任务识别可靠的机器学习模型因多种因素而变得复杂,包括泥石流事件与非泥石流事件在特征空间中的重叠、缺乏物理可解释性以及训练数据有限。因此,本文旨在通过系统性评估一系列机器学习模型的模型性能、特征重要性和对合成数据增强的响应,来解决这些挑战。利用美国西部流域尺度的野火后泥石流事件观测数据,我们比较了15个模型,包括一个新的基础模型——表格先验数据拟合网络(TabPFN)。重复分层交叉验证的结果表明,TabPFN在未增强数据上取得了最强的性能,威胁评分为0.637,紧随其后的是领先的基于树的模型。我们使用SHapley加性解释(SHAP)进行特征重要性评估,以确定表现最好的模型在预测泥石流时最依赖哪些特征。该评估发现,短历时降雨强度和风暴累积量在所用解释模型的SHAP排名中最高,而燃烧严重程度和地形特征排名较低。最后,我们量化了合成数据增强在缓解泥石流事件观测数据稀缺方面的效用。使用TabPFN生成合成训练数据,我们提升了除CNN外所有模型的性能,其中深度学习模型的最大平均威胁分数增益为+0.041。通过将严格的模型基准测试、透明的特征评估和数据增强相结合,这项工作为提升野火后泥石流预测的准确性和可靠性提供了一个综合框架。

###### 关键词:
野火后泥石流预测\sep机器学习\sep表格基础模型\sepTabPFN\sepSHAP\sep合成数据增强

## 1 引言

参见图注
图1:美国地质调查局(USGS)野火后泥石流数据集中34次火灾事件的研究区概览(2000–2013年,美国西部)。(a) 面板显示区域范围,并在数字高程模型(DEM)上标注了火灾质心;(b) 面板放大显示南加州集群;(c) 面板显示美国定位图。(d)–(h) 面板显示了Station、Grand Prix–Old、Schultz、Little Bear和Waldo Canyon火灾的流域边界,多边形填充表示响应(无泥石流或泥石流)。

野火后泥石流威胁着全球易发火灾地区烧毁流域内的生命、基础设施和资源,而业务化预警依赖于根据流域和风暴特征估算启动概率的模型(staley_prediction_2017)。预测这一灾害的难点有三。首先,为该任务选择最佳模型具有挑战性。可用的候选模型众多,且泥石流事件流域与非事件流域在降雨、燃烧严重程度和地形特征上存在重叠(表[2 (https://arxiv.org/html/2608.05265#S2.T2);图8 (https://arxiv.org/html/2608.05265#S3.F8)),因此没有任何单一阈值能够干净地区分这两类结果(nikolopoulos_evaluation_2018),这使得模型的选择至关重要。其次,当类别在特征空间中重叠时,不同的模型族可能会以不同方式放置决策边界,因此识别一个高性能模型实际依赖哪些特征并非易事。这种特征重要性对于支持模型选择和信任判断、诊断预测是否反映稳健信号而非局限于特定观测子集的虚假模式,以及评估模型是否能够泛化,都是必需的(ribeiro_why_2016)。第三,该问题可用的数据通常规模小且类别不平衡,泥石流事件属于少数类,这限制了任何模型学习两类结果之间边界的能力,并对识别稀有正类造成了不成比例的制约(he_learning_2009)。这些困难共同促使我们采用受控条件下的严格多模型评估策略,类似于其他专门遥感预测研究中使用的策略(xu_comparative_2014)。

典型的野火后泥石流灾害评估工作流程从烧毁流域的划分开始,然后汇集降雨和地形特征,形成一个表格化的特征集合,最后进行泥石流预测(staley_updated_2016)。在这一工作流程中,预测阶段至关重要,因为漏报会使暴露的社区得不到预警,而误报则会增加业务负担(sattele_reliability_2015)。因此,本文聚焦于预测阶段,即输入特征被转化为预警决策的阶段。相应地,我们使用事件检测指标(如威胁评分)来评估模型,这些指标在类别不平衡情况下平衡漏报和误报,而不仅仅是使用总体准确率(schaefer_critical_1990)。

已有多种机器学习模型被应用于野火后泥石流预测。将降雨强度和历时与启动概率联系起来的逻辑回归模型是美国地质调查局(USGS)当前业务化方法的基础(staley_objective_2013; staley_updated_2016; staley_prediction_2017)。基于USGS方法,已有研究报道了朴素贝叶斯、混合判别分析和分类树(kern_machine_2017)、决策树(addison_assessment_2019)、基于卫星输入训练的极端梯度提升(XGBoost)(orland_scalable_2022),以及随机森林和神经网络模型(nikolopoulos_evaluation_2018; roten_machine_2022)在威胁评分上的改进。在美国以外,逻辑回归模型也已被应用于地中海和中国西南地区的野火后泥石流预测(diakakis_exploring_2023; jin_susceptibility_2022)。

现有工作仍存在三个空白。首先,以往研究通常只比较少数几个模型,并依赖单一的训练-测试划分。这使得性能估计具有高度变异性,且严重依赖于特定的划分,尤其是在性能差距较小时(cawley_over-fitting_2010; krstajic_cross-validation_2014; dietterich_approximate_1998)。此外,几种近期开发的、针对表格数据的高性能模型尚未在该问题上得到评估。表格先验数据拟合网络(TabPFN)尤其值得关注,因为它通过上下文学习执行近似贝叶斯预测,在中小型数据集上表现出色(hollmann_tabpfn_2023; hollmann_accurate_2025)。在泥石流场景之外,TabPFN在融冻灾害制图中已优于常规模型(zhu_method_2026),并在数据有限条件下展现出强大的滑坡易发性制图性能(zhou_landslide_2025; yang_knowledge-data_2026)。同样,树结构递归特征机(xRFM)提供了一种可扩展的特征学习方法,在表格基准测试中表现出色(beaglehole_xrfm_2025)。

其次,高性能野火后泥石流预测模型所依赖的特征尚未得到很好的刻画。一项针对泥石流机器学习研究的元分析证实,该领域文献中很少应用解释方法(yang_machine-learning-based_2024)。与此相关的是,不同模型族是关注相同特征还是依赖不同信号,仍然是一个悬而未决的问题。

第三,虽然合成数据增强已在类似类别不平衡情况下改进了相关灾害模型(wang_optimizing_2019; kumar_addressing_2024),但这种增强是否能够迁移到野火后泥石流场景,以及哪些模型在加入增强后受益,尚不明确。

因此,本文提出了一个严格的野火后泥石流预测评估框架。我们对五个模型族的十五个模型进行了系统性比较:逻辑回归类、距离与核方法类、深度学习类、基于树类以及表格基础模型类。每个模型在共享的预处理流程和通用的超参数调优框架(如适用)下训练,然后通过重复分层k折交叉验证进行评估。这使模型架构成为主要变量,并在多次重采样上平均性能,因此观察到的差距反映的是模型选择,而非配置工作的不均衡或单一划分带来的采样噪声。

在模型排名之外,我们使用SHapley加性解释(SHAP)特征重要性(lundberg_unified_2017),既刻画单个高性能模型所依赖的特征,也在共享划分上对比不同模型族的特征重要性模式,探讨排名靠前的模型是收敛于相同特征还是依赖不同信号。最后,我们使用TabPFN生成合成训练观测数据,并在相同评估协议下量化数据增强是否能在这一类别不平衡场景中改进预测,以及十五个模型中哪些可能受益。

综合来看,这些结果阐明了哪些模型族最能处理泥石流事件流域与非事件流域之间的重叠,识别了高性能模型所依赖的特征以及模型族之间的一致或分歧之处,并量化了合成增强是否能够缓解这一任务中典型的训练数据规模小且类别不平衡的问题。

## 2 方法

### 数据和逐折流程

**数据来源** (https://arxiv.org/html/2608.05265#S2.F4)
– USGS野火后泥石流数据集 – 1,550条观测;33场火灾;248次风暴 – 美国西部七个州(2000–2013年)

**特征与响应** (https://arxiv.org/html/2608.05265#S2.SS1)
– 十个特征(表1 (https://arxiv.org/html/2608.05265#S2.T1)) – 六个降雨特征,四个流域特征 – 二元响应(泥石流:0/1)

**交叉验证** (https://arxiv.org/html/2608.05265#S2.SS2)
– 重复分层交叉验证 – 10×\times5折;所有模型使用相同折 – 外部测试集仅包含真实观测

**特征预处理** (https://arxiv.org/html/2608.05265#S2.SS3)
– 基于折拟合的插补和标准化 – 单调降雨约束;中位数填补空缺

**超参数调优** (https://arxiv.org/html/2608.05265#S2.SS4)
– 威胁评分优化的搜索(100次试验) – 对未增强和增强数据分别调优

**(1) 模型比较**

**比较的模型** (https://arxiv.org/html/2608.05265#S2.SS5)
– 15个模型,5个模型族:逻辑回归 (https://arxiv.org/html/2608.05265#S2.SS6)、距离与核方法类 (https://arxiv.org/html/2608.05265#S2.SS7)、深度学习类 (https://arxiv.org/html/2608.05265#S2.SS8)、基于树类 (https://arxiv.org/html/2608.05265#S2.SS9)以及TabPFN (https://arxiv.org/html/2608.05265#S2.SS10) – 未增强 vs. 增强训练

**评估指标** (https://arxiv.org/html/2608.05265#S2.SS11) – 威胁评分(主要)、AUC、F1

**(2) SHAP特征重要性评估** (https://arxiv.org/html/2608.05265#S2.SS12)

SHAP计算:
– 置换SHAP(TabPFN);TreeSHAP(随机森林、XGBoost、CatBoost) – 每折:在训练集上重新拟合,解释留出数据行

重要性评估:
– 蜂群图、折稳定性、跨模型排名、特征依赖图 – 流域尺度SHAP重要性图

**(3) 合成数据增强评估**

合成数据生成: (https://arxiv.org/html/2608.05265#S2.SS13)
– 每折使用类别条件TabPFN生成器 – 保真度(KS检验、Wasserstein-1距离、能量距离)

增强评估: (https://arxiv.org/html/2608.05265#S2.SS14)
– 所有15个模型共享相同的合成数据 – 复制真实行,然后追加合成数据 – 主要指标:每模型威胁评分 Δ

图2:实验流程的概念概览。左列列出了每个外部训练折内执行的顺序步骤:数据来源、特征与响应、交叉验证划分、预处理和超参数调优。右列显示了三个分析模块:15模型基准测试、SHAP特征重要性评估和基于TabPFN的合成数据增强评估。

图2 (https://arxiv.org/html/2608.05265#S2.F2)总结了整体方法。左列涵盖数据汇编、特征、交叉验证、预处理和超参数调优。右列对应三项主要贡献:15模型基准测试、SHAP特征重要性和TabPFN驱动的合成数据增强。本节按相同顺序展开。我们首先描述数据集和特征集,然后介绍重复分层交叉验证设计、折内预处理和超参数调优。接着介绍模型族、评估指标、配对模型比较、SHAP特征重要性,以及基于TabPFN的合成数据增强流程。

### 2.1 数据集

表1:模型比较中包含的特征。特征按类别分组,包含特征名称、单位和简要描述。

| 类别 | 特征 | 单位 | 描述 |
|---|---|---|---|
| 火灾与地形 | dNBR | - | 流域的平均差分归一化燃烧比 |
| | PropHM23 | - | 流域内高/中度严重程度、坡度>23^\circ燃烧的比例 |
| | ContribArea | km^2 | 观测位置的汇水面积 |
| | SoilKF | - | 流域平均KF因子(土壤细颗粒的可蚀性指数) |
| 风暴 | StormAccum | mm | 风暴的总降雨累积量 |
| | StormDur | h | 风暴总历时 |
| | StormAvgI | mm/h | 平均风暴强度 |
| 降雨 | PeakI15 | mm/h | 峰值15分钟降雨强度 |
| | PeakI30 | mm/h | 峰值30分钟降雨强度 |
| | PeakI60 | mm/h | 峰值60分钟降雨强度 |

表2:按响应类别分组的野火后泥石流预测因子汇总统计。对于每个特征,表格报告最小值、均值、中位数、最大值和四分位距(IQR)。

| 特征 | 无泥石流 | | | | | 泥石流 | | | | |
|---|---|---|---|---|---|---|---|---|---|---|
| | Min | Mean | Med | Max | IQR | Min | Mean | Med | Max | IQR |
| StormDur | 0.00 | 17.84 | 12.47 | 65.00 | 23.35 | 0.00 | 20.64 | 23.17 | 63.50 | 29.75 |
| StormAccum | 0.00 | 26.58 | 17.00 | 214.12 | 25.65 | 2.79 | 65.53 | 52.83 | 222.25 | 68.11 |
| StormAvgI | 0.00 | 3.79 | 1.40 | 58.67 | 2.65 | 0.00 | 8.84 | 3.20 | 58.67 | 4.12 |
| PeakI15 | 1.60 | 19.47 | 14.22 | 112.00 | 12.54 | 6.10 | 36.68 | 27.43 | 112.00 | 28.60 |
| PeakI30 | 1.20 | 13.92 | 10.00 | 80.00 | 9.20 | 3.56 | 26.38 | 19.60 | 80.00 | 18.17 |
| PeakI60 | 0.60 | 9.03 | 7.11 | 50.80 | 5.37 | 2.00 | 16.75 | 13.72 | 50.80 | 12.39 |
| ContribArea | 0.02 | 0.99 | 0.41 | 7.89 | 1.05 | 0.03 | 1.25 | 0.57 | 7.79 | 1.42 |
| PropHM23 | 0.00 | 0.46 | 0.49 | 0.99 | 0.49 | 0.01 | 0.56 | 0.59 | 0.99 | 0.30 |
| dNBR | 0.01 | 0.33 | 0.30 | 1.00 | 0.26 | 0.04 | 0.37 | 0.38 | 0.87 | 0.26 |
| KF | 0.00 | 0.21 | 0.24 | 0.98 | 0.11 | 0.00 | 0.30 | 0.24 | 11.36 | 0.06 |

参见图注
图3:十个基准特征与二元泥石流响应的上三角Spearman秩相关矩阵。每个单元格给出秩相关系数值。虚线将响应行和列与特征-特征条目分开。

参见图注
图4:Grand Prix–Old火灾:代表性风暴中九个特征在划分流域上的空间分布。顶行显示燃烧和土壤相关特征,下面各行显示降雨累积量、历时、平均强度,

相似文章

数据驱动的火区划分用于改进短期野火预测

arXiv cs.LG

本文提出了一种无监督的火区划分方法,将分水岭检测与K-means聚类相结合,以改进短期野火预测,并在法国多个省和多种预测模型上表现出相较于基于网格的方法的一致性能提升。