数据驱动的火区划分用于改进短期野火预测
摘要
本文提出了一种无监督的火区划分方法,将分水岭检测与K-means聚类相结合,以改进短期野火预测,并在法国多个省和多种预测模型上表现出相较于基于网格的方法的一致性能提升。
arXiv:2608.07472v1 公告类型:新
摘要:野火预测模型通常将研究区域离散化为均匀网格,忽略了点火点的异质空间分布。我们通过展示数据离散化方式比使用哪种模型更重要来挑战这一范式。我们提出了一种无监督的火区划分算法,将分水岭检测与K-means聚类相结合,直接根据历史火灾模式定义预测单元。在法国六个省和六种预测模型上的实验表明,火区划分始终优于基于网格的方法,平均IoU提升根据空间尺度不同为+3--6%。该方法计算轻量(每次配置<10秒)且完全可并行化。我们的结果表明,优化空间离散化能够为短期野火预测带来显著且可复现的性能提升。
查看缓存全文
缓存时间: 2026/08/11 08:05
# 数据驱动的火灾区域分割用于改进短期野火预测
来源:https://arxiv.org/html/2608.07472
Hassan NouraUniversité Maris et Louis Pasteur, FEMTO\-ST,法国贝桑松Christophe GuyeuxUniversité Maris et Louis Pasteur, FEMTO\-ST,法国贝桑松Benjamin AynesSAD Marketing,法国里尔
###### 摘要
野火预测模型通常将研究区域离散化为均匀网格,忽略了火点空间分布的非均匀性。我们挑战了这一范式,表明数据离散化的方式比使用哪种模型更为重要。我们提出了一种无监督的火灾区域分割算法,将分水岭检测与K均值聚类相结合,直接从历史火灾模式中定义预测单元。在法国六个省和六种预测模型上的实验表明,火灾区域分割始终优于基于网格的方法,平均IoU提升约\+3–6%,具体取决于空间尺度。该方法计算开销极低(每次配置<<10秒)且完全可并行化。我们的结果表明,优化空间离散化能够为短期野火预测带来显著且可复现的性能提升。补充材料可在此处获取(https://drive.google.com/drive/folders/1-QOrC0Bk0PFfP3KSfrjJSpfF2M9tAMJk?usp=sharing),代码将在GitHub上发布。
#### 关键词
野火预测,空间分割,分水岭算法,无监督学习,火灾区域检测
## 1 引言
野火影响着每个大陆,其成因涉及气候、生态和人为因素。全球每年报告近50万起野火事件,其中超过90%归因于人类活动[9 (https://arxiv.org/html/2608.07472#bib.bib7)]。经济和人文负担十分巨大:灭火成本、基础设施破坏和公共健康影响每个火灾季往往超过数十亿美元[4 (https://arxiv.org/html/2608.07472#bib.bib372)]。将物联网传感器网络与人工智能(AI)相结合的早期预警系统在改善检测和资源分配方面已显示出巨大潜力[10 (https://arxiv.org/html/2608.07472#bib.bib191)]。
### 1\.1 问题定义
本文工作研究的是将火灾易发区域的检测和空间分割作为野火预测的预处理步骤。具体而言,我们研究将研究区域划分为具有语义意义的火灾区域——而非依赖任意均匀网格——是否能提高AI模型生成的短期野火预测的准确性。
### 1\.2 研究现状
人工智能和物联网技术已用于野火检测和防范,但预测性能关键取决于空间离散化的方式[10 (https://arxiv.org/html/2608.07472#bib.bib191)]。CNN和ULSTM变体已在加利福尼亚和地中海地区的公里级分辨率上进行了探索[16 (https://arxiv.org/html/2608.07472#bib.bib205),15 (https://arxiv.org/html/2608.07472#bib.bib360)],但在如此精细的尺度上,由于无火单元格占绝对多数,结果难以解释,这需要欠采样并导致验证指标产生偏差。一些研究[20 (https://arxiv.org/html/2608.07472#bib.bib123),13 (https://arxiv.org/html/2608.07472#bib.bib381)]报告称,当目标分辨率非常精细时预测质量下降,这使得像素级预测的可靠性受到质疑。此外,聚合信息——如总火灾次数或累计过火面积——在此粒度下会丢失。较粗的空间分辨率可以缓解这些问题,但随之而来的是如何划分区域的问题。当前研究通常依赖均匀网格:Michail等人[19 (https://arxiv.org/html/2608.07472#bib.bib272)]将GraphCast[17 (https://arxiv.org/html/2608.07472#bib.bib283)]与时间编码器耦合在0\.25∘0\.25^\{\\circ\}网格上进行预测;Chen等人[7 (https://arxiv.org/html/2608.07472#bib.bib236)]将葡萄牙划分为十个单元格以预测过火面积;Koh等人[14 (https://arxiv.org/html/2608.07472#bib.bib68)]在0\.5∘0\.5^\{\\circ\}网格上分析了美国风险。
近年来,越来越多的研究将野火制图视为一项使用深度学习的*有监督*图像分割任务,采用U\-Net、Vision Transformers(ViT)和基于注意力的模型等架构[12 (https://arxiv.org/html/2608.07472#bib.bib376),2 (https://arxiv.org/html/2608.07472#bib.bib377),18 (https://arxiv.org/html/2608.07472#bib.bib4)]。这些方法在具备像素级真实标签时,擅长从多光谱卫星影像中检测活动火灾或描绘过火区域。然而,它们解决的是*a different problem*:在点火*之后*检测或分割火灾,而不是在预测*之前*定义预测区域。目前没有任何公开数据集提供预标记的火灾易发区域,可供在此类预测场景中训练模型。因此,我们的方法是*无监督*的:它直接从历史点火分布中推导预测单元,无需分割标签,从而与有监督的深度学习管线形成互补而非竞争关系。
当前日常野火预测研究的一个关键局限在于依赖规则网格分割,忽略了野火复杂不规则的空间分布。这种网格会在模型训练中引入噪声(水体、不可靠的历史编码等),可能降低预测性能。在本文中,我们通过提出一种火灾区域分割算法来解决这一空白,该算法利用图像处理技术定义具有语义意义的预测区域。我们的结果表明,与传统的基于网格的方法相比,该方法有明显改进,凸显了空间感知分割对野火预测的重要性。表1 (https://arxiv.org/html/2608.07472#S1.T1)总结了我们方法与其近期相关工作之间的主要区别。
表1:野火预测空间离散化方法比较。研究分辨率分割方式有监督任务Michail[19 (https://arxiv.org/html/2608.07472#bib.bib272)\]0\.25∘0\.25^\{\\circ\}网格N/A预测Chen[7 (https://arxiv.org/html/2608.07472#bib.bib236)\]10个单元格网格N/A预测Koh[14 (https://arxiv.org/html/2608.07472#bib.bib68)\]0\.5∘0\.5^\{\\circ\}网格N/A风险Huot[12 (https://arxiv.org/html/2608.07472#bib.bib376)\]像素无是检测Ban[2 (https://arxiv.org/html/2608.07472#bib.bib377)\]像素无是检测本文方法0\.20\.2–0\.4∘0\.4^\{\\circ\}火灾区域否预测
### 1\.3 主要贡献
本文解决了野火建模中的一个核心问题:预测单元(网格单元与火灾区域)的定义制约着模型学习点火模式的能力。我们证明,基于网格的空间离散化是野火预测中的一个主要瓶颈——它稀释了点火信号并引入了空间噪声。为克服这一局限,我们引入了一种火灾区域分割算法,将分水岭检测与聚类相结合,使预测区域与历史点火模式对齐,从而改善短期预测。基于该分割训练的模型在多个空间尺度上始终优于使用标准网格的模型。虽然这种划分方法提高了预测性能,但我们并不声称其最优,也尚未与替代分割策略进行系统比较。此外,目前没有公开数据集提供经过验证的空间分割以支持标准化评估。这项工作为野火预测开辟了一个不同的研究视角——不是寻找新模型,而是优化数据集本身的构建方式。图1 (https://arxiv.org/html/2608.07472#S1.F1)展示了本研究所开发的流程。
见图注
图1:处理流程。首先,算法检测并分割将进行风险预测的火灾影响区域。接下来,构建每日数据集,将每个火灾簇作为独立样本处理。最后,在火灾区域分割和传统规则网格上分别训练每个模型,以展示我们方法的优势。
## 2 所提方法:火灾区域分割
传统基于网格的离散化方法将研究区域划分为均匀单元,但由于火灾点火遵循复杂的非均匀空间模式,因此此类方法并非最优。因此,我们的方法优先考虑簇大小,确保在不同省份和尺度上的适应性。由于目前没有专门用于火灾前区域分割的公开数据集,我们依赖无监督分割算法。所提出的流程在任何预测建模之前先对火灾易发区域进行分割。我们的方法包含三个主要阶段:(A)生成连续的三维火灾风险信号,(B)检测火灾易发区域,(C)合并火灾区域以匹配指定的目标大小。
算法设计选择。我们选择将分水岭分割与K均值聚类相结合,而非SLIC超像素[1 (https://arxiv.org/html/2608.07472#bib.bib379)]、均值漂移[8 (https://arxiv.org/html/2608.07472#bib.bib380)]或DBSCAN等替代方法,原因如下。首先,分水岭能够自然检测由历史点火生成的密度表面中的“盆地”,生成的区域遵循火灾风险的地形特征,而不是强加任意几何形状。其次,K均值通过intensity\_levels参数明确控制合并区域的数量,这对于满足操作约束(省级边界、目标区域大小)至关重要。第三,这两种算法计算开销低,且在给定随机种子时具有确定性,便于在多种配置下进行可复现实验。虽然SLIC在图像过分割方面效果不错,但不适用于稀疏、分布不规则的点数据;均值漂移对带宽选择敏感,可能产生不可预测的簇数量;DBSCAN在研究区域密度变化显著时表现不佳。我们的两阶段方法(分水岭+K均值合并)在空间保真度和可控粒度之间取得了平衡。
图2 (https://arxiv.org/html/2608.07472#S2.F2)展示了该图像处理方法的详细步骤。该算法的目标是基于已知火灾位置,为指定的区域大小构建最优预测区域——即能够预测火灾数量的区域。当预测区域无法预先知道时,同样的算法可应用于上游AI模型提供的风险位置。
该方法接受三个输入参数:
1. 1\.缩放尺度\(s\):决定区域的大小(以度为单位)。较小的尺度值会产生更多区域,较大的尺度值会通过合并减少区域数量。像素数(大小)对应于尺度×尺度\\text\{scale\}\\times\\text\{scale\}度正方形内2公里分辨率像素的数量。
2. 2\.intensity\_levels\(r\):控制火灾区域强度阈值数量。较高的值生成更大的强度区域,较低的值则侧重于定位最高风险区域。
3. 3\.max\_dilations\(a\):指定用于合并过小区域的最大膨胀迭代次数。较高的值产生更多连通区域,但可能引入噪声。
4. 4\.tol\(t\):定义区域大小的容差。由于数据按省份组织,难以获得与目标大小完全匹配(像素级精确)的区域,因为火灾区域不一定遵循特定大小,且可能因省份而异。然而,某些区域可能足够接近。该参数允许定义最大和最小大小,使得大小±大小×tol\\text\{size\}\\pm\\text\{size\}\\times\\text\{tol\},其中大小是尺度±尺度\\text\{scale\}\\pm\\text\{scale\}正方形中2公里分辨率像素的数量。
### 2\.1 连续风险信号
原始火灾发生栅格过于稀疏和离散,无法直接用于空间分割,因为点火点是孤立的,不形成连续区域。为使分水岭算法能够检测连贯的火灾易发区域,我们首先将该离散信号转换为连续的空间风险表面。首先使用基于拉普拉斯分布的滤波器对每个像素的风险进行估计,该滤波器应用于三维火灾发生栅格。它根据20公里半径内火灾序列的平均持续时间(按季节和区域计算)对信号进行平滑。沿时间轴求和得到累积风险。
### 2\.2 检测火灾易发区域
该步骤减少噪声并帮助识别主要火灾区域。使用K均值将累积风险聚类为n\_reducor\_class\_class组。n\_reducor\_class\_class参数用于选择分水岭算法检测到的火灾易发区域的强度。
### 2\.3 合并火灾易发区域
该步骤的目的是确保每个检测到的火灾易发区域与目标大小匹配,该目标大小对应进行预测的空间尺度。换句话说,该算法不仅检测火灾易发区域,还对其整形,使其成为有效的预测单元。伪代码、Python代码和详细图示可在补充材料中获取。图3 (https://arxiv.org/html/2608.07472#S2.F3)展示了本文所用合并算法的简单示意图。
小于最小尺寸的区域与邻近区域合并。算法选择能够生成所需大小簇的最大邻近区域。当找不到有效邻居时,区域会扩张(膨胀)以到达更远的邻居。经过max\_dilations次迭代后仍然过小的区域将被移除,而过大的区域则被腐蚀。每次合并后,算法重新运行,直到每个簇都通过验证。如果没有区域满足标准,则输出仅包含背景的图像(即无分割区域)。背景像素(即非火灾像素)被递归拆分,直到所有簇达到所需大小(大小±大小×tol\\text\{size\}\\pm\\text\{size\}\\times\\text\{tol\})。
算法输出是一个标记栅格,其中每个像素属于一个定义预测单元的火灾区域簇。平均而言,该算法在40秒内完成一次分割,包括输入/输出操作。该基准测试在配备32 GB内存和13代Intel Core i7\-13850HX(28核)的Dell Precision 7780上完成。计算时间随研究区域大小扩展。由于算法未明确考虑原始研究区域的大小,因此无需修改即可在更大尺度(如整个国家)上应用。在更精细分辨率(如1×11\\times 1km)下应用同样无需更改,因为相关量为一个区域内的像素数量,而非像素分辨率本身。
见图注图2:本文实现的图像处理方法的详细步骤。白色像素代表以2公里分辨率被错误栅格化的六边形,已将其移除。见图注
图3:本文所用簇合并算法的简单示意图。基于网格的分割通过对每个省进行递归二分,直到生成大小为大小±容差×大小\\text\{size\}\\pm\\text\{tol\}\\times\\text\{size\}的簇。拆分使用2簇K均值算法执行。仅在拆分能使结果簇大小更接近目标时才进行拆分。相似文章
评估用于野火后泥石流预测的机器学习模型
本文使用美国地质调查局(USGS)流域尺度数据,系统评估了包括TabPFN基础模型在内的15种机器学习模型在野火后泥石流预测中的表现,发现TabPFN取得了最佳性能(威胁评分为0.637),并且合成数据增强能改善大多数模型的性能。
WildfireSpreadBench:指标在野火蔓延预测中决定模型
本文介绍了WildfireSpreadBench,用于基准测试野火蔓延预测模型,揭示了评估指标如AP与F1可能导致不同的模型排名,并影响操作适用性。
新型消防技术或可助力扑灭法国和西班牙等地的野火
文章探讨了新型消防技术,包括可生物降解的灭火剂(Ecofire)、人工智能驱动的早期预警系统(Predifire)、无线传感器网络(SenForFire)以及人工智能野火评估模型,这些技术旨在应对气候变化导致法国和西班牙日益严重的野火。
模块化深度学习机制用于可审计的次日野火蔓延预测
本研究提出模块化深度学习增强方案,用于次日野火蔓延预测,通过注意力偏置、检索增强和双流门控提升可审计性和可信度,并在基准测试中使用性能指标进行评估。
评估基础模型在极端环境事件中的泛化能力:以加州野火PM2.5为例
本文系统评估了时间序列基础模型(TSFMs)在预测野火烟雾导致的极端PM2.5浓度方面的表现,使用了加州12年的数据集。结果表明,像BiLSTM这样完全训练的循环基线模型优于TSFMs,挑战了更大预训练模型主导环境预测的假设。