Command Palette
Search for a command to run...
数据驱动的火险分区方法提升短期野火预测性能
数据驱动的火险分区方法提升短期野火预测性能
Nicolas Caron Hassan Noura Christophe Guyeux Benjamin Aynes
摘要
野火预测模型通常将研究区域离散化为均匀网格,忽略了起火点空间分布的非均质性。我们挑战这一范式,证明数据离散化的方式比选用何种模型更为重要。本文提出一种无监督的火险分区算法,结合分水岭检测与 K-means 聚类,直接从历史火灾模式中定义预测单元。在法国六个省份及六种预测模型上的实验表明,火险分区方法一致优于基于网格的方法,根据空间尺度不同,平均 IoU 提升 3–6%。该方法计算开销低(每种配置耗时 <10 秒),且完全可并行化。我们的结果表明,优化空间离散化能为短期野火预测带来显著且可复现的性能增益。补充材料可在此获取,代码将在 GitHub 上发布。
一句话总结
法国玛丽与路易·巴斯德大学、FEMTO-ST 研究所和 SAD Marketing 的研究者提出一种无监督火灾区域分割算法,该算法将分水岭检测与 K-means 聚类相结合,基于历史火灾模式定义预测单元,在短期野火预测中,其平均 IoU 较基于网格的离散化方法提升 3−−6%(具体取决于空间尺度)。
核心贡献
- 一种无监督火灾区域分割算法,结合分水岭检测与 K-means 聚类,直接从历史火灾分布中定义预测单元,无需标注的分割数据。
- 在六个法国省份、六种预测模型和多个空间尺度上,这种数据驱动的分割方法始终优于传统的网格化方法,平均 IoU 提升了 3–6%。
- 该方法每个配置的运行时间不到 10 秒,完全可并行化,并能无缝集成到现有的短期野火预测流程中。
引言
野火造成了沉重的经济和人员损失,而融合物联网传感器与 AI 的早期预警系统为改善检测和资源调配提供了有效途径。然而,此类 AI 模型的预测性能从根本上取决于如何将地表划分为预测单元。此前的研究大多采用均匀网格,这会稀释起火信号,引入来自水体等无关特征的空间噪声,并因大量无火网格单元的存在而导致严重的类别不平衡。这些基于网格的方法还会丢失聚合信息,并在精细分辨率下变得不可靠。虽然监督式深度学习方法已被应用于火灾分割,但它们针对的是起火后的映射,而非火灾发生前定义预测区域这一预处理步骤。为解决这一空缺,作者提出一种无监督火灾区域分割算法,该算法将分水岭检测与聚类相结合,直接从历史起火分布中导出预测单元。这种数据驱动的预处理步骤无需任何标注的分割数据,便能持续提升预测准确率,优于传统的网格化方法。
数据集
作者在两个野火数据集上评估其方法,这两个数据集均按法国行政省份组织。
数据集构成与来源
- 消防员干预数据集:汇编自艾因省、杜省、罗讷省和伊夫林省四个省份的消防员记录,时间跨度为 2017 年至 2024 年(罗讷省截至 2022 年)。记录位置为报告位置,并非确切的起火点,因此空间精度有限。大多数火灾系人为引起。
- BDIFF(森林火灾数据库):自 2006 年以来的法国森林火灾集中记录。本研究使用了罗讷河口省和埃罗省(2017–2023 年)的数据,这些数据以市镇级别记录火灾。该数据库仅捕获森林火灾,不包含其他类型的野火。
由于火灾位置不精确且具有异质性,两个数据集均被用于验证空间离散化方法。
目标与特征构建
- 预测任务是一个有序多分类问题。对于每个省份,无火灾发生的日子被标记为类别 0;有火灾发生的日子则根据每日火灾数量,通过 K-means 聚类划分为四个有序类别——正常、中等、高、极高。这强调了典型的火灾活动模式。
- 特征来源于六个组别:气象、地形、社会经济、空气质量、水文和历史特征。(空气质量和水文变量是为消防员数据集添加的。)所有特征都被转换为 2 公里分辨率的 3D 栅格,并使用平均值、最大值和最小值对每个像素进行聚合。低方差和高度相关的特征被移除。2 公里分辨率是为应对火灾位置不确定性而采取的实际折中方案;并非分割算法的要求。
数据使用与划分
- 数据集被划分为训练集(2017–2021 年)、验证集(2022 年)和测试集(2023 年)。所有预处理步骤均在训练集上拟合,然后应用于其他划分部分。
- 消防员数据集和 BDIFF 数据集被独立处理。最终样本包含特定日期、特定空间聚类的聚合特征和有序目标。分割操作仅使用训练集执行。
方法
作者提出了一种火灾区域分割流程,旨在根据历史火灾位置构建最优预测区域,以解决传统网格离散化方法无法捕捉复杂、非均匀的火灾起火空间模式的局限性。该方法依赖于无监督分割算法,将研究区域划分为指定目标大小的聚类,确保其在不同省份和尺度上的适应性。该流程分为三个主要阶段:生成连续的 3D 火灾风险信号、检测火灾易发区域,以及合并这些区域以匹配目标大小。
关于该图像处理方法的可视化概览,请参考下方框架图。
第一阶段,作者将稀疏且离散的原始火灾发生栅格转换为连续的空间风险曲面。这是通过对火灾发生的 3D 栅格应用基于拉普拉斯分布的滤波器来实现的。该滤波器根据 20 公里半径内火灾序列的平均持续时间(按季节和区域计算)对信号进行平滑处理。沿时间轴求和即可得到累积风险信号。
第二阶段,使用 K-means 将累积风险聚类为若干组,以降低噪声并识别主要火灾区域。组数由控制火灾易发区域强度的一个参数决定。随后,应用分水岭分割算法。作者选择结合分水岭分割与 K-means 聚类,是因为分水岭算法能自然地检测密度曲面中的“盆地”,生成遵循火灾风险地形的区域,而 K-means 则提供了对合并区域数量的明确控制。
第三阶段确保每个检测到的火灾易发区域与目标大小相匹配,该目标大小对应于进行预测的空间尺度。小于最小尺寸的区域将与邻近区域合并。如果找不到有效的邻近区域,则通过膨胀操作扩大区域。在最大膨胀迭代次数后仍然过小的区域将被移除,而过大的区域则进行腐蚀。背景像素被递归分割,直到所有聚类都达到所需大小。
如下图所示,合并算法迭代处理过小和过大的聚类,直到所有聚类都满足大小约束。
该方法接收若干输入参数,包括尺度(决定区域面积)、强度等级(控制强度阈值)、最大膨胀次数(指定合并迭代次数)以及区域大小的容差参数。输出是一个标记的栅格,其中每个像素属于一个火灾区域聚类,定义了一个预测单元。
为验证这些分割方法,作者采用了一种训练方案,即训练模型来预测每个聚类内的每日火灾风险。他们利用梯度提升决策树(XGBoost、CatBoost)等训练速度快的模型,将超参数搜索控制在一个合理的时间预算内。对最大膨胀次数和强度等级参数采用网格搜索策略来生成候选分区。搜索网格包含 max_dilations∈{1,2,3,4,5} 和 intensity_levels∈{2,3,4,5,6},并在 0.2,0.3,0.4 度的尺度上进行分析。为解决类别不平衡问题,测试了不同比例的零类样本,其中 0.3 到 0.5 的比例在大多数配置中被证明是最优的。所有实验均使用固定的随机种子 42 以确保可复现性。
实验
实验训练快速梯度提升树模型,以预测通过基于网格或基于火灾区域分割得到的聚类内的每日火灾风险,并在两个野火数据集上,跨越多个省份和空间尺度,通过 IoU 进行评估。火灾区域分割始终优于网格基线,其中中等尺度(0.3°)提供了最可靠的跨省份收益,且没有任何场景下基于网格的分割表现更好。为避免性能损失,需要针对特定省份进行超参数优化,尽管该方法计算量轻且可扩展。总的来说,火灾区域分割是一个无悔的预处理步骤,能提升预测精度。
所提出的火灾区域分割取代了传统的基于网格的空间离散化方法,用于野火预测,采用一种无监督方法直接从历史起火模式中导出区域。与依赖规则网格的先前预测研究相比,该方法在无需监督标签的情况下实现了可比或更精细的分辨率(0.2–0.4°)。分割计算量轻,处理单个省份的时间不到 10 秒,但跨省份应用单一配置会导致交并比下降 0.02–0.04,这凸显了局部调优的重要性。比较中的所有先前预测研究都使用规则网格分割,而所提出的方法是唯一创建火灾区域分割的方法。分割算法计算成本低:在 2 公里分辨率下处理单个省份的时间不到 10 秒,内存占用低于 2 GB,使得全国范围内的并行化处理是可行的。在不同省份使用统一的分割配置会使平均 IoU 降低 0.02–0.04,表明各省的野火模式需要本地化的参数设置。
该研究将野火预测定义为一项五级有序分类任务,特征分为六个类别:气象、地形、社会经济、空气质量、水文和历史特征。所有特征被聚合到 2 公里分辨率的 3D 栅格中,使用平均值、最大值和最小值,目标是通过对正火灾天数进行 K-means 聚类得到的五级发生标签。气象变量以 12 小时和 16 小时的间隔采样,而卫星衍生的植被指数每 7 天更新一次,静态地形特征提供海拔和土地覆盖背景信息。温度、露点、降水和风速数据来自 Meteostat,每 12 小时和 16 小时记录一次;而 NDVI、NDSI、NDMI、NDBI 和 NDWI 指数来自 Landsat,每 7 天更新一次。跨所有省份应用单一的分割参数配置会使平均 IoU 降低 0.02–0.04,表明最优设置是特定于省份的。
数据集涵盖六个法国省份,野火次数在不同时间段内从 1,025 次到 2,980 次不等。将在某一省份(罗讷河口省)优化得到的分割配置应用于其他省份时,埃罗省和艾因省的平均 IoU 下降了 0.02–0.04,证实了区域异质性对性能有显著影响。各省份的野火次数差异很大,从埃罗省的 1,025 次到杜省的 2,980 次,即便记录时间段不同。使用单一的分割配置导致埃罗省和艾因省的平均 IoU 下降 0.02–0.04,表明需要针对特定省份进行调优。
在容差固定为 0.3 的情况下,三个尺度下的聚类大小分布互不重叠,满足了最高容差下无分布重叠的条件。平均聚类大小随尺度单调递增,从尺度 0.2 的 169 个像素增加到尺度 0.4 的 677 个像素。尺度 0.2、0.3 和 0.4 下的聚类大小范围(最小值到最大值)完全不相交,确保了分布无重叠。从尺度 0.3(256 个像素)提升到尺度 0.4(677 个像素)时,平均聚类大小增加了一倍以上。
评估的模型涵盖线性模型、基于树的提升模型和循环神经网络架构。选择基于树的提升方法(XGBoost、CatBoost)是因为其训练速度快且在表格数据上性能强劲,而 GRU、LSTM 和 MLP 则作为神经网络基线。模型集合包括逻辑回归、两个梯度提升决策树模型(XGBoost、CatBoost)以及三个神经网络(GRU、LSTM、MLP)。选择 XGBoost 和 CatBoost 是因为它们在表格数据上仍然具有很强的竞争力,其性能优于或可与深度学习模型相媲美,同时训练时间能保持在几天以内。
该评估框架用无监督的火灾区域分割取代了传统的基于网格的野火预测方法,将气象、地形和卫星特征聚合到 2 公里栅格中,用于六个法国省份的有序风险预测。关键发现表明,在省份之间迁移时,统一的分割参数会导致平均 IoU 性能下降 0.02–0.04,证实了局部起火模式需要特定于省份的调优,而在 0.2、0.3 和 0.4 尺度下,聚类大小分布仍保持互不重叠。基于树的提升模型(XGBoost、CatBoost)因其在表格数据上的竞争性准确率和训练速度而被选中,且轻量级的分割处理单个省份的时间不到 10 秒,使得全国范围内的并行化处理是可行的。