基于数据驱动的土壤湿度回归与分类模型综述

arXiv cs.LG 论文

摘要

关于基于AI的土壤湿度估计与分类模型的结构化综述,涵盖统计时间序列、地统计学、经典机器学习、深度学习以及概率/贝叶斯方法。

arXiv:2606.18316v1 公告类型:新 摘要:土壤湿度建模是一个复杂的时空学习问题,具有非线性环境相互作用、异构数据源和有限的地面观测等特征。基于物理的方法,如水量平衡模型,依赖于明确的水文方程和高质量输入,但其计算成本与可扩展性限制了大范围部署。数据驱动的人工智能方法已成为灵活的替代方案,能够以简化建模假设的方式提取土壤湿度与环境变量之间的经验关系。本工作对基于AI的土壤湿度估计与分类模型进行了结构化综述。现有方法分为五类:(a) 统计时间序列模型,(b) 地统计学方法,(c) 经典机器学习模型,(d) 深度学习模型,以及 (e) 概率/贝叶斯方法。这些模型利用历史土壤湿度记录、气象变量、植被指数、地形、土壤特征和地理位置数据来执行回归或分类任务。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:41

# 基于数据驱动模型的土壤湿度回归与分类综述
来源:https://arxiv.org/html/2606.18316
11institutetext:机器人学与人工智能团队
计算机科学、空间与电气工程系
吕勒奥理工大学
瑞典吕勒奥###### 摘要

土壤湿度 \(SM\) 建模是一个复杂的时空学习问题,其特点是存在非线性环境相互作用、异构数据源以及有限的地面观测数据。基于物理的方法,例如水量平衡模型,依赖于明确的水文方程和高质量输入,但其计算成本和可扩展性限制制约了大规模部署。数据驱动的人工智能 \(AI\) 方法已成为灵活的替代方案,能够在减少建模假设的情况下,提取土壤湿度与环境变量之间的经验关系。本文对基于AI的土壤湿度估计与分类模型进行了结构化的综述。现有方法被组织为五类:\(a\) 统计时间序列模型、\(b\) 地统计方法、\(c\) 经典机器学习 \(ML\) 模型、\(d\) 深度学习 \(DL\) 模型以及 \(e\) 概率/贝叶斯方法。这些模型利用历史土壤湿度记录、气象变量、植被指数、地形、土壤特征和地理位置数据来执行回归或分类任务。

## 1 引言

土壤湿度 \(SM\) 是水文循环中的一个关键变量,了解其对洪水和干旱预报至关重要。此外,土壤湿度参数影响着农业和水资源管理;因此,准确测量和预测SM具有重要意义\[21\]、\[28\]、\[45\]。SM在空间和时间上动态变化,且其场域具有高度的空间异质性,如图1所示,即便在小流域内也不例外\[61\]、\[23\]。

![参见图注](figure_url)
图1:瑞典吕勒奥一处草地覆盖场地的土壤湿度空间变化。这些空间变化源于普通克里金插值,渐变色表示土壤湿度变化。了解时空变异性对于认识和模拟水文过程非常重要\[34\]。在空间和时间变异性方面,人们发现二者之间存在相关性,表明SM的时空稳定性与其空间分布模式的时间持久性有关\[27\]。

SM动态受气候、土壤、植被和地形等环境因素与物理因素的非线性相互作用影响\[2\]、\[23\]、\[40\]。最近的工作\[39\]表明,人工神经网络 \(ANNs\) 和随机森林 \(RFs\) 等树集成模型优于线性模型,因为它们能够捕捉水文地理和气候预测因子之间复杂的非线性相互作用。此外,当RF和ANN相较于简单关系能够显著改进估计时,SM对多个特征的非线性依赖性得到了强调\[32\]、\[2\]。

另一个具有挑战性的问题是空间尺度不匹配与多源数据同化。研究\[49\]通过使用逆向Hydroblocks-RTM将SMAP降尺度至30米,直接解决了卫星与实地尺度之间的空间尺度不匹配问题。此外,如\[20\]所述,对实地和遥感SM的数据同化改进了模型状态,但同时也指出了遥感在约5厘米表层土壤的局限性,以及需要通过降尺度和误差建模来解决尺度不匹配问题。

传统的基于物理的过程模型使用物理方程描述控制SM转移的水文过程,并作为陆面数据同化技术的一部分计算相关的解释变量\[12\]。这些模型大多是数值模型,严重依赖高精度的输入数据。此外,这些机理模型需要大量的计算成本,限制了它们在更大范围内的广泛应用\[58\]。随后引入了统计方法来提高模型的适应性。研究人员可以利用数据驱动方法来推导SM与环境参数之间的经验关系,从而减少对物理参数的依赖\[58\]、\[54\]。

本研究的目的是调查用于SM回归和分类任务的数据驱动模型,并对它们进行比较或区分。重点将放在按学习范式对模型进行分类,并强调当前面临的挑战和研究空白。

## 2 土壤湿度建模任务

数据驱动的SM建模通常被表述为回归或分类问题,具体取决于目标变量和应用场景。回归预测连续的SM值,而分类则将样本分配到离散的湿度状态,例如干燥、中等或湿润\[54\]、\[46\]、\[59\]。此外,一些研究涉及空间降尺度,即使用更高分辨率的辅助数据对粗分辨率SM产品进行细化\[49\]、\[38\],这些属于回归任务的范畴。尽管它们存在固有差异,但其所做的假设以及利用提供的输入-输出数据的方式都遵循图2所示的相同步骤。

### 2.1 输入变量与数据源

在所有数据驱动方法中,"垃圾进,垃圾出"(GIGO)原则都成立。因此,在任何这些任务中,恰当选择输入变量至关重要。在SM领域,建模任务的输入包括气象、遥感、土壤、地形和时间预测因子及其组合,包括但不限于降水、温度、太阳辐射、植被指数、SAR后向散射、土壤质地、高程、坡度和前期土壤湿度\[2\]、\[23\]、\[31\]、\[32\]、\[30\]。来自国际土壤湿度网络 \(ISMN\) 的实地测量数据、被动微波产品(例如 SMAP 和 SMOS)、Sentinel-1 SAR观测数据、ERA5-Land再分析数据以及辅助产品(例如 MODIS、DEMs 和 SoilGrids)是最常见的数据源\[26\]、\[44\]、\[49\]、\[48\]。

![参见图注](figure_url)
图2:数据驱动土壤湿度建模流程,从数据获取与预处理到特征构建、模型选择、输出和验证。
### 2.2 回归任务

回归是SM研究中最常用的工具,因为SM测量值存在于一个连续空间中。正式来说,回归范式试图根据一组环境与地理空间预测因子,无论是静态的还是按时间顺序设置的,来估计或预测湿度\[54\]。这样,问题就被表述为一个标准的监督学习设置,试图在预测因子组与湿度值(无论是地表还是地下记录的)之间建立一个映射关系。

根据输入空间,尤其是输出空间的不同,回归可以应用于不同的设置:\(a\) 点估计,目标是从同期预测因子预测特定位置或深度的SM\[54\]、\[26\];\(b\) 时间预测,目标是利用历史观测数据和外部输入(例如降水、温度、蒸散等)预测未来的SM值\[1\]、\[5\]、\[14\];\(c\) 多深度预测,与第一类不同,模型试图预测多个土壤层的SM值\[2\]、\[48\];以及 \(d\) 数据填补或记录重建,目标是"插补"稀疏或不完整数据集中的SM观测值\[57\]、\[44\]。最后但同样重要的是,值得单独提及的一个特殊回归情况是空间降尺度,即使用更密集分布的辅助变量(例如植被图、陆面温度、地形等)将SM测量值细化到更精细的空间分辨率\[49\]、\[38\]、\[41\]。尽管降尺度因其实际重要性有时被单独讨论,但最好将其理解为一个专门的回归问题,其中目标仍然是连续的SM,但重点转向恢复更精细的空间细节。

### 2.3 分类任务

分类建模将预测连续变量的需求放宽为将SM分类到预定义的类别/等级\[37\]、\[45\]、\[19\]、\[59\]。类别的形成可以基于专家知识,也可以基于对连续值的分箱\[46\]。尽管这种精度的缺失乍看起来可能奇怪,但在没有足够数据来构建回归问题,和/或这些类别作为更广泛系统的一部分已足够使用,或者因为它们更容易解释(例如,用于干旱监测、灌溉决策支持等应用)时,它可能是非常有用的。

### 2.4 评估与验证

与每个数据驱动模型一样,模型的效用是根据特定指标来评估的,这些指标衡量模型的输出与一组目标值(例如,回归任务使用 \(R^2\), RMSE, MAE, ubRMSE, KGE 等;分类任务使用准确率、F1分数、Kappa系数、精确率、召回率、AUC等)的匹配程度\[52\]、\[37\]。评估指标的估计方式(训练/验证/测试集的设计)也至关重要。随机交叉验证可能应避免使用,而应采用时间留出法、空间分区法或留一站法交叉验证\[26\]、\[36\]。实验设置的整体设计对于所提出的建模方法能够泛化到新的/未见过的数据至关重要。

## 3 数据驱动模型分类

本节回顾了用于SM回归和分类的代表性数据驱动方法,从较为成熟的方法开始,逐步过渡到最近的趋势。本综述的数据驱动模型分类总结于图3。

![参见图注](figure_url)
图3:本综述数据驱动模型的分类图
### 3.1 统计时间序列模型

统计时间序列模型是一种数据驱动模型,它假设观测数据是由一个随机过程生成的,并描述因变量和自变量之间的关系,通过解决一个优化问题来实现\[10\]。统计建模的主要优点包括可解释性强、在数据有限的情况下具有稳健性,以及能够为预测提供置信区间。然而,这需要以对数据分布和生成过程做出一些假设为代价\[43\]、\[50\]、\[15\]。其中大部分模型已经存在了超过半个世纪。

自回归积分滑动平均 \(ARIMA\) 模型使用过去的观测误差作为输入来预测未来的值。基本模型的变体已在SM建模中得到广泛应用。Huang在\[17\]中使用了一个普通的ARIMA \(12,1,0\) 模型来预测降水和土壤蒸发。该基本技术的一个扩展是季节性ARIMA \(SARIMA\),专为处理季节性时间序列而设计\[1\]。在\[5\]中,SARIMA模型利用特定深度的历史SM时间序列来预测SM,而在\[4\]中,SARIMA模型用于预测精准农业中的水分含量。Giorgio等人在\[14\]中开发了一个基于SARIMA的时间序列数据驱动模型,用于在再生水灌溉背景下对土壤含水量和盐度进行48小时预测,使用的数据包括地下50厘米处的土壤含水量和盐度数据(时间分辨率为15分钟)、每小时的大气数据以及每日灌溉量。在\[51\]中,Cluster-ARIMA模型用于预测土壤呼吸,其中土壤呼吸数据首先使用聚类技术进行分区,然后使用季节性ARIMA \(SARIMA\) 来确定待预测数据所属的聚类。实验结果的预测准确率为98.3%。向量自回归VAR-ARIMA模型被\[55\]用于预测SM,将降水、SM和蒸散视为独立输入。

### 3.2 地统计方法

地统计模型是一种空间建模方法,它将SM视为一个空间随机过程的实现\[11\]、\[9\]。与假设观测值独立同分布的经典回归模型不同,地统计方法将测量值之间的依赖性建模为空间距离的函数\[9\]。克里金法是最广泛使用的空间插值方法之一。

相似文章

体育领域大型模型综述

arXiv cs.CL

对体育领域大型模型的全面调查,涵盖任务、应用、数据集和挑战,以推动体育智能化。