STeMP: 时空建模协议
摘要
STeMP是一种标准化协议,用于报告和指导环境研究中的时空预测机器学习建模,旨在提高透明度和可重复性。该协议附有R包和网络应用程序,并托管在GitHub上。
查看缓存全文
缓存时间: 2026/07/24 05:12
# STeMP: 时空建模协议 来源: https://arxiv.org/html/2607.20592 [![[未标注图片]](https://arxiv.org/html/2607.20592v1/x1.png)Jan Linnenbrink](https://orcid.org/0000-0003-0991-8646) 明斯特大学景观生态研究所 德国明斯特 48149 jan\.linnenbrink@uni\-muenster\.de &[![[未标注图片]](https://arxiv.org/html/2607.20592v1/x2.png)Jakub Nowosad](http://orcid.org/0000-0002-1057-3721) 明斯特大学景观生态研究所 德国明斯特 48149 亚当·密茨凯维奇大学地理生态与地理信息研究所 波兰波兹南 61\-680 &[![[未标注图片]](https://arxiv.org/html/2607.20592v1/x3.png)Marvin Ludwig](https://orcid.org/0000-0002-3010-018X) 明斯特大学景观生态研究所 德国明斯特 48149 &Anna Frederike Jablotschkin 明斯特大学景观生态研究所 德国明斯特 48149 &Fabian Schumacher 明斯特大学景观生态研究所 德国明斯特 48149 &[![[未标注图片]](https://arxiv.org/html/2607.20592v1/x4.png)Teja Kattenborn](https://orcid.org/0000-0001-7381-3828) 传感器地理信息学主席 (geosense) 弗莱堡大学 德国弗莱堡 79106 &[![[未标注图片]](https://arxiv.org/html/2607.20592v1/x5.png)Hanna Meyer](https://orcid.org/0000-0003-0556-0210) 明斯特大学景观生态研究所 德国明斯特 48149 hanna\.meyer@uni\-muenster\.de ###### 摘要 1. 时空预测机器学习建模是环境研究和地球科学中的重要工具。然而,机器学习模型对训练数据的特征(如数据分布)以及方法选择(包括交叉验证策略和模型调优)高度敏感。每一个决策都会对模型本身以及模型质量的评估和其在特定目的下的适用性产生深远影响。考虑到基于机器学习的环境地图在科学及向实践转化中的重要作用,透明地报告时空模型(理想情况下使用标准化模型协议)对于建立信任、透明度和可比性至关重要。然而,目前尚缺乏针对时空建模的此类协议。 2. 我们提出STeMP(时空建模协议)以填补这一空白,具有双重目的:标准化报告以理解模型功能,以及在建模过程中通过指出关键决策和参数提供指导。该协议分为三个部分:概述、模型和预测。概述部分包含元数据,而模型和预测部分则深入描述预测变量、评估与软件以及建模流程中其他相关要素。 3. 协议定义托管在GitHub上,并附有R包(https://github.com/LOEK-RS/STeMP)。该R包包含一个Web应用程序,可用于手动或通过提供的建模对象半自动填写协议。当遇到常见陷阱时,协议会发出警告,这可以帮助作者在建模过程中获得指导,也为审稿人评估预测建模研究提供支持。通过GitHub,欢迎社区贡献意见和反馈。 *关键词*机器学习⋅\cdot模型协议⋅\cdot模型报告⋅\cdot可重复性⋅\cdot空间预测⋅\cdot透明度 ## 1 引言 机器学习方法在地球科学时空建模中日益流行。与统计建模不同,它们无需对数据分布做出假设,即可学习复杂、非线性且通常相互关联的关系。这使得机器学习在气候学(Yang et al., 2024 (https://arxiv.org/html/2607.20592#bib.bib17))、生态学(Pichler and Hartig, 2023 (https://arxiv.org/html/2607.20592#bib.bib16))、遥感与土壤科学(Wadoux, 2025 (https://arxiv.org/html/2607.20592#bib.bib15))等多样化地球科学领域得到应用。然而,机器学习模型常被视为“黑箱”,即其学习到的关系难以理解。此外,建模过程中必须做出多项决策,这些决策可能会显著改变模型、其性能估计及其解释。这适用于一般的机器学习模型,尤其适用于时空机器学习模型。例如,时空数据固有的自相关性问题使数据划分用于模型评估和解释变得复杂。未能考虑这些影响可能导致严重的陷阱,如过于乐观的性能估计,从而使人对模型产生虚假信心,甚至最终损害对空间预测建模的整体信任(Nowosad et al., 2026 (https://arxiv.org/html/2607.20592#bib.bib41))。 因此,透明地报告重要的建模决策(如数据划分和模型选择)以及输入数据特征至关重要,这样模型的实践者和评估者才能理解其局限性,并评估对于特定目的(例如,特定区域或时间,或需要特定质量的地方)是否应信任该模型所做的预测。这也有助于时空机器学习模型的作者明确评估其建模决策并遵循最佳实践。此外,虽然在环境建模中,模型通常与特定预测绑定,但近来出现了向发布可用于更广泛任务的模型的转变(Graser et al., 2026 (https://arxiv.org/html/2607.20592#bib.bib31))。在这种情况下,透明报告对于模型用户评估模型是否适用于特定任务(例如特定区域或时间)至关重要。然而,在地球科学应用的时空机器学习研究中,这种透明度往往缺乏。例如,关于预测变量的分辨率、训练点的分布以及所选评估策略的信息常常未能透明地传达,或者分散在手稿和附录中(参见 Zurell et al., 2020 (https://arxiv.org/html/2607.20592#bib.bib5))。然而,这些信息对于解释模型在给定任务上的适用性以及所传达性能统计的可靠性至关重要。 标准化模型协议有助于实现机器学习研究的透明度和可重复性,从而便于模型审查、解释其结果并使其能够复现。存在一些通用机器学习模型的协议(例如 Mitchell et al., 2019 (https://arxiv.org/html/2607.20592#bib.bib7)),并且在受到严格法律和制度监督的领域(如医学)也存在大量协议(例如 Collins et al., 2015 (https://arxiv.org/html/2607.20592#bib.bib20); Mongan et al., 2020 (https://arxiv.org/html/2607.20592#bib.bib18); Luo et al., 2016 (https://arxiv.org/html/2607.20592#bib.bib19))。在环境建模中,已有针对更具体应用的模型协议定义。ODMAP协议 (Zurell et al., 2020 (https://arxiv.org/html/2607.20592#bib.bib5))用于描述物种分布模型,而ODE协议 (Seuru et al., 2026 (https://arxiv.org/html/2607.20592#bib.bib8))针对社会生态研究。两者都建立在ODD协议 (Grimm et al., 2006 (https://arxiv.org/html/2607.20592#bib.bib6))的基础上,该协议用于报告生态学中的个体基模型。除了模型协议,还存在关于功能设计、对象和命名约定最佳实践的软件检查清单,适用于(空间)机器学习和统计模型(例如 rOpenSci 统计软件同行评审, Ram et al., 2019 (https://arxiv.org/html/2607.20592#bib.bib21))。然而,专注于时空机器学习建模领域、考虑到其独特特征(如空间自相关)的标准化模型协议尚付阙如 (Graser et al., 2026 (https://arxiv.org/html/2607.20592#bib.bib31))。这阻碍了透明度,并错失了发现和减轻时空机器学习特有陷阱(如不适当的数据划分或预测超出模型适用区域)的机会 (Nowosad et al., 2026 (https://arxiv.org/html/2607.20592#bib.bib41))。因此,需要一个专门针对环境科学中时空机器学习模型的标准化协议,以填补通用机器学习协议与非常具体的环境制图领域专用协议之间的空白。 在此,我们提出STeMP,即时空建模协议,以填补这一空白。它既关注模型的属性——这对于旨在将模型应用于自身任务的研究人员很重要——也关注预测的文档记录,这对于使用模型输出(例如地图)的实践者或科学家可能更为重要。它涵盖了数据的关键属性,这些属性对建模过程有重要影响。STeMP附带一个R包,包含一个Web应用程序和用于分析协议输出的R函数。虽然该协议和软件使参与建模过程的多个利益相关者受益,但它特别针对三个主要群体提供了特定功能: - •*模型开发者*:Web应用程序提供功能,可发现协议指定的潜在问题并将其作为警告传达,使开发者能够在同行评审或部署之前主动处理和减轻潜在错误。 - •*模型评估者*:STeMP附带的R函数可自动汇总已识别的问题,使审稿人能够有效评估模型最关键的部分。 - •*模型用户*:详细的文档使最终用户能够更轻松地评估模型在特定上下文中的适用性,并将其与替代模型进行比较。 社区参与对于此类协议的长期成功至关重要。因此,我们将协议定义及附带软件维护在GitHub(https://github.com/LOEK-RS/STeMP)上,欢迎社区提出建议或进行讨论。 ## 2 概念设计 与标准时空机器学习工作流程一致,我们将STeMP组织为三个主要部分:*概述*、*模型*和可选的*预测*部分(图1 (https://arxiv.org/html/2607.20592#S2.F1) 和表 Author Contributions (https://arxiv.org/html/2607.20592#Sx3))。*概述*部分提供关于模型的一般信息(如作者姓名、联系信息,以及是否有与模型相关的出版物)。*模型*和*预测*部分记录了建模过程中所做的决策及相应的预测。*模型*部分组织为七个与建模工作流程主要阶段相对应的子部分。它涵盖了关于学习方法的信息——指定所用算法及其用于分类还是回归——以及响应数据的特征(如采样设计),还有预测变量的空间和时间分辨率。该部分还涉及模型评估与选择、基于可解释AI技术的模型解释,以及关于模型潜在偏差或局限性的详细信息。也可以指定模型的技术方面,如软件实现。*预测*部分是可选的,因为模型不一定与特定预测或应用绑定,但可能被开发用于不同背景和不同最终用户。预测部分包含三个子部分:预测域、最终地图评估与不确定性评估,最后是结果地图的后处理。因此,它涵盖了不确定性量化的方法信息(例如,分位数随机森林 (Meinshausen and Ridgeway, 2006 (https://arxiv.org/html/2607.20592#bib.bib40))用于量化预测区间,或AOA (Meyer and Pebesma, 2021 (https://arxiv.org/html/2607.20592#bib.bib37))和MESS (Elith et al., 2010 (https://arxiv.org/html/2607.20592#bib.bib38))用于划定训练数据未覆盖的区域)、预测域的时空维度,以及后处理措施(如连续预测需要二值化时的阈值选择)。 参照图注图1: STeMP的结构。三个方框对应协议的三个部分。该协议与典型的机器学习工作流程保持一致,从响应变量和预测变量数据获取开始,到预测的后处理结束。粗体文本显示协议的各个子部分,斜体文本指必填字段。参见表 Author Contributions (https://arxiv.org/html/2607.20592#Sx3)获取所有字段及其简短描述的完整列表。 ## 3 随STeMP附带的软件 ### 3.1 功能 STeMP附带一个R包,包含一个Web应用程序和R函数,以简化协议填写,提高协议在模型开发期间的实用性,并增强其对模型审稿人的有用性。Web应用程序旨在满足大多数用户的需求,而R函数提供了额外的功能来读取和分析已填写的协议。 Web应用程序允许通过从上传的模型和空间数据集中检索信息来自动填写许多字段。目前支持使用R包 `caret` (Kuhn, 2008 (https://arxiv.org/html/2607.20592#bib.bib33))、`tidymodels` (Kuhn and Wickham, 2020 (https://arxiv.org/html/2607.20592#bib.bib32)) 和 `mlr3` (Lang et al., 2019 (https://arxiv.org/html/2607.20592#bib.bib34)) 训练并存储为RDS对象的模型对象。从这些对象中提取关于样本量、响应特征、模型参数等信息,并自动填写协议的相应字段。此外,可以上传空间数据集,包括训练位置和预测区域。从这些数据集中,可以提取坐标参考系统等信息,并自动生成训练位置和预测区域的地图。当训练位置和预测区域都上传后,基于空间最近邻距离自动推断采样模式(详见 Meyer et al. 2026 (https://arxiv.org/html/2607.20592#bib.bib27); Linnenbrink et al. 2024 (https://arxiv.org/html/2607.20592#bib.bib22); Baddeley et al. 2015 (https://arxiv.org/html/2607.20592#bib.bib28))。 除了自动化功能,Web应用程序在检测到常见的空间机器学习陷阱时会发出警告(Nowosad et al., 2026 (https://arxiv.org/html/2607.20592#bib.bib41))。目前检查以下方面: - •评估策略不适合预测任务(例如,对于空间聚类的训练点使用随机交叉验证)。 - •训练和评估模型之间的数据泄漏。 - •当模型可能在推估情境下应用(即训练
相似文章
TSSM:面向全球站点天气预报的三轴状态空间模型(基于时间-变量-历史建模)
本文提出TSSM,一种用于全球站点天气预报的三轴状态空间模型,该模型融合了按周期对齐的历史数据,以改进长时预测和极端事件预测。在大规模Weather-5K数据集上取得了最先进性能,并在观测缺失条件下展现出强大的鲁棒性。
用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件
本文介绍了用于可复现的AI驱动热流体研究的开放多模态数据集和开源软件包,提出了时空维度框架及SeqReg等序列回归工具。
SPDM:基于流形约束的几何调制状态空间建模用于时间序列预测
SPDM 提出了一种几何感知的状态空间模型,该模型利用对称正定流形上的流形约束进行时间序列预测,在11个基准测试中取得了最先进的性能。
深度研究的交互式范式
SteER 是一个用于可引导深度研究的框架,通过自适应暂停决策和实时用户画像建模,在过程中引入可解释的控制,在对齐方面比基线高出 22.80%,并在超过 85% 的成对对齐判断中受到人类读者的青睐。
SEAM: Global consistency beyond local accuracy in scientific machine learning
SEAM is a generator-agnostic framework that audits global consistency of explanations in scientific machine learning, detecting incompatible local explanations even when predictions are locally accurate and attributing failures to specific channels and overlaps. The paper presents theory and experiments across PDE systems, neural operators, and four open datasets.