可扩展且可信的地球观测基础模型
摘要
本章回顾了地球观测基础模型的设计原则和当前格局,强调了领域特定适应、物理上合理的表示以及一致评估基准的必要性。包含关于有害藻华预测和自适应监测站点选择的案例研究。
arXiv:2607.07758v1 公告类型:新
摘要:基础模型(FMs)已将机器学习从孤立的特定任务模型开发转变为在广泛数据上预训练并适应多个下游任务的通用模型。地球观测(EO)是该范式的一个重要领域,因为卫星和机载档案数据量大、重访率高且日益多模态,而可靠的现场标签通常稀疏。遥感基础模型(RSFMs)若缺乏领域特定适应,则无法可靠/最优地迁移。这是因为EO数据受测量物理和操作决策约束。本章回顾了这些领域特定约束所产生的设计原则。首先定义了遥感(RS)中的FMs范式,然后综合了当前模型格局、预训练目标、架构设计、下游适应和可信性要求。本章还纳入了最近的基准证据,表明没有任何单一地理空间基础模型普遍最优,且不一致的评估仍是公平比较和可靠部署的主要问题。此外,两个简短的环境监测案例研究:基于物理信息的频谱定向掩码用于有害藻华预测,以及强化学习用于自适应环境监测站点选择,以说明FMs领域引导原则的实际应用。本章提出,下一代RSFMs不仅应通过基准精度评估,还应通过模态感知迁移和物理上合理的表示来评估,以支持可信的EO决策。
查看缓存全文
缓存时间: 2026/07/10 06:14
# 可扩展且可信赖的地球观测基础模型 来源:https://arxiv.org/html/2607.07758 Syed Usama Imtiaz¹, Mitra Nasr Azadani¹, and Nasrin Alamdari¹ ¹佛罗里达州立大学土木与环境工程系 通讯作者:[email protected] **摘要**。基础模型(FMs)已将机器学习从孤立的特定任务模型开发,转变为在广泛数据上预训练并可适应多种下游任务的通用模型。地球观测(EO)是该范式的重要领域,因为卫星和航空影像档案库规模庞大、重访频率高且日益呈现多模态特征,而可靠的现场标签通常稀缺。遥感基础模型(RSFMs)若无领域特定适配,则无法可靠/最优地迁移。这是因为EO数据受测量物理学和操作决策约束的支配。本章回顾了这些领域特定约束所产生的设计原则。首先定义了遥感(RS)中的FMs范式,然后综合了当前模型格局、预训练目标、架构设计、下游适配和可信赖性要求。本章还纳入了最新的基准测试证据,表明没有任何单一地理空间基础模型是普遍最优的,且不一致的评估仍然是公平比较和可靠部署的主要问题。此外,通过两个简短的环境监测案例研究——物理引导的光谱特定掩码用于有害藻华预测,以及强化学习用于自适应环境监测站点选择——来实践说明FMs的领域引导原则。本章认为,下一代RSFMs不仅应通过基准准确率进行评估,还应通过模态感知迁移和物理上合理的表示来实现可信赖的EO决策。 **关键词**:遥感基础模型;地球观测;自监督学习;高光谱影像;多模态融合;可信赖AI。 ## 1 引言 **基础模型**(FMs)是一种在广泛数据上训练的模型,通常通过大规模自监督学习(SSL)或弱监督学习进行,可适应多种下游任务[3 (https://arxiv.org/html/2607.07758#bib.bib1)]。这一概念之所以重要,是因为它改变了机器学习模型开发的传统工作流程。在监督学习中,模型是针对已定义标签进行训练的,因此需要特定任务的标注数据和特定任务的训练或适配;而SSL首先从大量无标签数据档案中学习通用的可迁移表示,然后通过线性探测、提示、全微调或参数高效微调等方法适配该表示。这对遥感(RS)极为有利,因为地球观测(EO)档案库规模庞大、时空频率高且全球分布,而专家标签和现场测量成本高昂(延迟、采样不均匀,且通常与特定实地活动挂钩)。RSFMs现在包括用于影像和时间序列的视觉FMs、用于检索和视觉问答的视觉-语言模型、用于合成和填补空白的生成模型、用于光学-雷达-高程融合的多模态系统、用于地理空间推理的大型语言模型接口,以及新兴的负责任AI研究用于EO[52 (https://arxiv.org/html/2607.07758#bib.bib3)]。这种模态的广度使得该领域前景广阔;然而,这也带来了RSFMs被简单地定义为普通视觉模型更大版本的风险。这种定义在概念上是不完整的,因为卫星数据构成了一种独特的机器学习模态和数据:它们具有地理参考、依赖传感器、经过物理测量,并为操作上具有重要影响的决策提供依据[38 (https://arxiv.org/html/2607.07758#bib.bib2)]。 因此,本章围绕EO本身的属性来阐述RSFMs的设计和评估。这些相关属性包括传感器模态、光谱波段结构、空间分辨率、重访周期、大气校正、观测几何、地理位置、物理过程背景以及部署不确定性。例如,一个在RGB网络图像上预训练的模型可能学习到有用的纹理或物体形状,但它无法捕捉水色反射率、地形阴影或传感器重处理。本章的核心目标是将模型架构、预训练数据、适配协议和评估设计与目标EO问题相匹配。为进一步说明这一点,本章包含了两个环境监测示例,因为它们揭示了RSFMs设计的实际后果:标签稀缺、间接目标、产品版本依赖性、不确定性以及预算约束下的决策。这些示例在科学上强化了RSFMs,使其能够学习适用于依赖传感器物理和操作约束的下游任务的表示。 ## 2 关键定义 在讨论RSFMs之前,有几个术语很有用。**模态**是指由传感器和物理传感原理产生的一种测量类型,例如光学RGB影像、多光谱影像、高光谱影像、合成孔径雷达(SAR)、热红外影像、激光雷达点云或数字表面模型。**空间分辨率**是一个像素或测量所代表的地面区域。**光谱分辨率**描述了传感器对波长的采样精细程度。**时间分辨率**描述了观测的重访频率和时机。**地理位置**将每个观测与地球坐标联系起来。这些属性并非后期的元数据,它们决定了数据中存在何种信息以及哪些模型假设是有效的。 ## 3 遥感数据需要专门的基础模型 RS有别于传统的计算机视觉;它并非自然图像模型在更大规模上的应用。虽然自然图像通常记录从人类视角反射的可见光,但RS观测捕捉的是多种物理现象(例如,地表反射率、微波后向散射、发射热辐射、冠层高度、水色或高程),这些现象通过多种平台(即卫星、航空和地面)获取。这些数据在其底层物理单位、噪声分布、空间支持域和时间采样方案上差异显著。此外,模态多样性、空间和光谱分辨率、时间动态以及来自自然图像的领域差异是EO FMs的核心挑战[52 (https://arxiv.org/html/2607.07758#bib.bib3)]。 EO与自然图像视觉在至少五个方面存在差异。首先,它是**多模态**的。光学数据测量反射的太阳辐射,SAR主动用微波照射地表,激光雷达记录三维结构,热传感器测量发射的辐射。其次,EO是**多分辨率**的。高分辨率航空像素可能代表屋顶的一部分,而水色像素可能聚合一个广阔的水域区域。第三,EO是**光谱丰富**的。高光谱传感器测量窄的连续波段,相邻波长可能包含物理上可解释的吸收或散射特征。第四,EO是**时间性**的。作物生长、洪水涨落、森林燃烧与恢复、藻华加剧与迁移。第五,EO是**地理参考**的。位置有助于上下文推理,但它也可能编码地理偏差或实现隐私敏感的推理。这些差异需要专门的RSFMs设计。随机图像裁剪会去除地理空间上下文。仅RGB预训练会丢弃非可见波段,时间混洗会抹去物候或干扰信号。在一个传感器上训练的基础模型,如果波长、分辨率或大气校正发生变化,可能无法迁移到另一个传感器。因此,面向EO的RSFMs越来越多地包含波长编码、地面采样距离编码、时间和位置嵌入、传感器特定补丁嵌入、多模态融合模块以及物理上有意义的评估划分。 见图注图1:开发可信赖地球观测基础模型(FMs)的概念工作流程。a. 地球观测(EO)数据来自异构平台和传感器,包括卫星、航空和辅助观测系统,产生多传感器光学和合成孔径雷达(SAR)影像档案。数据整理和接口层将影像、元数据和衍生产品协调为分析就绪的输入。关键设计原则包括传感器感知、元数据感知、物理一致性、不确定性量化,以及跨传感器、区域和下游任务的可复现性和可迁移性。b. FMs开发包括大规模预训练目标,如掩码图像建模、监督多任务学习、对比学习和视觉生成学习。这些目标产生丰富且可互操作的表示,捕捉EO数据中的光谱、空间、时间和多模态结构。通过线性探测、时空感知评估划分、不确定性量化和泛化测试,支持可信赖的适配和部署。 ## 4 EO任务格局 RSFMs在广泛的下游任务光谱中进行评估,每个任务对学习到的潜在表示的不同维度提出挑战。例如,场景分类要求模型为离散图像块分配一个单一的类别标签,包括住宅、森林、机场或农田等类别。语义分割为每个组成像素分配一个主题类别,因此严格评估空间准确性、边界定义和多尺度上下文理解。目标检测定位包括建筑物、车辆、飞机、船舶或其他离散目标在内的特征,通常目标尺度和空间方向差异显著。此外,变化检测系统地比较多时相观测,并评估架构能否成功区分真实地表变化与混淆的照明或传感器引起的差异。视觉问答、字幕生成和短语定位整合了自然语言处理,要求视觉证据与人类文本查询之间精确的语义对齐[52 (https://arxiv.org/html/2607.07758#bib.bib3),25 (https://arxiv.org/html/2607.07758#bib.bib19)]。 环境监测引入了一个完全不同的任务类别,这在传统计算机视觉基准中不太突出。它是连续的生物物理参数反演和操作决策支持。一些相关示例包括量化叶绿素含量、生物量体积、淹没深度、土壤湿度、作物产量、毒素浓度、水温或与营养物相关的生态风险。这些任务本质上被构建为连续回归或时间预测问题,而非离散分类范式。除了这些固有复杂性外,它们通常还受限于稀疏的现场测量以及监管或科学阈值。第一个最清晰的例子是有害藻华(HAB)检测模型,模型的评估可能不仅仅依据均方根误差(RMSE),而是依据其在识别超过行政管理阈值的关键异常方面的统计敏感性,以防止人类暴露。其次,一个操作性的洪水测绘模型可能根据其可靠支持可操作的道路封闭或紧急疏散决策的能力进行验证。类似地,农业作物模型要求稳健的跨年和跨区域分布外有效性,而非在独立同分布(i.i.d.)随机采样像素上的高表现,后者可能因空间自相关而高估准确性。 下游任务的这种结构性差异直接推动了当前基准测试倡议所倡导的框架,将评估指标转向聚焦于隔离特定能力概况,而非识别一个全局优越的架构。这种方法要求根据精确的领域需求(例如,高分辨率空间推理、多光谱和时间动态、SAR鲁棒性、跨模态融合、预测、语言基础或标签稀缺回归)来测试目标[41 (https://arxiv.org/html/2607.07758#bib.bib24)]。一个主要在高空间分辨率RGB影像上预训练的架构可能在目标检测中表现出色,但在高光谱水质反演中可能欠佳。相反,一个在多光谱时间序列上优化的模型可能在作物分类上表现出色,但在生成性航空影像字幕生成上可能不太合适。因此,下游任务是一个关键的概念桥梁,将模型架构设计与实证评估联系起来。因此,RSFMs的工作流程(即自监督预训练目标、架构选择和下游适配策略)需要仔细选择以与下游任务对齐。 为进一步阐述这一点,特定任务评估明确分解并提供了给定框架所声称的泛化能力的精确形式。例如,作物分类的交叉验证评估根据年份和地区而变化。这是因为环境物候和农业管理实践在空间和时间上有所变化。视觉-语言架构需要空间基础准确性和对错误地理细节的系统性抵抗。这些分析性区分防止了RSFMs被当作一个同质模型来处理。一个选择性的RSFMs评估不需要详尽列举每个基准数据集的结果,但它必须严格阐明给定模型是否对下游任务(例如,感知、检索、预测、物理回归或决策支持)显示出效用。表1 (https://arxiv.org/html/2607.07758#S4.T1)总结了代表性的RSFMs和基准工作,重点关注改进科学迁移和评估解释的设计选择。 - •掩码和光谱预训练策略包括SatMAE、Scale-MAE、CROMA和SpectralGPT[5 (https://arxiv.org/html/2607.07758#bib.bib6),37 (https://arxiv.org/html/2607.07758#bib.bib7),8 (https://arxiv.org/html/2607.07758#bib.bib8),17 (https://arxiv.org/html/2607.07758#bib.bib9)] - •多模态或任意传感器策略包括DOFA、AnySat、Copernicus-FMs、Prithvi-EO-2.0、Galileo、TerraMind、SkySense V2和AlphaEarth[54 (https://arxiv.org/html/2607.07758#bib.bib11),1 (https://arxiv.org/html/2607.07758#bib.bib12),50 (https://arxiv.org/html/2607.07758#bib.bib13),45 (https://arxiv.org/html/2607.07758#bib.bib14),46 (https://arxiv.org/html/2607.07758#bib.bib15),21 (https://arxiv.org/html/2607.07758#bib.bib16),56 (https://arxiv.org/html/2607.07758#bib.bib17),4 (https://arxiv.org/html/2607.07758#bib.bib18)] - •视觉-语言、基准和审计工作包括RemoteCLIP、RS5M/GeoRSCLIP、VRSBench、EarthGPT、GeoLangBind、PANGAEA、GEO-Bench-2、MMEarth-Bench[26 (https://arxiv.org/html/2607.07758#bib.bib10),57 (https://arxiv.org/html/2607.07758#bib.bib20),25 (https://arxiv.org/html/2607.07758#bib.bib19),55 (https://arxiv.org/html/2607.07758#bib.bib21),53 (https://arxiv.org/html/2607.07758#bib.bib22),27 (https://arxiv.org/html/2607.07758#bib.bib23),41 (https://arxiv.org/html/2607.07758#bib.bib24),13 (https://arxiv.org/html/2607.07758#bi
相似文章
TESSERA v2:扩展像素级地球基础模型
该论文介绍了迄今为止最大的地球观测基础模型可控扩展研究,展示了预训练损失对下游性能的预测能力较差,并提供了最优计算资源分配规则。它训练了扩展的像素级模型(0.5B和1B参数),并将其蒸馏为紧凑的学生模型,这些模型优于更大的开源和专有模型。
无人知晓地理空间基础模型的最新进展
本文对152篇关于地理空间基础模型的论文进行了审查,发现严重缺乏标准化,导致无法确定最先进水平。作者提出了六项具体期望,以提高可重复性和可比性。
地理空间基础模型的新兴范式:从预训练到智能体推理
本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。
评估基础模型在时间序列预测中的运行可行性
本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。
LakeFM:面向水生生态系统的基础模型,使用不规则多变量多深度时间序列数据
LakeFM 是一个面向水生系统的基础模型,在大规模生态数据集上预训练,利用不规则多变量多深度时间序列数据预测湖泊动态,与现有模型相比取得了有竞争力的性能。