Geo-Strat-RL: 从可验证任务中学习地质事件推理
摘要
本文介绍了Geo-Strat-RL,一个使用可验证奖励强化学习(RLVR)来训练视觉语言模型从地层图和地震数据中推理地质事件历史的合成环境,展示了改进的重建和跨领域迁移能力。
arXiv:2606.25000v1 Announce Type: new
摘要:为了评估视觉语言模型能否推理地质历史,必须构建其底层过程历史已知的观测数据。此外,推理地质历史不仅仅是识别视觉模式的问题,还需要理解可能仅间接可见或高度模糊的时间和结构关系。当地面实况事件历史无法唯一识别或不可用时,如何训练具备视觉推理能力的模型产生既符合观测证据又符合地质原理的有效地质重建仍是一个开放挑战。因此,我们研究通过可验证奖励强化学习(RLVR)定义可验证的地质推理任务是否能够跨观测域改进地质事件重建。为此,我们提出了Geo-Strat-RL,这是一个合成环境,用于生成地层观测和紧凑的可见证据事件历史。该环境结合了地质生成器和一个可执行的验证器,该验证器对年代学、事件身份、沉积和结构关系进行评分。我们表明,RLVR改进了视觉语言模型(VLM)中的地质重建,提高了保留地层图上的地质内容得分。我们进一步在合成地震观测域中评估了相同的保留地质历史,方法是将生成的场景转换为声阻抗导出的振幅剖面。在这个受控的配对渲染器设置中,我们提供了证据表明,从地层图域RLVR训练中学到的地质推理能够迁移到合成地震表示中,而无需地震特定的训练示例,支持了RLVR可以在相关观测格式中教授可重用地质推理概念的假设。
查看缓存全文
缓存时间: 2026/06/25 05:10
# Geo-Strat-RL: 从可验证任务中学习地质事件推理
来源:https://arxiv.org/html/2606.25000
###### 摘要
要评估视觉语言模型能否推理地质历史,需要构建那些底层过程历史已知的观测数据。此外,对地质历史的推理不仅涉及识别视觉模式,还涉及理解时间与结构关系,这些关系可能仅间接可见或高度模糊。当地面真实事件历史无法唯一定义或不可用时,如何训练具备视觉推理能力的模型生成既符合观测证据又符合地质原理的有效地质重建,仍是一个开放挑战。因此,我们研究能否通过带可验证奖励的强化学习(RLVR)定义一个可验证的地质推理任务,从而改善跨观测域的地质事件重建。为此,我们提出 Geo-Strat-RL,一个合成环境,能够生成地层观测数据和紧凑的可见证据事件历史。该环境结合了一个地质生成器与一个可执行验证器,后者对年代顺序、事件身份、沉积和结构关系进行评分。我们证明,RLVR 改善了视觉语言模型(VLM)的地质重建能力,在留出的地层图上提高了地质内容评分。我们进一步在合成地震观测域中评估相同留出的地质历史,方法是将生成的场景转换为声阻抗衍生的振幅剖面。在这个受控的配对渲染器设置下,我们提出证据表明,从地层图域 RLVR 训练中学到的地质推理能够迁移到合成地震表示上,而无需地震专用的训练样本,支持了 RLVR 可以跨相关观测格式教授可重用地质推理概念的假设。
视觉语言模型,强化学习,合成基准,地质学,层序地层学
## 1 引言
机器学习在地球科学中有着悠久历史,涵盖遥感、地震解释、岩性分类、文档级知识提取等众多应用(Bergen et al.,2019 (https://arxiv.org/html/2606.25000#bib.bib25); Dramsch,2020 (https://arxiv.org/html/2606.25000#bib.bib26); Zhu et al.,2017 (https://arxiv.org/html/2606.25000#bib.bib27); Waldeland et al.,2018 (https://arxiv.org/html/2606.25000#bib.bib28); Wu et al.,2019 (https://arxiv.org/html/2606.25000#bib.bib29); Hall,2016 (https://arxiv.org/html/2606.25000#bib.bib30); Bressan et al.,2020 (https://arxiv.org/html/2606.25000#bib.bib31); Deng et al.,2023 (https://arxiv.org/html/2606.25000#bib.bib5); Lin et al.,2024 (https://arxiv.org/html/2606.25000#bib.bib6))。近期的基础模型将这一工作线从任务特定预测器扩展到语言和视觉语言系统,这些系统能够回答领域问题、遵循指令并综合科学背景。地质学专用语言模型如 K2 和 GeoGalactica 利用地质学语料库和指令数据改编通用大语言模型(LLM)(Deng et al.,2023 (https://arxiv.org/html/2606.25000#bib.bib5); Lin et al.,2024 (https://arxiv.org/html/2606.25000#bib.bib6)),而遥感 VLM 如 GeoChat 则展示了多模态指令遵循如何针对地理空间图像进行专业化(Kuckreja et al.,2024 (https://arxiv.org/html/2606.25000#bib.bib7))。这些系统表明,地质人工智能正从分类向推理迈进,但它们并未直接测试模型能否从静态图中重建潜在的地质历史。
受控的地质生成器提供了一种让这一问题变得可度量的方法。早期的生成模型工作使用神经网络表示多孔介质的分布并定义地质先验(Mosser et al.,2017 (https://arxiv.org/html/2606.25000#bib.bib32),2020 (https://arxiv.org/html/2606.25000#bib.bib33))。最近,对话系统展示了大型语言模型如何通过自然语言接口暴露数十年的勘探知识(Mosser et al.,2024 (https://arxiv.org/html/2606.25000#bib.bib34))。Geo-Strat-RL 遵循相同的实用模式:模型并非被要求抽象地描述地质,而是从受控观测中恢复已知的地质对象,并根据可核查的量进行评估。
地层剖面为这个问题提供了一个紧凑的场景。最终图像是静态的,但解释依赖于时间顺序、叠加关系、切割关系,以及沉积、变形、侵蚀和侵入之间的区别。这使得任务不同于物体识别或标题生成:模型必须推断一个过程历史,其步骤仅间接可见。通用 VLM(如 LLaVA 风格的模型)将视觉编码器连接到指令遵循语言模型(Liu et al.,2023 (https://arxiv.org/html/2606.25000#bib.bib8));最近的 Qwen-VL 模型提供了强大的开放多模态基线(Qwen Team,2025a (https://arxiv.org/html/2606.25000#bib.bib14))。Qwen3-VL 进一步强调更强的多模态推理和多层级视觉特征整合(Qwen Team,2025b (https://arxiv.org/html/2606.25000#bib.bib15))。然而,广泛的 VLM 基准很少单独检验模型是否学到了领域特定的时间规则,而不仅仅是表层描述。
因此,我们将地层解释视为一个 RLVR 问题。生成器提供图像和精确的事件历史,验证器将模型输出映射到分解的地质奖励,训练可以在没有人工偏好标签的情况下针对这一可执行反馈优化模型。这遵循了近期推理模型的工作,其中强化学习改善了答案可验证的任务(Shao et al.,2024 (https://arxiv.org/html/2606.25000#bib.bib12); DeepSeek-AI,2025 (https://arxiv.org/html/2606.25000#bib.bib13)),但我们将其应用于视觉地质事件重建。为了使该方法在开放 VLM 上实用,我们使用 Hugging Face Transformer Reinforcement Learning (TRL) 的 Group Relative Policy Optimization (GRPO) 实现训练低秩适配器(LoRA)(Hu et al.,2021 (https://arxiv.org/html/2606.25000#bib.bib11)),该实现支持自定义奖励函数和多模态 GRPO 训练(von Werra et al.,2020 (https://arxiv.org/html/2606.25000#bib.bib16); Hugging Face,2026 (https://arxiv.org/html/2606.25000#bib.bib17))。
本文研究当前 VLM 是否能够从合成剖面中推断地质事件历史,而无需依赖渲染的层名、箭头或其他视觉注释。目标并非产生最逼真的地质图或地震表示。相反,Geo-Strat-RL 将地质学用作一个紧凑、高歧义性的推理领域,在该领域中,可以在受控监督下研究 RLVR 跨地球科学领域泛化的能力:观测需要时间和结构推理,答案是可验证的,并且相同的潜在事件历史可以通过不同的表示域渲染。该基准故意狭窄:每个图像由受控模拟器生成,带有已知事件序列,每个模型响应根据紧凑的 JSON 目标进行评分。
参见图1 (https://arxiv.org/html/2606.25000#S1.F1):一个简单的配对留出场景,分别渲染为图观测和地震风格振幅观测。两个面板对应于相同的隐藏地质历史和紧凑目标。
### 贡献
- • 一个受控的地质生成器,能够生成地层观测和紧凑的可见证据事件历史。
- • 一个可执行验证器,将模型性能分解为格式、年代顺序、事件身份、沉积和结构属性组件。
- • 一个训练和评估流程,使用生成的样本和可验证奖励来改善开放 VLM 的地质重建。
- • 一个固定的无标签训练/验证/测试装备套件,附带分量置信区间,用于图和地震风格观测。
- • 配对图/地震风格实验,测试在一个观测域上训练的策略是否对相同潜在地质历史迁移到另一个观测域。
### 工件
仓库、数据集、模型和适配器链接收集在附录 E (https://arxiv.org/html/2606.25000#A5) 中。
## 2 方法论
### 2.1 任务定义
给定一个剖面图像 \(x\),模型必须生成一个紧凑的 JSON 对象 \(y\),包含一个时间顺序的事件序列。每个事件用一个简短的事件代码和属性表示:
\[
y = \{\texttt{"seq"}: [e_{1}, e_{2}, \ldots, e_{T}]\}.
\] (1)
相同的紧凑目标可以与隐藏场景的不同渲染配对;图1 (https://arxiv.org/html/2606.25000#S1.F1) 展示了一个在迁移设置中使用的简单图/地震风格对。目标年代顺序由模拟器直接生成,然后归一化到仅包含最终渲染图像中可见的证据,同时保留一个显式的初始基底单元作为固定惯例。紧凑模式支持五种事件代码:沉积 D、倾斜 T、断层 F、侵蚀或角度不整合 E、侵入 I。每个沉积事件命名基底或一个地层;沉积事件不分组。倾斜记录受影响的层和顺时针或逆时针方向。断层记录断层标识符和正断层或逆断层运动。侵蚀记录角度不整合面和可见的截断层或结构。侵入记录岩脉标识符、保留的起点和终点以及可见的切割层。对于端点位于地层柱内部的侵入,地层端点是根据生成的垂直端点元数据估算的,而非从渲染像素独立推断;因此这是一个受控的目标约定,而非关于人类图像挑选精度的声明。事件字母是刻意的接口选择,而非地质符号:固定短代码减少了完成长度,降低了截断风险,简化了确定性解析,并使验证器在不同模型系列间保持稳定。断层事件故意省略受影响的层列表,因为此类列表在最终静态图像中经过侵蚀和后期沉积后具有歧义;基准转而评分断层年代顺序、身份和正/逆断层感觉。
### 2.2 合成生成器
生成器首先采样一个年代顺序序列,然后渲染最终状态。它从一个显式的基底单元开始,沉积下部层包,可选地倾斜该包,添加与复杂度相关的有限断层和侵入,应用侵蚀或角度不整合,然后沉积较年轻的层。对于复杂度级别 4 和 5,如果侵蚀前未采样到侵入,则在程序后期保证一个侵入。随机化生成器使用 4–9 层,并在构建训练行时循环五个复杂度级别。岩性来自一个小型风格化集合。图颜色和纹理不是语义标识符:基底具有固定的诊断风格,而非基底沉积单元和侵入则接收种子确定性随机化风格,相邻单元之间具有对比度约束。
几何模型刻意像教科书一样。沉积创建具有有限可见厚度的多边形单元。倾斜围绕下部框架旋转现有层。断层使用断层局部坐标系中的有限位移场,具有沿断层衰减、跨断层衰减和窄核心过渡;受影响的层和现有侵入被分割和变形,而不仅仅是被断层线覆盖。侵蚀在倾斜的不整合面下方裁剪现有层和侵入,侵入在当前地层中插入一个不规则的岩脉多边形。构建后,场景垂直缩放到框架中,变形空隙被分配到基底暴露或最年轻可见层的向上延拓,最终输入图像渲染时不包含层名、箭头或事件标记。事件词汇遵循标准的层序地层和构造地质概念,但渲染器刻意是示意性的,而非物理正演模型(Catuneanu,2006 (https://arxiv.org/html/2606.25000#bib.bib21); Allan,1989 (https://arxiv.org/html/2606.25000#bib.bib24))。
这些假设刻意具有限制性。图基准不模拟沉积分异不确定性、模糊的露头暴露或多个有效的地质解释。相反,它提供了一个受控的过程历史任务,其中模拟器定义了单个答案键,并且失败可以归因于视觉识别、年代顺序排列或模式合规性。
参见图2 (https://arxiv.org/html/2606.25000#S2.F2):生成种子 20001 的构建流程。训练和评估图像仅包含最终剖面,但模拟器通过已知的年代顺序事件序列构建场景。
参见图3 (https://arxiv.org/html/2606.25000#S2.F3):生成种子 20001 的放大标注最终剖面。此面板仅供读者审核;基准图像不包含标签或箭头。
紧凑目标示例。对于图2 (https://arxiv.org/html/2606.25000#S2.F2) 中的构建流程,可见证据目标是:
`Target JSON`
### 2.3 地震风格迁移渲染器
为了测试图域 RLVR 是否学到了能在受控观测域偏移中幸存的地质推理,我们为相同的隐藏场景添加一个地震风格渲染器。该渲染器仅改变观测数据域,而不改变采样的地质历史或紧凑 JSON 目标。对于每个种子,配对的图和地震风格观测因此具有相同的事件序列和相同的可见证据答案键。图观测是一个彩色示意剖面,而地震风格观测是一个合成声学振幅剖面,表示为 VLM 输入的图像;图1显示了一个最小的配对示例。渲染器首先在最终场景上光栅化三个声学属性场:P 波速度 \(v_p\)、密度 \(\rho\) 和声阻抗 \(Z = \rho v_p\)。沉积单元接收确定性的声阻抗,从一层到下一层按固定最小步长增加,仅带有小的岩性相关扰动。这使得每个沉积接触面产生可见的反射系数,包括视觉相似或局部相邻单元之间的接触。断层、不整合面和侵入通过图渲染器使用的相同最终变形几何体进入;侵入体接收高阻抗体,但其内部振幅被平滑,因此任务线索是侵入体及其切割关系,而非点衍射伪影。速度模型随后用于一个简单的二维声学有限差分计算。我们在填充模型上方放置一排地表炮点和检波点,注入一个 Ricker 子波,使用吸收边界海绵传播压力波,切除直达波,并记录合成炮集。炮集使用轻量级 Kirchhoff 风格成像条件映射回深度,该成像条件使用炮-像-接收旅行时和照明归一化。最终显示的地震风格图像将该深度图像与阻抗-c相似文章
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
学习构建环境:通过可验证环境合成实现自我进化推理强化学习
本文提出EvoEnv,一种让语言模型通过强化学习构建可验证的Python环境以实现自我改进的方法,在Qwen3-4B-Thinking上取得了3.3%的相对提升。
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。