LithoFormer:基于Transformers的稳健地层推断框架

arXiv cs.LG 论文

摘要

LithoFormer是一个基于Seq2Seq Transformer的框架,用于从测井数据中进行地层推断。它采用PatchTST主干网络,结合旋转位置编码和多任务头,共同预测地质分带和边界,实现了边界误差降低90%,并消除了地层顺序违反。

arXiv:2607.22804v1 公告类型:新 摘要:准确的测井数据地下储层地质表征对于支持碳捕集与封存(CCS)、地热开发以及自然资源开采等项目至关重要。现有的自动化地质表征技术主要采用滑动窗口分类,这限制了其理解更广泛地质背景的能力,常常导致地层错位。为克服这些限制,我们引入了LithoFormer——一个稳健的地层推断框架,使用Seq2Seq Transformer模型,一次性输入整个多变量测井数据。该框架采用通道独立的PatchTST主干网络,并增强以旋转位置编码(RoPE),以捕捉整个多变量测井数据中的长程地质依赖关系。采用解耦的多任务头来共同预测地质分带和精确的边界概率,同时使用地质信息损失函数强制执行物理约束,如叠加定律。在三个真实数据集上验证和部署后,与传统的滑动窗口基线相比,LithoFormer将中位边界误差降低了90%,并消除了地层顺序违反。它还实现了80%的人工专家工作量减少,消除了地层不一致性,为大规模地下建模提供了可扩展且可靠的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:22

# LithoFormer:一种基于 Transformer 的地层层序推断稳健框架
来源:https://arxiv.org/html/2607.22804

Shwetha Salimath
Laboratoire Interdisciplinaire des Sciences du Numérique, Université Paris\-Saclay, SLB
Montpellier France
shwetha\.salimath@universite\-paris\-saclay\.fr (https://arxiv.org/html/2607.22804v1/mailto:[email protected])

Francesca Bugiotti
Laboratoire Interdisciplinaire des Sciences du Numérique, CentraleSupélec, CNRS, Université Paris\-Saclay
Gif\-sur\-Yvette France
francesca\.bugiotti@centralesupelec\.fr (https://arxiv.org/html/2607.22804v1/mailto:[email protected])

Sylvain Wlodarczyk
SLB
Montpellier France
swlodarczyk@slb\.com (https://arxiv.org/html/2607.22804v1/mailto:[email protected])

以及
Sohaib Ouzineb
SLB
Montpellier France
souzineb@slb\.com (https://arxiv.org/html/2607.22804v1/mailto:[email protected])

###### 摘要

从测井数据中对地下储层进行准确的地质表征对于支持碳捕集与封存 (CCS)、地热开发以及自然资源开采等项目至关重要。现有的自动化地质表征技术主要采用滑动窗口分类,这限制了它们理解更广泛地质背景的能力,常常导致地层错位。为克服这些局限,我们提出了 LithoFormer,这是一种使用 Seq2Seq Transformer 模型的稳健地层层序推断框架,该模型可一次性处理整个多变量测井数据。该框架利用一个基于通道独立的 PatchTST 骨干网络,并增强以旋转位置编码 (RoPE),从而捕获整个多变量测井数据中的长程地质依赖关系。采用解耦的多任务头来联合预测地质分带和精确边界概率,同时,一种地质信息损失函数强制执行如叠加律等物理约束。在三个真实世界数据集上进行验证和部署后,LithoFormer 的中位边界误差减少了 90%,并消除了与传统的滑动窗口基线方法相比的地层顺序违规。它还将人工专家工作量减少了 80%,并消除了地层不一致性,为大尺度地下建模提供了一种可扩展且可靠的解决方案。

时间序列分割,Transformer,物理信息机器学习,地下表征,多任务学习。

††ccs: 计算方法 监督学习
††ccs: 应用计算 地球与大气科学
††ccs: 计算方法 神经网络

## 1. 引言

地层图的绘制对于需要地下表征的能源项目至关重要,因为它决定了资源储存能力和地质安全性。精确的地下结构三维模型对于识别用于碳封存、地热层以及传统石油储层的孔隙储层至关重要。这种建模涉及重建数百万年来的地质过程,主要依赖于井间对比,即在已钻井之间对齐地层边界或“标志层”(Tsuji and Matsuoka,2014 (https://arxiv.org/html/2607.22804#bib.bib10); Alam and Mohamad\-Hussein,2023 (https://arxiv.org/html/2607.22804#bib.bib11))。测井分析有助于精确定位这些标志层 (Darling,2005 (https://arxiv.org/html/2607.22804#bib.bib3); Ellis and Singer,2007 (https://arxiv.org/html/2607.22804#bib.bib4)),提供地震数据常常遗漏的连续、高分辨率地下层记录。传统上,利用测井数据进行井间对比是一种手动过程,地质学家目视匹配测井数据(如伽马射线、电阻率和密度测量)中的模式 (Mann and Dowell Jr,1978 (https://arxiv.org/html/2607.22804#bib.bib19))。这种方法缺乏可扩展性。地质学家和我们的研究都证实,某一区域内的特定标志层通常表现出一致的信号模式 (Rider,1990 (https://arxiv.org/html/2607.22804#bib.bib7); Abdel Azim and Aljehani,2022 (https://arxiv.org/html/2607.22804#bib.bib8))。早期的计算匹配测井模式方法,如动态时间规整 (DTW) (Müller,2007 (https://arxiv.org/html/2607.22804#bib.bib18)),提供了一定程度的自动化,但通常脆弱、对噪声敏感,并且难以推广到地质多样化的区域。这导致了将任务视为滑动窗口分类问题的深度学习模型的发展。然而,滑动窗口范式本质上受限于局部感受野。这些模型缺乏全局上下文;滑动窗口具有“短视”视角,无法看到完整的地质序列。它们无法区分有效的标志层模式和出现在错误位置的视觉相似伪影,也无法强制执行地质层是顺序沉积的基本物理定律。

图1. 工作流程对比。滑动窗口方法(左)需要对每口井进行 LL 次局部分类,而 LithoFormer(右)则一次性处理整个测井数据,生成完整的地层图。M1、M2、M3 和 M4 是表示地层序列的标志层。

为了解决这些挑战,我们提出将方法从局部分类任务转变为全局端到端的 Seq2Seq 任务。我们引入了 LithoFormer,其核心贡献在于能够从长序列的多变量时间序列数据中预测事件的顺序。如图 1 (https://arxiv.org/html/2607.22804#S1.F1) 所示,该方法利用 Transformer 的能力同时学习局部模式和匹配有效地层顺序的全局趋势。通过一次性处理测井数据,LithoFormer 确保每个预测的标志层都放置在其正确的全局上下文中,从而保持地质解释的时间顺序完整性。本文的贡献如下:

- • **LithoFormer 框架**:用于识别复杂多变量时间序列数据中精确有序事件序列。
- • **稳健的数据中心流水线**:采用重采样、滤波和约束数据增强,帮助模型区分真实标志层与脱离上下文的模式。
- • **多任务 Transformer 架构**:使用通道独立的 PatchTST Transformer (Nie and H\. Nguyen,2023 (https://arxiv.org/html/2607.22804#bib.bib29)),增强以 RoPE (Su et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib36)) 和解耦的多任务头。双头联合学习粗粒度的分带(地质层段区间)和精确的边界(区间边界)。
- • **地质信息损失函数**:强制执行地层顺序(叠加律),同时采用厚度加权损失使模型能够准确检测极薄或稀有层。
- • **真实世界验证**:我们在来自科罗拉多州、怀俄明州和挪威北海的三个数据集上进行部署和测试。LithoFormer 在实现地质一致性的同时达到了最先进的精度。这为地下储层表征提供了一种可扩展且物理一致性的解决方案。

本文结构如下。第 2 节 (https://arxiv.org/html/2607.22804#S2) 回顾相关工作。第 3 节 (https://arxiv.org/html/2607.22804#S3) 详述我们的方法论,包括新颖的 LithoFormer 模型架构、数据增强流水线以及多阶段训练课程。第 4 节 (https://arxiv.org/html/2607.22804#S4) 报告我们的综合实验结果和消融分析,并在第 5 节 (https://arxiv.org/html/2607.22804#S5) 进行总结。

## 2. 相关工作

我们的工作涉及三个关键研究领域:自动化地质对比、深度学习时间序列分析以及物理信息机器学习。我们回顾了测井对比的演变,并讨论了支持我们方法的时间序列 Transformer 的进展。

**自动化测井对比** 在地层分析中至关重要。最初的方法侧重于通过信号处理实现自动化,使用互相关、统计方法和基于特征的匹配 (Dashtian and Jafari,2011 (https://arxiv.org/html/2607.22804#bib.bib21))。像 DTW 这样的技术被用于通过最优非线性扭曲来对齐测井序列 (Lineman et al\.,1987 (https://arxiv.org/html/2607.22804#bib.bib20))。然而,DTW 由于其计算需求和对噪声的敏感性,在多井和多变量对比方面存在困难。最近的方法已集成机器学习技术以实现更好的对比。循环神经网络 (RNN) 和卷积神经网络 (CNN),包括像 LSTM\-CNN 和 LSTM\-2dCNN 这样的混合模型,已被成功用于将测井数据处理为多变量时间序列并识别标志层特征 (Brazell et al\.,2019 (https://arxiv.org/html/2607.22804#bib.bib23); Imamverdiyev and Sukhostat,2019 (https://arxiv.org/html/2607.22804#bib.bib24); Salimath et al\.,2025 (https://arxiv.org/html/2607.22804#bib.bib25))。尽管如此,在管理长程依赖关系和捕获井的全局上下文方面仍然存在挑战,而这些问题正是 Transformer 架构旨在解决的。

**时间序列分析的 Transformer**。Transformer 架构 (Vaswani et al\.,2017 (https://arxiv.org/html/2607.22804#bib.bib26)) 已被改编用于时间序列任务,特别是通过像 Informer 和 Autoformer 这样的模型 (Zhou et al\.,2021 (https://arxiv.org/html/2607.22804#bib.bib27); Wu et al\.,2021 (https://arxiv.org/html/2607.22804#bib.bib28)),它们专注于长程预测。然而,这些模型将时间序列视为单个时间步的序列,导致计算成本高昂。该领域的一个进步是 PatchTST (Nie and H\. Nguyen,2023 (https://arxiv.org/html/2607.22804#bib.bib29)),我们的架构骨干,它将时间序列分割成用作令牌的补丁。这种方法减少了序列长度,捕获了局部语义,并改善了从更长上下文中的学习。它在分类 (Wang et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib31)) 和预测基准 (Huang et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib32); Goswami et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib33)) 上取得了最先进的性能。Transformer 需要位置信息来有效建模序列依赖关系 (Kim et al\., (https://arxiv.org/html/2607.22804#bib.bib37); Dufter et al\.,2022 (https://arxiv.org/html/2607.22804#bib.bib34))。早期方法采用绝对正弦位置嵌入,在处理较长序列时存在困难。RoPE 通过在注意力机制中表示相对位置来改进这一点,增强了平移不变性和泛化能力 (Su et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib36))。RoPE 在像 LLaMA 和 Gpt\-oss 这样的大型语言模型中表现出了卓越的性能 (Touvron et al\.,2023 (https://arxiv.org/html/2607.22804#bib.bib41); OpenAI et al\.,2025 (https://arxiv.org/html/2607.22804#bib.bib43))。

**物理信息和约束深度学习**。科学机器学习的一个重要方向是直接将领域知识和物理原理纳入学习过程 (Cuomo and Vincenzo Schiano di Cola,2022 (https://arxiv.org/html/2607.22804#bib.bib44); Farea et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib45))。虽然最初是为了解决物理问题而引入的,但它也成功地应用于金融和自主系统中的公平性和安全性 (Sivaraman and Golnoosh Farnadi,2020 (https://arxiv.org/html/2607.22804#bib.bib47); Hounie et al\.,2024 (https://arxiv.org/html/2607.22804#bib.bib48))。遵循这一思路,我们的方法引入了一个损失项,强制执行地质叠加律,引导优化向着地质一致的地层序列进行。

## 3. LithoFormer 框架

本节详细描述 LithoFormer 框架。我们首先解释问题形式化,然后详细描述数据中心流水线、多任务架构和地质信息训练课程。完整的端到端工作流,包括训练和推理,如图 2 (https://arxiv.org/html/2607.22804#S3.F2) 所示。

图 2. 端到端 LithoFormer 框架。

### 3.1. 问题形式化

地层层序推断被形式化为从多变量测井数据 X ∈ R^L×C 到一个有序的地质区域序列 y ∈ {0,...,K}^L 以及相应的标志层深度 d ∈ R^K 的映射。这里,L 表示深度样本数量,C 表示测井通道数量。这些通道对应于物理性质的测井数据,如伽马射线、电阻率和密度。K 是标志层数量。区域索引 {0,...,K} 对应于按预期地层顺序排序的标志层。索引“0”表示第一个标志层之前的区域。给定测井数据 X,LithoFormer 被训练来同时预测两个输出:
1. (1) 分带概率 P̂_zone: 一组概率曲线 P̂_zone ∈ [0,1]^(L×(K+1)),指示每个深度处地质区域出现的概率。
2. (2) 边界概率 P̂_edge: 一组概率曲线,P̂_edge ∈ [0,1]^(L×K),指示每个深度处标志层出现的概率。
从 P̂_zone 派生出一个全局一致的区域序列 ŷ_zone ∈ {0,...,K}^L,以建立地层顺序。同时,通过识别 P̂_edge 中的峰值概率来计算精确的标志层深度 d̂_edge ∈ R^K。使用这种符号,本文中描述的基本地质约束可以表述为:
- • 单调解层顺序:对于任意两个深度索引 i < j,我们有 ŷ_zone[i] ≤ ŷ_zone[j]。
- • 唯一且有序的边界:标志层深度满足 d̂_edge[1] < d̂_edge[2] < ... < d̂_edge[K]。

### 3.2. 数据中心流水线

我们的方法严重依赖于高质量、上下文连贯的数据。我们专门的数据流水线旨在确保 LithoFormer 学习到地质上有意义的模式。它包含三个主要阶段:深度域重采样、信号平滑滤波和领域知情的随机数据增强。

**深度域重采样**。测井数据通常以不均匀的深度间隔采集。为了处理这个问题,所有测井数据都被重采样到一个标准化的恒定间隔。在我们的所有实验中,使用五次样条插值将采样率设置为 0.1 米。

**信号去噪**。为了减少噪声同时保留关键的尖锐边界,我们在重采样后应用 Savitzky\-Golay 滤波器。窗口长度和多项式阶数会针对每条测井曲线进行适应性调整,以匹配其特定的信号特征。

**领域知情的约束数据增强**。为了泛化到未见过的测井数据并防止记忆化,我们提出了一种约束数据增强策略,该策略尊重地质过程的因果关系。该策略在呈现测井数据的变体的同时,保持其基本的结构。增强技术包括:对数域 Gamma 校正、裁剪和填充深度位移,以及高斯噪声添加。标志层顺序和相对位置被严格保持不变,以确保物理一致性。

### 3.3. 模型架构

我们模型的骨干基于 PatchTST 架构,并进行了修改以实现多变量时间序列分割和地层层序推断。如图 3 所示,架构由三个主要组件组成:一个多变量补丁嵌入,一种利用旋转位置编码 (RoPE) 的自注意力机制,以及一个解耦的多任务头,其分支用于分带和边界预测。

图 3. 骨干模型架构:多变量补丁嵌入、RoPE 增强的 Transformer 编码层以及解耦的多任务头。

**多变量补丁嵌入**。核心思想是将单变量时间序列分割成重叠的补丁,这些补丁充当变换器的输入令牌。这对于捕获局部语义和为我们的多任务头提供计算效率至关重要。对于具有 C 个通道的测井数据 X,我们首先独立地对每个通道进行补丁化。给定补丁长度 P 和步幅 S,每个通道产生长度为 N 的补丁序列,其中 N 是补丁数量。实践中,我们设置补丁长度 P=16,步幅 S=8,L0=10000 个测量点,导致 N≈1249 个补丁。然后,通过一个通道特定的线性投影层将每个补丁投影到一个维度为 D(我们的模型中使用 D=128)的特征向量。这种通道独立补丁化保留了每个测井曲线特有的局部信号模式。这一步骤的输出是一个形状为 (C, N, D) 的张量,该张量被传递给 Transformer 编码层。

**Transformer 编码器与旋转位置编码**。我们在 Transformer 编码层中使用旋转位置编码 (RoPE) 而不是绝对位置编码。RoPE 的核心优势在于它通过旋转矩阵隐式地在自注意力计算中编码相对位置信息。对于位置索引 m 和 n 处的两个令牌,注意力分数的计算方式如同它们之间的相对距离 (m−n) 被直接编码,这使得模型对输入序列的长度变化具有固有的鲁棒性,并能更好地外推到更长的序列。我们将此归因于旋转位置编码通过绝对旋转向量和软注意力之间的谐波交互,自然地优先考虑最近的令牌,从而在不增加上下文窗口的情况下促进细粒度局部上下文的建模。

**解耦多任务输出头**。骨干的最终隐藏状态 H ∈ R^(C×N×D) 然后被重塑并投影以产生双输出。分带头通过一个线性层将 H 映射到 (L×(K+1)) 维度,然后应用 softmax 激活函数。边界头使用一个更浅的子网络,由线性层和 sigmoid 激活函数组成,以处理 K 个标志层类别。每个标志层边界头是一个独立的前馈网络,具有不同的参数集。这种解耦设计使模型能够专门化,允许分带头学习区域级的模式,同时边界头专注于精细尺度的过渡。

### 3.4. 训练目标

训练目标包括一个多任务损失 ℒ_Multi,它结合了一个用于分带预测的交叉熵损失 ℒ_Zones 和一个用于边界预测的焦点损失 ℒ_Edge。我们提出的地层损失 ℒ_Strat 作为正则化项被添加。总损失 ℒ_Total 如公式所示:

ℒ_Total = ℒ_Zones + λ1ℒ_Edge + λ2ℒ_Strat,其中 λ1=10 且 λ2=1。

**分带损失 ℒ_Zones**。这是一个标准的交叉熵损失,应用于整个 P̂_zone 输出,其真实标签是通过插值地面真实标志层深度获得的。

**边界焦点损失 ℒ_Edge**。由于标志层(边界)相对于背景数量来说是稀少的,我们采用焦点损失来应对显著的类别不平衡。给出每个深度索引 i 和每个标志层类别 k 的地面真实二元标签 y_edge,i,k(如果该深度是该标志层的边界则为 1,否则为 0),以及模型预测 p_edge,i,k。焦点损失定义为 ℒ_FL(y_edge,i,k, p_edge,i,k) = −α_t(1 − p_t)^γ log(p_t),其中 p_t = p_edge,i,k 如果 y_edge,i,k=1,否则为 (1−p_edge,i,k)。α_t 是类别权重:如果 y_edge,i,k=1 则为 α,否则为 (1−α)。接近真实标志层深度的索引被赋予更高的权重,而背景索引则被赋予较低的权重。ℒ_Edge 是所有深度索引和标志层类别的平均焦点损失。这个损失项对于在稀疏检测任务中实现高精度至关重要。

### 3.5. 地层推断

LithoFormer 框架生成两组互补的预测:P̂_zone 和 P̂_edge。我们通过采用一个序列解码器来获得 d̂_zone,该解码器为每个 P̂_zone 通道迭代选择在所有通道中对应概率最高的最小深度。同时,通过识别输出 P̂_edge 的每个标志层通道中的峰值概率,获得高分辨率的标志层深度 (d̂_edge)。ŷ_zone 和 ŷ 分别是 d̂_zone 和 d̂_edge 的区域序列表示。最终,该框架利用 d̂_edge 作为最终结果,利用其优越的局部精度,同时分带输出 ŷ_zone 用于验证全局地层序列。

## 4. 实验与结果

我们通过比较 LithoFormer 框架和我们的骨干模型在精度、召回率和地层顺序方面的性能,与使用端到端 Seq2Seq 方法和滑动窗口模型的最先进方法进行了对比。消融研究探索了我们的数据中心流水线、补丁步幅和损失函数项。以下部分是

相似文章

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。

用于流式 3D 重建的几何上下文 Transformer

Papers with Code Trending

介绍了 LingBot-Map,这是一种前馈式 3D 基础模型,采用几何上下文 Transformer 架构用于流式 3D 重建,能够在 20 FPS 的速率下实现稳定的实时性能。