一种可逐部分训练的算子学习框架:桥接DeepONet与Karhunen-Loeve展开用于大规模应用
摘要
提出KL-DNN,一种可扩展的算子学习框架,利用Karhunen-Loève展开处理大规模PDE问题,在三维碳封存问题上实现了比DeepONet更低的误差和两个数量级的加速。
查看缓存全文
缓存时间: 2026/06/30 05:27
# 一种可分部训练的算子学习框架:融合 DeepONet 与 Karhunen–Loève 展开的大规模应用 来源:https://arxiv.org/html/2606.28519 KL\-DNN: Karhunen–Loève 深度神经网络 GCS: 地质碳储存 IBDP: 伊利诺伊盆地迪凯特项目 KL: Karhunen–Loève KLE: Karhunen–Loève 展开 PDE: 偏微分方程 SVD: 奇异值分解 DNN: 深度神经网络 MSE: 均方误差 RMSE: 均方根误差 MAE: 平均绝对误差 ISGS: 伊利诺伊州地质调查局 Christian Munoz: 土木工程系,伊利诺伊大学厄巴纳-香槟分校,厄巴纳,IL 61801,[email protected] & Alexandre Tartakovsky: 土木工程系,伊利诺伊大学厄巴纳-香槟分校,厄巴纳,IL 61801;太平洋西北国家实验室,里奇兰,WA 99352,[email protected] ###### 摘要 为大规模偏微分方程(PDE)问题训练算子学习模型面临维度灾难、内存限制和训练数据有限的挑战。这些挑战出现在许多科学和工程应用中,包括地下流动、气候建模和地质碳储存(GCS)。本文提出了一种基于 Karhunen–Loève 深度神经网络(KL-DNN)的可扩展算子学习框架,并展示了其在 GCS 建模中的性能。该模型在包含 100 个大规模仿真样本的数据集上训练,样本所在三维域具有 170 万个网格单元和 50 个时间步。KL-DNN 方法利用静态属性的低秩奇异值分解和动态压力场的嵌套 Karhunen–Loève 展开构建潜空间,无需子采样或空间粗化即可实现全分辨率预测。KL-DNN 模型对压力的平均均方根误差(RMSE)为 1.1 psi(相对于域内平均压力,相对误差约 0.04%),对 CO2 饱和度的 RMSE 为 0.0146(相对于羽流内平均饱和度,相对误差约 5%)。该模型在单个 GPU 上训练约需 20 分钟,相比在相同数据集上训练的 DeepONet,压力误差降低 19%,饱和度误差降低 7%,训练速度提升两个数量级。这些结果以及不到一分钟的推理时间,表明所提模型是大规模 PDE 问题的实用且精确的解决方案,能够支持快速不确定性量化、历史拟合和实时决策支持。 ## 简明语言摘要 我们提出了一种更快、更具可扩展性的机器学习模型,用于复杂物理系统,例如地下碳储存。传统基于物理的仿真对于这类系统虽然精确,但速度慢且计算成本高,在需要多次重复仿真(例如评估不确定性或测试不同场景)时变得不切实际。我们引入了一种名为 Karhunen–Loève 深度神经网络(KL-DNN)的框架。其核心思想是将非常大的高维数据(例如随时间演变的 3D 压力和 CO2 饱和度场)压缩成一组更小的变量,同时仍能捕获基本模式。该模型采用分部训练方式,使得计算量最大的步骤可以单独且高效地处理。该方法在一个具有数百万网格单元的真实大规模碳储存问题上进行了测试。尽管仅使用 100 个训练仿真,该模型仍能精确预测空间和时间上的压力与 CO2 分布。与现有方法(DeepONet)相比,它实现了更低的预测误差,同时将训练时间从数天缩短至约 20 分钟,并在不到一分钟内产生结果。总体而言,该框架能够为大规模地球物理系统提供快速可靠的预测,支持不确定性量化、模型校准和实时决策等应用。 ## 1 引言 大规模问题的基于物理的仿真虽然精确,但计算成本高昂。主要原因是偏微分方程(PDE)数值解的计算成本随域离散化网格单元数呈指数增长,这一现象称为维度灾难。本文重点关注需要数百万节点和数十个时间区间才能充分表示系统属性和状态的问题。地质碳储存(GCS)是此类问题的一个例子。在 GCS 应用中,系统需要在关键区域(如注入区和地质断层)进行精细离散化,这通常导致数值模型中节点数量庞大。地下参数(如孔隙度和渗透率)的高度异质性及其分布的内在不确定性使地下建模尤其具有挑战性[18, 25, 9]。地下模型的实际应用需要针对不同参数组合进行多次模型评估。例如,需要多次模型运行来估计模型预测的不确定性、研究不同场景以及进行历史拟合。多次仿真的需求及其高计算成本促使了算子学习模型的发展,这些模型能够预测系统状态(例如 GCS 中的 CO2 压力和饱和度)作为系统参数(例如储层孔隙度和渗透率)的函数。 目前已提出多种用于 GCS 的算子学习模型,包括傅里叶神经算子[19]、卷积编码器-解码器网络[12]和 DeepONet[10]。在这些方法中,只有文献[10]中的 DeepONet 模型处理了本文所考虑规模的问题。具体而言,在文献[10]中,DeepONet 模型针对伊利诺伊盆地迪凯特项目(IBDP)CO2 注入站点进行了训练,使用的训练数据集包含在三维域上进行的数值仿真,该域离散化为 170 万个网格单元,并在 50 个时间步报告解。DeepONet 在由分支网络确定的降维(潜)参数空间和由主干网络确定的降维状态变量空间中进行算子学习。其他用于参数化 PDE 的相关潜空间算子学习模型包括 PCA-Net[3] 和 KL-DNN[24, 23]。这两种方法使用密切相关的 PCA 和 Karhunen–Loève(KL)展开[8]来寻找潜空间。在 DeepONet、PCA-Net 和 KL-DNN 中,算子学习是在潜空间中利用全连接前馈深度神经网络(DNN)进行的,仅需少量全连接层。然而,为大规模问题学习潜表示可能需要过大的计算机内存和训练时间。在大规模问题上训练 DeepONet 尤其具有挑战性,因为状态和参数的潜表示是联合学习的,并与 DNN 训练相结合。在 PCA-Net 和 KL-DNN 中,状态和参数的潜表示通过奇异值分解(SVD)分别学习。然而,对大型数据集执行 SVD 可能需要大量内存,即使在大型超级计算机上也可能不可用。 DeepONet 已通过多种策略应用于大规模问题。带域分解的 DeepONet(DD-DeepONet)将大域拆分为子域,降低了内存需求和训练时间[27]。时间积分 DeepONet 变体(TI-DeepONet)专注于导数算子以避免长序列展开[13]。集成和专家混合架构进一步实现了异质域的局部化学习[17]。可分离 DeepONet(SepONet)对空间维度进行因式分解以降低复杂度和内存占用[28]。在文献[10]中,DeepONet 中引入了基于图的拓扑嵌入以捕获局部和全局交互。在处理包含数百万个网格单元和多个时间步的域时,采用训练子集的动态重采样来管理 DeepONet 训练所需的内存及相关计算成本。在 PCA-Net 中,采用空间区块上的局部 PCA 来降低计算成本和内存需求[6]。这种基于区块的方法比全局 PCA 模型训练速度最多快四倍,并通过保留局部变异性提高了关键区域附近的精度。 在本研究中,我们为大规模 PDE 问题提出了一种通用的可分部训练的算子学习框架。作为该框架的基础,我们改编了 KL-DNN/PCA-Net 方法。在大规模应用中,KL-DNN 和 PCA-Net 方法几乎相同,因为两者都使用 SVD 来构建参数和状态场的 PCA 或 KL 表示。此外,我们证明所得模型是 DeepONet 的一种特例,可被视为广义算子学习模型。本文的主要创新点如下: - • 我们提出了一种两步法来对大规模问题执行 SVD 分解。第一步,将多维 KLE 分解为低维 KLE。第二步,利用低秩 SVD 估计低维 KLE 中的特征值和特征函数。该方法能够在不显著损失精度的情况下对大型数据集进行 SVD 分解,而由于内存限制,即使在超级计算机上,这通常是不可行的。 - • 我们建立了 PCA-Net/KL-DNN 与 DeepONet 模型之间的对应关系。这使得可以分别训练 DeepONet 的主干和分支,并将其扩展到大规模问题。 我们通过将所提模型的精度和训练时间与在 IBDP 数据集上训练的 DeepONet 模型进行比较,来证明其有效性。该数据集包含 100 个样本,每个样本在 170 万个节点的网格和 50 个时间步上计算[10]。我们证明,我们的模型训练时间比使用动态重采样在该大型数据集上训练的 DeepONet 少两个数量级,且精度最高提升 19%。 本文组织如下:第 2 节介绍可扩展的算子学习模型。第 3 节描述使用 IBDP 数据集对算子学习模型的训练和预测。第 4 节给出结论。 ## 2 算子学习模型 我们提出一般偏微分方程(PDE)问题的算子学习方法: L[u(x,t), y1(x), ..., y_{N_p}(x)] = 0, (1) 并附以适当的初始条件和边界条件。这里 L 是微分算子,u(x,t) 是状态变量,y1(x), ..., y_{N_p}(x) 是 N_p 个依赖于空间位置的参数场。我们假设存在一个带标签的数据集 D = {y1^(i), ..., y_{N_p}^(i) → u^(i)}_{i=1}^{N_train},包含在 N_x × N_y × N_z × N_t 时空网格上获得的数值 PDE 解的 N_train 个样本。我们的目标是为大规模问题开发一个算子学习模型 G_u[y1, ..., y_{N_p}](x,t),其中 N_x, N_y, N_z 和 N_t 可能达数百万量级。下面,我们讨论训练大规模问题算子学习模型所面临的挑战以及所提模型如何应对这些挑战。 为引出所提方法,我们首先回顾单个参数场(N_p=1)情况下的 KL-DNN 神经算子 G_u[y(x)](x,t) 的公式。在该方法中,u 和 y 被视为随机过程 U 和 Y 的实现,训练数据集 D 中的 y^(i) 和 u^(i) 分别作为 Y 和 U 的独立样本生成。算子 G_u[y](x,t) 由 U 的时空 KLE [21] 给出: G_u[y](x,t) = \bar{u}(x,t) + \sum_{i=1}^{N_η} η_i[ξ(y);θ] φ_i(x,t) √λ_i, (2) 其中 \bar{u}(x,t) 是 U 的系综均值,φ_i(x,t) 和 λ_i 是 U 协方差的前 N_η 个主导特征函数和特征值,η_i 是 KLE 系数。特征函数和特征值通过 U 的样本协方差矩阵的特征值分解或 u^(i) 样本的 SVD 求得。因此,可计算的最大特征对数为 N_train,即 N_η ≤ N_train。对于足够大的 N_train,可根据 Mercer 定理 [11] 按所需容差 rtol 确定 N_η: rtol = \frac{\sum_{i=N_η+1}^∞ λ_i}{\sum_{i=1}^∞ λ_i}. (3) 然而,对于大规模问题,由于生成样本的计算成本高,N_train 通常较低。因此,N_train 通常是选择 N_η 的限制因素。选择 N_η 的具体约束将在本节后面讨论。 KLE 系数 η = [η_1, ..., η_N]^T 通过全连接前馈 DNN 映射到参数场 y 的截断 KLE 中的系数向量 ξ = (ξ_1, ..., ξ_{N_ξ})^T: y(x) ≈ K_y(x,ξ) = \bar{y}(x) + \sum_{i=1}^{N_ξ} ξ_i χ_i(x) √β_i, (4)
相似文章
Fixed and Adaptive Topological DeepONets: Functional Measurements on Hausdorff Locally Convex Spaces
This paper extends Topological DeepONets to handle functional measurements on Hausdorff locally convex spaces, replacing point samples with continuous linear functionals and introducing fixed and adaptive measurement systems. The framework is validated on several benchmarks including a non-normable input space, and demonstrates compact, discretization-portable coordinates for operator learning.
LiNO: 基于提升的多分辨率神经算子
本文介绍了 LiNO,一种使用基于提升的多分辨率分解来学习偏微分方程解算子的神经算子。它在包括达西流、泊松方程和纳维-斯托克斯方程在内的基准测试中表现出色,能够同时捕捉全局动态和精细尺度结构。
非线性算子及其导数的通用逼近
本文证明了在无限维空间中非线性算子及其导数的首个通用逼近定理,将经典结果扩展到DeepONet和PCA-Net等算子学习架构。
LLT: 用于PDE算子学习的局部线性Transformer
介绍LLT,一种基于Transformer的神经算子,它将线性全局注意力与局部空间混合相结合,用于PDE学习。在多个PDE问题上,与基线方法相比,它实现了具有竞争性的精度和更快的训练速度。
用于高Péclet入口输运DeepONet代理模型的有理增强Chebyshev主干基
本文介绍了一种用于DeepONet代理模型的有理增强Chebyshev主干,提高了模拟具有薄边界层的高Péclet输运问题的准确性。