神经算子的可学习组合

arXiv cs.LG 论文

摘要

本文介绍了LatentDDM,一种在小子域上预训练神经算子并通过组合它们来提高精度、降低在不同域中物理模拟适应成本的方法。

arXiv:2609.03069v1 公告类型:新 摘要:神经算子是物理模拟的快速、可微替代模型,但当域的几何形状、大小或操作条件与训练时不同,其精度往往会下降。监督适应可以恢复精度,但即使是一个小的目标集也需要昂贵的高保真模拟。因此,我们探究如何协同设计预训练和迁移以降低这种部署成本。LatentDDM首先在小子域上预训练神经算子以预测场。对于新设置,它冻结该算子,并仅训练一个组合局部预测的轻量级模块。我们在两个互补问题上评估我们的方法:稳态达西流动,其中远程压力耦合必须扩展到越来越大的多孔域;以及绕俯仰翼型的非定常不可压缩流动,其中当目标俯仰频率超过训练范围时,滚动误差会复合。与一次性处理整个域的能力匹配模型相比,经过16个目标模拟适应后,LatentDDM在更大的达西域上的误差降低了36-56%。它还在快速俯仰翼型流动中改善了20步场滚动,无论是零样本还是少样本校准后。这些结果表明,协同设计的局部预训练和组合级迁移是物理基础模型的一个有前景的设计原则。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:20

# 可学习的神经算子组合方式
来源:https://arxiv.org/html/2609.03069
###### 摘要
神经算子是物理模拟的快速、可微代理模型,但当域几何形状、尺寸或运行条件与训练数据不同时,其准确性往往会下降。监督适应可以恢复准确性,但即使是一个小型目标集也需要昂贵的高保真模拟。因此,我们探讨如何协同设计预训练和迁移,以降低这种部署成本。LatentDDM首先在小型子域上预训练一个神经算子来预测场。对于新场景,它冻结该算子,并仅训练一个轻量级模块,该模块用于组合局部预测。我们在两个互补问题上评估了我们的方法:稳态达西流(其中长程压力耦合必须跨越日益增大的多孔域)和俯仰机翼周围的非定常不可压缩流动(当目标俯仰频率超过训练范围时,滚动误差会累积)。与一次性处理整个域的容量匹配模型相比,LatentDDM在使用16个目标模拟适应后,在更大的达西域上误差降低了36-56%。在快速俯仰机翼流动中,它也改进了20步场预测,无论是零样本还是经过少样本校准。这些结果表明,协同设计的局部预训练和组合级别迁移是物理基础模型的一个有前景的设计原则。

## 1 引言
理解物理世界不仅需要重建系统当前状态的模型,还需要预测系统如何演化的模型。最近基于Transformer的模型可以直接从图像恢复三维几何形状[33]。预测当形状、边界条件或运行条件改变时物理场如何响应,需要一个物理转换模型。神经算子[16]通过用快速、可微的模型评估来替代昂贵的模拟来解决这个问题,使其可在大型学习或控制流水线中作为可微模拟器使用。它们已被用于工程设计,包括汽车空气动力学[8, 1]。

神经算子在其训练数据类似的系统上可以是准确的,但当域几何形状、尺寸或运行条件发生变化时,其误差往往会增大。在一个域上训练的模型在更大域上会失去准确性[6]。它们对初始条件、PDE系数或训练期间未见的物理过程也很敏感[30]。常见的应对方式是使用来自新场景的带标签样本来适应模型[9]。然而,即使是一个小型目标集也可能需要额外的高保真模拟,这仍然是巨大的部署成本[17]。

最近的工作试图通过在多个物理系统[25, 5]或几何形状[34]的数据上进行预训练来寻找泛化解决方案。这些研究扩大了模型在部署前能看到的范围。物理基础模型主要通过扩展其预训练数据来实现规模化,而较少关注如何将预训练与后续针对新场景的迁移步骤进行协同设计。

域分解方法(DDMs)将全局PDE求解分为两个部分:局部子域求解和在它们之间交换边界信息的协调规则[32]。现有的神经DDMs学习此流水线的不同部分。一类工作学习经典DDM迭代中的改进界面条件,同时保留数值子域求解[31]。然而,局部解过程需要重复的网格划分和建模。另一个关注点是子域求解器的开发,包括几何神经算子[24, 29, 14]、核方法[12]和生成模型[37]。最终解仍然是通过遵循控制方程的重复、固定边界更新来获得的。当控制方程不完整或学习的局部模型不能精确满足控制方程中的约束时,这种对控制方程的依赖变得具有限制性。一种作为独立模块从数据中学习的可学习组合规则,尚未被探索。

我们提出了LatentDDM,它通过神经网络协同设计局部算子和组合模块。这两个模块都从数据中学习,无需施加由方程导出的组合规则。局部算子被预训练,以从每个子域的几何形状、系数、边界条件和当前状态(如果需要)预测场。组合模块在初步的局部预测之间共享信息并更新每个局部输入。然后,在组装完整场之前,局部算子再次被评估。为了适应新场景,局部算子被冻结,仅使用少量样本监督组合模块。

我们测试该方法在域尺寸或运行条件变化时是否能高效适应,使用达西流和俯仰机翼流动系统作为验证案例。达西流求解多孔介质上的稳态解;局部区域之间的长程压力耦合是主要的建模难点。俯仰机翼案例描述了运动机翼周围的非定常不可压缩空气动力学;自回归预测期间的误差控制和运行条件变化是针对的挑战。

为了验证我们的方法,对于达西流,我们在小型子域上预训练局部算子,并仅在由它们组装的更大域上调整组合模块。对于机翼流动,我们在慢速俯仰轨迹上预训练局部算子和组合模块,然后在更快俯仰轨迹上测试零样本重用和少样本校准。两个实验都与一次性处理整个域的Transformer模型和具有固定组合规则的神经DDM进行了比较。

我们的贡献包括:(i) LatentDDM,一个预训练局部算子并将其组合规则作为独立模块学习的神经算子框架;(ii) 在域尺寸和运行条件变化下的受控测试,与一次性处理整个域的模型和神经DDM进行对比;(iii) 用于研究在运行条件漂移下更大域和滚动预测的达西流和俯仰机翼数据集。

## 2 相关工作
我们回顾三方面工作,它们为预训练和迁移的协同设计提供了参考:物理模型如何表示和预训练场;预训练模型如何适应新的方程、几何形状或运行条件;以及域分解方法(DDMs)如何组合子域解。

#### 物理预训练。许多预训练物理模型首先将场或网格转换为更小的表示集合。潜空间方法使用自编码器压缩完整场,然后学习动力学或生成[19, 41, 5]。基于点的模型将采样网格点或池化的超节点表示为token用于注意力计算[1],而Transolver将网格点分配到学习的切片并在切片token之间应用注意力[35]。从视觉Transformer继承的固定空间patch被用于MPP、DPOT、Unisolver和VICON等模型[7, 23, 25, 10, 42, 4]。在这些选择中,点、切片和patch表示都支持变化的几何形状,适合作为物理预训练的架构。这些表示支持使用自回归、去噪、条件或多模态目标的多系统预训练[25, 11, 10, 42, 21, 28]。最近的工作认识到几何形状是更便宜的监督来源:一种方法预训练自编码器从无标签形状重建占据状态,另一项工作向仅含几何的数据添加合成动力学[40, 34]。两者都在下游物理任务之前学习几何。相比之下,LatentDDM在固定大小的子域上从带标签的解预训练局部算子,探索了一个新的预训练轴。

#### 模型适应与迁移学习。迁移学习是一族方法,它们重用在源任务上学到的参数,并使用目标任务的信息更新部分或全部参数[27]。对于变化的几何形状和域,Geo-FNO学习变形到规则计算网格以进行适应[20, 18]。物理基础模型的一个常见迁移配方是在小型带标签的目标集上微调整个预训练网络[25, 11, 10, 28, 22]。其他模型以方程描述或物理参数为条件,以在一个网络中覆盖多种情况[42, 21]。受上下文学习启发,ICON和VICON相反地将示例输入-输出对置于模型输入中,并在推理时适应而无需更改权重[36, 4]。算子分裂通过组合为不同动力学学习的算子提供了另一种测试时路径[30]。虽然我们的适应也使用带标签的目标样本,但LatentDDM将此更新限制在组合模块上,该模块组合了冻结的局部算子的子域预测。

#### 神经域分解方法。经典DDMs将PDE域划分为子域,求解局部问题,并通过迭代协调其接口数据[32]。神经网络首先被用于此过程中,以学习接口条件或加速局部和粗略计算[31, 24, 26]。更近期的神经DDMs将分解作为模型结构:SNI和NEST重用学习的局部求解器,同时重复更新人工边界数据[14, 29]。这些方法保留数值迭代过程直到收敛。LatentDDM则使用可学习的组合来协调局部子域,无需迭代。

## 3 神经算子的可学习组合方式
请参阅图注 图1:全域方法、迭代神经DDM和LatentDDM。全域模型(左)在Transformer之前将场标记为Point、Slice或Patch token。神经DDM将完整计算域划分为重叠的子域,并在最后组装它们。迭代神经DDM(右)对子域输入进行迭代更新,给定上一次迭代的组装场,产生M轮子域评估和输入修正。我们的LatentDDM首先在所有子域上评估局部算子,然后组合模块使用第一次预测仅修正一次局部输入,之后进行最终评估和域组装。第3.1节在共享框架中解释了LatentDDM、全域模型和Schwarz Neural Inference (SNI) 作为一种神经DDM。第3.2节分离了冻结局部算子保留的误差和组合引入的误差,并给出了少样本适应的条件边界。

### 3.1 LatentDDM和比较方法的公式化
图1对比了从计算设置到预测场的三种路径。在左侧,全域模型将完整域转换为Point、Slice或Patch token,并在一个网络中学习场预测和全局信息交换。在右侧,显示了两种神经DDM。两种方法都将域划分为重叠的子域,并将相同的预训练局部算子应用于每个子域。而迭代神经DDM(即SNI)需要递归地应用方程驱动的迭代,LatentDDM将所有输入更新摊销到一个由轻量Transformer建模的组合模块中。其第一次预测被总结为每个子域一个token;然后Transformer在这些token之间交换信息,并返回每个子域一个输入修正。相同的冻结局部算子然后被第二次评估,最终场被组装。当模型需要适应新场景时,模型仅调整其组合模块,同时保留预训练的局部场预测器。

#### 可学习的组合方式。我们首先公式化LatentDDM方法。固定计算域Ω。设X = X_Ω包含几何形状、系数、源、物理边界或控制数据,以及进行一次预测所需的状态历史。一个重叠覆盖P_Ω = {Ω_i}_{i=1}^N定义了受限输入P_i X。固定映射A组装在Ω上的重叠局部输出。设U(Ω)表示该域上的输出场空间。局部算子在源对(x, u)上预训练,其中x是局部计算设置,u是其目标场:
θ_0 ∈ arg min_θ E_{(x,u)~D_loc^src} ||S^θ(x) - u||^2, θ_0 之后被冻结。(1)
第一次局部预测仅看到一个子域。向量c_i ∈ C_i表示其余域对裁剪i的缺失影响。例如,在达西流中,它改变内部裁剪边缘的压力值,在机翼流动中,它是粗糙的速度-压力输入。映射U(P_i X, c_i)应用此输入修正,其中U(P_i X, 0) = P_i X。对于c = (c_1, ..., c_N) ∈ C(X) = ∏_i C_i...

相似文章

LLT: 用于PDE算子学习的局部线性Transformer

arXiv cs.LG

介绍LLT,一种基于Transformer的神经算子,它将线性全局注意力与局部空间混合相结合,用于PDE学习。在多个PDE问题上,与基线方法相比,它实现了具有竞争性的精度和更快的训练速度。

动态潜路由

Hugging Face Daily Papers

动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。

用于自动神经算子发现的智能体AI科学社区

arXiv cs.LG

本文提出了一种由虚拟实验室组成的智能体AI科学社区,能够自主发现用于偏微分方程问题的神经算子架构。通过引用经济体系下的LLM规划器、数值工作者和评审者,该系统生成了高精度的混合架构,结果表明算子家族之间不存在普遍优胜者。