具有傅里叶增强特征的物理信息神经网络的交替Levenberg-Marquardt训练
摘要
本文提出了FALM-PINN,一种用于物理信息神经网络的交替Levenberg-Marquardt训练框架,该框架使用傅里叶增强特征来解决谱偏差和表示-系数耦合问题,在高频和非线性偏微分方程上实现了最多低两个数量级的误差。
查看缓存全文
缓存时间: 2026/08/07 07:53
# 1 引言
偏微分方程(PDEs)是物理建模的基础工具,描述了从波传播、流体流动到量子动力学等各种现象。由于解析解很少可用,经典方法被广泛用于提供精确近似。这些方法包括有限差分法[1](https://arxiv.org/html/2608.05892#bib.bib1)、有限元方法[2](https://arxiv.org/html/2608.05892#bib.bib2)、[3](https://arxiv.org/html/2608.05892#bib.bib3)、[4](https://arxiv.org/html/2608.05892#bib.bib4)、谱方法[5](https://arxiv.org/html/2608.05892#bib.bib5)、[6](https://arxiv.org/html/2608.05892#bib.bib6)、[7](https://arxiv.org/html/2608.05892#bib.bib7)、多尺度方法[8](https://arxiv.org/html/2608.05892#bib.bib8)、[9](https://arxiv.org/html/2608.05892#bib.bib9)、[10](https://arxiv.org/html/2608.05892#bib.bib10),以及专门针对高振荡问题的方法[11](https://arxiv.org/html/2608.05892#bib.bib11)。尽管这些方法精确且易于理解,但往往依赖于精心构造的网格或基函数,而对于复杂几何体可能难以设计,且其成本在高维问题中迅速增长。这些局限性促使了基于学习的求解器的发展,包括直接将控制方程纳入神经网络训练的物理信息方法。
物理信息神经网络(PINNs)已成为求解偏微分方程最广泛使用的框架之一[12](https://arxiv.org/html/2608.05892#bib.bib12)、[13](https://arxiv.org/html/2608.05892#bib.bib13)。标准 PINN 使用多层感知器(MLP)表示解,并通过自动微分获得其导数。这使得控制方程以及边界条件和初始条件能够被编码到一个复合损失中。这种无网格形式适用于正问题和逆问题,并自然扩展到具有挑战性的场景,例如高维 PDE[14](https://arxiv.org/html/2608.05892#bib.bib14)、复杂几何体[15](https://arxiv.org/html/2608.05892#bib.bib15)、从稀疏或含噪声数据重构流场[16](https://arxiv.org/html/2608.05892#bib.bib16)、[17](https://arxiv.org/html/2608.05892#bib.bib17),以及纳米光学和超材料中的逆向设计[18](https://arxiv.org/html/2608.05892#bib.bib18)。更广泛地说,物理信息学习已与贝叶斯公式集成,用于含噪数据下的不确定性量化[19](https://arxiv.org/html/2608.05892#bib.bib19),以及与在生成采样过程中施加 PDE 约束的扩散模型集成[20](https://arxiv.org/html/2608.05892#bib.bib20)、[21](https://arxiv.org/html/2608.05892#bib.bib21)、[22](https://arxiv.org/html/2608.05892#bib.bib22)。它也已扩展到无限维、算子学习的场景,例如 Fourier Neural Operator[23](https://arxiv.org/html/2608.05892#bib.bib23) 和 DeepONet[24](https://arxiv.org/html/2608.05892#bib.bib24)。
尽管取得了这些进展,一些众所周知的挑战仍然限制了 PINN 的有效性。一个显著的问题是**谱偏差**,即神经网络倾向于首先学习低频分量,这妨碍了高频和多尺度解的恢复[25](https://arxiv.org/html/2608.05892#bib.bib25)、[26](https://arxiv.org/html/2608.05892#bib.bib26)。对于刚性、非线性和混沌问题,训练也很困难,在这些问题中,标准 PINN 可能收敛缓慢,或者即使达到较小的训练损失也会产生不准确的解[27](https://arxiv.org/html/2608.05892#bib.bib27)、[28](https://arxiv.org/html/2608.05892#bib.bib28)。
为了解决这些挑战,人们开发了广泛的策略来提高 PINN 的可训练性。损失加权方法自适应地平衡非凸复合目标中的各项。例如,Wang 等人[29](https://arxiv.org/html/2608.05892#bib.bib29) 分析了神经正切核,以均衡物理和数据损失项的收敛速度。逐点加权方法进一步调整单个点的贡献,损失注意力 PINN 使用一个辅助网络,自适应地强调高误差点[30](https://arxiv.org/html/2608.05892#bib.bib30);Anagnostopoulos 等人[31](https://arxiv.org/html/2608.05892#bib.bib31) 提出了一种无梯度、基于残差的注意力方案,直接根据残差幅度更新逐点权重;Si 和 Yan[32](https://arxiv.org/html/2608.05892#bib.bib32) 从原始-对偶优化的角度将逐点加权扩展到局部邻域;Zhao 等人[33](https://arxiv.org/html/2608.05892#bib.bib33) 通过非负、单调递减的逐点权重施加时间因果性,这些权重与配点排列解耦。另一个互补方向改进了配点的采样。Wu 等人[34](https://arxiv.org/html/2608.05892#bib.bib34) 系统比较了非自适应和基于残差的自适应采样策略;Gao 和 Wang[35](https://arxiv.org/html/2608.05892#bib.bib35) 通过主动学习为高维非线性 PDE 选择信息量大的点;Lau 等人[36](https://arxiv.org/html/2608.05892#bib.bib36) 联合选择配点和实验点。
除了重新加权和重新采样之外,另一类工作通过输入嵌入、激活函数和架构修改来丰富网络表示本身。Fourier 特征嵌入用高频分量丰富输入表示[37](https://arxiv.org/html/2608.05892#bib.bib37),拓宽了网络可访问的频率谱,因此可能缓解谱偏差[38](https://arxiv.org/html/2608.05892#bib.bib38)。在激活函数层面,Sitzmann 等人[39](https://arxiv.org/html/2608.05892#bib.bib39) 采用正弦激活来表示振荡结构;Si 等人[40](https://arxiv.org/html/2608.05892#bib.bib40) 引入了可学习的 Cauchy 激活函数,以增强对刚性高频解的逼近;Zeng 和 Zhu[41](https://arxiv.org/html/2608.05892#bib.bib41) 引入了正弦增强的自适应激活函数,用于在不规则域上求解 PDE。在架构层面,Zhao 等人[42](https://arxiv.org/html/2608.05892#bib.bib42) 引入了捕捉演化方程时间依赖性的 transformer 骨干网络;Wang 等人[43](https://arxiv.org/html/2608.05892#bib.bib43) 将由可学习样条函数构建的 Kolmogorov–Arnold 层替换传统 MLP 层;Jagtap 和 Karniadakis[44](https://arxiv.org/html/2608.05892#bib.bib44) 将时空域分解,并为每个子域分配一个单独的子网络;Wang 等人[45](https://arxiv.org/html/2608.05892#bib.bib45) 通过自适应残差连接结合 Fourier 特征嵌入来稳定深度 PINN 的训练。
然而,精确解析高度振荡或强多尺度解仍然具有挑战性。基于 Fourier 特征和激活的方法大大缓解了谱偏差,但当目标解跨越非常宽的频带或包含尖锐结构时,其精度可能仍会停滞,即使精心调优的 PINN 也难以实现高精度[46](https://arxiv.org/html/2608.05892#bib.bib46)、[47](https://arxiv.org/html/2608.05892#bib.bib47)。更根本的是,这些先进的 PINN 变体通过最小化单个非凸目标联合训练所有网络参数,其中特征学习和系数拟合仍然纠缠在一起。从自适应基的角度来看,有效基在训练过程中不断变化,而输出层系数同时被调整[48](https://arxiv.org/html/2608.05892#bib.bib48)。这种耦合可能导致收敛缓慢、降低鲁棒性,并使理论分析复杂化。
几种方法通过将基构造与系数拟合分离来缓解这种耦合。极限学习机[49](https://arxiv.org/html/2608.05892#bib.bib49) 及其物理信息变体[50](https://arxiv.org/html/2608.05892#bib.bib50)、[51](https://arxiv.org/html/2608.05892#bib.bib51) 固定一个随机采样的特征基,并通过线性最小二乘恢复输出权重,这使得系数问题凸且高效求解。然而,固定基限制了在复杂或高频解上的逼近精度。与我们的工作最接近的是基于 Fourier 增强特征的迭代 PINN(IFeF-PINN)[52](https://arxiv.org/html/2608.05892#bib.bib52),它通过将 Fourier 特征映射应用于最后一个隐藏层来使基自适应,并通过更新基的同时求解输出系数来迭代训练。IFeF-PINN 是为标量线性 PDE 开发的,其系数子问题是凸的,且具有闭式解;将这种解耦框架扩展到非线性 PDE 系统(其中闭式更新和基于凸性的收敛分析都不再适用)仍然是一个未解决的问题。
为弥补这一差距,我们提出了 Fourier 增强交替 Levenberg–Marquardt PINN(FALM-PINN),这是一种将自适应基学习与系数拟合解耦的训练框架,适用于一般非线性和耦合 PDE 系统。训练在上层问题和下层问题之间交替进行:上层问题更新生成 Fourier 增强基的隐藏层参数,下层问题使用 Levenberg–Marquardt(LM)方法[53](https://arxiv.org/html/2608.05892#bib.bib53)、[54](https://arxiv.org/html/2608.05892#bib.bib54) 在该基上拟合投影系数。我们的贡献有三点。首先,我们将下层问题表述为一个非线性最小二乘问题,并使用 LM 算法求解,该算法将非凸问题替换为一系列严格凸的阻尼子问题,每个子问题都有闭式解。该框架将 IFeF-PINN[52](https://arxiv.org/html/2608.05892#bib.bib52) 作为线性 PDE 的特例包含在内。其次,我们表明应用于学习到的潜在表示的 Fourier 特征映射会诱导一个自适应平稳核(引理 1),这解释了自适应基学习是一种深度核学习[55](https://arxiv.org/html/2608.05892#bib.bib55),并有助于解释其缓解谱偏差的能力。第三,我们建立了交替格式的全局收敛性,而无需下层问题的凸性(定理 1)。
本文的其余部分组织如下。第 2 节简要概述了 PINN 和 Fourier 特征映射。第 3 节介绍了 FALM-PINN 框架,包括上层和下层问题、全局交替算法及其收敛性保证。第 4 节报告了在线性和非线性基准上的数值实验,第 5 节总结了结论并讨论了一些有前景的未来方向。
## 2 背景
### 2.1 物理信息神经网络
PINN 将控制方程直接纳入训练目标,从而能够在物理约束下进行数据驱动学习[12](https://arxiv.org/html/2608.05892#bib.bib12)、[13](https://arxiv.org/html/2608.05892#bib.bib13)。设 \(n>0\) 表示时空域的维数,\(m>0\) 表示解分量的数量,\(M>0\) 表示方程组中方程的数量,\(k>0\) 表示系统中最高微分阶数。我们考虑在有界域 \(\Omega\subset\mathbb{R}^n\) 上的以下 PDE 系统:
\[
\begin{aligned}
\mathscr{N}[u](x) &= f(x),\quad x\in\Omega,\\
\mathscr{B}[u](x) &= g(x),\quad x\in\Gamma\subseteq\partial\Omega,
\end{aligned}
\]
其中 \(\mathscr{N}\colon\mathcal{U}\to C(\Omega;\mathbb{R}^M)\) 是一个偏微分算子,\(\mathscr{B}\colon\mathcal{U}\to C(\Gamma;\mathbb{R}^m)\) 表示线性边界算子,两者都定义在经典解空间 \(\mathcal{U}\coloneqq C^k(\overline{\Omega};\mathbb{R}^m)\) 上。该公式适用于广泛的边界条件,包括 Dirichlet、Neumann、Robin 和周期类型。函数 \(u\in\mathcal{U}\) 是解,\(f\in C(\Omega;\mathbb{R}^M)\) 是源项,\(g\in C(\Gamma;\mathbb{R}^m)\) 指定边界条件。
标准 PINN 用 MLP 近似 \(u\),记为 \(\hat{u}\),并通过最小化复合损失来训练:
\[
\hat{\mathcal{L}}_\lambda(\hat{u})=\frac{1}{N_b}\sum_{i=1}^{N_b}\|\mathscr{B}[\hat{u}](x_b^i)-g(x_b^i)\|^2+\frac{\lambda}{N_f}\sum_{i=1}^{N_f}\|\mathscr{N}[\hat{u}](x_f^i)-f(x_f^i)\|^2,
\]
其中 \(X_b=\{x_b^i\}_{i=1}^{N_b}\subset\Gamma\) 和 \(X_f=\{x_f^i\}_{i=1}^{N_f}\subset\Omega\) 分别是边界和配点集。物理权重 \(\lambda>0\) 平衡了两个损失项,可以在训练过程中固定或自适应调整。为了明确说明网络架构,考虑一个 \(L\) 隐藏层网络,定义为:
\[
\begin{aligned}
z^{(0)} &=相似文章
面向物理信息神经网络的傅里叶特征金字塔
本文介绍了beignet,一种PINN架构,它用可训练的多分辨率傅里叶特征金字塔替换了随机傅里叶特征,在PDE基准测试上实现了更高的准确性和计算效率。
基于物理信息的错误场学习:物理信息神经网络的后训练优化框架
本文提出了一种用于物理信息神经网络(PINNs)的基于物理信息的错误场学习(PIEFL)框架,引入辅助错误网络以提高在计算约束下求解部分微分方程(PDEs)的解的精度。
Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators
This paper introduces feature interaction modules based on factorization machines into physics-informed neural networks and neural operators (FM-PINN, FM-Operator, FM-DeepONet) to better capture spatio-temporal variable couplings for solving parameterized PDEs, showing accuracy gains particularly on shock-dominated equations.
从非凸自和谐正则化到可扩展的PINNs拟牛顿训练
本文提出了SCORE,一种受自和谐启发的拟牛顿方法,用于训练物理信息神经网络(PINNs)。它使用递减耦合的移位割线几何,在不需要计算Hessian矩阵的情况下,提高了非线性PDE基准测试的最终精度。
频率分解何时有益于物理信息神经网络(PINNs)?一项初步消融研究
本研究通过提出一种双分支、频谱门控架构(DBSG-PINN),探讨了频率分解对物理信息神经网络(PINNs)的益处。在一维偏微分方程基准测试上的消融实验表明,频率分解在频谱复杂问题上最为有效,可将误差降低高达59.2%。