从非凸自和谐正则化到可扩展的PINNs拟牛顿训练
摘要
本文提出了SCORE,一种受自和谐启发的拟牛顿方法,用于训练物理信息神经网络(PINNs)。它使用递减耦合的移位割线几何,在不需要计算Hessian矩阵的情况下,提高了非线性PDE基准测试的最终精度。
arXiv:2608.04206v1 公告类型:新
摘要:物理信息神经网络(PINNs)通常需要高精度的拟牛顿精化才能获得可靠的偏微分方程解,但其残差目标可能表现出不定、近乎奇异且缩放不良的局部曲率。正则化拟牛顿方法为稳定割线模型提供了成熟机制,而自和谐方法则为基于曲率的步长选择提供了局部度量规则。基于这两方面的工作,我们提出了SCORE,一种受自和谐启发的拟牛顿方法,具有递减耦合的移位割线几何,用于PINN训练。其独特机制在于,由学习到的逆度量计算出的单一拟牛顿递减量同时决定了一个经过强Wolfe检验的候选步长和一个用于定义下一个割线几何的自适应移位。移位位移表示沿接受步长的平均移位度量的作用,同时无需构造Hessian矩阵,也无需Hessian-向量乘积。在局部谱等价条件下,我们证明了拟牛顿递减量和候选步长在正移位度量下与其对应量保持可比性,并在匹配度量情况下恢复了归一化的自和谐规则。强Wolfe接受、回退线搜索和标准曲率保障提供了全局化,而无需修改底层PINN目标。在粘性Burgers、Kuramoto--Sivashinsky、Korteweg--de Vries和复Ginzburg--Landau方程上的实验表明,SCORE比测试的BFGS和自缩放Broyden基线获得了更低的最终误差。Burgers消融实验进一步表明,移位曲率稳定化和基于递减量的步长选择对高精度精化做出了互补贡献。
查看缓存全文
缓存时间: 2026/08/06 07:47
# 从非凸自协调正则化到可扩展的拟牛顿训练 PINNs 来源:https://arxiv.org/html/2608.04206 1\] organization=香港中文大学(深圳)数据科学学院,addressline=龙岗区龙翔大道2001号,city=深圳,postcode=518172,state=广东,country=中国 2\] organization=莱斯大学计算应用数学与运筹学系,addressline=6100 Main Street, MS 134,city=Houston,postcode=77005\-1827,state=Texas,country=USA 3\] organization=约翰霍普金斯大学数据科学与人工智能研究所、应用数学与统计系,addressline=3400 N\. Charles Street,city=Baltimore,postcode=21218,state=Maryland,country=USA \\cortext \[cor1\]通讯作者\. Kang Ankang\.an@rice\.eduShiqian Masqma@jhu\.eduMing Yanyanming@cuhk\.edu\.cn\[\[\[ ###### 摘要 物理信息神经网络(PINNs)通常需要高精度的拟牛顿修正才能获得可靠的偏微分方程解,但其残差目标可能表现出不定、近似奇异且尺度较差的局部曲率。正则化拟牛顿方法为稳定割线模型提供了成熟机制,而自协调方法则为依赖于曲率的步长选择提供了局部度量规则。基于这两方面的工作,我们提出了SCORE,一种受自协调启发的拟牛顿方法,其具有与减量耦合的平移割线几何结构,用于PINN训练。其独特机制在于:仅用一个从学习到的逆度量计算的拟牛顿减量,即可同时确定一个经强Wolfe检验的候选步长,以及用于定义下一个割线几何结构的自适应平移量。平移位移表示沿接受步长的平均平移度量的作用,且既不需要构造Hessian矩阵,也不需要Hessian向量积。在局部谱等价条件下,我们证明了拟牛顿减量和候选步长与正平移度量中的对应量仍具有可比性,并在度量匹配情形下恢复了归一化自协调规则。强Wolfe接受准则、回溯线搜索和标准曲率保护提供了全局化机制,而无需修改底层PINN目标。在粘性Burgers方程、Kuramoto–Sivashinsky方程、Korteweg–de Vries方程和复Ginzburg–Landau方程上的实验表明,SCORE达到了比测试的BFGS和自缩放Broyden基线更低的最终误差。Burgers消融实验进一步表明,平移曲率稳定化和基于减量的步长选择对高精度修正具有互补的贡献。 ###### 关键词: 物理信息神经网络\\sep拟牛顿方法\\sep自协调\\sep非凸优化\\sep割线正则化 \{highlights\} 弱自协调视角稳定了PINN后期修正。 单一学习度量减量同时控制平移量和候选步长。 平移割线在不使用Hessian乘积的情况下表示正局部几何。 SCORE在四个非线性PDE基准上提高了最终精度。 ## 1 引言 物理信息神经网络(PINNs)\[raissi2019physics,karniadakis2021physics\]已成为求解偏微分方程(PDEs)的科学机器学习问题中广泛使用的框架。通过将PDE残差、边界条件和初始条件纳入训练目标,PINNs为正向模拟和反问题参数识别提供了一种无网格公式,通常只需要很少或不需要观测数据。它们已被应用于传热\[xu2023physics,cai2021physics,si2025initialization,majumdar2025hxpinn\]、固体力学\[hu2024physics,faroughi2024physics\]、磁异常检测\[besnard2025fast\]、随机系统\[zhang2020learning,chen2021solving\]以及不确定性量化\[yang2019adversarial,zhang2019quantifying,yang2021b\]。尽管应用广泛,但高精度训练PINNs仍然困难,特别是当可靠的PDE解要求将残差误差降至非常小的水平时。PINN训练可能受到刚度、损失项之间的不平衡、梯度病态、谱偏差以及对优化器及其参数的敏感性的影响\[wang2021understanding,si2026convolution,krishnapriyan2021characterizing,rathore2024challenges,an2026lightweight,si2026complex\]。诸如Adam\[kingma2014adam\]等一阶方法因其鲁棒性和较低的每次迭代成本而在训练早期被广泛使用。然而,当残差目标变得严重病态时,它们可能收敛缓慢或停滞。这种行为促使在PINNs中使用二阶和基于曲率的优化器,包括拟牛顿方法,如L-BFGS、BFGS、自缩放BFGS和自缩放Broyden变体\[rathore2024challenges,urban2025unveiling,jnini2026curvature,kiyani2025optimizing\],以及牛顿型、Gauss-Newton、Levenberg-Marquardt、自然梯度和结构化预处理方法\[jnini2025gauss,muller2023achieving,jnini2025dual,levenberg1944method,dai2026tinns,alizadeh2025physics,shahab2026physics\]。这些研究表明,局部曲率信息可以提高PINNs的优化效率和可达到的精度。然而,可靠地使用曲率信息仍然具有挑战性。尽管PINN目标通常写成平方残差之和,但它一般是非凸的。其局部曲率包含一个非负的Gauss-Newton贡献,以及一个可能具有任意符号的额外残差相关贡献。因此,所得曲率模型可能是不定的、近似奇异的或病态的。这些困难与拟牛顿方法尤其相关,因为后者是通过连续的参数步长和梯度差来推断曲率,而不是显式形成Hessian矩阵。当观测到的割线曲率较弱或尺度较差时,学习到的近似可能变得不可靠,优化器可能需要大量的阻尼、更新跳过或保守的线搜索步长\[rathore2024challenges,urban2025unveiling,jnini2026curvature,kiyani2025optimizing\]。这些保护措施对于稳健的拟牛顿修正是至关重要的,但PINNs的残差最小二乘结构提出了一个更根本的问题:当完整残差Hessian是不定、近似奇异或病态时,自缩放拟牛顿方法应该学习什么样的局部曲率几何?自缩放使逆近似的幅度适应观测曲率的变化。然而,割线更新仍然由原始梯度位移驱动,因此同时反映了PINN Hessian的非负Gauss-Newton贡献和符号不定的残差相关贡献。自协调提供了关于这一问题的曲率相对视角。经典自协调使用局部Hessian度量来度量曲率变化,并使用相应的减量来校准牛顿步长\[nesterov1994interior,nesterov2013introductory,bach2010self,sun2019generalized\]。对于非凸PINN目标,通过弱自协调的平移曲率几何\[goldfarb2025non\]获得正局部度量。平移提供了一个正曲率下限,而相关的减量在所得局部几何中度量提议步长。因此,正则化自然地成为实现对非凸目标进行曲率相对控制的机制。正则化拟牛顿方法通过修改后的割线信息提供了无Hessian的机制来表示正平移曲率模型\[tankaria2022regularized,kanzow2023regularization\]。自协调拟牛顿方法进一步证明了局部曲率信息如何指导步长选择\[gao2019quasi\]。这些发展为将正局部度量和依赖于曲率的步长控制纳入基于割线的方法提供了优化基础。在本工作中,我们使用这些原理将自缩放Broyden修正适配到PINNs的残差几何结构。我们提出SCORE,一种受自协调启发的SSBroyden方法,其中平移局部度量通过逆更新所使用的割线位移来表示。从学习到的逆度量计算的拟牛顿减量同时确定自适应曲率平移量和受自协调启发的候选步长。候选步长通过强Wolfe条件检验,当候选被拒绝时使用标准Wolfe线搜索。所得构造在单个局部几何结构内连接了高精度PINN优化的三个方面。PINN残差结构识别了不定和尺度不良曲率的来源;弱自协调激发了正平移度量和基于减量的控制;SSBroyden提供了该度量的可扩展割线表示。同一学习度量减量协调了当前曲率模型下的步长和用于构造下一个模型的稳定化。我们的主要贡献总结如下: - •我们将PINNs的残差最小二乘几何与自缩放Broyden修正期间学习到的曲率信息联系起来。非负Gauss-Newton分量与残差相关Hessian分量之间的相互作用促使稳定由割线更新表示的局部度量。 - •我们引入了基于弱自协调的局部度量视角,用于高精度PINN修正。所得的正平移几何为非线性残差目标中的曲率稳定化和依赖于减量的步长控制提供了统一基础。 - •我们开发了SCORE,这是上述视角在SSBroyden中的无Hessian实现。平移割线位移表示沿接受步长的正局部度量,而拟牛顿减量联合确定自适应曲率平移量和经强Wolfe检验的候选步长。 - •我们在粘性Burgers、Kuramoto–Sivashinsky、Korteweg–de Vries和复Ginzburg–Landau方程上评估了SCORE。该方法一致地达到了比测试的BFGS和SSBroyden基线更低的最终误差,并且Burgers消融实验证明了平移曲率稳定化和基于减量的步长选择的互补优势。 ## 2 预备知识与相关工作 本节介绍用于开发SCORE的三个要素。我们首先将PINN训练表述为残差最小二乘问题,并描述其局部曲率。然后,我们回顾基于割线的拟牛顿方法,这些方法在不明式形成Hessian的情况下近似曲率。最后,我们总结弱自协调以及正则化牛顿方法中使用的平移曲率度量。第3节(https://arxiv.org/html/2608.04206#S3)结合这些思想来激励我们的平移拟牛顿构造。 ### 2\.1 PINN目标作为残差最小二乘问题 物理信息神经网络通过配点处评估的残差项来强制执行微分方程\[raissi2019physics,karniadakis2021physics\]。令Ω⊂Rn\\Omega\\subset\\mathbb\{R\}^\{n\}为具有边界∂Ω\\partial\\Omega的空间域,T\\mathcal\{T\}表示时间区间。一个时间相关的偏微分方程可以抽象地写为 F\[u\]\(x,t\)\\displaystyle\\mathcal\{F\}\[u\]\(\\mathbf\{x\},t\)=0,\\displaystyle=0,\(x,t\)∈Ω×T,\\displaystyle\(\\mathbf\{x\},t\)\\in\\Omega\\times\\mathcal\{T\},\(1\)B\[u\]\(x,t\)\\displaystyle\\mathcal\{B\}\[u\]\(\\mathbf\{x\},t\)=0,\\displaystyle=0,\(x,t\)∈∂Ω×T,\\displaystyle\(\\mathbf\{x\},t\)\\in\\partial\\Omega\\times\\mathcal\{T\},\(2\)I\[u\]\(x,0\)\\displaystyle\\mathcal\{I\}\[u\]\(\\mathbf\{x\},0\)=0,\\displaystyle=0,x∈Ω,\\displaystyle\\mathbf\{x\}\\in\\Omega,\(3\)其中F\\mathcal\{F\}、B\\mathcal\{B\}和I\\mathcal\{I\}分别表示控制算子、边界算子和初始条件算子。非齐次数据可以被纳入这些算子,而不影响下面的讨论。PINN用神经网络uθu\_\{\\theta\}表示uu,其参数为θ∈Rp\\theta\\in\\mathbb\{R\}^\{p\}。给定PDE残差、边界和初始条件配点集ΩF\\Omega\_\{F\}、ΩB\\Omega\_\{B\}和ΩI\\Omega\_\{I\},参数通过最小化下式获得 f\(θ\)\\displaystyle f\(\\theta\)=λFLF\(θ\)\+λBLB\(θ\)\+λILI\(θ\),\\displaystyle=\\lambda\_\{F\}\\mathcal\{L\}\_\{F\}\(\\theta\)\+\\lambda\_\{B\}\\mathcal\{L\}\_\{B\}\(\\theta\)\+\\lambda\_\{I\}\\mathcal\{L\}\_\{I\}\(\\theta\),\(4\)LF\(θ\)\\displaystyle\\mathcal\{L\}\_\{F\}\(\\theta\)=1Nf∑\(x,t\)∈ΩF\|F\[uθ\]\(x,t\)\|2,\\displaystyle=\\frac\{1\}\{N\_\{f\}\}\\sum\_\{\(\\mathbf\{x\},t\)\\in\\Omega\_\{F\}\}\\bigl\|\\mathcal\{F\}\[u\_\{\\theta\}\]\(\\mathbf\{x\},t\)\\bigr\|^\{2\},\(5\)LB\(θ\)\\displaystyle\\mathcal\{L\}\_\{B\}\(\\theta\)=1Nb∑\(x,t\)∈ΩB\|B\[uθ\]\(x,t\)\|2,\\displaystyle=\\frac\{1\}\{N\_\{b\}\}\\sum\_\{\(\\mathbf\{x\},t\)\\in\\Omega\_\{B\}\}\\bigl\|\\mathcal\{B\}\[u\_\{\\theta\}\]\(\\mathbf\{x\},t\)\\bigr\|^\{2\},\(6\)LI\(θ\)\\displaystyle\\mathcal\{L\}\_\{I\}\(\\theta\)=1N0∑\(x,0\)∈ΩI\|I\[uθ\]\(x,0\)\|2\.\\displaystyle=\\frac\{1\}\{N\_\{0\}\}\\sum\_\{\(\\mathbf\{x\},0\)\\in\\Omega\_\{I\}\}\\bigl\|\\mathcal\{I\}\[u\_\{\\theta\}\]\(\\mathbf\{x\},0\)\\bigr\|^\{2\}\.\(7\)权重λF\\lambda\_\{F\}、λB\\lambda\_\{B\}和λI\\lambda\_\{I\}平衡可能具有显著不同尺度的损失分量。这种不平衡,连同刚度和PDE算子引起的导数结构,导致了PINN训练中常见的病态\[wang2021understanding,krishnapriyan2021characterizing,rathore2024challenges\]。在将损失权重和归一化因子吸收到残差定义中后,目标可以紧凑地写为 f\(θ\)=1Nr∑i=1NrRi\(θ\)2,f\(\\theta\)=\\frac\{1\}\{N\_\{r\}\}\\sum\_\{i=1\}^\{N\_\{r\}\}R\_\{i\}\(\\theta\)^\{2\},\(8\)其中RiR\_\{i\}收集了PDE、边界和初始条件残差。为了描述该目标的局部曲率,假设每个Ri:Rp→RR\_\{i\}:\\mathbb\{R\}^\{p\}\\to\\mathbb\{R\}是二次连续可微的,并定义 Ji\(θ\):=∇Ri\(θ\),Qi\(θ\):=∇2Ri\(θ\)\.J\_\{i\}\(\\theta\):=\\nabla R\_\{i\}\(\\theta\),\\qquad Q\_\{i\}\(\\theta\):=\\nabla^\{2\}R\_\{i\}\(\\theta\)\.对于任何方向h∈Rph\\in\\mathbb\{R\}^\{p\}, ∇2f\(θ\)\[h,h\]=2Nr∑i=1Nr\[\(Ji\(θ\)⊤h\)2\+Ri\(θ\)h⊤Qi\(θ\)h\]\.\\nabla^\{2\}f\(\\theta\)\[h,h\]=\\frac\{2\}\{N\_\{r\}\}\\sum\_\{i=1\}^\{N\_\{r\}\}\\left\[\\bigl\(J\_\{i\}\(\\theta\)^\{\\top\}h\\bigr\)^\{2\}\+R\_\{i\}\(\\theta\)h^\{\\top\}Q\_\{i\}\(\\theta\)h\\right\]\.\(9\)第一项是非负的,对应于Gauss-Newton曲率。第二项依赖于当前残差,可能具有任意符号。因此,尽管PINN目标是平方和,但其完整参数空间Hessian不一定是半正定的。当两个曲率分量具有显著不同的尺度时,它也可能是近似奇异或病态的。这种分解还决定了基于割线的优化器观测到的曲率信息。由完整PINN目标生成的梯度位移结合了非负Gauss-Newton曲率和残差相关曲率。因此,即使损失持续下降,原始割线对也可能表现出弱、符号不定或强烈各向异性的曲率。自缩放使逆近似的幅度适应观测曲率的变化。相似文章
具有傅里叶增强特征的物理信息神经网络的交替Levenberg-Marquardt训练
本文提出了FALM-PINN,一种用于物理信息神经网络的交替Levenberg-Marquardt训练框架,该框架使用傅里叶增强特征来解决谱偏差和表示-系数耦合问题,在高频和非线性偏微分方程上实现了最多低两个数量级的误差。
基于空间相关性的物理信息神经网络课程学习
本文提出了一种基于空间相关性的物理信息神经网络(PINNs)课程学习框架,通过利用子区域间的空间相关性来提高训练稳定性和求解精度,解决了高维非凸损失景观和多目标约束不平衡等问题。
具有可学习损失平衡和迁移学习的物理信息神经网络
本文提出了一种自监督物理信息神经网络(PINN)框架,该框架通过可学习的混合神经元自适应地平衡基于物理和数据驱动的损失,并结合迁移学习以提高数据稀缺情况下的效率。该框架在仅有87个数据点的液态金属微型散热器CFD数据上进行了验证,误差低于8%。
面向广义PINNs的无模块化冲突规避训练
本文识别了物理信息神经网络(PINNs)中一种由容量引起的失效模式,其中过参数化网络发展出功能模块化,阻碍收敛,并提出模块稀疏同步(ModSync)框架,该框架惩罚任务专用连接以保持跨目标交互,并达到最先进的精度。
用于微分方程的自适应量子物理信息神经网络及其在流体动力学中的应用
本文介绍了一种混合量子-经典框架,通过自适应配置点采样和损失感知注意力机制增强量子物理信息神经网络(QPINNs),用于求解微分方程,在流体动力学和反应-扩散基准测试中取得了显著的精度提升。