频率分解何时有益于物理信息神经网络(PINNs)?一项初步消融研究
摘要
本研究通过提出一种双分支、频谱门控架构(DBSG-PINN),探讨了频率分解对物理信息神经网络(PINNs)的益处。在一维偏微分方程基准测试上的消融实验表明,频率分解在频谱复杂问题上最为有效,可将误差降低高达59.2%。
查看缓存全文
缓存时间: 2026/08/27 09:27
# 频率分解何时有益于物理信息神经网络?一项初步消融研究
来源:https://arxiv.org/html/2608.24940
2026年8月14日
###### 摘要
偏微分方程(PDEs)通常具有高频和多尺度特征,神经网络难以逼近。物理信息神经网络(PINNs)将控制方程直接融入训练过程,但存在*频谱偏差*:它们学习低频分量的速度快于高频分量。傅里叶特征嵌入和正弦激活等技术可解决此问题,但大多数研究假设这些技术普遍有益,而未实际检验哪些频谱区域真正受益。我们引入一种双分支、频谱门控架构(DBSG-PINN),将低频和高频分量分离到独立子网络中,并通过自适应门控将其连接,利用该架构对频率分解和频谱路由进行了部分受控消融实验。我们在五个一维基准PDE上进行了测试,涵盖从平滑单尺度问题到振荡多尺度问题。频率分解在频谱复杂的基准问题上效果最为显著,在多模态波动问题中将相对L₂误差降低了59.2%,但在平滑PDE上获益甚微。在某个基准(一维波动方程)上,其表现显著差于更简单的固定组合变体。门控的效益与目标解的频谱丰富程度成正比:完整模型相对于消融变体的优势在多尺度基准上最大,在单尺度基准上最小(或为负值),这符合门控利用频率结构而非作为噪声的假设,尽管我们本研究未直接可视化或量化其空间激活。所有结果均来自五个一维基准的单一训练随机种子,因此我们将此呈现为一项探索性研究,旨在提出问题而非提供答案,并概述了验证该模式是否成立所需的额外随机种子和基准测试。
*关键词* 物理信息神经网络⋅频谱偏差⋅频率分解⋅消融研究⋅偏微分方程
## 1 引言
偏微分方程(PDEs)是建模物理、生物和工程系统的数学支柱,涵盖流体流动、热传导、波传播、扩散、反应动力学和电磁现象。大多数此类方程源于守恒定律和基本原理,但封闭形式的解仅存在于一小类理想化情况中。一旦涉及非线性动力学、复杂几何结构、非均匀材料或高维参数空间,解析解通常难以获得。这就是为什么数值方法——有限差分、有限元、谱求解器——在实践中承担了主要任务。它们有效,但代价不菲:网格生成、重复模拟运行和大量计算是其代价,而对于反问题、不确定性量化与参数估计,这一代价更为高昂。
科学机器学习(SciML)采用不同路径,将控制物理定律直接融入数据驱动模型,而非仅依赖观测数据——网络在无需大量标注数据的情况下,被推动寻求物理一致的解。物理信息神经网络(PINNs)可能是该领域最具影响力的框架,用于正向和反向PDE问题:控制方程、边界条件和初始条件通过自动微分融入训练目标,因此网络所学内容必须满足底层物理定律。此后,PINNs已应用于计算流体动力学、反向建模、生物医学工程和地球物理模拟,目前已成为SciML中的默认工具。
尽管如此,传统PINNs并非没有问题:已报道的包括优化病态、竞争损失项间的不平衡,以及在刚性或高度非线性PDE上的收敛不良。*频谱偏差*可能是其中研究最多的问题——通过梯度下降训练的网络能很好地学习目标函数的低频分量,但高频分量的学习则滞后。研究首次在深度网络中展示了这一点,而神经切线核(NTK)随后给出了原因:低频函数与主导的核特征模态对齐,因此收敛更快。在实践中,这意味着PINNs常难以处理局部不连续性、陡峭梯度、振荡行为或多个相互作用的时空尺度——波传播、反应扩散系统以及其他高频或多尺度PDE往往是此问题最突出的领域。
针对频谱偏差,已提出多种频率感知的修复方法,大致可分为四类。一类直接丰富输入本身:傅里叶特征嵌入帮助网络逼近高频函数,正弦表征网络(SIREN)中的周期激活为振荡信号及其导数实现了类似功能。第二类直接作用于优化过程,采用自适应激活函数、自适应损失平衡和学习率退火。第三类通过域分解解决可扩展性问题——保守PINNs、扩展PINNs和有限基PINNs均将域划分为子区域,使优化和局部精度更易处理。第四类依赖门控机制或更深层的残差架构以实现可扩展性和稳定性。这些进展共同推动了PINNs可处理的问题范围大幅扩展。
尽管取得了这些进展,大多数现有工作专注于构建更复杂的架构以对抗频谱偏差,而较少关注这些机制*何时*真正有效。大多数频率感知方法假设更丰富的频谱表示对各类PDE普遍有用。但物理系统的频谱特性差异很大:一些PDE平滑且以低频为主,而另一些则涉及局部振荡、多个相互作用的频率模式或复杂的多尺度动力学。这引出一个自然问题:显式频率分解是否始终能提高精度,抑或其价值取决于PDE的频谱特性?据我们所知,鲜有研究直接比较频率分解架构与匹配容量的消融变体在不同频谱复杂度PDE上的表现。这一空白促使我们提出本探索性研究。
为研究此问题,我们构建了双分支频谱门控物理信息神经网络(DBSG-PINN),这是一个用于检验频率分解在PINNs中作用的受控实验框架。它由两个子网络组成,每个专门处理不同频谱区域:一个低频分支使用双曲正切激活来捕获平滑的解分量,一个高频分支使用正弦激活来建模振荡行为。它们的输出通过一个自适应门控结合,该门控学习空间变化的混合权重,使模型能根据局部解的行为平衡两种表示。每个组件均可移除,而不改变优化过程或(大致)网络容量,这使得消融研究得以进行:我们可以隔离频率分解和自适应频谱路由的单独贡献。
我们在五个基准PDE上测试了该框架,这些PDE涵盖了从平滑单尺度解到振荡多尺度动力学的频谱复杂度范围:伯格斯方程、反应扩散方程、艾伦-卡恩方程、波动方程和多模态波动方程。对于每个基准,我们将完整的DBSG-PINN与三个消融变体进行比较,分别移除高频分支、低频分支或自适应门控,同时尽可能保持网络容量和优化设置一致。这旨在减少(但未能完全消除)性能差异可能源于模型复杂度或训练策略而非频率分解本身的风险;我们将在第4节讨论此控制实现了什么、未实现什么。
在所有五个基准上,频率分解在频谱复杂的基准上明显有益:在多模态波动方程上相对L₂误差降低达59.2%,并且在该基准上频谱恢复效果也更广泛地改善。在更平滑、单尺度的问题上,效益缩小或消失——在伯格斯方程上,一个更简单的固定组合变体略胜完整的门控模型,而在一维波动方程上则显著胜出。我们需要谨慎说明这展示了什么、未展示什么:这些是从一个种子在五个基准上的观察结果,并非关于频率分解PINNs作为一个类别的普遍结论。
除精度外,我们还考察了学习到的门控在不同基准上的贡献。其效益在频谱内容最丰富的基准上最大,在最简单的基准上最小(或为负)——这一模式符合门控利用频率结构而非充当噪声的假设,尽管我们是从基准级比较而非门控空间激活的直接可视化中推断的。尽管如此,这来自每个基准的一个训练模型,需要独立验证——理想情况下包括将g(x,t)与局部频谱内容进行直接可视化——才能将其称为该架构的普遍特性。
#### 我们的贡献
- • 我们构建了DBSG-PINN,一种结合低频和高频子网络并通过自适应频谱门控连接的双分支架构。
- • 我们设计了一个消融框架,可单独移除低频分支、高频分支或门控,同时精确匹配训练设置,并仅近似匹配每分支的容量——在大多数基准上,低频和高频分支的深度和宽度并不相同。
- • 我们报告了五个具有不同频谱复杂度的一维基准PDE的初步比较——旨在揭示值得进一步研究的模式,而非确立普遍规律。
- • 我们展示了初步的、基准级的模式,即门控的贡献与目标解的频谱复杂度成正比,尽管我们在此未直接可视化或量化其空间激活。
## 2 方法
### 2.1 物理信息神经网络
PINNs属于更广泛的科学机器学习(SciML)模型类别,将控制物理定律直接融入训练目标,而非仅依赖标注数据。具体而言,这意味着在最小化控制PDE残差的同时,考虑初始和边界条件,推动网络寻求与底层物理一致的解,而不仅仅是拟合数据点。
考虑一个一般非线性PDE
∂u(x,t)/∂t + N[u(x,t)] = 0, (1)
其中u(x,t)是未知解,x是空间坐标,N(⋅)是非线性微分算子。
解由神经网络近似
u(x,t) ≈ u_θ(x,t), (2)
其中θ是可训练的网络参数。
使用自动微分,PDE残差计算为
r_θ(x,t) = ∂u_θ(x,t)/∂t + N[u_θ(x,t)]. (3)
评估r_θ(x,t)所需的所有空间和时间导数均通过自动微分获得,该方法通过网络图计算精确导数,而非依赖有限差分近似。
整体的PINN目标是一个加权和,包括控制方程残差以及初始和边界条件损失,
L = λ_r L_PDE + λ_IC L_IC + λ_BC L_BC, (4)
标量权重λ_r、λ_IC和λ_BC用于平衡这些项。选择不当的权重是PINN训练中梯度不平衡和刚性问题的已知原因,因此先前工作探索了自适应或自加权方案。此处我们为每个基准固定权重(表6),以便所有消融变体共享相同的损失环境;自适应加权留待未来工作。
其中
L_PDE = (1/N_r) Σ_{i=1}^{N_r} ||r_θ(x_i, t_i)||², (5)
且
L_IC = (1/N_IC) Σ_{i=1}^{N_IC} ||u_θ(x_i, 0) - u_0(x_i)||², (6)
方程1写作一阶时间PDE以保证一般性,此时上述值项是所需的唯一初始条件。对于第3节中的二阶时间(波动类型)基准(多模态波动和一维波动),控制方程除了初始值u(x,0)=u_0(x)外,还指定初始速度u_t(x,0)=v_0(x);我们在L_IC中强制执行这两项,
L_IC = (1/N_IC) Σ_{i=1}^{N_IC} [||u_θ(x_i, 0) - u_0(x_i)||² + ||∂_t u_θ(x_i, 0) - v_0(x_i)||²], (7)
其中∂_t u_θ(x_i, 0)再次通过自动微分获得,且两项在L_IC内权重相等。对于一阶时间基准(伯格斯、艾伦-相似文章
具有傅里叶增强特征的物理信息神经网络的交替Levenberg-Marquardt训练
本文提出了FALM-PINN,一种用于物理信息神经网络的交替Levenberg-Marquardt训练框架,该框架使用傅里叶增强特征来解决谱偏差和表示-系数耦合问题,在高频和非线性偏微分方程上实现了最多低两个数量级的误差。
面向物理信息神经网络的傅里叶特征金字塔
本文介绍了beignet,一种PINN架构,它用可训练的多分辨率傅里叶特征金字塔替换了随机傅里叶特征,在PDE基准测试上实现了更高的准确性和计算效率。
Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators
This paper introduces feature interaction modules based on factorization machines into physics-informed neural networks and neural operators (FM-PINN, FM-Operator, FM-DeepONet) to better capture spatio-temporal variable couplings for solving parameterized PDEs, showing accuracy gains particularly on shock-dominated equations.
具有可学习损失平衡和迁移学习的物理信息神经网络
本文提出了一种自监督物理信息神经网络(PINN)框架,该框架通过可学习的混合神经元自适应地平衡基于物理和数据驱动的损失,并结合迁移学习以提高数据稀缺情况下的效率。该框架在仅有87个数据点的液态金属微型散热器CFD数据上进行了验证,误差低于8%。
周期性物理信息神经网络中傅里叶谱微分与空间自动微分的计算比较
本文比较了周期性物理信息神经网络中的傅里叶谱微分与空间自动微分,发现傅里叶方法在不损害准确性的前提下,显著加快了训练速度并减少了内存消耗。