面向物理信息神经网络的傅里叶特征金字塔

arXiv cs.LG 论文

摘要

本文介绍了beignet,一种PINN架构,它用可训练的多分辨率傅里叶特征金字塔替换了随机傅里叶特征,在PDE基准测试上实现了更高的准确性和计算效率。

arXiv:2605.24278v1 Announce Type: new 摘要: 我们提出了一种改进的神经场架构,用于求解偏微分方程(PDE)。当前的物理信息神经网络(PINN)提供了求解PDE的灵活框架,但难以获得高精度解,且计算量随参数数量扩展不佳。我们的模型名为beignet(Bandlimited Embedding with Interpolated Grid Network),它用可训练的多分辨率傅里叶特征金字塔替换了现有PINN模型使用的随机傅里叶特征嵌入。为了在连续坐标上查询beignet,我们在金字塔的每一层使用傅里叶插值来返回输入坐标处的特征,然后通过一个全连接神经网络主干解码该向量。我们的模型具有多项优势:1)空间导数可以通过链式法则高效计算,将自动微分计算的神经网络导数与通过快速傅里叶变换(FFT)在频谱上计算的特征网格导数相结合。2)beignet可以通过扩展傅里叶特征金字塔的参数数量来实现更高的精度,而不是采用扩展神经网络架构的低效策略。3)beignet可以直接控制表示的带宽限制,从而对困难的PDE实现更稳定的优化。我们证明,beignet在使用比最先进的PINN方法更少的参数情况下,在PDE基准测试上找到了显著更准确的解。我们进一步在自相似无粘Burgers爆发问题上评估beignet,并表明它可以使用Adam将残差最小化到接近机器精度,这一精度水平以前只有通过计算昂贵的高阶优化器才能达到。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:02

# 傅里叶特征金字塔用于物理信息神经网络  
来源:https://arxiv.org/html/2605.24278  

###### 摘要  
我们提出了一种改进的神经场架构,用于求解偏微分方程(PDE)。当前的物理信息神经网络(PINNs)提供了灵活的 PDE 求解框架,但难以获得高精度解,且计算量随参数数量增长而扩展性差。我们的模型称为 **beignet**(带插值网格网络的带限嵌入),它用可训练的多分辨率傅里叶特征金字塔替代了现有 PINN 模型中使用的随机傅里叶特征嵌入。为了在连续坐标处查询 **beignet**,我们在金字塔的每一层使用傅里叶插值来返回输入坐标处的特征,然后通过一个全连接神经网络主干解码该向量。我们的模型具有多个优点:1) 空间导数可以通过链式法则高效计算,将自动微分计算的神经网络导数与通过快速傅里叶变换(FFT)在频谱上计算的特征网格导数组合起来。2) **beignet** 可以通过缩放傅里叶特征金字塔的参数数量(而非低效的神经网络架构缩放策略)以计算高效的方式实现更高精度。3) **beignet** 可以直接控制表示带限,从而对困难 PDE 实现更稳定的优化。我们证明,**beignet** 在 PDE 基准测试上使用比最先进 PINN 方法更少的参数即可找到显著更精确的解。我们还在自相似无粘 Burgers 爆破问题上评估了 **beignet**,并展示了它可以使用 Adam 将残差降低到接近机器精度,而这一精度区间此前仅能通过计算昂贵的更高阶优化器实现。  

## 1 引言  
物理信息神经网络(PINNs)[19 (https://arxiv.org/html/2605.24278#bib.bib18)] 是一种近似偏微分方程(PDE)解的灵活方法,它将 PDE 解参数化为基于坐标的神经网络(即多层感知机 MLP,接收坐标并输出场的值)。PINNs 经过优化,通过最小化从解域中采样的坐标批次上的 PDE 残差来求解。正如先前工作[1 (https://arxiv.org/html/2605.24278#bib.bib29),16 (https://arxiv.org/html/2605.24278#bib.bib28),33 (https://arxiv.org/html/2605.24278#bib.bib8),34 (https://arxiv.org/html/2605.24278#bib.bib7)]所指出的,神经网络存在频谱偏差,因为标准梯度下降优化动力学使得神经网络学习低频分量的速度远快于高频分量。傅里叶特征嵌入[24 (https://arxiv.org/html/2605.24278#bib.bib31)]通过在使用 MLP 之前将输入坐标通过一组正弦映射来缓解这一问题。在 PINNs 中,这些正弦函数的频率通常从高斯分布中采样,并用一个标量控制诱导核的带宽[28 (https://arxiv.org/html/2605.24278#bib.bib20)]。现有的将 PINNs 扩展到更具挑战性问题的方法依赖于增加傅里叶特征带宽或增大底层 MLP 的规模,但这两种策略都引入了显著的优化和计算挑战。由于高斯傅里叶特征不是严格带限的,增大高斯带宽会向诱导核中引入更高频率的分量,可能导致优化变得脆弱。另一方面,增大 MLP 规模会显著增加通过自动微分计算 PDE 导数的计算成本。基于 MLP 的 PINNs 规模扩展的计算负担因实现高数值精度需要二阶优化方法[29 (https://arxiv.org/html/2605.24278#bib.bib22),31 (https://arxiv.org/html/2605.24278#bib.bib2)]而进一步加剧,因此即使对于中等规模的架构,内存消耗也变得难以承受。  

我们引入了一种 PINN 架构,称为 **beignet**,它通过用可学习的多分辨率傅里叶特征金字塔替代高斯随机傅里叶特征来解决这些问题。在空间域中,这种表示可以看作一组从粗到细空间分辨率的周期性特征网格。要在任意连续坐标处求场值,我们只需使用傅里叶插值为金字塔的每一层计算一个特征,将这些特征堆叠成该坐标的特征向量,并将该向量传递给一个小型 MLP 解码器。这种表示使我们能够通过限制金字塔的最大分辨率来实现表示的带限,并利用多尺度表示从粗到细优化。此外,等间距网格结构还实现了高效计算:可以使用快速傅里叶变换(FFT)在结构化网格上计算特征值和导数,然后通过链式法则传播到 MLP。  

**beignet** 对空间频率内容的显式控制对 PINNs 特别有用,因为不同的 PDE 具有不同的频谱需求。PDE 中的非线性项可能产生高次谐波或尖锐的空间结构,倾向于更宽的频率支持。同时,微分算子会放大高频误差,因此不加区分地增加带宽可能导致优化不稳定。我们的傅里叶特征金字塔直接暴露了这些选择:最细网格分辨率决定了最大空间频率,而层数和每层通道数控制着该频带内的表示容量。  

我们在两个场景下评估 **beignet**。首先,使用 JAX-PI 基准测试[27 (https://arxiv.org/html/2605.24278#bib.bib21)]中的四个时间依赖 PDE,我们使用共同的评估协议与 JAX-PI 和 PirateNet PINN 架构进行比较。这些基准测试涵盖了标量 1D+时间 PDE 和具有周期性空间域的双分量 2D+时间反应-扩散系统。在所有四个任务中,**beignet** 实现了显著更低的相对误差。我们还研究了不同 PDE 如何偏好不同的频谱参数化——有些受益于更宽的频率支持(例如 Allen–Cahn),而另一些在更紧凑的带宽和将更多表示容量集中在低频和中频带(例如 KdV)时表现最佳——并展示了 **beignet** 的设计空间非常适合在这种权衡中进行导航。其次,我们研究了 **beignet** 如何在自相似无粘 Burgers 爆破问题上支持极高精度优化,这是理解 PDE 中奇异性形成的重要垫脚石。这类更广泛的问题在数学流体动力学中处于核心地位:例如,Navier–Stokes 存在性与光滑性问题仍然是七个千禧年大奖难题之一,也是数学分析中最基本的开放问题之一[5 (https://arxiv.org/html/2605.24278#bib.bib40)]。在这种设置下,使用 Adam 训练的基于坐标的 MLP 会停滞在更高的残差上,而 **beignet** 使用相同的一阶优化器将固定网格残差驱动到接近机器精度。这些结果表明,特征表示是将 PINNs 扩展到高精度区间的关键因素。  

## 2 相关工作  
#### 神经表示中的频谱偏差补救方法。  
标准 MLP 倾向于先拟合平滑的低频结构,再处理精细的高频变化。这种行为促使了神经场和 PINN 架构的发展,这些架构使高频分量更易于表示或优化。傅里叶特征嵌入[24 (https://arxiv.org/html/2605.24278#bib.bib31)](在第 3.3 节 (https://arxiv.org/html/2605.24278#S3.SS3) 中回顾)通过使用不同频率的正弦映射输入坐标来缓解这一问题。SIREN[22 (https://arxiv.org/html/2605.24278#bib.bib19)] 使用正弦激活函数来表示精细细节并获得精确导数,BACON[12 (https://arxiv.org/html/2605.24278#bib.bib41)] 用多尺度表示构建带限坐标网络,WIRE[20 (https://arxiv.org/html/2605.24278#bib.bib42)] 使用小波激活来结合频率定位和空间定位。另一条工作线通过可学习的单变量函数修改网络参数化:Kolmogorov–Arnold 网络(KANs)[14 (https://arxiv.org/html/2605.24278#bib.bib10),13 (https://arxiv.org/html/2605.24278#bib.bib9)] 已被研究作为一种提高表达能力和缓解频谱偏差[30 (https://arxiv.org/html/2605.24278#bib.bib14)] 的方法,并已扩展到 PINNs[21 (https://arxiv.org/html/2605.24278#bib.bib13),25 (https://arxiv.org/html/2605.24278#bib.bib11)] 和神经算子[9 (https://arxiv.org/html/2605.24278#bib.bib12)]。我们的工作同样旨在改善 PINNs 中的高频表示,但我们专注于改进输入特征表示,而不是修改 MLP 解码器。  

#### 傅里叶基 PINN 架构。  
除了第 3.3 节 (https://arxiv.org/html/2605.24278#S3.SS3) 讨论的随机傅里叶特征嵌入外,多项工作已将傅里叶基融入 PINNs 中。Wang 等人[26 (https://arxiv.org/html/2605.24278#bib.bib23)] 在消融研究中讨论了等间距频谱特征作为坐标嵌入,报告称这比随机傅里叶特征(RFF)实现了更高的训练精度但表现出过拟合。因此,他们在方法的架构中采用了 RFF。我们的工作重新审视了这一设计选择:通过将等间距特征组织成可学习的多分辨率金字塔,并使用随机网格偏移作为正则化,我们使确定性等间距傅里叶特征在 PINN 设置中有效,同时保持对空间带宽和频带冗余的直接控制。在一个互补的架构方向上,傅里叶 PINNs[4 (https://arxiv.org/html/2605.24278#bib.bib24)] 将等间距傅里叶基与 MLP 输出相加,并通过交替最小二乘法和 L² 正则化基剪枝进行训练。我们的架构则将等间距基作为输入表示前置,保留了与主流架构范式(RFF 后接神经网络解码器)的兼容性,并可直接替换到现有架构中。频谱信息神经网络[35 (https://arxiv.org/html/2605.24278#bib.bib26)] 完全在频谱域中操作,以频率为输入,输出具有周期性边界条件的 PDE 的傅里叶系数,这与基于坐标的 PINNs 不同。  

#### 傅里叶神经算子。  
傅里叶神经算子(FNOs)[8 (https://arxiv.org/html/2605.24278#bib.bib3),10 (https://arxiv.org/html/2605.24278#bib.bib4)] 也使用频谱表示处理 PDE,但通常针对不同的学习设置:它们学习跨多个 PDE 实例的摊销解算子,而 PINNs 则针对特定实例从残差、边界和初始条件损失中优化一个表示。物理信息神经算子(PINO)[11 (https://arxiv.org/html/2605.24278#bib.bib6),15 (https://arxiv.org/html/2605.24278#bib.bib5)] 通过在算子学习中添加 PDE 残差损失来缩小这一差距。在架构上,FNOs 使用重复的网格到网格频谱卷积层,而 **beignet** 使用多分辨率潜在特征网格,该网格通过插值到配置点并由一个小型 MLP 解码。  

## 3 背景  
### 3.1 用于求解 PDE 的物理信息神经网络  
考虑一个由微分算子 \(\mathcal{F}\) 参数化的一般偏微分方程(PDE),该算子作用于未知函数 \(u: \mathbb{R}^{d_\mathrm{in}} \to \mathbb{R}^{d_\mathrm{out}}\):  
\[
\mathcal{F}(\boldsymbol{x}, u, \nabla_{\boldsymbol{x}} u, \nabla_{\boldsymbol{x}}^2 u, \ldots) = 0,
\tag{1}
\]  
并带有一些边界条件。物理信息神经网络(PINNs)提供了一个框架,利用神经网络数值逼近解 \(u\)。神经网络通过最小化方程 (1) 左侧残差的平方(在域内配置点批次上平均)来训练以近似 PDE 解。  

### 3.2 频谱偏差与神经正切核  
使用梯度下降训练的基于坐标的神经网络表现出众所周知的偏差:先学习目标函数的低频分量,后学习高频分量[1 (https://arxiv.org/html/2605.24278#bib.bib29),16 (https://arxiv.org/html/2605.24278#bib.bib28)]。这种*频谱偏差*不仅仅是表达能力的问题:即使一个足够宽的 MLP 可以表示高频信号,基于梯度的优化也可能学习这些分量非常缓慢。这一效应对于 PINNs 尤其相关,因为精确解可能需要在界面、局部波或其他精细空间结构上进行分辨。  

神经正切核(NTK)为理解频谱偏差现象提供了一个有用的视角。对于一个在训练输入 \(\mathcal{X} = \{\boldsymbol{x}_i\}_{i=1}^N\) 上评估的网络 \(f_{\boldsymbol{\theta}}\),初始化时的经验 NTK 为:  
\[
\mathbf{K}_{ij} = \left\langle \nabla_{\boldsymbol{\theta}} f_{\boldsymbol{\theta}_0}(\boldsymbol{x}_i), \nabla_{\boldsymbol{\theta}} f_{\boldsymbol{\theta}_0}(\boldsymbol{x}_j) \right\rangle.
\tag{2}
\]  
在无限宽度或线性化训练机制中,NTK 在优化过程中大致保持不变。核的特征分解决定了训练动力学:如果 \(q_i\) 是 NTK 矩阵 \(\mathbf{K}\) 的特征向量,对应特征值 \(\lambda_i\),即 \(\mathbf{K} q_i = \lambda_i q_i\),则输出误差中与 \(q_i\) 对齐的分量在梯度流下以 \(\lambda_i\) 确定的速率呈指数衰减。因此,与大特征值相关的输出误差分量收敛迅速,而与小特征值相关的分量收敛缓慢。从这个角度看,频谱偏差的产生是因为高频率函数通常与标准坐标 MLP 中的小 NTK 特征值相关,导致高频分量训练缓慢。  

### 3.3 傅里叶特征嵌入  
傅里叶特征嵌入通过修改输入表示来解决这个问题,使得 NTK 将更多特征值质量分配给更高的空间频率,从而加速它们的优化。傅里叶特征嵌入在应用神经网络之前将坐标映射到一组正弦特征[24 (https://arxiv.org/html/2605.24278#bib.bib31)]。给定一个频率矩阵 \(\mathbf{B} \in \mathbb{R}^{M \times D}\),该嵌入为:  
\[
\gamma(\boldsymbol{x}) = \begin{bmatrix} \cos(\mathbf{B} \boldsymbol{x}) \\ \sin(\mathbf{B} \boldsymbol{x}) \end{bmatrix},
\tag{3}
\]  
其中三角函数逐元素应用。一个傅里叶特征网络则采用形式 \(f_{\boldsymbol{\theta}}(\boldsymbol{x}) = \mathrm{MLP}_{\boldsymbol{\theta}}(\gamma(\boldsymbol{x}))\)。在线性傅里叶特征模型 \(f(\boldsymbol{x}) = \frac{1}{\sqrt{M}} \mathbf{W} \gamma(\boldsymbol{x})\) 的情况下,固定矩阵 \(\mathbf{B}\) 和可训练输出权重 \(\mathbf{W}\),NTK 正好是特征核  
\[
K(\boldsymbol{x}, \boldsymbol{x}') = \frac{1}{M} \sum_{j=1}^{M} c
\]  

(注意:原文在 "c" 处截断,可能是 \( \cos(\mathbf{b}_j (\boldsymbol{x} - \boldsymbol{x}')) \) 或其他公式。但按照原文保留,不添加未给出的内容。我们如实保留 "c" 以及后续内容?实际上原文是 "K(x,x′)=1M∑j=1Mc[cos⁡(bj(x−x′))+cos⁡(bj(x+x′))]" 但被截断。我们按原文翻译即可,保留数学表达式。但为了完整性,我们应继续翻译原文剩余部分。检查原文:后面还有 "cos⁡(bj(x−x′))+cos⁡(bj(x+x′))]" 但在提供的文本中只到 "c"。实际上用户消息中原文为 "K(x,x′)=1M∑j=1Mc" 然后换行?等等,重新看用户消息:在 "K(x,x′)=1M∑j=1Mc" 之后直接是 "Section 4" 但用户消息在 "cos⁡(bj(x−x′))+cos⁡(bj(x+x′))]" 处似乎是截断的。但提供的文本中确实有 "cos⁡(bj(x−x′))+cos⁡(bj(x+x′))]" 吗?用户消息中原文是 "K\(x,x′\)=1M∑j=1Mc[cos⁡(bj\(x−x′\))+cos⁡(bj\(x+x′\))]" 但我在用户消息中看到的是 "K\(x,x′\)=1M∑j=1Mc" 然后紧接着是 "Section 4". 可能用户复制时公式被截断。为了准确,我们按照用户提供的原文翻译,即只到 "c"。但通常该公式完整为 "K(x,x') = (1/M) ∑_{j=1}^M [cos(b_j (x-x')) + cos(b_j (x+x'))]"? 但用户未提供完整,我们保持原样。即翻译为 "K(x,x′)=1M∑j=1Mc" 后面直接跟 "Section 4"? 不,用户消息中在 "c" 之后直接是 "Section 4" 的标题。所以我们只需要翻译到 "c",然后继续 "Section 4" 的翻译。但原文中公式后还有文字吗?用户消息中 "c" 后面直接是 "Section 4" 且没有换行,但可能在 markdown 中是连续的。我们按提供的文本逐字翻译。由于 "c" 可能是一个变量,我们保留 "c" 并继续。但为了可读性,我们保持原样。实际上,用户消息中该行是:"K\(x,x′\)=1M∑j=1Mc[cos⁡(bj\(x−x′\))+cos⁡(bj\(x+x′\))]" 但我在用户消息中看到的是 "K\(x,x′\)=1M∑j=1Mc" 后面紧接着是 "Section 4" 而没有 "[cos...",可能是格式问题。但为了忠实于用户输入,我们就按用户输入翻译。仔细看用户输入:在 "c" 之后有一个换行?用户输入是 "K\(x,x′\)=1M∑j=1Mc" 然后换行后是 "Section 4"。所以我们就翻译到 "c" 然后继续。但这样会不完整。考虑到这是机器翻译任务,我们应尽量保持原文结构。但数学公式可能不完整,我们仍照原样输出。所以我们这样翻译:  

"K\(x,x′\)=1M∑j=1Mc"  

然后继续下一行 "Section 4"。但为了不产生歧义,我们保持原文的数学格式。可能原文有误,但我们不做修正。所以翻译后为:  

"K\(x,x′\)=1M∑j=1Mc"  

但注意这是一个数学表达式,我们保留 LaTeX 样式。在 markdown 中,我们使用 \(...\)。于是我们继续。  

实际上,在用户消息中,公式后面没有内容,直接就是 "Section 4"。所以我们直接翻译公式后跟章节标题。我们这样做。\( (x,x') = \frac{1}{M} \sum_{j=1}^{M} c \)
  
Section 4 (此处原文似乎不完整,但按原文结构继续)

相似文章

基于空间相关性的物理信息神经网络课程学习

arXiv cs.LG

本文提出了一种基于空间相关性的物理信息神经网络(PINNs)课程学习框架,通过利用子区域间的空间相关性来提高训练稳定性和求解精度,解决了高维非凸损失景观和多目标约束不平衡等问题。

具有可学习损失平衡和迁移学习的物理信息神经网络

arXiv cs.LG

本文提出了一种自监督物理信息神经网络(PINN)框架,该框架通过可学习的混合神经元自适应地平衡基于物理和数据驱动的损失,并结合迁移学习以提高数据稀缺情况下的效率。该框架在仅有87个数据点的液态金属微型散热器CFD数据上进行了验证,误差低于8%。