用于求解偏微分方程的新型傅里叶特征网络
摘要
本文提出了 Fourier Feature Networks (FENs),一种使用傅里叶特征求解偏微分方程的单隐藏层神经网络架构,其精度高于无需仿射变换的 Extreme Learning Machines。
查看缓存全文
缓存时间: 2026/08/18 10:26
# 一种求解偏微分方程的新颖傅里叶特征网络
来源:https://arxiv.org/html/2608.14733
\[style=chinese, orcid=0000\-0002\-8398\-7212\]
\[style=chinese\]
\[style=chinese\]
\[style=chinese\]
**杨启宏**
yangqh0808@163\.com
地址:组织=四川大学数学学院,城市=成都,邮编=610065,国家=中国
**邓杨涛**
ytdeng1998@foxmail\.com
**何巧琳**
qlhejenny@scu\.edu\.cn
###### 摘要
基于单隐藏层神经网络的基础,本文提出了傅里叶特征网络,该网络利用\(\cos\)、\(\sin\)或两者的组合来引入傅里叶特征。与极限学习机类似,傅里叶特征网络采用单隐藏层架构来生成一组基函数。然后,目标函数被近似表示为这些基函数的线性组合,其系数通过最小二乘法确定。然而,与通常依赖仿射变换来提高表示能力的极限学习机不同,傅里叶特征网络无需对输入变量进行此类变换即可获得高精度解。为了评估这些网络的表示能力,我们针对随机初始化且固定的权重和偏置,在一个预定义的范围内搜索最优缩放因子。通过调整此缩放因子,我们确保使用各种激活函数(例如\(\text{sigmoid}\)、\(\tanh\)和\(\text{swish}\))时,傅里叶特征网络和极限学习机之间的比较是公平的。我们的数值实验表明,傅里叶特征网络始终比极限学习机获得更高的精度。
###### 关键词
神经网络,函数逼近,傅里叶特征,最小二乘法,偏微分方程
††corresponding:通讯作者
††credit:本研究的概念构思,方法论,写作 \- 初稿撰写
## 1 引言
近年来,神经网络在科学计算中的应用日益广泛。值得注意的是,诸如Deep Ritz Method \[38\]、Deep Galerkin Method \[33\]和Physics\-Informed Neural Networks \[28\]等方法的发展引起了极大关注。大量研究 \[39, 21, 14, 15, 1\] 已经证明了神经网络在该领域的巨大潜力,尤其是在偏微分方程的数值求解方面。当前基于神经网络的求解PDE的方法大致可分为两大类。第一类是基于训练的方法,其目标是最小化PDE的残差以拟合目标函数。这通常使用基于梯度的优化算法实现,如Adam \[18\]或L\-BFGS \[23\]。DRM \[38\]、DGM \[33\]和PINNs \[28\]等方法都属于这一类别。一个密切相关的方向是算子学习 \[19, 20, 25\],它旨在使用数据来近似无限维Banach空间之间的映射。尽管算子学习在表述和应用范围上有所不同,但它仍然从根本上依赖于基于训练的优化。
第二类包括随机化神经网络方法,它们不涉及迭代训练。相反,它们使用随机初始化的单隐藏层神经网络生成一组基函数。目标函数被表示为这些基函数的线性组合,PDE则被离散化为关于这些组合系数的线性方程组。然后使用最小二乘法求解这些系数。网络初始化后,权重和偏置保持固定;只优化线性系数。这种方法既可以看作是基于最小二乘的算法,也可以看作是随机化神经网络方法。代表性的技术包括随机特征法 \[4, 5, 3\]、基于Petrov–Galerkin方法的随机化神经网络 \[29, 31, 30, 36\]和隐藏层连接极限学习机 \[27\]。
尽管对基于训练的神经网络求解PDE进行了广泛研究,但这些方法往往精度有限,并且通常需要相当长的计算时间 \[7\]。相比之下,随机化神经网络因其能够高效且精确地求解PDE而在科学计算领域备受关注。然而,这类方法在实施上也面临一些显著的挑战。\chadded极限学习机是提出于\[16\]的单层前馈神经网络,其可能由于依赖Xavier或Kaiming初始化方法而无法获得满意的结果。Dong和Yang \[10\]提出了一种基于差分进化算法在ELM中计算\(R_{m}\)的最优或近最优值的方法。RFM与局部极限学习机非常相似,因为两者都采用称为单位划分的域分解策略。该技术使得通过方程的强形式使用ELM求解PDE成为可能。虽然有效,但域分解显著增加了算法实现的复杂性。\chadded数值实验在一些复杂情况下无法显示良好的结果。
在RNN\-PG中,解是通过PDE的弱形式构建的。因此,网格生成和数值积分是算法的必要组成部分,这进一步增加了其实现复杂性。HLConcELM与上述方法的不同之处在于修改了ELM的架构,具体是添加一个额外的隐藏层并连接隐藏层的输出。这种架构增强提高了精度,但也引入了额外的计算开销。特别是,当使用自动微分计算导数时,复杂的网络架构可能导致运行时间显著延长,尤其是在涉及大量基函数时。尽管这些算法可以实现比基于训练的神经网络显著更高的精度,但它们仍然达不到机器精度。
为了在保持低计算成本和避免增加网络复杂性的同时解决这个问题,我们专注于使用ELM求解PDE,特意避开增加复杂性的操作,如域分解和数值积分。为了进一步提高ELM的精度而不牺牲简单性,我们提议将傅里叶特征集成到网络架构中。具体来说,我们引入了傅里叶特征网络,它采用基于\(\cos\)、\(\sin\)或两者组合的激活函数。在这项工作中,我们提出并评估了三种类型的FEN,每种对应一种激活策略,并与使用\(\text{sigmoid}\)、\(\tanh\)和\(\text{swish}\)函数激活的传统ELM进行了详细的精度比较。\chadded所提出的FEN不对输入变量应用仿射变换。此外,我们使用统一的初始化方法来初始化权重和偏置,并采用一种在给定范围内搜索最优缩放因子的方法,使FEN能够实现最佳性能。
本文组织如下:第2节介绍了ELM的网络架构和算法细节,包括\(\text{sigmoid}\)、\(\tanh\)和\(\text{swish}\)激活函数。我们在第3节提出了傅里叶特征网络以及FEN的三种不同激活模式。第4节介绍了一系列旨在验证我们方法有效性的数值实验。第5节总结了我们的结果,讨论了我们工作的意义,并提出了未来的研究方向。
## 2 预备知识
### 2\.1 神经特征空间
神经网络被广泛认为是将\(d\)维输入映射到更低或更高维空间的非线性映射函数。在结构上,一个神经网络通常由三个部分组成:输入层、多个隐藏层和输出层。在此背景下,神经特征空间指的是最后一个隐藏层的输出所表示的函数空间。
假设输入向量为\(\boldsymbol{x}\in\mathbb{R}^{d}\)。神经网络隐藏层表示的非线性映射为\(\phi_{i}(\boldsymbol{x})\),其中\(1\leq i\leq M\),且\(M\)是最后一个隐藏层的输出数量。因此,神经特征空间,记为\(\mathcal{P}_{NN}\),定义为由基函数\(\{\phi_{i}\}\)张成的空间,即 \(\mathcal{P}_{NN}=span\\\{\phi_{1},\phi_{2},\cdots,\phi_{M}\\\}\)。(1)
在神经网络中,输出层通常计算最后一个隐藏层输出的线性组合。这里,我们假设输出层只有一个输出。因此,神经网络表示的函数可以表示为 \(u_{M}(\boldsymbol{x})=\sum_{i=1}^{M}w_{i}\phi_{i}\)。(2)
### 2\.2 极限学习机
假设网络在输入层有\(d\)个神经元,对应于输入向量\(\boldsymbol{x}\in\mathbb{R}^{d}\)。ELM的主要思想是随机初始化输入层与隐藏层之间的权重\(\boldsymbol{W}\in\mathbb{R}^{M\times d}\)和偏置\(\boldsymbol{b}\in\mathbb{R}^{M}\)。然后,直接计算从隐藏层到输出层的权重\(\boldsymbol{w}\in\mathbb{R}^{M}\)。这可以数学表述如下:
\(u_{M}(\boldsymbol{x})=\boldsymbol{w}^{T}\sigma(\boldsymbol{W}\boldsymbol{x}+\boldsymbol{b})\),
(3)
其中\(\sigma\)是激活函数,它对向量\(\boldsymbol{W}\boldsymbol{x}+\boldsymbol{b}\)进行逐元素作用,\(u_{M}(\boldsymbol{x})\)是ELM表示的函数。我们只需要计算\(\boldsymbol{w}\)。
### 2\.3 仿射变换
众所周知,归一化在增强神经网络训练的性能和泛化能力方面起着至关重要的作用 \[17\]。归一化加速训练过程,增强模型泛化能力,防止过拟合,并提高对权重初始化方法变化的鲁棒性。在科学计算中,当神经网络用于函数逼近或求解PDE时,归一化作为确保数值稳定性的基本预处理步骤至关重要。在此背景下,通常应用仿射变换。
设输入变量为\(\boldsymbol{x}\in\Omega\subset\mathbb{R}^{d}\),其中\(\Omega\)是一个闭集。仿射变换将输入变量\(\boldsymbol{x}\)映射到新向量\(\tilde{\boldsymbol{x}}\in[-1,1]^{d}\subset\mathbb{R}^{d}\),由下式给出:
\(T_{i}(x_{i})=2\frac{x_{i}-x_{i}^{(l)}}{x_{i}^{(u)}-x_{i}^{(l)}}-1\),
(4)
其中\(x_{i}\)是\(\boldsymbol{x}\)的第\(i\)个分量,\(x_{i}^{(l)}\)和\(x_{i}^{(u)}\)分别是\(x_{i}\)的下界和上界。
当使用ELM求解PDE时,应用仿射变换对于获得优异性能至关重要。然而,研究表明,省略这些变换可能导致结果显著退化。包含仿射变换的ELM可以表示为:
\(u_{M}(\boldsymbol{x})=\boldsymbol{w}^{T}\sigma(\boldsymbol{W}\tilde{\boldsymbol{x}}+\boldsymbol{b})=\boldsymbol{w}^{T}\sigma\left(\boldsymbol{W}\boldsymbol{T}(\boldsymbol{x})+\boldsymbol{b}\right)\),
(5)
其中\(\boldsymbol{T}=\left[T_{1}(x_{1}),T_{2}(x_{2}),\cdots,T_{d}(x_{d})\right]^{T}\)。
## 3 方法论
### 3\.1 傅里叶特征网络
观察发现,采用\(\tanh\)激活函数的神经网络虽然能够生成可接受的结果,但根本上无法达到机器级精度。为了解决这种逼近能力的限制并提高解的精度,我们通过傅里叶特征嵌入引入了一种新的架构增强。
#### 3\.1\.1 采用\(\cos\)激活函数的傅里叶特征网络
Gallant和White \[11\]通过开发余弦压缩激活函数,率先将傅里叶特征集成到神经网络架构中。在此基础上,Silvescu \[32\]通过基于余弦的激活算子实现了傅里叶特征嵌入。最近,Ngom和Marin \[26\]提出了一种采用余弦函数激活的单隐藏层傅里叶神经网络。尽管他们的实验证明了有希望的结果,但解的精度仍然达不到机器精度。此外,他们的模型省略了偏置项,这可能会限制神经网络的表达能力。
受到这些工作的启发,我们提出了一种采用\(\cos\)激活函数的傅里叶特征网络。在此背景下,我们也关注单隐藏层神经网络。目标函数可以表示为:
\(u_{M}(\boldsymbol{x})=\boldsymbol{w}^{T}\cos(\boldsymbol{W}\boldsymbol{x}+\boldsymbol{b})\)。
(6)
值得注意的是,与采用\(\text{sigmoid}\)、\(\tanh\)或\(\text{swish}\)函数激活的网络(如公式(5)所示)不同,采用\(\cos\)激活的傅里叶特征网络的输入不需要仿射变换。
#### 3\.1\.2 采用\(\sin\)激活函数的傅里叶特征网络
Sitzmann等人 \[34\]引入了正弦表示网络,它利用正弦函数作为周期性激活函数。这种设计使得神经网络能够相似文章
具有傅里叶增强特征的物理信息神经网络的交替Levenberg-Marquardt训练
本文提出了FALM-PINN,一种用于物理信息神经网络的交替Levenberg-Marquardt训练框架,该框架使用傅里叶增强特征来解决谱偏差和表示-系数耦合问题,在高频和非线性偏微分方程上实现了最多低两个数量级的误差。
Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators
This paper introduces feature interaction modules based on factorization machines into physics-informed neural networks and neural operators (FM-PINN, FM-Operator, FM-DeepONet) to better capture spatio-temporal variable couplings for solving parameterized PDEs, showing accuracy gains particularly on shock-dominated equations.
SirenFNO:傅里叶神经算子的高效全频学习
SirenFNO利用正弦表示网络学习全频傅里叶核,消除了频率截断,在提高PDE基准准确性的同时实现了显著的参数减少。
面向物理信息神经网络的傅里叶特征金字塔
本文介绍了beignet,一种PINN架构,它用可训练的多分辨率傅里叶特征金字塔替换了随机傅里叶特征,在PDE基准测试上实现了更高的准确性和计算效率。
Frequency Shift Physics-Informed Extreme Learning Machine for Solving High-Frequency Partial Differential Equations
本文提出了一种频移物理信息极限学习机(FS-PIELM)框架,利用加法权重初始化机制克服求解高频偏微分方程时的频谱偏差。该方法在基准问题上相比现有PIELM变体实现了高达五个数量级的改进。