关于神经网络的显式超表达逼近
摘要
本文研究了固定架构神经网络的显式参数-误差权衡逼近,利用中国剩余定理作为构造性编码机制,并获得了Lipschitz和Hölder光滑函数的显式界。
arXiv:2607.06781v1 Announce Type: new
摘要:本文研究了具有显式参数边界和基本激活函数的固定架构神经网络逼近问题。先前的工作展示了使用固定规模网络的超表达逼近,但缺乏关于参数大小相对于逼近误差的定量和非渐近刻画。我们通过引入中国剩余定理作为构造性编码机制解决了这一问题。对于$[0,1]^D$上的Lipschitz连续函数,我们构建了一个宽度为$\max\{D,4\}$、深度为$5$的网络,并给出了显式的参数-误差权衡。对于$C^{r,\gamma}_A\left([0,1]^D\right)$中的Hölder光滑函数,我们固定的网络宽度为$\max\{2D,\ D+5N+1\}$,深度为$r+9$,其参数大小$\mathcal{P}$满足$\log_2 \mathcal{P}=\mathcal{O}\bigl(\varepsilon^{-2D/(r+\gamma)}\log(1/\varepsilon)\bigr)$。这与参数有界且架构无界范式下的结果是对偶的。
查看缓存全文
缓存时间: 2026/07/09 07:44
# 1 引言 来源:https://arxiv.org/html/2607.06781 ## 关于神经网络显式超强逼近 范丰磊¹,李泽宇²,王晨宇²,王建军³,* ¹香港城市大学数据科学系,九龙塘达之路83号,九龙,香港。[email protected] ²香港中文大学数学系,大学道,沙田,新界,香港。[email protected]; [email protected] ³广西民族大学土木建筑工程学院,南宁530006,中国。[email protected] *通讯作者。 ###### 摘要 本文研究具有显式参数边界和基本激活函数的固定架构神经网络逼近问题。已有工作展示了利用固定大小网络实现超强逼近,但缺乏关于参数大小与逼近误差之间定量且非渐近的表征。我们通过引入中国剩余定理作为构造性编码机制来解决此问题。对于定义在 \([0,1]^D\) 上的 Lipschitz 连续函数,我们构建了一个宽度为 \(\max\{D,4\}\)、深度为 \(5\) 的网络,并给出显式的参数-误差权衡。对于 \(C_A^{r,\gamma}([0,1]^D)\) 中的 Hölder 光滑函数,我们的固定网络宽度为 \(\max\{2D, D+5N+1\}\)、深度为 \(r+9\),其参数幅度 \(\mathcal{P}\) 满足 \(\log_2 \mathcal{P} = \mathcal{O}\bigl(\varepsilon^{-2D/(r+\gamma)}\log(1/\varepsilon)\bigr)\)。这与参数有界而架构无界范式下的结果形成对偶关系。 **关键词:** 神经网络逼近,固定架构神经网络,基本超强激活函数,Hölder 光滑函数 ### 1.1 背景与我们的结果 过去几年中,深度神经网络在人工智能(Babaiee et al., 2025 [链接](https://arxiv.org/html/2607.06781#bib.bib1); Esser et al., 2024 [链接](https://arxiv.org/html/2607.06781#bib.bib9))和数据科学(Wu and Yao, 2025 [链接](https://arxiv.org/html/2607.06781#bib.bib42); Gicic et al., 2024 [链接](https://arxiv.org/html/2607.06781#bib.bib10))领域取得了巨大成功,这激励了广泛的研究来建立深度学习的理论基础。在此背景下,大量工作探讨了深度神经网络的逼近能力,以揭示深度学习的强大力量。这些研究考察了网络如何通过仿射线性变换和非线性激活函数的组合来表达目标函数。通常,逼近误差以网络参数总数、宽度和深度或神经元数量来刻画。特别是,几种重要基本函数空间的逼近已被充分研究,例如连续函数空间(Yarotsky, 2018 [链接](https://arxiv.org/html/2607.06781#bib.bib45); Shen et al., 2020 [链接](https://arxiv.org/html/2607.06781#bib.bib35))、\(C^s\) 函数空间(Yarotsky and Zhevnerchuk, 2020 [链接](https://arxiv.org/html/2607.06781#bib.bib47); Lu et al., 2021 [链接](https://arxiv.org/html/2607.06781#bib.bib29))、Sobolev 空间(Yarotsky, 2017 [链接](https://arxiv.org/html/2607.06781#bib.bib44); Hon and Yang, 2021 [链接](https://arxiv.org/html/2607.06781#bib.bib15))、Besov 空间(Siegel, 2023 [链接](https://arxiv.org/html/2607.06781#bib.bib39))和 Korobov 空间(Blanchard and Bennouna, 2022 [链接](https://arxiv.org/html/2607.06781#bib.bib4); Yang and Lu, 2024 [链接](https://arxiv.org/html/2607.06781#bib.bib43))。 尽管这些研究达到了(接近)最优的逼近率,但网络的大小通常随着误差减小而呈指数增长。一个特殊的逼近方向利用了超强激活函数,这使得能够用固定架构的网络(与函数和误差无关)来逼近一类函数。也就是说,无需扩大网络规模,只需调整权重即可达到任意精度,且可应用多种激活函数。第一个固定架构逼近结果由 Maiorov and Pinkus(1999 [链接](https://arxiv.org/html/2607.06781#bib.bib30))给出,他们建立了超强激活函数的存在性。关键思想是在 \(C([0,1])\) 中构造一个稠密的可数子集,然后通过 Kolmogorov 叠加定理(KST)(Kolmogorov, 1957 [链接](https://arxiv.org/html/2607.06781#bib.bib20))将多变量情况约化为单变量情况。然而,这里的超强激活函数相当复杂且没有闭式表达。遵循 KST 的思路,Yarotsky(2021 [链接](https://arxiv.org/html/2607.06781#bib.bib46))解决了这种计算上的难处理性。Yarotsky(2021)证明了任何 \(C\left([0,1]^d\right)\) 函数都可以用具有多个基本激活函数的固定大小网络来逼近。Zhang et al.(2022 [链接](https://arxiv.org/html/2607.06781#bib.bib50))利用基本通用激活函数(EUAF)构建了一个固定网络来逼近任意连续函数。该工作明确表明,使用丢番图逼近和 KST 中的无理缠绕,一个 EUAF 网络只需 \(\mathcal{O}(1)\) 深度和 \(\mathcal{O}(d^2)\) 宽度即可实现超强表达能力。此外,Wang et al.(2025 [链接](https://arxiv.org/html/2607.06781#bib.bib41))提出了基于参数化 EUAF(PEUAF)的固定架构网络,获得了类似的超强逼近结果,并指出此类超强网络在实践中是可训练的。 然而,实现超强表达能力是有代价的。一旦宽度和深度固定,逼近的负担就转移到了参数的大小上。因此,建立参数大小关于逼近误差的定量且非渐近的边界对于固定架构逼近至关重要。Beknazaryan(2022 [链接](https://arxiv.org/html/2607.06781#bib.bib3))利用精细化的 Kronecker 定理给出了 Hölder 连续函数的显式超强逼近。尽管网络大小和参数幅度是显式的,但激活函数会随着误差容限的变化而重新调整。也就是说,Beknazaryan(2022)将架构的增长换成了激活复杂度的增长。据我们所知,现有关于固定架构网络逼近的工作缺乏参数大小关于逼近误差的定量且非渐近的边界,而那些提供相关结果的工作要么依赖于与误差相关的激活函数,要么依赖于在初始输入中对目标函数的预先编码。主要原因是它们使用了丢番图逼近或 KST,其中包含难以显式表达的先验因子。 在本文中,我们提出了 Lipschitz 连续和 Hölder 光滑函数的定量且非渐近的固定架构逼近,参数大小由逼近精度显式刻画。我们的核心机制是引入中国剩余定理(CRT)。给定由互质整数索引的输入域划分和由整数索引的函数值量化,我们利用 CRT 将每个单元与一个量化值显式关联起来。然后,使用具有多个基本超强激活函数的固定架构网络重建目标。我们的主要结果如下: * **Lipschitz 函数的逼近。** 对于 \([0,1]^D\) 上的任意 Lipschitz 函数,我们构建了一个宽度为 \(\max\{D,4\}\)、深度为 \(5\) 的网络,不仅证明了此类固定大小网络的存在性,还提供了显式的参数幅度 \(\mathcal{P}\),满足 \(\log_2 \mathcal{P} \leq O\bigl(\varepsilon^{-2D}\log(1/\varepsilon)\bigr)\),将目标精度 \(\varepsilon\) 与网络的参数幅度联系起来。据我们所知,这是在超强逼近领域首次建立的显式关系。 * **Hölder 光滑函数的逼近。** 对于任意 Hölder 光滑函数 \(f \in C_A^{r,\gamma}([0,1]^D)\),我们通过局部 Taylor 展开构造了一个有理的网格多项式代理。该逼近使用固定架构网络实现,宽度为 \(\max\{2D, D+5N+1\}\),深度为 \(r+9\)。关键在于,更高的目标光滑度缓解了所需参数幅度的增长,我们将其约束为 \(\log_2 \mathcal{P} \leq O\bigl(\varepsilon^{-2D/(r+\gamma)}\log(1/\varepsilon)\bigr)\)。这表明目标函数的光滑度改善了缩放规律,将复杂度指数从 \(2D\) 降低到 \(2D/(r+\gamma)\)。经典的逼近结果给出了架构随误差的变化,而参数大小固定。我们的结果可以看作是对经典范式的对偶,有助于完善超强逼近的图景。 ### 1.2 相关工作 **经典神经网络逼近。** 神经网络的逼近能力一直是深度学习理论的核心主题,近年来涌现了大量相关工作。早期关于通用逼近的工作(Cybenko, 1989 [链接](https://arxiv.org/html/2607.06781#bib.bib8); Hornik et al., 1989 [链接](https://arxiv.org/html/2607.06781#bib.bib17); Hornik, 1991 [链接](https://arxiv.org/html/2607.06781#bib.bib16); Leshno et al., 1993 [链接](https://arxiv.org/html/2607.06781#bib.bib23); Barron, 1993 [链接](https://arxiv.org/html/2607.06781#bib.bib2))表明,足够宽或足够深的全连接神经网络可以在紧集上逼近任意连续函数,但未刻画逼近率。其他网络的通用逼近定理也被广泛研究。例如,Zhou(2020b [链接](https://arxiv.org/html/2607.06781#bib.bib52))、Zhou(2020a [链接](https://arxiv.org/html/2607.06781#bib.bib51))、Yu and Zhou(2023 [链接](https://arxiv.org/html/2607.06781#bib.bib48))、Li et al.(2025 [链接](https://arxiv.org/html/2607.06781#bib.bib26))证明了深度卷积网络在具有足够深度时可以逼近紧集上的任意连续函数,表明局部性和权值共享保持了通用性。此外,Yun et al.(2020 [链接](https://arxiv.org/html/2607.06781#bib.bib49))证明了 Transformer 可以通用逼近连续置换等变的序列到序列映射;Lin and Jegelka(2018 [链接](https://arxiv.org/html/2607.06781#bib.bib28))表明每层只有一个神经元的 ReLU 激活 ResNet 是通用逼近器。此外,ResNet 的通用逼近也可以通过动力系统建立(Li et al., 2023 [链接](https://arxiv.org/html/2607.06781#bib.bib25), 2019 [链接](https://arxiv.org/html/2607.06781#bib.bib27))。 虽然经典的通用逼近定理主要关注神经网络逼近器的存在性,但随后出现了一条更定量的研究路线,旨在根据网络宽度、深度、参数数量和神经元数量来刻画逼近误差。使用 ReLU 网络根据总参数数的误差估计已被充分研究,并达到了几种基本函数空间(例如连续函数(Yarotsky, 2018 [链接](https://arxiv.org/html/2607.06781#bib.bib45))、光滑函数(Yarotsky and Zhevnerchuk, 2020 [链接](https://arxiv.org/html/2607.06781#bib.bib47); Petersen and Voigtlaender, 2018 [链接](https://arxiv.org/html/2607.06781#bib.bib31))和 Sobolev 空间(Hon and Yang, 2021 [链接](https://arxiv.org/html/2607.06781#bib.bib15); Yarotsky, 2017 [链接](https://arxiv.org/html/2607.06781#bib.bib44)))的(接近)最优逼近率。关于宽度和深度的误差进一步推动了非渐近逼近的研究,例如连续函数(Shen et al., 2020 [链接](https://arxiv.org/html/2607.06781#bib.bib35), 2022 [链接](https://arxiv.org/html/2607.06781#bib.bib38))、\(C^s\) 函数(Lu et al., 2021 [链接](https://arxiv.org/html/2607.06781#bib.bib29))以及 Korobov 空间中的函数(Blanchard and Bennouna, 2022 [链接](https://arxiv.org/html/2607.06781#bib.bib4); Yang and Lu, 2024 [链接](https://arxiv.org/html/2607.06781#bib.bib43)),这些工作不仅达到了(接近)最优的逼近误差,而且结果是显式的,没有未知的前因子。尽管经典网络逼近中的误差是(接近)最优的,但网络的大小随着误差的减小而呈指数增长。 **超强激活函数与固定架构逼近。** 设计超强激活函数是提高逼近率的方向之一,它允许用一个使用有限族激活函数且架构仅依赖于输入维度的神经网络来逼近一类目标函数。超强逼近的初始思想来源于 KST(Kolmogorov, 1957 [链接](https://arxiv.org/html/2607.06781#bib.bib20)),该定理表明任何连续函数 \(f \in C\left([0,1]^d\right)\) 可以表示为 \(f(\mathbf{x}) = \sum_{i=0}^{2d} g_i\left( \sum_{j=1}^d h_{i,j}(x_j) \right)\)。注意,KST 可视为具有依赖于目标函数的激活函数的网络组合。关于 KST 与神经网络联系的进一步研究,参见 Igelnik and Parikh(2003 [链接](https://arxiv.org/html/2607.06781#bib.bib18))、Kůrková(1991 [链接](https://arxiv.org/html/2607.06781#bib.bib21), 1992 [链接](https://arxiv.org/html/2607.06781#bib.bib22))、Maiorov and Pinkus(1999 [链接](https://arxiv.org/html/2607.06781#bib.bib30))。特别是在 Maiorov and Pinkus(1999)中,作者利用 KST 设计了一种特殊的激活函数,并构建了一个具有 \(\mathcal{O}(d)\) 个神经元的固定大小网络,该网络可以以任意误差逼近 \([-1,1]^d\) 上的任意连续函数。由于这种激活函数复杂且没有闭式表达,该网络无法在实践中应用。随后,一些工作(Guliyev and Ismailov, 2016 [链接](https://arxiv.org/html/2607.06781#bib.bib12); Guliyev and Ismailov, 2018b [链接](https://arxiv.org/html/2607.06781#bib.bib14); Ismailov, 2014 [链接](https://arxiv.org/html/2607.06781#bib.bib19); Guliyev and Ismailov, 2018a [链接](https://arxiv.org/html/2607.06781#bib.bib13))进一步研究了类似的激活函数。很长一段时间内,超强逼近中的计算难处理性仍然是一个难题。 另一条研究线探索了使用基本激活函数的较弱形式的超强表达能力,其中网络大小必须随着精度提高而增长,但增长速度远慢于经典神经网络逼近理论中的幂律。例如,Yarotsky and Zhevnerchuk(2020 [链接](https://arxiv.org/html/2607.06781#bib.bib47))表明,使用 ReLU 和 \(\sin\) 激活函数的网络可以以关于参数数量的指数误差率逼近 Lipschitz 函数。此外,Shen et al.(2021b [链接](https://arxiv.org/html/2607.06781#bib.bib37))也证明了一个三层网络,使用 \(\lfloor\cdot\rfloor\)、\(2^x\) 和 \(1_{x\geq 0}\) 作为激活函数,可以逼近 Lipschitz 函数……
相似文章
神经算子的定量 Sobolev 逼近界及其在 Burgers 方程上的实证验证
本文建立了神经算子的定量 Sobolev 逼近界,证明了算子可以以显式的复杂度-误差关系进行一致逼近。通过在 Burgers 方程上对 Fourier 神经算子(FNOs)进行验证,展示了 Sobolev 空间逼近理论能够准确预测其缩放行为。
非线性算子及其导数的通用逼近
本文证明了在无限维空间中非线性算子及其导数的首个通用逼近定理,将经典结果扩展到DeepONet和PCA-Net等算子学习架构。
广义神经元
本文探讨了深度学习中的通用近似定理,分析了使用 ReLU 激活函数时单个神经元和神经网络层的表示能力。
多输入神经算子学习在Sobolev空间中的泛化保证
本文提供了多输入神经算子在Sobolev范数下测量的近似误差和泛化误差估计,分析了多个输入函数(具有不同定义域和正则性)如何影响误差界,适用于偏微分方程和科学计算问题。
Verified SHAP: 神经网络精确Shapley值的可证明边界
提出了一种基于验证的算法,用于计算神经网络精确SHAP值的可证明边界,可扩展到比先前精确方法大得多的搜索空间。