无限维空间上的分辨率一致贪婪神经近似

arXiv cs.LG 论文

摘要

本文为具有无限维输入的浅层神经网络模型开发了构造性近似和学习保证,将误差分离为坐标截断、网络宽度和样本大小组件,以实现统一的理论分析。

arXiv:2608.20812v1 公告类型:新 摘要:我们为具有通过有限坐标观测的无限维输入的浅层神经网络模型开发了构造性近似和学习保证。分析基于参数归一化神经字典及其相关的加权变分族。在该族中,近似误差分离为依赖分布的坐标截断项和贪婪有限宽度项。对于经验回归,完全纠正贪婪程序产生总体保证,其统计复杂性在保持的输入分辨率下是一致的。相同框架可扩展到Hilbert值响应,而不显式依赖输出维度。无维陈述是统计性的,而非计算性的:选择新神经元仍需解决非凸参数搜索问题。最近无限维通用近似结果的基础准波兰构造提供了一个激励示例,合成实验证明了预测的分辨率、宽度和样本大小范围。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:33

# 无限维空间上分辨率一致的贪婪神经近似
来源:https://arxiv.org/html/2608.20812

Pablo M\. Berná
隶属机构:大西洋地中海技术大学 – UTAMED 数字企业、技术与法律学院,西班牙马拉加 pablomanuel\.berna@utamed\.es
Antonio Falcó
隶属机构:数学、物理与技术科学系,塞德纳尔埃雷拉大学-CEU,CEU大学,西班牙巴伦西亚阿尔法拉德尔帕特里亚尔卡,圣巴托洛梅55号,邮编46115 afalco@uchceu\.es
Diego Mondéjar

###### 摘要
我们为具有无限维输入、通过有限坐标观测的浅层神经模型构建了近似保证和学习保证。分析基于参数归一化的神经字典及其相关的加权变差类。在此类中,近似误差分解为与分布相关的坐标截断项和有限宽度贪婪项。对于经验回归,完全纠正的贪婪过程给出了总体保证,其统计复杂性相对于所保留的输入分辨率是一致的。相同的框架可扩展到希尔伯特值响应,而无需显式依赖于输出维度。无维度结论是统计性的,而非计算性的:选择新神经元仍需解决非凸参数搜索问题。近期无限维通用近似结果背后的准波兰构造提供了一个动机示例,合成实验说明了预测的分辨率、宽度和样本量范围。

## 1引言
许多学习问题自然地将输入表述为非有限维向量。函数观测、轨迹、场、概率测度以及偏微分方程的解更自然地被视为无限维空间中的元素。在此设定下的神经近似引发了一个在标准有限维学习中基本不存在的困难:在模型能够训练之前,输入本身通常必须以有限分辨率表示。这导致了三种不同的误差来源。首先,无限维输入只能保留有限多个坐标或测量值。其次,近似神经网络具有有限宽度。第三,网络必须从有限观测中学习。因此,一个自然的定量理论应同时解释近似和学习如何依赖于输入分辨率、所选神经元数量和样本量。Galimberti[6 (https://arxiv.org/html/2608.20812#bib.bib6)]的近期工作为适合神经架构在无限维和准波兰空间上建立了全局Lp L^{\{p\}}通用近似结果。这些结果提供了重要的定性基础:在通过可数标量观测族表示输入后,有限神经模型可以逼近广泛的目标函数类。然而,通用近似是密度陈述。其本身并未提供选择神经元的构造性规则、网络宽度的收敛速率,或从有限数据训练网络时的统计保证。本文的目的是为适应贪婪神经近似的正则性类发展这样的定量理论。我们假设输入具有可数坐标表示,其幅度由平方可和包络控制。有限分辨率学习器仅保留前有限个坐标。由此产生的信息丢失通过数据分布下被丢弃尾部的均方大小来衡量。此公式被有意地比准波兰设定更为一般化:后者成为一个重要应用,而非主要理论的假设。为构造近似网络,我们使用贪婪选择。从当前残差开始,算法重复搜索与剩余未解释部分强烈相关的神经单元。在总体层面,这导致近似误差直接分解为分辨率项和有限宽度项。在经验层面,我们使用贪婪过程的完全纠正版本,与条件梯度方法密切相关,以控制后续近似器的复杂性。参数加权变差类扮演着核心角色。粗略地说,具有较大内部参数的神经单元被分配更大的成本,而目标被假设为具有有限总加权成本的表示。这种归一化使得相同的正则性量能够同时控制坐标截断下的近似和统计复杂性。然而,重要的是这是一个真正的正则性假设。虽然归一化不会改变神经单元生成的线性跨度,但它会改变有界变差类。因此,我们的结果为显式加权神经类提供了速率;它们不应被解释为底层通用近似定理覆盖的每个目标的定量速率。我们稍后将精确区分这一点,并通过一维阈值示例表明加权类和非加权类的行为可能非常不同。主要的统计现象是,更精细的输入分辨率不一定导致更大的估计惩罚。朴素的有限维分析可能暗示复杂性项随保留坐标的数量增加而增加。相反,本文考虑的坐标表示在一个共同的希尔伯特空间中保持一致有界。利用这一几何结构,结合参数归一化,给出了在输入分辨率上一致的Rademacher复杂性估计。因此,最终的总体界分为三个贡献:分辨率误差+有限宽度误差+统计误差,其中统计贡献对保留的输入坐标数量没有显式依赖。在本文的动机示例准波兰构造中,前两个贡献表现出熟悉的逆分辨率和逆宽度行为,而统计项对样本量具有标准的平方根依赖,直至对数因子。这种分辨率独立性是统计性的而非计算性的。选择下一个神经单元仍需解决其参数上的非凸优化问题,并且该搜索的成本可能随保留分辨率的增加而增加。类似的计算困难也出现在凸无限宽度神经公式[1 (https://arxiv.org/html/2608.20812#bib.bib1)]中。因此,本文的实验使用有限候选字典。其目的分别是说明理论预测的分辨率、宽度和采样效应,而非声称高效解决了连续神经元选择问题。我们的分析建立在几个既定思想之上。贪婪近似及其与统计学习的联系有着悠久历史[2 (https://arxiv.org/html/2608.2012#bib.bib2)];Bach[1 (https://arxiv.org/html/2608.2012#bib.bib1)]等人开发了浅层神经网络的变差空间公式和条件梯度方法;近期工作给出了正交贪婪算法和神经变差空间的精细化分析[17 (https://arxiv.org/html/2608.2012#bib.bib17), 16 (https://arxiv.org/html/2608.2012#bib.bib16)]。本文的贡献不在于新的贪婪原则或新的经验过程不等式。而在于一个端到端的分析,展示了这些工具如何与无限维输入的有限分辨率观测相互作用。更具体地说,本文做出以下贡献:1. (i)我们在最小可测性假设下制定了有限分辨率神经近似,并量化了通过截断无限维坐标表示所丢失的信息。2. (ii)我们引入参数加权的神经变差类,并证明了构造性贪婪近似界,该界分离了输入分辨率和网络宽度的影响。3. (iii)我们证明了归一化神经字典在Rademacher复杂性界在保留的输入分辨率上是一致的,并将其与完全纠正贪婪过程相结合,获得端到端的总体风险保证。4. (iv)我们通过利普希茨下界和一个精确的一维阈值示例,量化了加权类施加的额外正则性。5. (v)我们将统计论证扩展到希尔伯特值响应,而无需在统计项中显式依赖于保留的输入维度或输出维度。6. (vi)我们提供了可重现的合成实验,分离了分辨率、宽度和样本量范围,并说明了加权与非加权变差约束之间的区别。本文其余部分组织如下。第2节[https://arxiv.org/html/2608.2012#S2]介绍了坐标表示和分辨率误差的概念。接下来的章节定义了加权神经变差类并建立了确定性贪婪近似结果。然后我们研究经验复杂性和完全纠正学习过程,随后是数值实验。最后,第10节[https://arxiv.org/html/2608.2012#S10]在讨论和结论之前处理了希尔伯特值响应。

## 2最小可测设定
###### 假设2\.1(可测坐标嵌入)。设\( (X, \mathcal{A}, \mu) \)(\( (\mathcal\{X\}, \mathcal\{A\}, \mu) \))为概率空间。令\( h_j: X \to \mathbb{R} \)(\( h\_\{j\}: \mathcal\{X\} \to \mathbb\{R\}, j \geq 1 \))为可测函数,并假设存在\( \alpha = (\alpha_j)_{j \geq 1} \in \ell^2 \)(\( \alpha=(\alpha\_\{j\})\_\{j\geq 1\}\in\ell^\{2\} \))使得对所有\( j \geq 1 \)和\( x \in X \)(\( \text{对于所有 } j \geq 1 \text{ 和 } x \in \mathcal\{X\} \))有\( \|h_j(x)\| \leq \alpha_j \)(\( \|h\_\{j\}(x)\|\leq\alpha\_\{j\} \))。定义\( H(x) := (h_1(x), h_2(x), \ldots) \in \ell^2 \)(\( H(x):=(h\_\{1\}(x), h\_\{2\}(x), \ldots)\in\ell^\{2\} \)),\( H_N(x) := P_N H(x) \)(\( H\_\{N\}(x):=P\_\{N\}H(x) \)),其中\( P_N \)(\( P\_\{N\} \))是到前\( N \)(\( N \))个典范坐标的正交投影。两个坐标尾部量将很有用。分布相关的尾部为\( \eta_N(\mu) := \left( \int_X \| (I - P_N) H(x) \|_{\ell^2}^2 \, d\mu(x) \right)^{1/2} \)(\( \eta\_\{N\}(\mu):=\left(\int\_\{\mathcal\{X\}\}\left\lVert(I-P\_\{N\})H(x)\right\rVert\_\{\ell^\{2\}\}^\{2\}\,d\mu(x)\right)^\{1/2\} \)),(1) 而一致尾部为\( \eta_N^\infty := \sup_{x \in X} \| (I - P_N) H(x) \|_{\ell^2} \)(\( \eta\_\{N\}^\{\infty\}:=\sup\_\{x\in\mathcal\{X\}\}\left\lVert(I-P\_\{N\})H(x)\right\rVert\_\{\ell^\{2\}\} \))。(2) 根据假设2\.1[https://arxiv.org/html/2608.2012#S2.Thmtheorem1],\( \eta_N(\mu) \leq \eta_N^\infty \leq \left( \sum_{j > N} \alpha_j^2 \right)^{1/2} \)(\( \eta\_\{N\}(\mu)\leq\eta\_\{N\}^\{\infty\}\leq\left(\sum\_\{j>N\}\alpha\_\{j\}^\{2\}\right)^\{1/2\} \))。(3) 我们将偏差作为额外的希尔伯特坐标纳入。设\( \mathcal{P} := \ell^2 \oplus \mathbb{R} \)(\( \mathcal\{P\}:=\ell^\{2\}\oplus\mathbb\{R\} \)),\( \theta = (w, b) \in \mathcal{P} \)(\( \theta=(w,b)\in\mathcal\{P\} \)),\( \| \theta \|_{\mathcal{P}} := \sqrt{\| w \|_{\ell^2}^2 + b^2} \)(\( \left\lVert\theta\right\rVert\_\{\mathcal\{P\}\}:=\sqrt\{\left\lVert w\right\rVert\_\{\ell^\{2\}\}^\{2\}+b^\{2\}\} \)),并定义\( Z(x) := (H(x), 1) \)(\( Z(x):=(H(x),1) \)),\( Z_N(x) := (H_N(x), 1) \)(\( Z\_\{N\}(x):=(H\_\{N\}(x),1) \))。包络给出一致半径\( K := \sup_x \| Z(x) \|_{\mathcal{P}} \leq \sqrt{1 + \| \alpha \|_{\ell^2}^2} \)(\( K:=\sup\_\{x\}\left\lVert Z(x)\right\rVert\_\{\mathcal\{P\}\}\leq\sqrt\{1+\left\lVert\alpha\right\rVert\_\{\ell^\{2\}\}^\{2\}} \)),(4) 并且对每个\( N \)(\( N \))有\( \| Z_N(x) \|_{\mathcal{P}} \leq K \)(\( \left\lVert Z\_\{N\}(x)\right\rVert\_\{\mathcal\{P\}\}\leq K \))。

### 2\.1准波兰构造示例
Galimberti使用的拓扑假设对于下面的估计不是必需的。当人们想要将该类连接到全局密度定理时,它们变得相关。在[6 (https://arxiv.org/html/2608.2012#bib.bib6)]的准波兰构造中,一个连续的分离序列可以缩放使得\( 0 \leq h_j(x) \leq \frac{1}{j} \)(\( 0\leq h\_\{j\}(x)\leq\frac\{1\}\{j\} \))。因此,\( \eta_N(\mu)^2 \leq (\eta_N^\infty)^2 \leq \sum_{j > N} \frac{1}{j^2} \leq \frac{1}{N} \)(\( \eta\_\{N\}(\mu)^\{2\}\leq(\eta\_\{N\}^\{\infty\})^\{2\}\leq\sum\_\{j>N\}\frac\{1\}\{j^\{2\}\}\leq\frac\{1\}\{N\} \)),\( K \leq \sqrt{1 + \frac{\pi^2}{6}} \)(\( K\leq\sqrt\{1+\frac\{\pi^\{2\}\}\{6\}} \))。(5) 分离性质稍后仅用于解释加权球并集的稠密性;在定量证明中未使用。

## 3归一化神经原子和加权变差
我们使用有界1-Lipschitz激活函数\( \rho(t) := \frac{t_+}{1 + t_+} \)(\( \rho(t):=\frac\{t\_\{\+\}\}\{1+t\_\{\+\}\} \)),\( t_+ := \max\{t, 0\} \)(\( t\_\{+\}:=\max\\\{t,0\\\} \))。(6) 因此\( 0 \leq \rho \leq 1 \)(\( 0\leq\rho\leq 1 \)),\( \rho(0) = 0 \)(\( \rho(0)=0 \)),且\( \| \rho(s) - \rho(t) \| \leq \| s - t \| \)(\( \|\rho(s)\-\rho(t)\|\leq\|s\-t\| \))。此外,\( \lim_{\lambda \to \infty} \rho(\lambda t) = \begin{cases} 1, & t > 0, \\ 0, & t \leq 0, \end{cases} \)(\( \lim\_\{\lambda\to\infty\}\rho(\lambda t)=\begin\{cases\}1,&t\>0,\\\\ 0,&t\leq 0,\end\{cases} \)),因此关联的秩一无限维激活具有[6 (https://arxiv.org/html/2608.2012#bib.bib6)]中使用的分离行为。对于\( \theta = (w, b) \)(\( \theta=(w,b) \)),定义\( g_\theta(x) := \rho(\langle \theta, Z(x) \rangle_{\mathcal{P}}) = \rho(b + \langle w, H(x) \rangle_{\ell^2}) \)(\( g\_\{\theta\}(x):=\rho(\left\langle\theta,Z(x)\right\rangle\_\{\mathcal\{P\}\})=\rho(b+\left\langle w,H(x)\right\rangle\_\{\ell^\{2\}\}) \)),以及\( g_{\theta, N}(x) := \rho(\langle \theta, Z_N(x) \rangle_{\mathcal{P}}) \)(\( g\_\{\theta,N\}(x):=\rho(\left\langle\theta,Z\_\{N\}(x)\right\rangle\_\{\mathcal\{P\}\}) \))。

###### 定义3\.1(参数归一化原子)。令\( c(\theta) := 1 + \| \theta \|_{\mathcal{P}} \)(\( c(\theta):=1+\left\lVert\theta\right\rVert\_\{\mathcal\{P\}\} \))。定义\( \psi_\theta(x) := \frac{g_\theta(x)}{c(\theta)} \)(\( \psi\_\{\theta\}(x):=\frac\{g\_\{\theta\}(x)\}\{c(\theta)\} \)),\( \psi_{\theta, N}(x) := \frac{g_{\theta, N}(x)}{c(\theta)} \)(\( \psi\_\{\theta,N\}(x):=\frac\{g\_\{\theta,N\}(x)\}\{c(\theta)\} \)),(7) 以及对称的有限分辨率字典\( \mathcal{D}_N^\sharp := \{ \pm \psi_{\theta, N} : \theta \in \mathcal{P} \} \)(\( \mathcal\{D\}\_\{N\}^\{\sharp\}:=\\\{\pm\psi\_\{\theta,N\}:\theta\in\mathcal\{P\}\\\} \))。(8) 因为\( 0 \leq \rho \leq 1 \)(\( 0\leq\rho\leq 1 \)),所以\( \| \psi_{\theta, N}(x) \| \leq \frac{1}{1 + \| \theta \|_{\mathcal{P}}} \leq 1 \)(\( \|\psi\_\{\theta,N\}(x)\|\leq\frac\{1\}\{1+\left\lVert\theta\right\rVert\_\{\mathcal\{P\}\}\}\leq 1 \))。(9) 归一化保留了线性跨度,\( \operatorname{span}\{ \psi_\theta : \theta \in \mathcal{P} \} = \operatorname{span}\{ g_\theta : \theta \in \mathcal{P} \} \)(\( \operatorname\{span\}\\\{\psi\_\{\theta\}:\theta\in\mathcal\{P\}\\\}=\operatorname\{span\}\\\{g\_\{\theta\}:\theta\in\mathcal\{P\}\\\} \)),(10) 但这一事实不能与固定变差球的保留相混淆。

###### 定义3\.2(非加权与加权变差范数)。设\( \mathfrak{M}(f) \)(\( \mathfrak\{M\}(f) \))为\( \mathcal{P} \)(\( \mathcal\{P\} \))上的有限带符号博雷尔测度\( \nu \)(\( \nu \))的集合,使得\( f(x) = \int_{\mathcal{P}} g_\theta(x) \, d\nu(\theta) \)对于\( \mu \)-几乎处处\( x \)(\( \text{对于 } \mu\text{-a.e. } x \))成立。\( f(x) = \int\_\{\mathcal\{P\}\}g\_\{\theta\}(x)\,d\nu(\theta) \)定义非加权变差半范数\( \| f \|_{\mathcal{B}_H} := \inf_{\nu \in \mathfrak{M}(f)} \| \nu \|(\mathcal{P}) \)(\( \left\lVert f\right\rVert\_\{\mathcal\{B\}\_\{H\}\}:=\inf\_\{\nu\in\mathfrak\{M\}(f)\}\|\nu\|(\mathcal\{P\}) \)),(12) 以及加权范数\( \| f \|_{\mathcal{B}_H^\sharp} := \inf_{\nu \in \mathfrak{M}(f)} \int_{\mathcal{P}} (1 + \| \theta \|_{\mathcal{P}}) \, d|\nu|(\theta) \)(\( \left\lVert f\right\rVert\_\{\mathcal\{B\}\_\{H\}^\{\sharp\}\}:=\inf\_\{\nu\in\mathfrak\{M\}(f)\}\int\_\{\mathcal\{P\}\}(1+\left\lVert\theta\right\rVert\_\{\mathcal\{P\}\})\,d|\nu|(\theta) \))。(13) 类\( \mathcal{B}_H^\sharp \)(\( \mathcal\{B\}\_\{H\}^\{\sharp\} \))由具有有限加权范数的函数组成。由于\( c(\theta) \geq 1 \)(\( c(\theta)\geq 1 \)),所以\( \| f \|_{\mathcal{B}_H} \leq \| f \|_{\mathcal{B}_H^\sharp} \)(\( \left\lVert f\right\rVert\_\{\mathcal\{B\}\_\{H\}\}\leq\left\lVert f\right\rVert\_\{\mathcal\{B\}\_\{H\}^\{\sharp\}\} \))。

相似文章

关于神经网络的显式超表达逼近

arXiv cs.LG

本文研究了固定架构神经网络的显式参数-误差权衡逼近,利用中国剩余定理作为构造性编码机制,并获得了Lipschitz和Hölder光滑函数的显式界。

非线性算子及其导数的通用逼近

arXiv cs.LG

本文证明了在无限维空间中非线性算子及其导数的首个通用逼近定理,将经典结果扩展到DeepONet和PCA-Net等算子学习架构。

基于广义Lipschitz光滑性的神经网络梯度下降收敛保证

arXiv cs.LG

本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。

从近似到涌现:深度学习理论

arXiv cs.LG

本文提出了一个理论框架,将近似理论与深度学习中的涌现现象桥接起来,为神经网络如何学习提供了新的见解。