通过平滑激活缓解深度神经网络一致收敛中的维数灾难
摘要
本文建立了一个理论框架,表明深度神经网络中的平滑激活可以缓解一致收敛中的维数灾难,提供非渐近保证,并在最坏情况可靠性上优于ReLU网络。
arXiv:2606.05599v1 公告类型: 新
摘要: 本文建立了平滑激活深度神经网络(DNN)估计器一致收敛的理论框架。虽然标准ReLU网络在各种非参数回归任务中达到了$L^2(P)$范数下的极小化最优速率,但我们证明了一个理论下界,表明最小二乘ReLU估计器在其一致收敛行为中可能遭受维数灾难。受下游任务需要最坏情况可靠性的统一保证的驱动,我们通过分析平滑激活DNN(平滑DNN),包括前馈和残差结构,来解决这一局限。我们为这些模型的逼近器建立了新的伪维数界、非渐近逼近保证和Hölder范数界。利用这些结果,我们推导了平滑DNN估计器在多种统计背景下的非渐近一致收敛率,包括Huber回归、最小二乘回归、分位数回归和逻辑回归。我们证明,平滑DNN可以通过自适应地利用目标函数的低维层次组合结构来缓解一致收敛中的{维数灾难}。在模拟研究和实际应用的支持下,我们的结果将平滑DNN定位为在需要统一保证的统计学习任务中,具有理论依据且实际可行的ReLU网络替代方案。
查看缓存全文
缓存时间: 2026/06/05 08:12
# 通过平滑激活缓解深度神经网络一致收敛中的维度诅咒
来源:https://arxiv.org/html/2606.05599
00脚注:*MSC2020 学科分类:*62G08, 62G35.
00脚注:*关键词与短语:*逼近论、Huber回归、非参数回归、残差网络(ResNets)、分位数回归.
(宾夕法尼亚州立大学统计系)
###### 摘要
本文为平滑激活深度神经网络(DNN)估计量的一致收敛性建立了一个理论框架。虽然标准ReLU网络在各种非参数回归任务中能够在L²(P)范数下达到极小化最优速率,但我们建立了一个理论下界,表明最小二乘ReLU估计量在其一致收敛行为中可能遭受维度诅咒。受需要在最差情形下保证可靠性的下游任务中对可靠一致保证的需求驱动,我们通过分析平滑激活DNN(平滑DNN)来应对这一局限性,这类网络涵盖前馈和残差结构。我们为这些模型的逼近器建立了新的伪维数界、非渐近逼近保证以及Hölder范数界。利用这些结果,我们推导了平滑DNN估计量在多种统计上下文(包括Huber、最小二乘、分位数和逻辑回归)中的非渐近一致收敛速率。我们证明,平滑DNN可以通过自适应地利用目标函数的低维层次组合结构来缓解一致收敛中的维度诅咒。在模拟研究和真实世界应用的支持下,我们的结果将平滑DNN定位为在需要一致保证的统计学习任务中,一种在理论上坚实且在实践上可行的ReLU网络替代方案。
## 1 引言
具有整流线性单元(ReLU)激活的前馈神经网络(FNN)因其能够有效逼近具有潜在低维结构的函数,在非参数回归中受到了广泛关注[4, 37, 26]。这种结构灵活性使其得以应用于广泛的统计问题,包括稳健回归[12, 9]、生存分析[51]以及因子和交互模型[13, 6]等。虽然ReLU FNN估计量在L²(P)范数下能达到极小化最优收敛速率[12],但其一致收敛性质尚不十分清楚。然而,一致收敛是许多下游统计理论分析和决策制定应用(例如确保可靠的个性化治疗推荐[16]、构建有效的置信带[47]以及实现迁移学习[36])的基本前提。目前,关于ReLU FNN一致收敛的理论保证明显有限:它们通常局限于具有单变量协变量的浅层ReLU网络估计量[36],或依赖于存在一致相合的初始估计量[21]。这一关键的理论空白引发了人们对ReLU FNN估计量在需要一致保证的上下文中的可靠性的严重担忧,从而限制了其实际适用性。
为了研究这个开放性问题,我们首先刻画了ReLU FNN一致收敛中的一个根本瓶颈。具体来说,我们在文献中建立了第一个理论下界,表明最小二乘ReLU FNN估计量在其一致收敛速率中固有地遭受维度诅咒,即使它们同时能在L²(P)范数下达到极小化最优收敛速率。这强调了ReLU FNN在L²(P)上的最优收敛并不能转化为下游统计理论分析所需的一致可靠性。
除了这些理论局限性,对ReLU FNN的关注也日益偏离现代深度学习实践。分段线性的ReLU激活在很大程度上已被C∞光滑的替代方案(如Sigmoid线性单元(SiLU)[35, 11]和高斯误差线性单元(GELU)[20])所取代,这是由其卓越的经验性能驱动的。此外,残差架构(ResNets)[18, 19]从根本上重塑了神经网络设计。通过解决训练极深网络中固有的梯度消失和退化问题,残差连接已成为现代深度学习不可或缺的支柱。尽管这些组件的统计理论仍然有限,但残差架构与C∞光滑激活的结合构成了当前强大基础模型(从Vision Transformers[10]到LLaMA[44]和DeepSeek[45]等最先进的大型语言模型)的结构基础。
为了克服这一瓶颈,受深度学习最新架构发展的启发,我们专注于具有平滑激活的深度神经网络(平滑DNN),涵盖前馈和残差架构,并为其一致收敛分析建立了一个严格的理论框架。通过全面的理论分析和支持性的模拟研究,我们证明平滑DNN可以显著缓解一致收敛中的维度诅咒,并提供比ReLU FNN严格更强的一致保证。这些结果将平滑DNN定位为在需要一致收敛的统计学习任务中,一种原则性且理论上坚实的替代方案。
本研究的主要方法论和理论贡献有三方面。它们共同弥合了平滑DNN的经验成功与其当前缺乏统一一致收敛统计理论之间的关键差距:
- • **刻画ReLU FNN在一致收敛中的维度诅咒。** 我们建立了第一个理论下界,论证了ReLU FNN在一致范数下固有地遭受维度诅咒。虽然能够达到极小化最优的L²(P)收敛[12],但定理2.1揭示了最小二乘ReLU FNN估计量的一致收敛速率下界为n^{-1/(d+1)},上界为n^{-1/(d+2)},其中n是样本量,d是特征维度,且与目标函数的Hölder光滑度无关。此外,我们在第2.2节中基于插值不等式的分析表明,这一局限性根本源于ReLU激活函数有限的光滑性,这阻止了ReLU FNN利用高阶正则性。
- • **平滑DNN的基础理论框架。** 关于具有平滑激活的深度神经网络(特别是ResNets)的统计理论,目前仍然基本缺失。现有文献主要集中在使用不太常见的激活函数(如sigmoid、tanh或整流幂单元(RePU)激活)的FNN上[8, 5, 41],或使用ReLU激活的残差架构[34, 29, 28]。为了实现平滑DNN的一致收敛分析,第4节开发了一套全面的理论工具。具体而言,我们在定理4.4中建立了伪维数的上界,并在定理4.6和4.8中分别推导了Sobolev函数和层次组合模型的逼近误差界。据我们所知,这些结果为建立平滑DNN估计量的一致收敛保证提供了第一个理论基础。
- • **一致收敛与稳健性保证。** 基于我们的理论框架,我们为平滑DNN估计量在Huber回归、最小二乘回归、分位数回归和逻辑回归中建立了一致收敛保证。特别地,定理5.4表明平滑DNN Huber估计量在一致范数下是非渐近稳健的,扩展了ReLU FNN Huber估计量在L²(P)范数下的现有稳健性结果[12, 9]。定理5.5随后给出了作为Huber回归特例的平滑DNN最小二乘估计量的相应一致收敛速率,并表明它可以克服定理2.1中ReLU最小二乘回归表现出的维度诅咒。分位数和逻辑回归的类似一致收敛和稳健性保证分别在定理5.7和5.8中建立。值得注意的是,逻辑回归的一致收敛保证也为下游应用(如双希格斯玻色子产生的概率估计[31])提供了严格的理论支持;见定理5.10。更广泛地说,在所有这些任务中,我们证明平滑DNN估计量能够适应目标函数的低维层次组合结构,从而在一致收敛方面比ReLU FNN具有明显的理论优势。
为支持我们的方法论和理论结果,第6节在Huber回归中,将平滑DNN估计量的数值L²(P)和均匀估计误差与ReLU FNN估计量进行了基准比较。平滑DNN估计量实现的显著性能提升为我们的方法和理论提供了经验支持。综合来看,这些结果支持平滑DNN估计量在需要一致收敛的实际应用中作为ReLU FNN的有效替代方案。
本文的其余部分组织如下。第2节建立了最小二乘ReLU FNN估计量的上下一致收敛速率。第3节介绍了平滑DNN的新方法。在第4节中,我们建立了平滑DNN的关键统计性质。基于这些基础元素,我们在第5节推导了平滑DNN估计量在Huber、最小二乘、分位数和逻辑回归中的一致收敛速率。在第6节中,我们介绍了模拟研究和真实应用。第7节包含一些结论性评述。完整的证明以及其他技术或数值结果见补充材料。
在继续之前,我们介绍以下将在本文中使用的符号和术语。我们使用记号a ≲ b表示存在一个与a和b无关的常数C > 0,使得a ≤ Cb。如果a ≲ b和b ≲ a同时成立,我们称a ≍ b。如果存在一个关于log n的函数C(log n)使得a ≤ C(log n)·b,我们称a ≲_{log n} b。我们可能进一步使用符号≲_{log}来省略任何其他对数项。a ∨ b = max(a, b) 且 a ∧ b = min(a, b)。对于n ∈ ℕ₊,记[n] = {1, 2, …, n}。对于x ∈ ℝ,记⌈x⌉ = min{n ∈ ℕ : n ≥ x}。对于x ∈ ℝᵈ,记其ℓ₂范数为‖·‖₂,ℓ∞范数为‖·‖∞。对于任意M > 0,令L∞(M)表示被M一致有界的实值函数的集合。对于Ω ⊂ ℝᵈ,我们用‖f‖_{L∞(Ω)}表示函数f在Ω上的一致范数。对于x = (x₁, …, x_d) ∈ ℝᵈ 且 α = (α₁, …, α_d) ∈ ℕᵈ,我们记x^α = x₁^{α₁} x₂^{α₂} … x_d^{α_d},且|α| = |α₁| + |α₂| + … + |α_d|。令D_i为对第i个变量的导数算子,其中i ∈ [d],则阶数为α ∈ ℕᵈ的多指标导数定义为D^α := D₁^{α₁} … D_d^{α_d}。设β = r + s,其中r为非负整数,0 < s ≤ 1,且C > 0。令‖·‖_{C^β(Ω)}表示β阶Hölder范数,称d维函数f在Ω ⊆ ℝᵈ上是(β, C)-光滑的,如果
‖f‖_{C^β(Ω)} := max_{0 ≤ |α| ≤ r} ‖D^α f‖_{L∞(Ω)} ∨ max_{α: |α| = r} sup_{x, y ∈ Ω, x ≠ y} |D^α f(x) - D^α f(y)| / ‖x - y‖₂^s ≤ C.
## 2 ReLU FNN估计量的一致收敛
在本节中,我们研究ReLU FNN估计量在实现一致收敛方面的根本局限性。第2.1节在定理2.1中建立了最小二乘ReLU估计量一致收敛速率的理论下界,表明它们固有地遭受*维度诅咒*,即使其L²(P)相似文章
基于广义Lipschitz光滑性的神经网络梯度下降收敛保证
本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。
非均匀光滑性下最速下降与Adam的收敛性
本文将非均匀光滑性假设推广到曲率与目标值呈仿射关系的目标函数,证明了最速下降法以及RMSProp和Adam的对角变体的收敛速率,并应用于逻辑回归和神经网络。
Bug or Feature^2:权重漂移、激活稀疏性与尖峰
本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。
深度隐含偏差:从神经坍缩到Softmax编码
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。
每一层都至关重要:一个关于ReLU网络的指数型$L_2$深度层次结构
本文提出了一种关于ReLU网络的指数型深度层次结构,基于L2近似误差,证明更深的网络在函数近似上提供了指数级的表征能力提升。