深度促进局部熵:深层变分范数ReLU回归中的二次深度依赖
摘要
本文证明了深层变分范数ReLU回归的极小极大风险对深度具有二次依赖关系,使用了局部打包论证和逼近定理。
arXiv:2608.17434v1 公告类型:新
摘要:我们研究了在显式向量值Parhi--Nowak deep-RBV^2架构上的高斯回归,该架构具有深度L、宽度w、层和变化预算A以及输出界限B。对于这个参数数量为O(L w^2)的架构,已知的下界和上界相差一个深度因子。我们构建了一个局部打包,表明在显式的样本大小相关半径条件下,二次深度依赖是固有的。该打包具有对数基数Omega(L^2 w^2 log w);其码字位于O(lambda) L^2球内,且两两相距Omega(lambda)。主要成分是一个偏差校正的有界系数逼近定理和平衡放大:将深度为D的ReLU网络乘以q可以使用一个恒定信道实现,使得每个系数仅增长q^(1/D)。转换为向量值RBV^2块后,层和成本为O(D w^2 q^(1/D))。高斯Fano方法给出了一个半径显式的下界,由输出、测试和表示尺度控制。在A=B=R,sigma与R成正比,以及所述的半径条件下,这给出了极小极大风险至少为L^2 w^2 log(w) R^2/n量级。一个基于伪维数的有限网络上界对于无界高斯响应给出了O-tilde(L^2 w^2 R^2/n)。因此,极小极大风险对深度具有二次多项式依赖,直至对数因子,并且在较小半径下表现出向表示受限行为的转变。
查看缓存全文
缓存时间: 2026/08/19 10:02
# 深度实现局部熵:深度变差-范数ReLU回归中的二次深度依赖性
来源:https://arxiv.org/html/2608.17434
高敏波、蔡少伟
单位:中国科学院软件研究所系统软件重点实验室
单位:计算机科学国家重点实验室
单位:中国科学院大学计算机科学与技术学院
单位:中国北京
邮箱:[\{jiangt,gaomb,caisw\}@ios\.ac\.cn](mailto:)
###### 摘要
我们研究了在显式向量值Parhi–Nowak深度RBV²($\mathcal{R}\mathrm{BV}^{2}$)架构上的高斯回归,该架构具有深度$L$、宽度$w$、层和变差预算$A$以及输出界$B$。对于这一参数规模为$O(Lw^{2})$的架构,已知的下界与上界在深度因子上相差一个数量级。我们构造了一个局部码本,证明在显式的样本量相关半径条件下,二次深度依赖性是内在的。该码本的对数基数为$\Omega(L^{2}w^{2}\log w)$;其码字位于半径为$O(\lambda)L^{2}$的球内,且两两分离度为$\Omega(\lambda)$。主要构件包括偏差修正的有界系数逼近定理和平衡放大:将深度为$D$的ReLU网络乘以$q$可以通过单个常数通道实现,使得每个系数仅增长$q^{1/D}$。转换为向量值RBV²($\mathcal{R}\mathrm{BV}^{2}$)块后,其层和成本为$O(Dw^{2}q^{1/D})$。利用高斯Fano方法,得到了由输出尺度、测试尺度和表示尺度控制的显式半径下界。在$A=B=R$、$\sigma\asymp R$以及所述半径条件下,该下界给出$\mathfrak{R}_{n}^{*}\gtrsim\frac{L^{2}w^{2}\log w\,R^{2}}{n}$。基于伪维数的有限网络上界在无界高斯响应下给出$\widetilde{O}(L^{2}w^{2}R^{2}/n)$。因此,极小极大风险在对数因子内呈现深度的二次多项式依赖性,并在较小半径下表现出向表示受限行为的转变。
## 1 引言
深度能大幅压缩组合描述,但相应的统计复杂度是随深度线性增长还是二次增长,不仅仅取决于参数计数。一种通用的分段线性计算图界为参数数量支付一次代价,为计算深度再支付一次。核心问题是第二次支付是证明的伪产物,还是反映深度实际能够解码的信息。深度的近似理论优势已得到充分证实。深度分离构造在选定目标族上展现出指数级节省,而定量ReLU逼近理论则识别出增加深度能够改善或必须用于最优逼近率的区间(Telgarsky 2016(https://arxiv.org/html/2608.17434#bib.bib22);Yarotsky 2017(https://arxiv.org/html/2608.17434#bib.bib25);Yarotsky 2018(https://arxiv.org/html/2608.17434#bib.bib26))。这些结果涉及表示能力。而本研究的问题是,深度是否为范数约束组合类的局部统计复杂度贡献了第二个因子。Ganguli和Constantinescu 2026(https://arxiv.org/html/2608.17434#bib.bib6)在圆周上的深度变差空间架构中孤立了这一问题。在该研究所使用的$O(Lw^{2})$参数化下,他们的界具有如下示意形式:
$\Omega\!\left(\frac{Lw^{2}R^{2}}{n}\right)\;\leq\;\mathfrak{R}_{n}^{*}\;\leq\;\widetilde{O}\!\left(\frac{L^{2}w^{2}R^{2}}{n}\right)。\quad(1)$
该工作中展示的基本模块公式并未显式显示中间维度,而所引用的Parhi–Nowak构造和$O(Lw^{2})$参数计数对应于向量值中间映射。因此,我们研究与所引用构造和参数计数一致的向量值解释:$d_{0}=d_{L}=1$,$d_{\ell}\leq w$,且每个组合块的隐藏宽度至多为$w$。范数控制的神经函数空间提供了网络复杂度的互补视角。早期的Barron类型和凸神经网络公式通过函数空间范数控制逼近和估计(Barron 1993(https://arxiv.org/html/2608.17434#bib.bib3);Bach 2017(https://arxiv.org/html/2608.17434#bib.bib2))。有界范数ReLU网络的精确描述随后将此类范数与样条和Radon域变差空间联系起来(Savarese et al. 2019(https://arxiv.org/html/2608.17434#bib.bib17);Ongie et al. 2020(https://arxiv.org/html/2608.17434#bib.bib10);Parhi and Nowak 2021(https://arxiv.org/html/2608.17434#bib.bib13))。Parhi and Nowak 2022(https://arxiv.org/html/2608.17434#bib.bib14);Parhi and Nowak 2026(https://arxiv.org/html/2608.17434#bib.bib16)以及Shenouda et al. 2024(https://arxiv.org/html/2608.17434#bib.bib19)中发展的深度组合和向量值扩展提供了本研究使用的函数空间设置。在该架构内,缺失的深度因子是通过局部函数空间码实现的,而非通过细化通用上界论证。我们构造了这样一个码本,其对数基数为$\log\|\mathcal{Z}\|=\Omega(L^{2}w^{2}\log w)$。该码本始于有界系数的比特提取。一个宽度为$m$、深度为$D$的ReLU网络可以在系数和偏置均以1为界的条件下,逼近$[0,1]$上所有有界且1-Lipschitz的函数,精度达到$O((m^{2}D^{2}\log m)^{-1})\quad(2)$。该构造源自Ou et al. 2024(https://arxiv.org/html/2608.17434#bib.bib12)。在带偏置的仿射层约定下,已发布的逐层缩放步骤需要修正以实现齐次缩放。我们通过为每个隐藏状态增加一个常数通道来提供此修正;一个单位系数扇出构造随后用系数幅度换取额外的深度。修正后的推导在普适常数意义下保持了公式(2)。同样的增强状态思想产生了我们的关键架构引理。如果$N$的深度为$D$,那么$qN$具有相同的深度和一个额外的隐藏坐标,其系数幅度仅为$q^{1/D}$。一个系数为$s$的全连接层具有向量值RBV²($\mathcal{R}\mathrm{BV}^{2}$)成本$O(w^{2}s)$,因此$\mathfrak{V}_{D,w}(qN)\lesssim Dw^{2}q^{1/D}。\quad(3)$这将比特提取码的$1/M$标签尺度转化为统计间隔,而无需在单个层中支付$M$的代价。极小极大问题需要的不止是全局熵界。一个有界权重网络类可能包含指数多个分离的函数,这些函数要么落在层和变差球之外,要么生活在远大于高斯测试尺度的幅度上。相关的障碍必须在表示约束和局部化下都得以幸存。我们的构造做到了这一点:在选择统计幅度$\lambda$后,每个码字的$L^{2}$范数为$O(\lambda)$,不同码字之间的距离为$\Omega(\lambda)$,并且所有码字都留在指定的深度RBV²($\mathcal{R}\mathrm{BV}^{2}$)球内。针对普通有界权重全连接ReLU网络的紧覆盖数界已经表明,在固定$B=1$和固定精度下,全局熵阶为$W^{2}D\log\!\left(\frac{(W+1)^{D}B^{D}}{\varepsilon}\right)$,其在深度$D$上是二次的(Ou and Bölcskei 2026(https://arxiv.org/html/2608.17434#bib.bib11))。本研究的结果在测试尺度的变差约束类中嵌入了可比拟的二次深度码,并将其转化为极小极大下界。这种局部观点还将构造与神经回归的统计分析联系起来,这些分析在组合光滑性、Besov型和浅层神经变差空间假设下给出了极小极大或近极小极大保证(Schmidt-Hieber 2020(https://arxiv.org/html/2608.17434#bib.bib18);Suzuki 2019(https://arxiv.org/html/2608.17434#bib.bib21);Parhi and Nowak 2023(https://arxiv.org/html/2608.17434#bib.bib15))。经典的熵方法将打包数和覆盖数与极小极大风险联系起来(Yang and Barron 1999(https://arxiv.org/html/2608.17434#bib.bib24);Tsybakov 2009(https://arxiv.org/html/2608.17434#bib.bib23)),而局部化复杂度理论则强调测试尺度附近的几何(Bartlett et al. 2005(https://arxiv.org/html/2608.17434#bib.bib4))。浅层神经变差空间的紧度量熵结果提供了直接的比较(Siegel and Xu 2024(https://arxiv.org/html/2608.17434#bib.bib20))。
#### 贡献。
1. 我们给出了单位系数逼近率(2)的偏差修正推导。新的齐次提升引理精确处理了所有偏置,并替换了逼近论证中使用的两个对偏置敏感的缩放步骤。
2. 我们在显式向量值深度RBV²($\mathcal{R}\mathrm{BV}^{2}$)架构内构造了一个大小为$\exp(\Omega(M))$的局部打包,其中$M=\Theta(L^{2}w^{2}\log w)$。
3. 我们证明了一个显式半径的极小极大下界,分离了输出上界、高斯测试尺度和表示受限尺度。一个样本量相关的推论给出了比相应的一致$n$条件更宽松的充分条件。
4. 我们使用形式化的架构到计算图引理、伪维数、总体覆盖以及一个直接处理高斯响应的有限类最小二乘预言不等式,证明了高斯回归上界。
#### 组织。
第2节(https://arxiv.org/html/2608.17434#S2)–第3节(https://arxiv.org/html/2608.17434#S3)给出模型和定理。第4节(https://arxiv.org/html/2608.17434#S4)定位第二个深度和。第5节(https://arxiv.org/html/2608.17434#S5)–第7节(https://arxiv.org/html/2608.17434#S7)构造打包并证明下界。第8节(https://arxiv.org/html/2608.17434#S8)证明高斯上界。附录包含修正的逼近归约和完整的技术证明。
## 2 统计与函数类设置
#### 圆周与风险。
将圆周等同于$t\in[0,2)$,具有归一化均匀测度$\mu(\mathrm{d}t)=\mathrm{d}t/2$。我们观察$T_{i}\sim\mu,\quad Y_{i}=f^{\star}(T_{i})+\xi_{i},\qquad\xi_{i}\sim N(0,\sigma^{2}),\quad(4)$其中独立同分布。对于一个类$\mathcal{F}$,$\mathfrak{R}_{n}^{*}(\mathcal{F},\sigma)\coloneqq\inf_{\widehat{f}}\sup_{f^{\star}\in\mathcal{F}}\mathbb{E}_{f^{\star}}\left\lVert\widehat{f}-f^{\star}\right\rVert_{L^{2}(\mu)}^{2}。\quad(5)$
#### 向量值块。
对于$s:\mathbb{R}^{d}\to\mathbb{R}^{D^{\prime}}$形式为$s(x)=\sum_{k=1}^{K}v_{k}\rho(w_{k}^{\top}x-b_{k})+Cx+c_{0},\quad(6)$我们使用Parhi–Nowak范数$\left\lVert s\right\rVert_{\mathcal{R}\mathrm{BV}^{2}(d;D^{\prime})}\coloneqq\sum_{k=1}^{K}\left\lVert v_{k}\right\rVert_{1}\left\lVert w_{k}\right\rVert_{2}\quad(7)\quad+\sum_{j=1}^{D^{\prime}}\left(\|s_{j}(0)\|+\sum_{r=1}^{d}\|s_{j}(e_{r})-s_{j}(0)\|\right)。\quad(8)$这是[Parhi and Nowak 2022(https://arxiv.org/html/2608.17434#bib.bib14)]的向量值Radon域变差空间约定,与Shenouda et al. 2024(https://arxiv.org/html/2608.17434#bib.bib19)的多输出变差空间框架一致。
#### 深度架构。
固定$d_{0}=d_{L}=1$,$1\leq d_{\ell}\leq w$($1\leq\ell<L$),每个映射$s_{\ell}:\mathbb{R}^{d_{\ell-1}}\to\mathbb{R}^{d_{\ell}}$具有RBV²($\mathcal{R}\mathrm{BV}^{2}$)范数$\left\lVert s_{\ell}\right\rVert_{\mathcal{R}\mathrm{BV}^{2}(d_{\ell-1};d_{\ell})}$。深度$L$、宽度$w$的组合类定义为$\mathfrak{V}_{L,w}(f)\coloneqq\inf\sum_{\ell=1}^{L}\left\lVert s_{\ell}\right\rVert_{\mathcal{R}\mathrm{BV}^{2}(d_{\ell-1};d_{\ell})},\quad(9)$其中下确界取遍所有表示$f=s_{L}\circ\cdots\circ s_{1}$的分解,$1=d_{0}\leq d_{1},\ldots,d_{L-1}\leq d_{L}=1$。对于$A,B>0$,令$\mathcal{C}_{L,w}(A,B)\coloneqq\left\{f:[0,2)\to\mathbb{R}:\mathfrak{V}_{L,w}(f)\leq A,\ \left\lVert f\right\rVert_{\infty}\leq B\right\},\quad(10)$在周期化时具有连续端点识别。记$\mathfrak{R}_{n}^{*}(A,B,\sigma)=\mathfrak{R}_{n}^{*}(\mathcal{C}_{L,w}(A,B),\sigma)$。激励性的归一化是$A=B=R$且$\sigma\asymp R$。一个块包含$O(w^{2})$个标量参数,因此架构的参数规模为$W_{\rm par}=O(Lw^{2})。\quad(12)$附录A(https://arxiv.org/html/2608.17434#A1)给出了精确计数和形式化计算图实现。
#### 标准网络约定。
令$\mathcal{N}(W,D,B)$表示标量输出实现$h_{l}=\rho(A_{l}h_{l-1}+b_{l}),\quad1\leq l\leq L,\quad(13)$其中$\rho(x)=\max(x,0)$,$A_{l}\in\mathbb{R}^{d_{l}\times d_{l-1}}$,$b_{l}\in\mathbb{R}^{d_{l}}$,$\left\lVert A_{l}\right\rVert_{\infty,1}+\left\lVert b_{l}\right\rVert_{1}\leq B$,$h_{0}=x\in\mathbb{R}$,且$d_{0}=1$,$d_{L}=1$,$d_{\ell}\leq W$($1\leq\ell<L$)。
## 3 主要结果
#### 定理2(比特提取逼近)。
存在普适常数$C_{\rm app},D_{0}>0$,使得对于所有整数$m,D\geq D_{0}$以及每个满足$\left\lVert g\right\rVert_{\infty}\leq 1$和$\operatorname{Lip}(g)\leq 1$的连续函数$g:[0,1]\to\mathbb{R}$,存在$N\in\mathcal{N}(m,D,1)$使得$\left\lVert N-g\right\rVert_{L^{\infty}([0,1])}\leq\frac{C_{\rm app}}{m^{2}D^{2}\log m}。\quad(14)$比特提取构造归功于Ou et al. 2024(https://arxiv.org/html/2608.17434#bib.bib12)。附录B(https://arxiv.org/html/2608.17434#A2)给出了偏差修正的推导,并显式跟踪了宽度和深度的所有相关变化。修正有两步。从一个多项式系数近似$N\in\mathcal{N}(W,D,B)$出发,齐次提升通过增加一个常数坐标来增强每个隐藏状态,并实现$B^{-D}N$,其系数为单位值。一个宽度为$(W+1)$的扇出构造随后用系数幅度换取额外的深度,使用$J=\lceil D\log B/\log\lfloor(W+1)/2\rfloor\rceil$个附加层来恢复输出幅度。在所需情形$B=W^{2}$下,有$J=O(D)$;用此构造替换两个对偏置敏感的样条缩放调用,保持了宽度/深度渐近性并得到公式(14)。令$D=L-1$,$m=w-1$,$M=\left\lfloor c_{0}m^{2}D^{2}\log m\right\rfloor,\quad(15)$其中$c_{0}>0$足够小。一层保留用于折叠圆周,一个隐藏坐标用于齐次放大。
###### 定理3(显式半径下界)。
存在普适常数$c,C_{0},C_{\rm tr},c_{0}>0$以及整数$L_{0},w_{0}$,使得对于$L\geq L_{0}+1$,$w\geq w_{0}+1$,每个$A,B,\sigma>0$以及每个$n\geq 1$,有$\mathfrak{R}_{n}^{*}(A,B,\sigma)\geq c\left[\min\left\{B,\sigma\sqrt{\frac{M}{n}},\frac{1}{M}\left(\frac{(A-C_{0})_{+}}{C_{\rm tr}Dw^{2}}\right)^{D}\right\}\right]^{2}。\quad(16)$打包是局部的:在其活跃幅度$\lambda$处,每个码字的$L^{2}$范数至多为$C\lambda$,不同码字之间的距离至少为$c\lambda$。三项分别是输出上界、高斯测试尺度和表示受限放大尺度。
###### 推论4(样本量相关的二次深度区间)。
固定常数$c_{0}$和$L,w$足够大,在定理3的设定下,如果$\sigma\asymp R$且$A=B=R$,则存在样本量$n_{0}=n_{0}(L,w,R)$使得对于所有$n\geq n_{0}$,有$\mathfrak{R}_{n}^{*}(R,R,\sigma)\gtrsim\frac{L^{2}w^{2}\log w\,R^{2}}{n}$。相似文章
深度隐含偏差:从神经坍缩到Softmax编码
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。
通过精确线性代数实现更浅的ReLU网络表示
本文改进了表示最大值函数所需ReLU网络深度的理论界限,展示了最多10个输入时精确的两隐藏层表示,并通过精确线性代数技术改进了更大n时的深度。
残差神经网络中深度充分性的量化:一个一阶准则
本文定义了一个一阶准则,用于确定训练好的残差神经网络是否具有足够的深度,证明了插入候选处缺乏严格局部递减表征了深度饱和,并在ResNets、GPT-2风格模型和Pythia检查点上进行了经验验证。
通过平滑激活缓解深度神经网络一致收敛中的维数灾难
本文建立了一个理论框架,表明深度神经网络中的平滑激活可以缓解一致收敛中的维数灾难,提供非渐近保证,并在最坏情况可靠性上优于ReLU网络。
深度双下降
OpenAI研究揭示了“双下降”现象,即测试误差随着模型规模和训练步数的增加呈现出非单调的模式,挑战了传统上对深度学习偏差-方差权衡的理解。