任意权重双层神经网络的鲁棒性定律
摘要
本文证明了一个关于无界权重双层神经网络的猜想鲁棒性定律,表明对于连续分段线性激活函数(如ReLU),拟合含噪数据的网络其Lipschitz常数至少为√(n/m)量级(最多差一个对数因子)。
arXiv:2607.07778v1 公告类型:新
摘要:Bubeck、Li和Nagaraj猜想,对于一般数据,任何具有$m$个神经元且拟合$n$个含噪标签的双层神经网络,其Lipschitz常数至少为$\sqrt{n/m}$量级,且对权重的大小没有限制。Bubeck和Sellke证明了该定律对于Lipschitz参数化类的通用版本,但要求参数满足多项式有界性;在深度为三层时,该有界性假设是必不可少的。无界权重的双层情况需要不同的论证。我们证明了这个猜想定律(最多差一个对数因子),适用于所有连续分段线性激活函数,特别是ReLU网络。对于从$\mathbb{S}^{d-1}$($d\ge3$)或$N(0,I_d/d)$均匀抽取的数据,标签在$[-1,1]$中且噪声水平为$\sigma^2>0$,以及任意宽度为$m$、具有任意实值权重、偏置和仿射跳跃连接的双层网络,以高于噪声底限$\varepsilon$的精度拟合数据将迫使$\mathrm{Lip}(f)\ge c\,\varepsilon\sqrt{n/(\bar m\log(C\bar m nd/\varepsilon))}$,其中$\bar m=(K-1)m+1$,且该不等式以高概率成立。在同一事件下,还有一个基于实际拐点计数的版本:每个具有$k(f)\le n$个不同拐点超平面的实际双层分段线性函数,无论其由多少冗余隐藏单元参数化,都满足上述界限,只需将$\bar m$替换为$k(f)+1$。该证明用函数空间覆盖替代了参数空间覆盖(后者对于无界权重不可行)。核心的确定性工具是一个刚性引理:在$B_2$和$\mathbb{S}^{d-1}$($d\ge3$)上,每个经典拐点的系数由实际函数的Lipschitz常数控制,因为在一般点上,不同超平面上的拐点无法相互抵消。当$d=2$时,刚性性质确实失效,并且一个显式的宽度为$2n$、Lipschitz常数为$O(1)$的双层ReLU插值函数在过参数化端点处符合该定律。
查看缓存全文
缓存时间: 2026/07/10 06:15
# 两层神经网络任意权重的鲁棒性定律 来源:https://arxiv.org/html/2607.07778 Yitzchak Shmalo 耶路撒冷希伯来大学爱因斯坦数学研究所,Givat Ram,以色列 yitzchak\.shmalo@gmail\.com (mailto:[email protected]) (日期:2026年7月7日) ###### 摘要。Bubeck、Li 和 Nagaraj 猜想,对于一般数据,任何拟合 n 个带噪标签的 m 个神经元的两层神经网络,其 Lipschitz 常数至少为 n/m 量级,且对权重大小没有任何限制。Bubeck 和 Sellke 对 Lipschitz 参数化类证明了该定律的一个通用版本,但要求参数具有多项式上界;在深度为三层时,该有界性假设是真正必要的。因此,两层无界权重情况需要不同的论证。我们证明了这个猜想定律(对数因子除外),适用于每个连续分段线性激活函数,特别是 ReLU 网络。对于从 S^{d-1}(d≥3)或 N(0, I_d/d) 均匀抽取的数据,标签在 [−1,1] 中且条件噪声水平 σ^2>0,以及任何固定宽度为 m 的两层网络(具有任意实数权重、偏置和仿射跳跃连接),拟合数据低于噪声下限 ε 会迫使 Lip(f) ≥ c ε sqrt{ n / [m̄ log(C m̄ n d / ε)] },其中 m̄ = (K−1)m+1,以高概率成立。我们还证明了有限视野同时宽度版本和实现拐点计数版本:在一个高概率事件上,每个实现的两层分段线性函数,其不同拐点超平面数 k(f) ≤ n,服从相同界限,只需将 m̄ 替换为 k(f)+1,无论使用了多少冗余隐藏单元来参数化它。该证明用函数空间覆盖取代了参数空间覆盖(后者对于无界权重是不可能的)。核心确定性部分是刚性引理:在 B_2 上,以及在 d≥3 的 S^{d-1} 上,每个正则拐点的系数受实现函数的 Lipschitz 常数控制,因为不同超平面上的拐点不能在对数点处取消。这产生了有界正则表示,从而得到所需的熵界。我们还解释了为什么球面论证确实排除了 d=2 的情况,给出了一个宽度为 2n 的高维分离区域中的两层 ReLU 插值器,其 Lipschitz 常数为 O(1),并陈述了高斯证明扩展到高斯测度之外所需的精确集中/局部化假设。 ###### 关键词与短语:鲁棒性定律,两层神经网络,ReLU 网络,任意权重,Lipschitz 插值,度量熵,等周性 ###### 2020 数学主题分类:Primary 68T07, 68Q32; Secondary 60F10, 60B20, 60B15 ## 1. 引言 一个拟合 n 个带噪标签且需要鲁棒性(即小 Lipschitz 常数)的函数需要容量。Bubeck、Li 和 Nagaraj [1] 针对该学科的基本架构精确阐述了这一点。设 \[ \mathcal{N}_m = \left\{ f(x) = \sum_{k=1}^m a_k \psi(\langle w_k, x\rangle + b_k) + \langle v, x\rangle + c \;:\; a_k, b_k, c \in \mathbb{R},\; w_k, v \in \mathbb{R}^d \right\} \quad (1) \] 为宽度为 m 的具有激活函数 ψ 的两层网络类别,对权重的大小*没有任何限制*。仿射部分 ⟨v,x⟩+c 只是扩大了 [1] 中所研究类别;以下所有结果在其不存在时也必然成立。 ###### 猜想 1.1(Bubeck–Li–Nagaraj [1],猜想 1)。设 ψ 为任何 Lipschitz 激活函数。对于 x_1,…,x_n 独立均匀分布在 S^{d-1} 上(或 N(0, I_d/d)),且 y_1,…,y_n 独立均匀分布在 {−1,+1} 上,以高概率,任何拟合数据的 f ∈ \mathcal{N}_m 必须满足 Lip_{S^{d-1}}(f) ≥ c \sqrt{n/m}。其解释是,鲁棒插值大约需要每个数据点一个神经元,而非鲁棒插值在高维中可能只需要更少的神经元。 Bubeck 和 Sellke [2] 证明了一个深远的推广:对于任何接受 p 个多项式大小的实参数 Lipschitz 参数化的函数类,以及满足等周性的协变量分布,在噪声下限以下拟合数据强迫 Lip(f) ≳ ε \sqrt{nd/p}(对数因子除外)。对于宽度为 m 的两层网络,p = Θ(md),在多项式权重假设下给出所需的 n/m 缩放。该假设在更大深度时并非仅仅是技术性的:Bubeck 和 Sellke 构造了违反该定律的三层无界权重网络。Wu、Huang 和 Zhang [3] 随后将鲁棒性定律扩展到等周性数据之外,在多项式有界参数下。猜想 1.1 提出的无界权重两层 ReLU 情况仍然是自然的边界情况。 本文证明该定律对于每个连续分段线性激活函数成立,特别是 ReLU 网络,仅相差一个对数因子。该对数的代价在全文中是明确的;我们不主张无对数的下界。第 7 节在球面模型中改进了该对数本身:在 n ≳ m d^2 \log(md) 范围内,因子 log(Cmnd) 改进为 log(Cmd)——样本量使对数不再起作用——并且没有单尺度打包论证能表明任何对数是必要的。第 8 节证明了对*每个* Lipschitz 激活都成立的投影容量下界:该猜想在宽度为 1 时以 n/\log(nd) 的边际成立,在宽度为 2 时在整个允许维度范围内成立,在宽度为 3 时在 d ≥ C \log(nd) 时以无对数形式成立。超出 d ~ n/(m \log(nd)) 范围,投影方法已耗尽——其净成本达到标签预算——对于一般激活函数在宽度 m≥2 时该区间仍开放;此外,一个线性激活插值器表明一旦 d ≳ n,则无法存在超过 C\sqrt{n} 的下界。第 9 节陈述了一个未解决的乘子估计(猜想 9.1),无对数猜想在临界宽度带中可归结为该估计;该归结本身及其周围的无条件结构——占据、服务容量、堆积刚性、帽质量、强制深度、仿射上确界恒等式,以及对于*每个* Lipschitz 激活函数已解决的单一方向情况(无对数)——在补充说明 [13] 中展开。该归结与表示无关,因此一般激活函数的剩余障碍与 ReLU 的相同。 ### 1.1. 固定符号与约定 我们在全文中固定这些符号。 * ⟨·,·⟩ 和 ‖·‖ 是 \mathbb{R}^d 上的欧几里得内积和范数;\mathbb{S}^{d-1} = {x : ‖x‖=1};B_R = {x : ‖x‖ ≤ R}。 * Lip_D(f) = sup_{x≠x'∈D} |f(x)-f(x')|/‖x-x'‖ 是 f 在集合 D 上的欧几里得 Lipschitz 常数。 * ReLU(t) = max(t,0)。函数 ψ: \mathbb{R}→\mathbb{R} 是*连续分段线性且具有 K 段*,如果它是连续的且存在断点 τ_1<⋯<τ_{K-1},使得 ψ 在 (−∞,τ_1), (τ_1,τ_2), …, (τ_{K-1},∞) 上分别是仿射的;ReLU 是 K=2, τ_1=0 的情况。连续性属于定义的一部分,并在引理 2.1 中使用。 * 对于单位向量 u 和 t∈\mathbb{R},H_{u,t} = {x : ⟨u,x⟩=t} 是法向量为 u、到原点有符号距离为 t 的超平面。 * clip(t) = max(−1, min(1,t)) 是 \mathbb{R} 到 [−1,1] 的投影;它是 1-Lipschitz 的。 * ψ 始终表示网络激活函数;ψ_2(带下标)表示次高斯 Orlicz 范数 ‖Z‖_{ψ_2} = inf{s>0 : \mathbb{E} e^{Z^2/s^2} ≤ 2}。 * c, C, c_0, c_2, C_0, C', κ 表示正的绝对常数;c, C 可能在不同行中变化,而有下标常数一旦选定即固定。 * 任何在期望内部出现的函数类或 Lipschitz 函数的上确界,其类在一致范数下是可分的——权重在有限维空间中连续变化,或 Lipschitz 函数球中——因此它等于固定可数稠密子集上的上确界且是可测的;我们直接用 sup 而不进一步说明。 我们将 ψ 写为具有 K 段的分段线性激活函数,并设 m̄ := (K−1)m+1;对于 ReLU,m̄ = m+1。我们使用两个数据模型,均来自 [1]: * (S) μ = \mathbb{S}^{d-1} 上的均匀概率测度,且 d≥3,定义域 D = \mathbb{S}^{d-1}; * (G) μ = N(0, I_d/d) 且定义域 D = B_2。 数据 (x_i, y_i)_{i≤n} 是 i.i.d. 的,x_i ∼ μ,y_i ∈ [−1,1],噪声水平 σ^2 := \mathbb{E} \operatorname{Var}(y∣x) > 0。独立的 ±1 标签是 σ^2=1 的特例。 ### 1.2. 结果 ###### 定理 1.2(固定宽度定律)。存在绝对常数 C_0, c_0 > 0 使得以下成立。设 ψ 为连续分段线性且具有 K 段,令 m̄ = (K−1)m+1,ε ∈ (0, σ^2] 且 δ ∈ (0,1),并假设 n ≥ C_0 ε^{-2} \log(8/δ)。在模型 (G) 中额外假设 d ≥ 2 \log(8n/δ)。那么,至少以概率 1−δ,每个具有任意权重的 f ∈ \mathcal{N}_m 若满足 \[ \frac{1}{n}\sum_{i=1}^n \bigl(f(x_i)-y_i\bigr)^2 \leq \sigma^2 - \varepsilon, \] 则满足 \[ \operatorname{Lip}_D(f) \geq c_0 \varepsilon \sqrt{\frac{n}{\bar{m} \log\!\bigl(C_0 \bar{m} n d / \varepsilon\bigr)}}. \] ###### 推论 1.3(BLN 对分段线性激活函数成立,至多一个对数因子)。在猜想 1.1 的设定下,ψ 连续分段线性且球面模型中 d≥3,存在依赖于 ψ 仅通过其段数的常数 c_1, C_1 > 0,使得以至少 1−δ 的概率,当 n ≥ C_1 \log(8/δ) 时,每个 f ∈ \mathcal{N}_m 具有任意权重且精确拟合数据,或仅经验均方误差至多为 1/2,满足 \[ \operatorname{Lip}_{\mathbb{S}^{d-1}}(f) \geq c_1 \sqrt{\frac{n}{m \log(C_1 m n d)}}. \] ###### 推论 1.4(有限视野同时宽度)。固定整数 M ≥ 1。在定理 1.2 的假设下,若 n ≥ C_0 ε^{-2} \log(8M/δ) 且模型 (G) 中 d ≥ 2 \log(8nM/δ),则存在一个概率至少为 1−δ 的事件,在该事件上定理 1.2 的结论对于每个宽度 1 ≤ m ≤ M 及每个 f ∈ \mathcal{N}_m 同时成立。 宽度进入证明的方式仅通过实现函数具有拐点的不同超平面数量。对于两层分段线性函数 f,令 k(f) 为在 D 内携带正则表示中非零拐点的不同超平面 H_{u,t} 的数量。在引理 2.1 后,宽度为 m 的网络有 k(f) ≤ (K−1)m,但冗余或取消的参数化可能使 k(f) 小得多。 ###### 定理 1.5(实现拐点计数定律)。存在绝对常数 C_0, c_0 > 0,使得在定理 1.2 的设定下,若 n ≥ C_0 ε^{-2} \log(8n/δ) 且模型 (G) 中 d ≥ 2 \log(8n/δ),则至少以概率 1−δ,每个两层分段线性网络 f(任意宽度和任意权重)若 k(f) ≤ n 且拟合数据低于噪声下限 ε,满足 \[ \operatorname{Lip}_D(f) \geq c_0 \varepsilon \sqrt{\frac{n}{(k(f)+1) \log\!\bigl(C_0 (k(f)+1) n d / \varepsilon\bigr)}}. \] 拐点计数定理对于满足 k(f) ≤ n 的实现函数而言比固定宽度定理更强;定理 1.2 仍单独陈述,因为它给出了即使在 (K−1)m > n 时也成立的干净固定宽度保证。 ###### 推论 1.6(结构化单隐藏层架构)。固定整数 K_0 ≥ 0。在定理 1.2 的假设下,将 m̄ 替换为 K_0+1,至少以概率 1−δ,每个单隐藏层分段线性脊架构的标量输入输出映射,若其实现函数至多有 K_0 个不同拐点超平面,则当其拟合数据低于噪声下限 ε 时满足 \[ \operatorname{Lip}_D(f) \geq c_0 \varepsilon \sqrt{\frac{n}{(K_0+1) \log\!\bigl(C_0 (K_0+1) n d / \varepsilon\bigr)}}. \] 该界限仅依赖于实现函数,而非参数化方式;因此任何受约束的单隐藏层参数化——例如卷积层中的跨滤波器权重共享、绑定或重复权重、第一层的低秩分解——都满足相同界限,其中 K_0 是约束所允许的不同拐点超平面数量。若激活函数有 K 段,且卷积层有 F 个滤波器在 S 个空间位置评估,则可取 K_0 ≤ (K−1)FS。 ###### 推论 1.7(向量输出)。设输出维度为 r。假设 y_i ∈ [−1,1]^r,并记 σ_ℓ^2 = \mathbb{E} \operatorname{Var}(y_ℓ∣x)
相似文章
每一层都至关重要:一个关于ReLU网络的指数型$L_2$深度层次结构
本文提出了一种关于ReLU网络的指数型深度层次结构,基于L2近似误差,证明更深的网络在函数近似上提供了指数级的表征能力提升。
Bug or Feature^2:权重漂移、激活稀疏性与尖峰
本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。
使用双隐层ReLU网络表示MAX函数
本文探讨了使用双隐层ReLU神经网络对MAX函数进行理论表示,提供了精确表示的详细系数列表和恒等式。
通过精确线性代数实现更浅的ReLU网络表示
本文改进了表示最大值函数所需ReLU网络深度的理论界限,展示了最多10个输入时精确的两隐藏层表示,并通过精确线性代数技术改进了更大n时的深度。
通过平滑激活缓解深度神经网络一致收敛中的维数灾难
本文建立了一个理论框架,表明深度神经网络中的平滑激活可以缓解一致收敛中的维数灾难,提供非渐近保证,并在最坏情况可靠性上优于ReLU网络。