预测随机低维重参数化何时能训练神经网络
摘要
本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。
查看缓存全文
缓存时间: 2026/08/14 09:30
# 预测随机低维重参数化何时能训练神经网络 来源:https://arxiv.org/html/2608.12597 Andrew Cheng† 清华大学计算机科学与技术系,北京,中国 曼彻斯特大学计算机科学系,曼彻斯特,英国 Ali Eslamian† Jie Cheng 迈阿密大学计算机科学与技术系,牛津,俄亥俄州,美国 Mehdi Zargham 戴顿大学计算机科学系,代顿,俄亥俄州,美国 Qiang Cheng\* 肯塔基大学计算机科学系,列克星敦,肯塔基州,美国 肯塔基大学生物医学信息学研究所,列克星敦,肯塔基州,美国 ###### 摘要 神经网络通常可以使用随机低维重参数化来进行训练或微调:不是直接优化所有模型参数,而是优化一个小型潜变量向量,该向量通过一个冻结的随机映射被映射为完整的参数更新。此过程将训练限制在一个随机选择的低维搜索空间中,并提出了一个实际问题:这个搜索空间需要多大才能访问到实现低损失的参数?已知随机低维训练会表现出一种由低损失区域几何性质决定的尖锐可达性转变。我们首先将该现象表示为一种等价的锥形式,在该形式中,紧致凸目标的转变以极锥的统计维度为中心。我们的主要理论贡献是一种超越这种几何刻画的操作性二次分析。我们推导出一个方向分辨的主公式,该公式同时利用曲率谱和参考点到解的位移轮廓来预测随机切片残差,从而明确展示了相对于曲率的位移方向如何影响所需的潜变量维度。该公式产生了一个新的自洽各向同性方向预测器,并且在其保守的仅半径专用形式中,恢复了先前的高斯宽度二次界。在此分析的基础上,我们引入了随机映射网络(RaMaN),这是一个可扩展框架,对于具有 \(P\) 个参数的网络,它使用结构化阿达玛映射或种子再生成高斯映射来实例化预测的潜变量维度 \(d\)。这些构造消除了密集随机生成器所需的 \(O(dP)\) 冻结映射存储,并将优化器状态内存从 \(O(P)\) 减少到 \(O(d)\)。我们进一步开发了无矩阵曲率近似和免扫描维度选择程序,并设计了一个基准测试,用于衡量跨任务、架构和映射族的可达性转变,同时考虑可训练参数、冻结映射存储、优化器状态内存、检查点大小和运行时间。在受控的二次和神经曲率实验中,方向分辨预测器紧密跟踪实测的转变位置,并且在位移方向重要的设置中显著优于方向无关的近似;端到端实验进一步展示了图像和语言模型中尖锐的、依赖协议的训练转变。 †这些作者对本工作贡献相同。 \*通讯作者:Qiang Cheng,[[email protected]](mailto:[email protected]) ## 1 引言 现代深度神经网络通常通过直接优化高维权重向量 \(\theta \in \mathbb{R}^P\) 的所有参数来进行训练,其中 \(P\) 可能从数百万到数十亿甚至更多。尽管这种直接参数化具有很高的表达能力,但代价也很高:优化器必须为每个参数维护梯度和辅助状态,检查点大小随 \(P\) 扩展,并且当任务所需的有效自由度远小于环境参数维度时,不受约束的优化可能会过拟合。模型的环境维度与优化问题的有效维度之间的这种差距,促使人们采用低维重参数化。在*低维重参数化*中,完整的参数向量 \(\theta \in \mathbb{R}^P\) 不会被直接优化。相反,它通过一个固定或部分固定的映射 \(\theta = g_\omega(z)\),从一个更小的可训练潜变量向量 \(z \in \mathbb{R}^d\)(其中 \(d \ll P\))生成,\(\omega\) 表示映射中的随机、结构化或不可训练参数。等价地,可以写成 \(\theta = \theta_{\mathrm{ref}} + \Delta\theta(z)\),其中 \(\theta_{\mathrm{ref}}\) 是参考点(例如随机初始化、预训练模型或试点解),\(\Delta\theta(z)\) 是由低维潜变量 \(z\) 生成的受约束参数位移。训练只优化 \(z\),而目标网络使用生成的权重 \(\theta(z)\) 执行标准的前向计算。 这个想法有一个简单的几何解释。直接训练在整个参数空间 \(\mathbb{R}^P\) 中搜索,而低维重参数化将训练限制在映射 \(\operatorname{Im}(g_\omega) = \{g_\omega(z) : z \in \mathbb{R}^d\}\) 的图像中,其中 \(\omega\) 表示定义该映射的冻结随机抽取。当 \(g_\omega\) 光滑时,该图像至多有 \(d\) 个局部自由度,因为 \(g_\omega\) 在任意 \(z \in \mathbb{R}^d\) 处的雅可比矩阵的秩至多为 \(d\)。如果低损失区域在大多数参数方向上都很宽,并且只沿相对较少的重要方向受到约束,那么这种限制是有益的。在这种情况下,低维图像不必覆盖整个环境空间 \(\mathbb{R}^P\),只需有足够的自由度来满足这些有效约束即可。我们将对应的受约束方向的数量称为低损失区域的*有效余维数*。这一观点为经验观察提供了几何解释,即神经网络通常可以在令人惊讶的小型随机子空间中成功训练或微调[1 (https://arxiv.org/html/2608.12597#bib.bib2),14 (https://arxiv.org/html/2608.12597#bib.bib1)]。 然而,核心挑战不仅在于低维随机搜索空间能否到达低损失区域。已有工作表明,随机子空间的可训练性会随着潜变量维度的增加而表现出尖锐的几何转变[14 (https://arxiv.org/html/2608.12597#bib.bib1),11 (https://arxiv.org/html/2608.12597#bib.bib20)]。实际重要的问题是,这种转变是否可以从无需对潜变量维度进行穷举扫描的量中预测出来。具体来说,给定一个从随机或结构化随机族中抽取的冻结映射 \(g_\omega: \mathbb{R}^d \to \mathbb{R}^P\),我们希望确定一个维度 \(d\),使得在 \(\omega\) 上以高概率满足 \(\operatorname{Im}(g_\omega) \cap S_\varepsilon \neq \emptyset\),其中 \(S_\varepsilon = \{\theta: \mathcal{L}(\theta) \leq \mathcal{L}^\star + \varepsilon\}\) 是一个 \(\varepsilon\)-低损失子水平集。一个相关的算法问题是,在现实的训练预算和映射构造下,对得到的潜变量进行基于梯度的优化能否利用这种可达的低损失区域。最近的方法提供了大量证据表明,优化少量可训练变量有时可以接近或匹配全参数训练,包括内在维度训练[14 (https://arxiv.org/html/2608.12597#bib.bib1)]、低维微调[1 (https://arxiv.org/html/2608.12597#bib.bib2)]、随机基参数化[16 (https://arxiv.org/html/2608.12597#bib.bib3),9 (https://arxiv.org/html/2608.12597#bib.bib4)]以及映射网络[20 (https://arxiv.org/html/2608.12597#bib.bib5)]。例如,映射网络优化一个低维潜变量向量 \(z \in \mathbb{R}^d\),该向量调制一个具有冻结基权重的随机初始化映射网络,以生成目标网络的 \(P \gg d\) 个参数。这些方法确立了低维参数化的实际可行性,但它们本身并没有提供一个基于目标损失局部几何性质来选择潜变量维度的前瞻性规则。 Larsen 等人[11 (https://arxiv.org/html/2608.12597#bib.bib20)]为此现象提供了一个重要的几何解释。他们通过从初始化视角观察到的低损失子水平集的角高斯宽度来刻画随机子空间的可训练性,将观察到的转变与目标区域的几何性质联系起来。然而,这种刻画难以前瞻性地使用:未知神经网络低损失区域的高斯宽度通常在进行人们希望避免的维度扫描之前无法直接获得。此外,在二次设置中,所得到的仅半径近似依赖于 Hessian 谱和从参考点到最小值的标量距离,但没有明确解析该位移相对于曲率特征方向的方向。这就留下了几何转变刻画与可用于潜变量维度选择的可计算预测器之间的操作性差距。 我们分两个阶段来弥补这一差距。首先,对于紧致凸目标集,我们将已知的随机切片可达性转变表示为一种等价的锥形式,其中转变的位置由平移后的低损失区域生成的极锥的统计维度来刻画。这种表述提供了一种方便的有效余维数解释,并为局部二次分析搭建了桥梁。然后,我们的主要理论贡献是一个方向分辨的二次预测器。对于半正定局部曲率模型,我们推导出一个主公式,该公式同时利用曲率谱和完整的参考点到解的位移轮廓来预测随机切片残差。因此,两个具有相同 Hessian 谱和相同位移范数的问题,当它们的位移相对于曲率特征空间的方向不同时,预测出的所需潜变量维度也可能不同。通过施加等能量位移模型,可以得到一个新的自洽各向同性方向预测器;而方向均匀的仅半径专用形式则恢复了 Larsen 等人[11 (https://arxiv.org/html/2608.12597#bib.bib20)]早先的二次界。后者在无法获得方向位移信息时提供了一种保守的选择。 这种局部二次设置在分析上易于处理,而且在经验上具有相关性:对深度网络 Hessian 的研究通常报告少数较大的离群特征值以及大量接近零的特征值块,对应于少数刚性方向和许多近似平坦方向[19 (https://arxiv.org/html/2608.12597#bib.bib17),5 (https://arxiv.org/html/2608.12597#bib.bib18),17 (https://arxiv.org/html/2608.12597#bib.bib19)]。由于在现代网络规模下无法获得精确的谱信息,我们进一步开发了基于主导曲率方向和未解析谱质量的随机估计的无矩阵近似。这些近似支持实用的潜变量维度选择,而无需对候选维度进行全面扫描。 在此分析的基础上,我们引入了*随机映射网络*(RaMaN),这是一个将潜变量维度选择与固定随机低维重参数化相结合的可扩展框架。RaMaN 在估计的位移轮廓可用时支持方向分辨选择,在只知道位移尺度时支持基于半径的选择,在两种估计都不够可靠时支持嵌套自适应扩展。选定的维度通过可扩展的映射族实例化,包括结构化阿达玛映射(SHM)(受 SRHT 和 Fastfood 等快速结构化阿达玛构造的启发[2 (https://arxiv.org/html/2608.12597#bib.bib15),21 (https://arxiv.org/html/2608.12597#bib.bib16),12 (https://arxiv.org/html/2608.12597#bib.bib14)])以及种子再生成高斯映射。全局种子再生成高斯构造实现了定理 1 (https://arxiv.org/html/2608.12597#Thmtheorem1) 所假设的均匀随机子空间,而默认的逐层高斯构造对应于推论 3 (https://arxiv.org/html/2608.12597#Thmtheorem3) 在其乘积结构假设下的独立逐层设置。SHM 提供了一种结构化、内存高效的替代方案,其经验行为将被单独评估。这些构造避免了存储一个密集的 \(P \times d\) 随机映射对象,并将优化器状态内存从 \(O(P)\) 减少到 \(O(d)\)。 我们的目标并不是声称所有大型神经网络都可以仅通过几千个潜变量来训练。相反,我们想知道:当几何上可能存在实质性的可训练维度降低时,所需的维度能否从可测量的局部曲率和位移信息中预测出来;以及映射结构、优化器和训练协议如何影响由此产生的转变。这一视角将低维重参数化从纯粹的经验维度扫描过程,转变为一个具有明确、可证伪预测的框架。 我们的主要贡献总结如下: - **理论。** 在高斯宽度刻画随机子空间训练的基础上,我们将可达性转变重新表示为等价的锥/统计维度形式,并推导出一个新的方向分辨二次主公式。与之前仅半径的二次界不同,主公式预测器联合依赖于曲率谱和参考点到解的位移轮廓。该预测器有两个有用的特例:一个新的自洽各向同性方向预测器,以及一个方向均匀预测器,后者在特殊情况下恢复先前的仅半径界。 - **方法。** 我们开发了随机映射网络(RaMaN),它将基于曲率和位移信息的潜变量维度选择与可扩展的冻结随机重参数化相结合。RaMaN 支持方向分辨和基于半径的免扫描选择,以及保留先前活跃随机搜索空间的嵌套自适应维度扩展。为了在不需要存储稠密 \(P \times d\) 映射的情况下实例化所选维度,我们开发了基于 Hadamard 基方向嵌套选择的种子结构化阿达玛映射(SHM)\(\operatorname{crop}\, HDI_{\Omega}\),以及一种种子再生成高斯构造,其活跃列构成固定虚拟高斯矩阵的前缀。这些构造保留了理论所依据的固定切片解释,同时提供了可扩展的无矩阵训练。 - **测量。** 我们设计了一个基准测试,用于衡量随机低维训练跨任务、架构和映射族的相变。该基准评估方向分辨主公式预测器及其各向同性方向和方向均匀特例,比较高斯映射族与结构化随机映射族以及实用的维度选择策略,并不仅报告可训练参数,还报告冻结映射存储、优化器状态内存、检查点大小和墙钟成本。 ## 2 相关工作 ##### 低维重参数化与内在维度。 一个不断增长的研究方向……
相似文章
权重归一化:加速深度神经网络训练的简单重参数化方法
OpenAI 提出了权重归一化,一种重参数化技术,通过将权重向量的长度与方向解耦,改进神经网络训练的收敛性和计算效率,且不引入小批次依赖关系,适用于循环神经网络和对噪声敏感的应用场景。
DLR: 零推理成本的隐式残差用于低秩预训练
引入重复隐式残差(DLR),这是一种仅训练、无参数的插件,用于低秩预训练,可提升从60M到7B参数的LLaMA模型的困惑度,并且训练后可折叠到模型中,推理成本为零。
A Local Sinkhorn Framework for Conditional Distribution Reconstruction of Multidimensional Random Fields
This paper proposes a scalable local Sinkhorn divergence framework for training stochastic neural networks to reconstruct multidimensional random fields, with theoretical generalization error bounds and numerical demonstrations for uncertainty quantification.
面向ReRAM的模型微调:解决I-V非线性和保持误差问题
提出了一种基于微调的硬件感知训练算法,以减轻ReRAM交叉阵列中的I-V非线性和保持误差,从而以最小开销实现鲁棒的DNN部署。在图像分类和问答任务上进行了评估,达到了接近基线的准确率。
利用张量特征训练网络加速高维函数学习
本文提出一种加速高维函数深度神经网络训练的方法,通过引入上下文特征(包括来自分解预训练DNN的秩1特征和张量特征),并利用随机张量分解将存储成本降低数个数量级。