减少随机优化中的每样本损害
摘要
本文介绍了一个在随机优化中减少每样本损害的框架,其中来自批次平均和历史状态的参数更新会增加单个样本的损失。该方法采用降维技术,并专注于最后一层线性层以提高效率,在图像分类任务上展示了更好的泛化性能。
arXiv:2607.16261v1 公告类型:新
摘要:现代优化器将当前小批量的梯度与历史优化状态(如动量或自适应矩)相结合。虽然非常有效,但跨批次的聚合以及结合历史状态可能会产生增加单个样本损失的参数更新。我们将这种效应称为损害,并将参数更新形式化为一个优化问题,明确最小化批次平均和过去优化状态对当前数据的冲突影响。由于精确公式难以处理,我们引入了一个高效的代理方法。我们首先将问题的维度降低到批次大小,然后通过成功地将优化限制在最后一层线性层上,大幅削减了内存和速度瓶颈。这依赖于一个意想不到的发现:这一层单独就能可靠地捕获每样本梯度的二阶统计信息。由此产生的替代问题可以轻松集成到标准优化器(如SGD和AdamW)中,并可使用少量GPU友好的迭代求解。关键在于,该方法具有良好的扩展性,因为相对计算开销会随着模型大小或输入的增长而缩小。在图像分类基准上的实验证实了每样本干扰减少和泛化性能提升。
查看缓存全文
缓存时间: 2026/07/21 06:48
# 1 引言 来源:https://arxiv.org/html/2607.16261 边注间距已被修改。上边距已被修改。边注间距已被修改。页面布局违反了ICML样式。请不要更改页面布局,或包含geometry、savetrees、fullpage等会为您更改布局的包。我们无法可靠地撤销对样式的任意更改。请移除违规的包或布局修改命令,然后重试。 降低随机优化中每个样本的损害 Apostolos Avranas† ###### 摘要 现代优化器将当前小批量的梯度与历史优化状态(如动量或自适应矩)相结合。虽然这种方法非常有效,但跨批次聚合并结合历史信息可能导致参数更新增加单个样本的损失。我们将这种效应称为*损害*,并将参数更新形式化为一个优化问题,该问题显式地最小化批量平均和过去优化状态对当前数据的冲突影响。由于精确形式化是难以处理的,我们引入了一个高效的代理。我们首先将问题的维度降低到批量大小,然后通过成功将优化限制在最后一个线性层,大幅削减内存和速度瓶颈。这基于一个意外的发现:*这一层独自可靠地捕捉了每个样本梯度的二阶统计量*。由此产生的代理问题能够轻松集成到SGD和AdamW等标准优化器中,并且可以使用少量GPU友好的迭代来解决。关键的是,该方法表现出*有利的缩放特性*,因为相对计算开销随着模型大小或输入增大而减小。在图像分类基准上的实验证实了*降低的每个样本干扰*和*提升的泛化能力*。我们开源了相关代码¹。¹脚注:¹https://github.com/avranasa/sample-harm-reduction †脚注:†Amadeus, 821 Av. Jack Kilby, 06270, France。Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026。 随机优化是现代深度学习的基础。在实践中,参数更新通过聚合小批量上的梯度并将其与历史信息(如动量或自适应矩)相结合来计算。这些机制对于稳定训练至关重要,但它们隐含地假设将批量平均梯度与过去优化状态相结合对当前小批量的学习总是有益的。在这项工作中,我们挑战了这一假设。历史优化状态与批量平均梯度之间的相互作用可能产生参数更新,从而主动增加当前批次中单个样本的损失。虽然这种影响可能在批次级别被掩盖,但它代表了在单个样本级别上的系统性信息损失。我们将这种现象称为*损害*。从这个角度来看,标准优化器可能无意中牺牲单个样本的改进来换取优化稳定性。为了纠正这种不平衡,我们的目标是保护每个样本免受批量平均和历史优化状态可能产生的冲突影响。我们引入一个*新颖*的框架,将参数更新形式化为一个优化问题,显式地最小化对当前小批量中样本的有害影响。不幸的是,直接求解所得的优化问题在实践中是禁止的。我们采用一系列步骤来推导出一个代理问题,该问题允许一个计算高效的解决方案: - • *降维:* 我们通过数学变换将优化问题从参数空间转换到显著更小的批量空间。 - • *最后一层近似:* 该公式涉及全网络每个样本的梯度,其计算增加了巨大的开销。我们证明,通过精心操作,该问题可以仅使用最后一个线性层的每个样本梯度来近似。这依赖于我们惊人的发现:该层独自可靠地捕捉了全网络每个样本梯度的核心二阶统计量,使得代理问题高度代表原始问题。 - • *隐式梯度计算:* 即使对于最后一层,具体化每个样本梯度也构成瓶颈。我们利用Khatri-Rao因子分解特性来绕过具体化这些梯度,完全消除相关的内存和速度开销。 - • *高效求解器:* 我们为所得的代理问题提出一个定制的求解器,该求解器使用少量GPU友好的迭代快速收敛。 总体而言,我们的框架与优化器无关,可以集成到广泛使用的方法中,如带动量的随机梯度下降(SGD)和AdamW。重要的是,引入的计算和内存开销很小,并且随着模型大小或输入维度扩展而自然缩小。实验上,我们证实所提出的方法成功减轻了对当前批次中单个样本的损害。此外,在图像分类基准上的评估显示泛化能力提升,表明控制更新干扰是提升深度学习优化的一个实用且互补的维度。 ## 2 文献综述 我们的工作与持续学习领域的研究最为密切相关,该领域的目标是在学习新任务时防止灾难性遗忘先前获得的知识。相比之下,我们的设置根本不同:我们不是保护过去的知识免受新数据影响,而是旨在防止过去优化状态对输入数据的有害影响。在持续学习文献中,与我们方法最接近的是梯度情景记忆(GEM)[Lopez-Paz and Ranzato (2017)](https://arxiv.org/html/2607.16261#bib.bib4),它使用了基于梯度对齐的类似损害概念。为了确定更新方向,GEM形式化了一个优化问题,通过转到其对偶形式,维度从参数空间降低到样本数量。然而,依赖于大量情景记忆和高效求解所得优化问题等挑战并未得到完全解决。后续工作[Chaudhry et al. (2019)](https://arxiv.org/html/2607.16261#bib.bib7);[Hu et al. (2020)](https://arxiv.org/html/2607.16261#bib.bib8)通过用过去样本的平均梯度替换情景记忆来缓解部分这些限制。相关方法在不同任务的梯度之间强制施加正交性或基于投影的约束[Farajtabar et al. (2020)](https://arxiv.org/html/2607.16261#bib.bib10);[Saha et al. (2021)](https://arxiv.org/html/2607.16261#bib.bib11)。最后,最近的工作[Luo et al. (2025)](https://arxiv.org/html/2607.16261#bib.bib13)表明,灾难性遗忘效应在当代大型语言模型中持续存在,且随着模型规模增大而加剧。 通过将当前小批量中的每个样本视为一个独立任务,我们可以与多任务学习(MTL)建立平行关系。在[Navon et al. (2022)](https://arxiv.org/html/2607.16261#bib.bib15)中,每个任务被建模为博弈中的一个玩家,导致一个优化问题,该问题学习每个任务梯度的权重,并依赖一个捕捉成对梯度交互的任务-任务Gram矩阵。在[Yu et al. (2020)](https://arxiv.org/html/2607.16261#bib.bib9)中,作者使用了与我们类似的任务间损害概念,并与[Chaudhry et al. (2019)](https://arxiv.org/html/2607.16261#bib.bib7)类似,提出投影平均梯度以减少任务间的冲突。在[Dong et al. (2022)](https://arxiv.org/html/2607.16261#bib.bib16)中,使用正交分解来避免不同任务梯度之间的干扰。在[Liu et al. (2021a)](https://arxiv.org/html/2607.16261#bib.bib17)中,他们考虑加权每个任务的梯度以最小化最差冲突。在[Liu et al. (2021b)](https://arxiv.org/html/2607.16261#bib.bib19)中,每个任务的权重旨在平衡各任务之间的学习速度,而在[Senushkin et al. (2023)](https://arxiv.org/html/2607.16261#bib.bib18)中,他们旨在构建不同任务之间的正交归一化梯度。与上述工作相反,[Yang et al. (2023)](https://arxiv.org/html/2607.16261#bib.bib20)明确考虑了基础优化器,并提出了针对MTL设置的适配。类似地,我们的目标是调整实际优化器,以改变优化轨迹,使其在每次迭代中减少对当前小批量样本的有害影响。 在这项工作中,我们专注于两个广泛使用的优化器:AdamW [Loshchilov and Hutter (2019)](https://arxiv.org/html/2607.16261#bib.bib34)和带动量的SGD [Sutskever et al. (2013)](https://arxiv.org/html/2607.16261#bib.bib31);[Nesterov (1983)](https://arxiv.org/html/2607.16261#bib.bib32)。AdamW是Adam [Kingma and Ba (2014)](https://arxiv.org/html/2607.16261#bib.bib22)的一个变体,它将权重衰减与基于梯度的更新解耦。其他强大的Adam风格方法包括Adafactor [Shazeer and Stern (2018)](https://arxiv.org/html/2607.16261#bib.bib26);[Zhai et al. (2022)](https://arxiv.org/html/2607.16261#bib.bib27),它减少了内存使用;LAMB [You et al. (2020)](https://arxiv.org/html/2607.16261#bib.bib23),它采用逐层自适应;以及RAdam [Liu et al. (2020)](https://arxiv.org/html/2607.16261#bib.bib33),它纠正了自适应学习率的方差。对于SGD风格的方法,大规模训练中具有竞争力的优化器包括MUON [Jordan et al. (2024)](https://arxiv.org/html/2607.16261#bib.bib25),它鼓励正交更新,以及Lion [Chen et al. (2023)](https://arxiv.org/html/2607.16261#bib.bib24),它使用动量的符号。 这项工作中的一个重要元素是在不引入过多内存和计算成本的情况下处理每个样本的梯度。每个样本的梯度及其统计量(如范数)在各种情境中很有用,如差分隐私[Abadi et al. (2016)](https://arxiv.org/html/2607.16261#bib.bib36)、预测泛化[Yin et al. (2018)](https://arxiv.org/html/2607.16261#bib.bib41)以及开发新优化器[Roulet and Agarwala (2025)](https://arxiv.org/html/2607.16261#bib.bib35)。不幸的是,计算每个样本的梯度要求很高。对于卷积神经网络,[Rochette et al. (2019)](https://arxiv.org/html/2607.16261#bib.bib40)提出了一种更高效的计算方法。此外,像Opacus [Yousefpour et al. (2021)](https://arxiv.org/html/2607.16261#bib.bib37)和Backpack [Dangel et al. (2020)](https://arxiv.org/html/2607.16261#bib.bib38)这样的库就是为此目的开发的。我们注意到,计算完整的每个样本梯度在内存和运行时间上都是昂贵的。然而,存在一种高效的技术可以在不显式计算完整梯度的情况下计算其范数。这个技巧曾被用于[Roulet and Agarwala (2025)](https://arxiv.org/html/2607.16261#bib.bib35);[Li et al. (2022)](https://arxiv.org/html/2607.16261#bib.bib39);[Bu et al. (2023)](https://arxiv.org/html/2607.16261#bib.bib42)。 ## 3 动机与问题形式化 令F(x;θ)表示一个参数为θ∈RΘ的模型,处理输入x。标准训练过程在B个样本的小批量{xi}i=1B上进行,每个样本有一个逐样本损失Li(θ)=L(F(xi;θ))。在实践中,如SGD和AdamW等标准优化器[Sutskever et al. (2013)](https://arxiv.org/html/2607.16261#bib.bib31);[Kingma and Ba (2014)](https://arxiv.org/html/2607.16261#bib.bib22);[Loshchilov and Hutter (2019)](https://arxiv.org/html/2607.16261#bib.bib34)仅使用*聚合的*批量梯度g=∇θ(1/B)∑_{i=1}^B Li(θ),并结合内部优化状态(例如动量)来更新参数。虽然这个过程可靠地降低了平均损失,但最终目标通常是在每个样本上都表现良好。这种差异在分类任务中尤为明显,其中交叉熵是准确率的代理。最小化平均损失并不能保证每个样本都有改进,甚至可能无法增加正确分类的样本数量。除了这种目标上的不匹配,批次聚合还丢弃了有关批次的宝贵信息:我们失去了对逐样本贡献和冲突(即哪些样本因参数更新而受益或受损)的可见性。最后,实际优化器将当前批次梯度与历史信息(如动量或自适应矩)混合在一起。因此,实际参数更新可能与当前批次的下降方向有显著偏差,可能增加一部分*当前*样本的损失。在这个意义上,更新可能对当前批次样本产生“灾难性”损害。这激发了对更新的逐样本视角:我们不是仅考虑聚合的批量梯度,而是寻求尊重每个样本下降方向的鲁棒更新。 令G∈RB×Θ为逐样本梯度矩阵,其中每一行Gi=(1/B)∇θ Li(θ)对应于第i个样本的梯度。使用一阶泰勒展开,样本i的损失变化为: Li(θ+dθ) ≈ Li(θ) + Gi^T dθ (1) 当Gi^T dθ > 0时,样本i的损失增加。我们将这种增加描述为“损害”。根据泰勒一阶近似,损害的严重程度与max(0, Gi^T dθ)成正比。理想情况下,我们寻求一个方向dθ同时改善每个样本。然而在实践中,冲突的梯度使这*不可能*。由于我们无法保证没有样本受损,我们的目标转向最小化整个小批量中的总损害。我们构建一个目标J(dθ),它对样本损害(即当Gi^T dθ > 0时)进行线性惩罚,而对成功降低样本损失的方向(Gi^T dθ ≤ 0)赋予零惩罚。定义辅助函数: H(v) := Σ_{i=1}^B max(0, [v]_i), 其中[v]_i表示向量v∈RB的第i个元素,我们可以将目标表示为J(dθ) := H(G dθ)。因此,我们寻求最优参数更新: dθ⋆ = arg min_{dθ} J(dθ). (2) ### 3.1 引入对更新方向的约束 直接求解方程2存在几个陷阱。首先,平凡解dθ=0在技术上是优的(零损害),但对训练模型无效。其次,方程2可能允许任意大的更新幅度,如果我们不加以约束,优化器可能选择极大的步长,虽然相似文章
快速停止!早停法实现认证鲁棒性
本文介绍了一个面向任意时有效认证鲁棒性的元学习框架,该框架使用序列E过程自适应分配计算资源,与传统的随机平滑方法相比,样本复杂度降低了20倍,同时保持了严格的统计保证。
小批量噪声通过主导子空间波动降低锐度
本文认为,Hessian矩阵的主导子空间虽然对减少损失贡献甚微,但在小批量SGD中降低锐度方面起着关键作用。文章推导了由主导方向上的小批量噪声引起的锐度校正项。
从单次SGD到数据复用:素描线性回归中的小批量缩放定律
本文推导了在幂律谱下素描线性回归的批量缩放定律,分析了单次和多次遍历的小批量SGD。它提供了明确的风险分解,展示了批量大小如何影响偏差、方差和波动项,并证明了无放回采样比有放回采样产生更低的噪声。
超越有界方差:Blum-Gladyshev噪声下非凸优化的方差缩减归一化方法
本文研究了Blum-Gladyshev噪声下的非凸随机优化,其中梯度方差随与初始点的距离增长。证明了带有动量的归一化SGD和方差缩减STORM方法的收敛性保证,在某些条件下达到了极小极大最优速率。
乐观对偶平均化统一了现代优化器
本文介绍了 SODA,这是乐观对偶平均化的一种广义形式,统一了 Muon 和 Lion 等现代优化器。该研究提出了一种实用包装器,在不同规模下均可提升性能,且无需为权重衰减进行额外的超参数调优。