正交梯度约束塑造噪声标签记忆动力学

arXiv cs.LG 论文

摘要

本文介绍了 OrthoGrad,这是一种几何干预,在优化过程中去除权重梯度的径向分量,并表明它在小数据场景下减少了对噪声标签的记忆,但无法防止最终的记忆。

arXiv:2607.16231v1 Announce Type: new 摘要:现代神经网络能够拟合损坏的训练标签,这使得噪声标签学习成为研究记忆驱动过拟合的有用场景。大多数正则化方法修改目标、架构或数据分布;而我们则研究对优化器更新本身的一种几何干预。我们在噪声标签图像分类中评估了 OrthoGrad,它去除了每个权重梯度中与当前权重向量平行的分量。在小数据场景下的 MNIST 上,OrthoGrad 对 CNN 的测试准确率提升最为明显,同时减少了对损坏标签的拟合。基于权重范数和梯度-权重余弦相似度的机制诊断表明,当原始梯度包含显著的径向分量时,投影效果最强;而在梯度已经几乎与权重正交的大数据场景下,效果变弱。额外的 CIFAR-10 ResNet-18 实验表明,该方法可以改变记忆轨迹,但无法防止最终的噪声标签记忆。这些结果支持将正交更新约束作为研究学习动态的有用诊断工具,同时表明 OrthoGrad 是场景依赖的,而非通用的正则化方法。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:46

# 正交梯度约束塑造噪声标签记忆动力学
来源:https://arxiv.org/html/2607.16231
\\hldauthor\\Name

Richard Mai\\Emailricardooorichado@gmail\.com \\addr独立研究者

###### 摘要

现代神经网络能够拟合被破坏的训练标签,这使得噪声标签学习成为研究记忆驱动过拟合的有用场景。大多数正则化方法会修改目标函数、架构或数据分布;而本文则研究优化器更新本身的几何干预。我们在噪声标签图像分类中评估了 OrthoGrad,该方法移除每个权重梯度中与当前权重向量平行的分量。在小数据规模的 MNIST 上,OrthoGrad 最明显地提升了 CNN 的测试准确率,同时减少了对破坏标签的拟合。基于权重范数和梯度-权重余弦相似度的机制诊断表明,当原始梯度包含非平凡的径向分量时,投影的效果最强;而在梯度已几乎与权重正交的较大数据规模场景中,效果会减弱。额外的 CIFAR-10 ResNet-18 实验显示,该方法能够改变记忆轨迹,但无法阻止最终的噪声标签记忆。这些结果支持将正交更新约束作为研究学习动力学的有用诊断工具,同时表明 OrthoGrad 的效果依赖于具体场景,而非通用的正则化方法。

## 1 引言

即使在训练数据包含破坏或随机分配的标签时,神经网络也能达到接近完美的训练准确率,这表明高训练准确率本身并不意味着有意义的泛化能力 [ZhangEtAl2017]。这一现象使得噪声标签学习成为研究过拟合、记忆和隐式正则化的有用实验场景。先前的研究表明,深度网络通常先学习简单或结构化模式,然后才逐渐记忆错误标注的样本,这表明噪声标签记忆与训练动力学密切相关,而不仅仅是模型容量的体现 [ArpitEtAl2017, LiuEtAl2020]。关于噪声标签学习的综述进一步强调,错误标签的记忆仍是监督式深度学习中的核心失败模式 [SongEtAl2020]。

控制过拟合的常见方法是修改目标函数、架构或数据分布。例如,显式正则化器如 dropout(在训练过程中随机移除单元以减少共适应)以及权重衰减(其与自适应优化器的交互催生了 AdamW 等方法)[SrivastavaEtAl2014, LoshchilovHutter2019]。然而,这些干预措施并未隔离优化器更新几何的作用。由于优化算法本身的选择会偏向神经网络找到的解,研究更新层面的干预提供了另一种理解隐式正则化的途径 [NeyshaburEtAl2015, BlancEtAl2020]。

泛化能力的几何解释必须谨慎对待。范数、锐度以及其他参数空间的量可能会在重新缩放或重参数化时发生变化,而不一定改变网络所表示的函数。DinhEtAl2017 指出,基于锐度的解释可能具有误导性,因为等效的网络在表观锐度上可能差异很大,而 NeyshaburEtAl2015 则主张,恰当的几何应该考虑神经网络中的缩放不变性 [DinhEtAl2017; NeyshaburEtAl2015]。因此,本文并不将原始参数空间的几何视为泛化能力的完整解释。相反,它将几何作为一种实验干预手段:我们探究约束优化器更新的方向是否会改变模型记忆噪声标签的趋势。

正交梯度方法为此类干预提供了自然的框架。在持续学习中,正交梯度下降(Orthogonal Gradient Descent)将新任务的梯度投影到旨在保留先前任务性能的子空间中 [FarajtabarEtAl2020]。在多任务学习中,PCGrad 通过将一个梯度投影到另一个梯度的法平面来修改冲突的任务梯度,从而减少任务间的破坏性干扰 [YuEtAl2020]。这些方法表明,改变梯度方向(而不直接改变模型架构或数据集)能够显著影响训练行为。

本研究研究的是正交梯度修改的单任务类比。与将梯度投影到远离先前任务方向的做法不同,我们将每个梯度投影到远离当前权重向量的方向。最近有关单任务的研究探讨了将梯度相对于权重正交化以实现神经校准,表明这种几何优化器修改会影响置信度和不确定性行为 [Hedges2025]。受此研究启发,我们探究类似的更新约束是否能减少噪声标签记忆。我们的假设是,当前权重向量代表了已在训练中被加强的方向;移除梯度中与该向量平行的分量可能会阻止对这些方向的重复放大,并鼓励参数空间中的更切向轨迹。

我们在噪声标签图像分类中评估这种干预,重点关注记忆现象尤为明显的小数据场景。我们的结果表明,在最清晰的 MNIST CNN 设置中,OrthoGrad 能减少破坏标签的拟合,并提高测试准确率。然而,效果并非一致:在更大的数据场景以及 CIFAR-10 ResNet-18 实验中,OrthoGrad 改变了记忆轨迹,但并未持续提升最终准确率,也未阻止最终的记忆。因此,我们不将 OrthoGrad 视为通用正则化器。相反,我们将其用作一种受控的几何干预,以展示优化器更新方向可以塑造记忆动力学。

## 2 方法

令 g = ∇_w L(w) 为权重张量 w 的当前梯度。OrthoGrad 移除 g 中与 w 平行的分量:

g_⟂ = g - λ * (⟨g, w⟩) / (‖w‖² + ε) * w。

除非另有说明,所有主要实验均使用固定的全投影设置 λ = 1。我们仅对权重张量应用此变换,排除偏置和归一化参数。在重新归一化变体中,我们将投影后的梯度重新缩放以保留原始梯度范数:

g̃_⟂ = (‖g‖) / (‖g_⟂‖ + ε) * g_⟂。

然后,Adam 在其常规动量更新中使用 g̃_⟂ 而非原始梯度。这保持了架构、损失函数、数据集、学习率和 Adam 超参数不变,从而隔离了更新方向的影响。

## 3 结果

我们在噪声标签图像分类上评估 OrthoGrad。主要实验使用 MNIST 和两种轻量级架构:一个小型 MLP 和一个小型 CNN。MLP 将 28×28 输入展平,并使用两个 ReLU 隐藏层(大小分别为 64 和 32),最后接一个 10 类输出层。CNN 使用四个 ReLU 卷积层、一个最大池化层和两个最终线性层。

对于主要的噪声标签设置,我们在 500 个 MNIST 样本上训练,标签噪声为 30%,使用 Adam(学习率 10^{-3},批量大小 64)训练 400 个 epoch。我们使用五组匹配的随机种子进行 Adam 和 Adam+OrthoGrad 实验。报告测试准确率、训练准确率和破坏标签准确率(定义为故意破坏的样本按其破坏标签被正确分类的比例)。

参考标题

小型 MLP

参考标题

小型 CNN

图 1:30% 噪声下的记忆与验证动力学。OrthoGrad 在噪声 MNIST CNN 设置中效果最明显。对于小型 MLP,测试准确率从 Adam 下的 64.0±0.8% 提升至 OrthoGrad 下的 67.7±0.7%。对于小型 CNN,测试准确率从 52.2±2.5% 提升至 69.0±4.6%,而训练准确率从 96.8±2.8% 降至 71.2±3.1%。OrthoGrad 还降低了破坏标签准确率,尤其是在 CNN 上,表明它抑制了对故意翻转标签的拟合。

几何直觉是,经过投影后,更新相对于当前权重向量没有一阶径向分量。如果 g_⟂ ⟂ w,则

‖w - η g_⟂‖² = ‖w‖² + η²‖g_⟂‖²,

因此该更新在一阶上切于权重范数球面,尽管有限的学习率仍能在二阶上改变范数。这促使我们在训练过程中跟踪权重范数和梯度-权重余弦相似度。

**机制分析**。为了理解 OrthoGrad 为何改变泛化行为,我们跟踪权重范数以及投影前的梯度与权重向量之间的余弦相似度。

**机制分析结果**。图 2(https://arxiv.org/html/2607.16231#S3.F2)显示,OrthoGrad 的效果强烈依赖于数据规模。在 n=500 时,OrthoGrad 使权重范数低于 Adam,且投影前的梯度-权重余弦相似度明显为负,因此投影移除了更新中一个有意义的径向分量。在 n=48000 时,余弦相似度保持在接近零,意味着原始梯度已经几乎与权重向量正交。在该场景中,投影在方向性上接近于空操作,不再起到简单的范数稳定约束作用。这有助于解释为何最强的泛化效果出现在小数据噪声标签设置中,而非全数据训练中。

不同训练规模下的权重范数 参考标题 参考标题

参考标题

参考标题

不同训练规模下的投影前余弦相似度 参考标题 参考标题

参考标题

参考标题

图 2:不同训练规模下的机制诊断。在较小数据设置中,OrthoGrad 改变了范数轨迹,且原始梯度具有非平凡的径向分量。在完整 MNIST 规模下,梯度-权重余弦相似度接近零,投影的效果较弱或定性不同,OrthoGrad 产生更大的最终范数。

### CIFAR-10 扩展

为了测试 MNIST 趋势是否能迁移到更复杂的图像设置,我们使用 ResNet-18 在 5000 个训练样本上额外进行了 CIFAR-10 实验。在干净 CIFAR-10 上,OrthoGrad 与基线相当,但未显示出一致的优势。在 20% 噪声标签设置中,两种方法最终都记住了破坏标签,因此仅看最终 epoch 的准确率会低估轨迹层面的效果。基线显示了预期的记忆模式:随着训练进行,破坏标签上的准确率上升,而原始干净标签上的准确率下降。OrthoGrad 在某些运行中改变了这一轨迹,但并未阻止最终的记忆。因此,我们将 CIFAR 实验解释为表明正交更新约束可以重塑记忆动力学,而不是证明 OrthoGrad 能够普遍解决噪声标签学习问题。

## 4 讨论

OrthoGrad 类似于基于范数的正则化,因为它能约束权重空间中的径向运动,但它并不等同于权重衰减。权重衰减通过显式地收缩权重来改变目标函数或优化器,而 OrthoGrad 改变的是梯度更新的方向。这一区别很重要,因为 OrthoGrad 可以在不直接优化小参数范数的情况下减少径向梯度分量。我们的实验表明,这种更新层面的干预在原始梯度与当前权重向量对齐的非平凡分量时最为有效。

梯度-权重余弦诊断也说明了为什么在大规模场景中效果减弱。在高维参数空间中,不相关的方向通常接近正交,但这里相关的量并非仅随机向量几何,而是训练梯度与当前权重之间的经验对齐。当余弦相似度接近零时,投影掉权重平行分量几乎没有改变。当它显著非零时(如小数据噪声标签运行中),同样的投影可以大幅改变优化器轨迹。

本研究存在若干局限性。最强的正面结果是在 MNIST 规模的噪声标签实验中,而 CIFAR-10 ResNet-18 扩展的结果是混合的而非一致正面。特别是,OrthoGrad 可以改变噪声 CIFAR-10 上的记忆轨迹,但无法阻止长时间训练后对破坏标签的最终拟合。因此,不应将该方法解释为通用正则化器。相反,我们的结果暗示了一个更狭窄的结论:权重正交梯度约束为研究更新几何如何影响记忆动力学提供了一种有用的干预手段。未来的工作应在更大的架构和数据集上进行测试,系统性地与权重衰减和早停法进行比较,并研究基于梯度-权重对齐的自适应投影强度。

## 致谢

Claude 和 ChatGPT 在写作和语法方面提供了辅助。然而,想法、实验和分析均由作者独立完成。

## 参考文献

相似文章

矩阵正交化提升循环模型的记忆能力

Hacker News Top

这项工作提出对mLSTM循环模型的记忆矩阵进行正交化,以提高其在噪声关联回忆任务上的性能。实验表明,与基线mLSTM相比,使用牛顿-舒尔茨迭代进行只读正交化可提升验证准确率。

通过梯度手术的持续学习低秩适配器初始化

arXiv cs.LG

该论文提出了Slice,一种基于梯度手术的LoRA适配器初始化方法,用于持续学习,通过调和当前任务和过去任务的冲突梯度来减少灾难性遗忘,实现了更好的稳定性-可塑性权衡。

理解并强制任务算术中的权重解耦

Hugging Face Daily Papers

本文提出即插即用正则项 OrthoReg,通过在微调阶段强制权重正交,无需额外计算即可提升任务算术与模型融合效果。

当标签稀缺时优化如何发挥作用 [R]

Reddit r/MachineLearning

Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。