动量作为深度学习优化中残差驱动的乘子校正

arXiv cs.LG 论文

摘要

本文介绍了一个受ADMM启发的动量框架(AIM)和一个新的优化器RADAR,从理论上将动量解释为残差驱动的乘子校正,实验表明在强自适应基线上取得了持续改进。

arXiv:2608.12925v1 公告类型:新提交 \n摘要:基于动量的优化器在现代深度学习中广泛使用,但动量递归、更新几何与加速之间的关系仍未完全理解。我们提出了一个基于残差惩罚变量分裂的$\textbf{A}$DMM-$\textbf{I}$nspired $\textbf{M}$omentum(AIM)框架,将动量解释为由分裂残差驱动的乘子式校正。AIM从ADMM风格的乘子更新中恢复梯度的指数移动平均,并将实际优化器中通常交织的两种机制分开:残差惩罚决定更新几何,而目标相关子问题的近似决定加速形式。基于AIM,我们提出了$\textbf{R}$elativistic $\textbf{A}$daptive gradient $\textbf{D}$escent with $\textbf{A}$ccelerated $\textbf{R}$esidual(RADAR),它结合了相对论自适应几何、解耦残差校正和二阶动量过滤,以改进更新方向和动量估计。我们通过方差扰动的Lyapunov漂移分析建立了随机收敛性。在监督视觉学习、语言建模和强化学习上的实验表明,RADAR在强自适应优化器基线上取得了持续改进。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:32

# 动量作为残差驱动的乘子修正,用于深度学习优化
来源:https://arxiv.org/abs/2608.12925
查看 PDF(https://arxiv.org/pdf/2608.12925)

> 摘要:基于动量的优化器在现代深度学习中广泛使用,然而动量递归、更新几何与加速之间的关系仍只得到部分理解。我们提出了一个基于残差惩罚变量分裂的 $\textbf{A}$DMM-$\textbf{I}$启发式 $\textbf{M}$动量(AIM)框架,将动量解释为由分裂残差驱动的乘子式修正。AIM 从 ADMM 风格的乘子更新中恢复梯度的指数移动平均,并分离了实际优化器中通常交织在一起的两种机制:残差惩罚决定更新几何,而目标相关子问题的逼近决定加速形式。基于 AIM,我们提出了 $\textbf{R}$相对论 $\textbf{A}$自适应梯度 $\textbf{D}$下降与 $\textbf{A}$加速 $\textbf{R}$残差(RADAR),它结合了相对论自适应几何、解耦残差修正和二阶动量滤波,以改善更新方向和动量估计。我们通过方差扰动的 Lyapunov 漂移分析建立了随机收敛性。在监督视觉学习、语言建模和强化学习上的实验表明,RADAR 相对于强自适应优化器基线取得了持续改进。

## 提交历史

来自 Zhixin Ren [查看电子邮件(https://arxiv.org/show-email/98077c49/2608.12925)] **[v1]** 2026年8月13日 星期四 08:04:38 UTC(184 KB)

相似文章

MGUP:一种用于随机优化的动量-梯度对齐更新策略

arXiv cs.LG

提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。

乐观对偶平均化统一了现代优化器

arXiv cs.LG

本文介绍了 SODA,这是乐观对偶平均化的一种广义形式,统一了 Muon 和 Lion 等现代优化器。该研究提出了一种实用包装器,在不同规模下均可提升性能,且无需为权重衰减进行额外的超参数调优。