正则感知的随机MGDA及自适应避冲突更新方向控制
摘要
本文提出了一种正则感知的随机多梯度下降方法(MoRe),该方法在冲突避免更新与标量化更新之间自适应切换。在非凸场景下,该方法将收敛率从 O~T^{-1/4} 提升至 O~T^{-1/2},同时保持每轮迭代的冲突避免特性。
arXiv:2607.15412v1 公告类型:新
摘要:多目标学习(MOL)旨在同时优化多个目标。多梯度下降算法(MGDA)是一个常用方法,它沿各目标之间的共同下降方向或冲突避免(CA)方向进行迭代更新。然而,在随机场景中,原始随机MGDA方法(SMG)缺乏快速收敛率,因为小批量采样在梯度中引入了噪声。这导致更新方向产生偏差,而偏差受CA方向连续性的控制。在本文中,我们证明了CA方向关于雅可比矩阵是$1/2$-赫尔德连续的,且指数$1/2$在最坏情况下无法改进。这导致之前工作中原始随机MGDA的收敛率不理想。然而,在额外的正则性条件下,我们证明可以将其改进为利普希茨连续性。基于这一发现,我们提出了一种随机多目标正则感知(MoRe)方法,该方法在子问题正则时利用CA方向的利普希茨连续性,否则切换至固定的标量化权重。直观上,所提算法在梯度冲突较大时采用CA方向更新,否则采用线性标量化更新。理论上,我们的方法将非凸场景下SMG的收敛率从$\widetilde{\mathcal O}(T^{-1/4})$提升至$\widetilde{\mathcal O}(T^{-1/2})$,其中$\widetilde{\mathcal O}(\cdot)$隐藏了对数因子。同时,我们还建立了每轮迭代的冲突避免保证。实验方面,实验证明了其在多任务性能上的有效性,并验证了与已建立理论速率一致的收敛行为。
查看缓存全文
缓存时间: 2026/07/20 09:27
# 正则性感知的随机MGDA及自适应冲突规避更新方向控制 来源:https://arxiv.org/html/2607.15412 Chentong Huang, Lisha Chen 电气与计算机工程系,罗切斯特大学,罗切斯特,纽约州 14627 电子邮箱:[email protected], [email protected] ###### 摘要 多目标学习(MOL)旨在同时优化多个目标。多梯度下降算法(MGDA)是一种常用方法,它迭代地沿所有目标共同的下降方向或冲突规避(CA)方向更新。然而,在随机设置中,原始的随机MGDA方法(即SMG[11 (https://arxiv.org/html/2607.15412#bib.bib3)])缺乏快速收敛率,因为小批量采样会在梯度中引入噪声,导致更新方向产生偏差,而该偏差由CA方向的连续性控制。在本文中,我们证明CA方向关于雅可比矩阵是1/2-Hölder连续的,且指数1/2在最坏情况下无法改进。这导致之前的随机MGDA方法收敛率次优。然而,在额外的正则性条件下,我们证明这一连续性可以提升为Lipschitz连续性。基于这一见解,我们提出一种随机多目标正则性感知(MoRe)方法,当子问题正则时利用CA方向的Lipschitz连续性,否则切换为固定标量化权重。直观上,所提算法在梯度冲突较大时采用CA方向更新,否则采用线性标量化更新。理论上,我们的方法将SMG[11 (https://arxiv.org/html/2607.15412#bib.bib3),1 (https://arxiv.org/html/2607.15412#bib.bib20)]在非凸设置下的收敛率从\(\widetilde{\mathcal{O}}(T^{-1/4})\)提升到\(\widetilde{\mathcal{O}}(T^{-1/2})\),其中\(\widetilde{\mathcal{O}}(\cdot)\)隐藏了对数因子。同时,我们建立了每次迭代的冲突规避保证。实验上,结果验证了在多任务性能方面的有效性,并展示了与理论收敛率一致的行为。 ## I 引言 多目标学习(MOL)已成为现代机器学习中的重要范式。代表性应用包括多任务学习[13 (https://arxiv.org/html/2607.15412#bib.bib9)]、元学习[19 (https://arxiv.org/html/2607.15412#bib.bib11),2 (https://arxiv.org/html/2607.15412#bib.bib7)]以及多约束学习[21 (https://arxiv.org/html/2607.15412#bib.bib10)]。本文考虑定义在训练样本序列\(S=(z_1,\dots,z_n)\in\mathcal{Z}^n\)上的经验MOL问题。设\([M]\coloneqq\{1,\dots,M\}\),其中\(M\ge 2\)。对于每个目标\(m\in[M]\),令\(f_{z,m}(x)\)表示在数据点\(z\)上对模型\(x\in\mathbb{R}^p\)评估的第\(m\)个目标函数,其经验版本定义为\(f_{S,m}(x)\coloneqq n^{-1}\sum_{i=1}^n f_{z_i,m}(x)\)。经验MOL问题被形式化为向量值目标的优化: \[ \min_{x\in\mathbb{R}^p} F_S(x)\coloneqq \bigl(f_{S,1}(x),\dots,f_{S,M}(x)\bigr)^\top. \tag{1} \] 与单目标学习不同,MOL寻求Pareto最优或Pareto驻点,而非标量损失的极小点。一个核心挑战是不同目标的梯度可能冲突:一个目标的下降方向可能增加另一个目标。许多方法[12 (https://arxiv.org/html/2607.15412#bib.bib64),10 (https://arxiv.org/html/2607.15412#bib.bib71),1 (https://arxiv.org/html/2607.15412#bib.bib20)]采用的一种常见策略是动态组合目标梯度以获得冲突规避(CA)方向。其中代表性方法是MGDA[12 (https://arxiv.org/html/2607.15412#bib.bib64),7 (https://arxiv.org/html/2607.15412#bib.bib67),4 (https://arxiv.org/html/2607.15412#bib.bib1)],它计算目标梯度的最小范数凸组合,并启发了许多MOL变体[10 (https://arxiv.org/html/2607.15412#bib.bib71),6 (https://arxiv.org/html/2607.15412#bib.bib5),1 (https://arxiv.org/html/2607.15412#bib.bib20)]。虽然确定性MGDA变体已相对成熟,但全批量梯度在实际每次迭代中计算成本过高,尤其对于大型机器学习模型。这促使了随机MGDA变体的发展,例如随机多梯度(SMG)方法[11 (https://arxiv.org/html/2607.15412#bib.bib3)],它用小批量计算得到的随机梯度估计代替全批量梯度矩阵。然而,直接将对MGDA的收敛分析扩展到随机设置并不平凡。由于CA方向是梯度矩阵的非线性函数,用小批量估计代替全批量梯度矩阵会引入方向偏差:小批量CA方向可能不是全批量CA方向的无偏或稳定近似。这种敏感性可以通过方向映射的\(\alpha\)-Hölder连续性来刻画:对于梯度矩阵\(Q_1,Q_2\in\mathbb{R}^{p\times M}\),设\(d_{Q_1}\)和\(d_{Q_2}\)为对应的CA方向。则有 \[ \|d_{Q_1}-d_{Q_2}\|\le \ell_{\mathrm{H}}\|Q_1-Q_2\|^\alpha, \tag{2} \] 其中\(\ell_{\mathrm{H}}>0\)为Hölder常数,\(\alpha\in(0,1]\),\(\alpha=1\)对应Lipschitz连续性;另见[1 (https://arxiv.org/html/2607.15412#bib.bib20), Section 4.2]。尽管这与随机MGDA方法的稳定性和收敛性直接相关,但现有文献中对这一问题的探索仍然有限。具体来说,[14 (https://arxiv.org/html/2607.15412#bib.bib4)]证明了CA方向关于模型变量\(x\)是1/2-Hölder连续的,且指数1/2是紧的。此外,[1 (https://arxiv.org/html/2607.15412#bib.bib20)]证明了关于随机梯度矩阵的相应1/2-Hölder连续性结果。这促使我们研究何时可以成立更强的正则性,并在设计具有改进收敛保证同时保持冲突规避行为的随机算法时利用这些性质。 ### I-A 相关工作 **确定性基于梯度的MOL。** MOL的一条主要工作线是利用梯度信息为所有目标寻找共同的更新方向。该方向的基础方法是MGDA[12 (https://arxiv.org/html/2607.15412#bib.bib64),7 (https://arxiv.org/html/2607.15412#bib.bib67),4 (https://arxiv.org/html/2607.15412#bib.bib1)],它动态组合梯度以获得共同下降方向。在MGDA之外,还提出了一些梯度聚合方法来缓解目标间的冲突。例如,PCGrad[20 (https://arxiv.org/html/2607.15412#bib.bib70)]投影冲突的任务梯度,而CAGrad[10 (https://arxiv.org/html/2607.15412#bib.bib71)]寻求一个冲突厌恶的聚合方向。这些方法凸显了MOL中冲突感知梯度聚合的重要性。然而,在大规模学习和现代深度学习中,全批量梯度通常每次迭代计算成本过高。 **随机MOL。** 实际的MOL算法通常需要基于(小批量)随机梯度进行更新,这推动了MGDA的随机扩展。例如,SMG[11 (https://arxiv.org/html/2607.15412#bib.bib3)]将MGDA扩展到随机设置并提供了收敛保证。后续工作进一步利用不同的采样、方差缩减和偏好引导机制开发了可证明收敛的随机MOL算法[22 (https://arxiv.org/html/2607.15412#bib.bib8),6 (https://arxiv.org/html/2607.15412#bib.bib5),1 (https://arxiv.org/html/2607.15412#bib.bib20),17 (https://arxiv.org/html/2607.15412#bib.bib79),3 (https://arxiv.org/html/2607.15412#bib.bib27),18 (https://arxiv.org/html/2607.15412#bib.bib28),5 (https://arxiv.org/html/2607.15412#bib.bib77)]。对于收敛分析,一个关键障碍在于控制更新方向偏差和冲突规避误差:由于CA方向非线性地依赖于梯度矩阵,随机梯度噪声会产生CA方向误差。这进而影响随机MGDA变体的收敛分析,并可能导致次优的收敛率,如[1 (https://arxiv.org/html/2607.15412#bib.bib20)]所讨论,并总结于表I (https://arxiv.org/html/2607.15412#S1.T1)。 **CA方向映射的连续性。** CA方向映射的连续性对随机MOL很重要,因为它控制CA方向误差。早期工作研究了CA方向关于模型变量的连续性,并建立了1/2-Hölder连续性结果[14 (https://arxiv.org/html/2607.15412#bib.bib4)]。对于随机MOL,Chen等人[1 (https://arxiv.org/html/2607.15412#bib.bib20)]证明了关于随机梯度矩阵的1/2-Hölder连续性结果。然而,这些结果没有刻画何时可以得到关于梯度矩阵的更强Lipschitz连续性,也没有探索是否可以利用它来获得更快的随机收敛和更稳定的CA方向。我们的工作通过识别方向映射的一个非退化Lipschitz区域,并利用正则性感知随机算法来利用它,填补了这一空白。 ### I-B 我们的贡献 本文的贡献总结如下。 **CA方向的连续性分析。** 我们提供了CA方向映射的细粒度连续性分析。在定义2 (https://arxiv.org/html/2607.15412#Thmdefinition2)的非退化条件下,引理1 (https://arxiv.org/html/2607.15412#Thmlemma1)证明CA方向映射是Lipschitz连续的,而引理2 (https://arxiv.org/html/2607.15412#Thmlemma2)表明,没有非退化条件时,有界集上的1/2-Hölder连续性在最坏情况下是紧的。 **改进的收敛保证。** 受上述连续性性质的启发,我们开发了一种多目标正则性感知(MoRe)算法,该算法在不同情况下利用CA方向的正则性。采用小批量大小\(|Z_t|=\Theta(t+1)\)和步长\(\alpha=\Theta(T^{-1/2})\),定理1 (https://arxiv.org/html/2607.15412#Thmtheorem1)给出了非凸经验驻点率\(\widetilde{\mathcal{O}}(T^{-1/2})\),改进了[1 (https://arxiv.org/html/2607.15412#bib.bib20)]中SMG的\(\widetilde{\mathcal{O}}(T^{-1/4})\)率。定理2 (https://arxiv.org/html/2607.15412#Thmtheorem2)进一步建立了每次迭代的CA方向距离界。与现有方法的比较见表I (https://arxiv.org/html/2607.15412#S1.T1)。 **多任务学习实验。** 我们将所提方法与现有MOL算法进行比较,实验结果展示了其在模型性能和收敛行为方面的实际有效性。 表I:与现有随机MOL算法在批量大小、收敛率和CA方向距离方面的比较。其中,Conv.和CA Dist.分别表示收敛率和CA方向距离,\(\widetilde{\mathcal{O}}(\cdot)\)隐藏了对数因子。注意MoDo[1 (https://arxiv.org/html/2607.15412#bib.bib20)]的结果是通过优化调整定理中的超参数得到的。 | 算法 | 批量大小 | 收敛率 | CA方向距离 | |------|----------|--------|------------| | SMG[11 (https://arxiv.org/html/2607.15412#bib.bib3)][1 (https://arxiv.org/html/2607.15412#bib.bib20), Thms 7,8] | \(\Theta(t+1)\) | \(\widetilde{\mathcal{O}}(T^{-\frac14})\) | 每次迭代 | | CR-MOGM[22 (https://arxiv.org/html/2607.15412#bib.bib8), Thm 3] | \(\Theta(1)\) | \(\mathcal{O}(T^{-\frac12})\) | - | | MoCo[6 (https://arxiv.org/html/2607.15412#bib.bib5), Thm 2] | \(\Theta(1)\) | \(\mathcal{O}(T^{-\frac{1}{10}})\) | 平均 | | MoDo[1 (https://arxiv.org/html/2607.15412#bib.bib20), Thms 3,5] | \(\Theta(1)\) | \(\widetilde{\mathcal{O}}(T^{-\frac12})\) | 平均 | | MoCo+[5 (https://arxiv.org/html/2607.15412#bib.bib77), Thms 1,2] | \(\Theta(1)\) | \(\mathcal{O}(T^{-\frac23})\) | 平均 | | 本文,定理1 (https://arxiv.org/html/2607.15412#Thmtheorem1),2 (https://arxiv.org/html/2607.15412#Thmtheorem2) | \(\Theta(t+1)\) | \(\widetilde{\mathcal{O}}(T^{-\frac12})\) | 每次迭代 | ## II 问题设置 本节介绍MOL问题的一些基本概念。我们简要引入对应的总体目标\(F\),仅用于陈述Pareto驻点和Pareto最优性的标准概念。令\(F(x)\coloneqq (f_1(x),\ldots,f_M(x))^\top\),其中\(f_m(x)\coloneqq \mathbb{E}_z[f_{z,m}(x)]\)。我们的优化和收敛分析聚焦于上述定义的经验目标\(F_S\)。将\(F\)替换为\(F_S\)后,相同的定义适用于经验问题。 ###### 定义1 (Pareto最优点和Pareto驻点)。 点\(x^*\in\mathbb{R}^p\)称为Pareto最优,如果不存在\(x\in\mathbb{R}^p\)且\(x\neq x^*\),使得对所有\(m\in[M]\)有\(f_m(x)\le f_m(x^*)\),且至少对一个\(m'\in[M]\)有\(f_{m'}(x)<f_{m'}(x^*)\)。点\(x\)称为Pareto驻点,如果不存在下降方向\(d\in\mathbb{R}^d\)使得对所有\(m\in[M]\)有\(\nabla f_m(x)^\top d<0\)。对于可微的目标,这等价于存在一个向量\(\lambda\in\Delta^M\)使得\(\nabla F(x)\lambda=0\),其中\(\Delta^M\)表示\(M\)维单纯形。 换句话说,Pareto驻点是不能通过同时降低所有目标而改进的点。 ### II-A 多梯度下降算法(MGDA) MGDA[12 (https://arxiv.org/html/2607.15412#bib.bib64),7 (https://arxiv.org/html/2607.15412#bib.bib67),4 (https://arxiv.org/html/2607.15412#bib.bib1)]是MOL中的基础方法。在每次迭代\(t\),给定当前点\(x_t\),它计算全批量梯度矩阵(其中\(\nabla F_S(x_t)=[\nabla f_{S,1}(x_t),\ldots,\nabla f_{S,M}(x_t)]\in\mathbb{R}^{p\times M}\))上的最小范数凸组合系数\(\lambda^*(x_t)\): \[ \lambda^*(x_t)\in \arg\min_{\lambda\in\Delta^M} \|\nabla F_S(x_t)\lambda\|^2. \tag{3} \] 定义方向\(d(x_t)=-\nabla F_S(x_t)\lambda^*(x_t)\),更新规则为\(x_{t+1}=x_t+\alpha_t d(x_t)\),\(\alpha_t>0\)为步长。只要\(x_t\)不是Pareto驻点,所得方向\(d(x_t)\)就是一个共同下降方向。此外,当\(\nabla F_S(x_t)\lambda^*(x_t)=0\)时MGDA终止,此时\(x_t\)是Pareto驻点。 ### II-B 随机多目标梯度(SMG)方法 MGDA的一个自然随机对应是SMG方法[11 (https://arxiv.org/html/2607.15412#bib.bib3)],它用从采样数据计算得到的随机梯度估计代替全批量梯度。具体地,设\(Z=(\zeta_1,\ldots,\zeta_{|Z|})\)是从\(S\)中独立同分布(等价于有放回)采样得到的小批量。定义 \[ \nabla F_Z(x)\coloneqq \frac{1}{|Z|}\sum_{r=1}^{|Z|}\nabla F_{\zeta_r}(x), \tag{7} \] 其中\(F_z(x)=(f_{z,1}(x),\ldots,f_{z,M}(x))\)收集了在样本\(z\)上评估的目标值。为简单记,令\(Q\in\mathbb{R}^{p\times M}\)表示随机梯度矩阵\(\nabla F_Z(x)\),即 \[ Q\coloneqq \nabla F_Z(x)=[q_{Z,1}(x),\ldots,q_{Z,M}(x)]\in\mathbb{R}^{p\times M}, \tag{8} \] 其中\(q_{Z,m}(x)\coloneqq \frac{1}{|Z|}\sum_{r=1}^{|Z|}\nabla f_{\zeta_r,m}(x)\in\mathbb{R}^p\)。定义 \[ g_Q(\lambda)\coloneqq \|Q\lambda\|^2,\quad \lambda\in\Delta^M. \tag{9} \] 则SMG计算随机下降方向为 \[ d_Q=-Q\lambda_Q^*,\quad \text{s.t.}\quad \lambda_Q^*\in\arg\min_{\lambda\in\Delta^M} g_Q(\lambda). \]
相似文章
MGUP:一种用于随机优化的动量-梯度对齐更新策略
提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。
多目标优化中梯度聚合的统一框架
本文提出了一个多目标优化中梯度聚合的统一理论框架,建立了收敛到帕累托平稳性的速率。作者引入了一个充分对齐条件,并展示了其在现有算法和新算法(如 capped MGDA)中的应用。
面向组合奖励的流模型冲突感知加性引导
本文识别了组合奖励下引导流模型中的流形外漂移,并提出冲突感知加性引导(CAR),这是一种轻量级方法,可动态解决梯度冲突,从而无需重新训练即可提升生成保真度。
通过隐式梯度传输加速基于 LMO 的优化
本文提出了 LMO-IGT,这是一类新的随机优化方法,它利用隐式梯度传输来加速收敛,同时保持每次迭代仅计算一次梯度的结构。文中引入了一个统一的理论框架,并展示了相较于 Muon 等现有基于 LMO 的优化器,该方法具有更优的性能。
重新思考LLM强化学习中的散度正则化
本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。