基于LMO方法的零阶无参数优化:高效微调的新方法

arXiv cs.LG 论文

摘要

本文介绍了AdaNAGED,一种结合零阶优化、无参数自适应和非欧几里得更新几何的方法,用于大型语言模型的内存高效微调,具有理论收敛保证,并在OPT-1.3B模型上进行了验证。

arXiv:2606.14970v1 Announce Type: new Abstract: 微调大型语言模型(LLMs)已成为现代优化的核心应用,使预训练模型能够适应各种下游任务和特定领域的数据。大规模微调的一个主要障碍是反向传播的内存开销,它需要存储激活值、梯度和优化器状态。零阶(ZO)优化提供了一种内存高效的替代方案,但其性能对步长和平滑参数高度敏感,通常需要昂贵的任务特定调优。无参数(PF)优化通过在没有问题相关常数先验知识的情况下调整算法参数来解决这一问题。此外,大规模微调可以从考虑参数块异质结构的几何感知更新中受益,这些更新可以通过利用线性最小化预言(LMO)的方法来建模。在这项工作中,我们研究了基于LMO的零阶优化的PF自适应,并引入了$\texttt{AdaNAGED}$,一种统一无梯度训练、自适应调优和非欧几里得更新几何的方法。我们建立了收敛保证,并在使用$\texttt{OPT}-1.3\mathrm{B}$模型的大规模LLM微调任务上验证了该方法。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:36

# 1 引言
来源:https://arxiv.org/html/2606.14970
![[未加标题的图片]](https://arxiv.org/html/2606.14970v1/logos/innopolis.png)![[未加标题的图片]](https://arxiv.org/html/2606.14970v1/x1.png)![[未加标题的图片]](https://arxiv.org/html/2606.14970v1/x2.png)基于LMO方法的零阶无参数优化:高效微调的新方法
Dmitriy Bystrov¹,², Daniil Medyakov¹,², Dmitry Bylinkin¹,², Aleksandr Beznosikov¹,²,³
¹莫斯科独立人工智能研究院
²人工智能基础研究实验室(BRAIn Lab)
³因诺波利斯大学

微调大型语言模型(LLMs)已成为现代优化的核心应用,使预训练模型能够适应多样化的下游任务和特定领域数据。大规模微调的主要障碍是反向传播的内存开销,它需要存储激活值、梯度和优化器状态。零阶优化提供了一种内存高效的选择,但其性能对步长和平滑参数高度敏感,通常需要昂贵的任务特定调参。无参数优化通过在没有问题相关常数先验知识的情况下自适应调整算法参数来解决此问题。此外,大规模微调可以利用几何感知更新,考虑参数块的异质结构,这可以通过利用线性最小化预言的方法来建模。本文研究基于LMO的零阶优化的无参数自适应方法,并引入AdaNAGED,该方法统一了无梯度训练、自适应调参和非欧几里得更新几何。我们建立了收敛保证,并在OPT−1.3B模型的大规模LLM微调任务上验证了该方法。

优化是现代机器学习的基本组成部分,其在大型语言模型微调中的作用尤为突出[1(https://arxiv.org/html/2606.14970#bib.bib1),2(https://arxiv.org/html/2606.14970#bib.bib2)]。微调提供了一种有效且灵活的方式,使预训练模型适应多样化的下游任务,同时利用预训练期间获取的知识[3(https://arxiv.org/html/2606.14970#bib.bib3),4(https://arxiv.org/html/2606.14970#bib.bib4),5(https://arxiv.org/html/2606.14970#bib.bib5)]。形式上,我们考虑以下优化问题:

min_{x∈R^d} f(x),(1)

其中x表示模型参数,f为损失函数。训练通常使用基于梯度的优化方法进行,如SGD[6(https://arxiv.org/html/2606.14970#bib.bib6)]或Adam[7(https://arxiv.org/html/2606.14970#bib.bib7)]。这些方法依赖于通过反向传播计算的梯度[8(https://arxiv.org/html/2606.14970#bib.bib8)],这为参数更新提供了一阶信息。这种组合已成为现代机器学习中的标准训练流程,在广泛任务中展现出强劲的经验性能和可靠的优化行为。

尽管反向传播具有强劲的经验性能,但在大规模LLM微调中,它成为主要的内存瓶颈,因为需要在训练过程中存储中间激活值、梯度和优化器状态[9(https://arxiv.org/html/2606.14970#bib.bib9),10(https://arxiv.org/html/2606.14970#bib.bib10)]。由于微调是将已预训练的模型调整到更窄的目标任务或领域,这种开销促使人们研究减少或避免一阶训练内存成本的优化方法。现有方法通过块级下降方法[11(https://arxiv.org/html/2606.14970#bib.bib11),12(https://arxiv.org/html/2606.14970#bib.bib12)]、量化[13(https://arxiv.org/html/2606.14970#bib.bib13),14(https://arxiv.org/html/2606.14970#bib.bib14)]和参数高效微调方法[15(https://arxiv.org/html/2606.14970#bib.bib15),16(https://arxiv.org/html/2606.14970#bib.bib16)]来应对这一挑战。然而,这些方法仍然依赖反向传播,因此无法完全消除与基于梯度优化相关的内存负担。零阶优化提供了另一种截然不同的优化范式[17(https://arxiv.org/html/2606.14970#bib.bib17)]。零阶方法不依赖梯度,而是假设仅能访问目标函数的函数值评估。形式上,零阶优化用有限差分估计替换梯度:

∇f(x) ≈ [f(x+τe) - f(x)]/τ · e,(2)

其中e是随机采样向量,τ是平滑参数。零阶优化是一个成熟的优化领域,包含一类广泛的算法,具有成熟的收敛保证[18(https://arxiv.org/html/2606.14970#bib.bib18),19(https://arxiv.org/html/2606.14970#bib.bib19),20(https://arxiv.org/html/2606.14970#bib.bib20)]。这一范式直接解决了内存瓶颈:零阶方法不需要存储反向传播所需的中间量,而是依赖沿采样扰动方向的函数值查询。特别是,在构造有限差分估计之后,向量e不必显式存储;按照Malladi等人的做法[10(https://arxiv.org/html/2606.14970#bib.bib10)],它可以用随机生成器的种子表示,从而几乎不引入额外内存开销。

零阶设置引入了若干挑战,包括需要仔细选择超参数。特别是,零阶方法的性能对步长和平滑参数的选择高度敏感。尽管存在理论上的最优选择,但计算它们通常需要预先获取问题相关量,如Lipschitz常数或到最优解的距离[6(https://arxiv.org/html/2606.14970#bib.bib6),21(https://arxiv.org/html/2606.14970#bib.bib21),22(https://arxiv.org/html/2606.14970#bib.bib22)],这些在实际应用中是不可用的。因此,实现通常依赖耗时的网格搜索,且每个新任务都需要重复搜索。解决此问题的自然方法是通过无参数优化。此范式中的算法不需要问题特定常数的先验知识,而是从局部优化景观和沿轨迹积累的统计量中自适应估计这些量。在一阶优化中,这一研究方向已相当成熟,包括多种估计问题相关常数同时保持强收敛保证的方案[23(https://arxiv.org/html/2606.14970#bib.bib23),24(https://arxiv.org/html/2606.14970#bib.bib24),25(https://arxiv.org/html/2606.14970#bib.bib25)]。

与一阶设置相比,无参数零阶优化的研究仍远不充分。将无参数原则扩展到零阶优化具有挑战性,因为超参数必须从有限差分信息而非精确梯度中自适应调整。这对平滑参数τ尤其棘手:大的值会增加梯度近似的偏差,而过小的值可能因除以τ导致不稳定[26(https://arxiv.org/html/2606.14970#bib.bib26)]。因此,零阶无参数方法必须在不访问问题相关常数的情况下自适应调整步长和平滑参数τ,使得这一方向具有挑战性。

除了超参数选择,零阶微调还提出了如何使更新适应大规模模型几何结构的问题。由于不同的参数组可能自然对应不同的向量或矩阵结构,欧几里得更新不一定总能捕捉到最合适的局部几何。这促使人们研究相对于非欧几里得范数定义的优化方法。这一原则的典型例子是Muon[27(https://arxiv.org/html/2606.14970#bib.bib27)],它可以看作一种SGD类方法,利用谱范数几何处理矩阵形状的参数。通过对矩阵更新进行近似正交化,Muon根据矩阵权重的结构平衡更新方向。这一思想可以更一般地利用范数球上的线性最小化预言来表述[28(https://arxiv.org/html/2606.14970#bib.bib28),29(https://arxiv.org/html/2606.14970#bib.bib29)]。给定一个由范数诱导的域D,线性最小化预言定义为

lmo_D(x) = argmin_{v∈D} ⟨x, v⟩。(3)

底层范数的特定选择恢复出不同的更新规则:向量范数产生与带动量的归一化SGD[30(https://arxiv.org/html/2606.14970#bib.bib30)]和带动量的符号SGD[31(https://arxiv.org/html/2606.14970#bib.bib31)]相关的方法,而矩阵范数则捕获诸如Muon[27(https://arxiv.org/html/2606.14970#bib.bib27)]和Gluon[32(https://arxiv.org/html/2606.14970#bib.bib32)]等方法。这种几何感知更新对大规模微调尤其有吸引力,因为它们可以改善参数更新的条件,并在不同的向量和矩阵形状块上提供更稳定的优化。

无参数优化和基于LMO的更新解决了零阶微调的两个基本方面。前者减少了对昂贵的任务特定超参数调优的依赖,而后者通过线性最小化预言实现了结构化非欧几里得几何下的优化。尽管各自具有相关性,但当更新方向由LMO定义时,零阶设置中如何实现无参数思想仍不清楚。本文对这一问题进行了全面研究。

## 2 相关工作与贡献

### 2.1 相关工作

#### 零阶方法。
无梯度优化的早期基础包括同时扰动方法,该方法通过沿随机扰动点的函数值评估来估计下降方向[33(https://arxiv.org/html/2606.14970#bib.bib33)]。关于非凸优化的随机零阶方法的现代分析在[17(https://arxiv.org/html/2606.14970#bib.bib17)]中开发,其中基于梯度的更新被来自零阶预言查询的估计器替换。此后,人们研究了各种估计器设计和采样策略[19(https://arxiv.org/html/2606.14970#bib.bib19)]。经典选择包括单位球上的随机方向[34(https://arxiv.org/html/2606.14970#bib.bib34)]、基于标准基的坐标级扰动[35(https://arxiv.org/html/2606.14970#bib.bib35)]和高斯平滑估计器[17(https://arxiv.org/html/2606.14970#bib.bib17),10(https://arxiv.org/html/2606.14970#bib.bib10)]。这些估计器通常设计为仅利用函数值来近似平滑目标的梯度。

最近的工作探索了更结构化的扰动方案和算法改进。例如,HiZOO利用Hessian感知的零阶更新来改善LLM微调的收敛[36(https://arxiv.org/html/2606.14970#bib.bib36)]。另一条工作线将随机有限差分估计器与策略梯度方法联系起来,从强化学习角度解释零阶更新,并将其与REINFORCE类估计器相关联[37(https://arxiv.org/html/2606.14970#bib.bib37),38(https://arxiv.org/html/2606.14970#bib.bib38),39(https://arxiv.org/html/2606.14970#bib.bib39)]。其他正交进展包括基于动量的零阶方法[40(https://arxiv.org/html/2606.14970#bib.bib40)]和方差缩减估计器[41(https://arxiv.org/html/2606.14970#bib.bib41),42(https://arxiv.org/html/2606.14970#bib.bib42),43(https://arxiv.org/html/2606.14970#bib.bib43)]。

零阶方法已成功应用于深度神经网络,展示了这一范式的实际相关性[44(https://arxiv.org/html/2606.14970#bib.bib44),45(https://arxiv.org/html/2606.14970#bib.bib45)]。此外,它们已成为缓解LLM微调内存约束的有前途的方法[10(https://arxiv.org/html/2606.14970#bib.bib10),19(https://arxiv.org/html/2606.14970#bib.bib19)]。

#### 无参数优化。
自适应和无参数优化的大部分理论是针对非光滑凸目标开发的。在此设置中,基于梯度的方法的最优步长[46(https://arxiv.org/html/2606.14970#bib.bib46)]通常选择为

γ = ‖x⁰ - x*‖ / (M√T),(4)

其中M是目标的Lipschitz常数(|f(x)-f(y)| ≤ M‖x-y‖,∀x,y∈R^d)。然而,在实践中,M和到解的初始距离‖x⁰-x*‖都不可用。无参数优化的核心思想是自适应地估计此类量,并在不需要输入它们的情况下恢复收敛保证。

包括AdaGrad[47(https://arxiv.org/html/2606.14970#bib.bib47)]、AdaDelta[48(https://arxiv.org/html/2606.14970#bib.bib48)]和Adam[7(https://arxiv.org/html/2606.14970#bib.bib7)]在内的早期自适应方法是最早广泛使用的方法,它们减少了对问题常数先验知识的依赖。这些方法利用已计算梯度的统计量来重新缩放更新,并在整个训练过程中构造自适应步长安排。然而,其中一些方法因存储统计量而引入了额外的内存开销,并且通常不能显式适应到最优解的初始距离。无参数思想也在在线学习中被广泛研究,尽管其问题表述有所不同[49(https://arxiv.org/html/2606.14970#bib.bib49)]。这一工作线引入了“抛硬币”(coin-betting)、“奖励加倍”(reward-doubling)及相关方案[50(https://arxiv.org/html/2606.14970#bib.bib50),51(https://arxiv.org/html/2606.14970#bib.bib51),52(https://arxiv.org/html/2606.14970#bib.bib52),53(https://arxiv.org/html/2606.14970#bib.bib53)]。这些方法消除了一些形式的手动调参,但其保证通常依赖于在线学习假设,如有界随机预言。

无参数优化的一个后续里程碑是开发了适应(4)中初始距离‖x⁰-x*‖的方法。最早具有这种适应性的无参数方法之一是由Carmon和Hinder提出的[23(https://arxiv.org/html/2606.14970#bib.bib23)]。然而,其构造依赖于一个额外的搜索过程,这限制了其实际效率。后来提出的DoG算法[54(https://arxiv.org/html/2606.14970#bib.bib54)]是一种迭代方案,能够自适应估计Lipschitz常数和到解的距离,但其距离估计可能无界。后续工作[55(https://arxiv.org/html/2606.14970#bib.bib55),56(https://arxiv.org/html/2606.14970#bib.bib56)]通过引入更稳定的距离估计器解决了此问题。然而,这些论文中引入的一些算法仍然需要Lipschitz常数的先验知识,并缺乏随机分析。最近的工作进一步扩展了无参数范式,加入了动量[57(https://arxiv.org/html/2606.14970#bib.bib57)]。

相似文章

Muon 优化器能否微调 Adam 预训练模型?

Hugging Face Daily Papers

研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。