GRZO:面向大语言模型微调的群组相对零阶优化
摘要
GRZO是一种新颖的零阶优化方法,用于微调大语言模型,通过群组相对归一化降低方差,与MeZO相比实现了更高的准确性和内存效率。
arXiv:2606.02857v1 公告类型:新论文
摘要:零阶(ZO)优化是反向传播的一种内存高效替代方案,用于微调大语言模型,但其部署受到梯度估计高方差的限制。我们提出GRZO,一种群组相对零阶优化器,它为每个小批量样本抽取一个伪独立扰动,并通过群组相对归一化聚合每个样本的损失,将有效梯度方向计数从一个提高到批量大小,无需额外前向计算成本,同时保持推理级内存。我们证明GRZO在方向上无偏,方差随批量大小成比例缩小,从而得到比MeZO更紧的非凸收敛界。在RoBERTa-large、Llama3-8B和OPT-13B等多个任务上,GRZO在Llama3-8B上相比MeZO平均准确率提升$+3.0$,峰值GPU内存降低$23\%$;作为MeZO核心的即插即用替代方案,它平均将稀疏、低秩和量化ZO变体性能提升$+6.0$。
查看缓存全文
缓存时间: 2026/06/03 09:40
# GRZO:面向大语言模型微调的分组相对零阶优化
来源:https://arxiv.org/html/2606.02857
Liyan Tan, Yequan Zhao, Yifan Yang, Ruijie Zhang, Xinling Yu, Zheng Zhang
加州大学圣塔芭芭拉分校
{liyan_tan, yequan_zhao, ruijiezhang, xyu644}@ucsb.edu
[email protected]
[email protected]
###### 摘要
零阶(ZO)优化是微调大语言模型时一种内存高效的反向传播替代方案,但其应用受限于梯度估计的高方差。我们提出 **GRZO**,一种**分组相对**零阶优化器,它为每个小批量样本生成一个伪独立扰动,并通过分组相对归一化聚合每个样本的损失值,从而在无额外前向开销且保持推理级内存的前提下,将有效梯度方向数量从一个提升至批量大小。我们证明 GRZO 在方向上是无偏的,其方差随批量大小成比例缩小,从而得到比 MeZO 更紧的非凸收敛界。在 RoBERTa-large、Llama3-8B 和 OPT-13B 的多个任务上,GRZO 在 Llama3-8B 上的平均准确率相比 MeZO 提升 +3.0%,同时峰值 GPU 内存降低 23%;作为 MeZO 核心的即插即用替代,它平均将稀疏、低秩和量化 ZO 变体提升 +6.0%。
GRZO:面向大语言模型微调的分组相对零阶优化
Liyan Tan, Yequan Zhao, Yifan Yang, Ruijie Zhang, Xinling Yu, Zheng Zhang
加州大学圣塔芭芭拉分校
{liyan_tan, yequan_zhao, ruijiezhang, xyu644}@ucsb.edu
[email protected]
[email protected]
## 1 引言
请参考图注(a) 效率与准确率对比。请参考图注(b) 损失收敛曲线。
图1:RTE 任务(Llama3-8B)上 GRZO 概览。左图:峰值内存最低(16.0 GB),准确率最高(81.6%),且每步时间与 MeZO 相当。右图:在训练步数和实际时间上收敛最快。
对下游任务微调大语言模型(LLM)仍然至关重要,但一阶微调成本高昂:反向传播需要存储激活值、梯度和优化器状态,且这些成本随模型规模线性增长。内存高效方法如 LoRA(Hu et al., 2022)、Adapter(Houlsby et al., 2019)、Prefix-Tuning(Li and Liang, 2021)、Prompt-Tuning(Lester et al., 2021)、GaLore(Zhao et al., 2024)、CoLA(Liu et al., 2025b)和 Lax(Zhang et al., 2026)减少了部分内存占用,但仍依赖反向传播,继承了其大部分激活存储成本。此外,许多实际目标——准确率、F1 分数、奖励信号——是不可微的,不属于一阶优化流程。这些考虑促使零阶(ZO)微调作为一种仅前向的替代方案出现。
LLM 微调的经典 ZO 方法是 MeZO(Malladi et al., 2023a),一种两点估计器,通过两次扰动前向传播之间的损失差来近似梯度。Malladi 等人 (2023a) 报告称,相比 SGD(Amari, 1993)和 AdamW(Loshchilov and Hutter, 2019)微调,内存降低高达 12 倍,训练内存保持在推理水平附近,同时兼容不可微目标。问题在于 MeZO 每步仅使用一个随机扰动方向;该估计器的方差随模型维度增长,导致当骨干网络达到数十亿参数范围时,下降缓慢且优化不稳定。
然而,ZO 梯度估计的高方差使得 MeZO 容易收敛较慢或达到次优。越来越多的文献通过低秩(Chen et al., 2025)或稀疏(Liu et al., 2025a; Zhang et al., 2025)扰动来降低维度以减少方差;但在 LLM 微调中,损失景观具有低有效秩(Aghajanyan et al., 2021; Malladi et al., 2023b),因此收敛速率可以独立于参数量。另一个方向通过控制变量(Gautam et al., 2024)、Hessian 曲率(Zhao et al., 2025a)或最小方差两点估计器(Ma and Huang, 2025)设计更低方差的 ZO 梯度估计器。缺点在于这些估计器引入了额外的计算或内存开销,侵蚀了无反向传播 LLM 微调的系统优势。这些方法以额外成本实现方差缩减——缩小更新空间、额外前向传播或额外的持久内存——侵蚀了最初推动 ZO 方法的推理级效率。
我们识别出第三个长期被忽视的方差缩减维度:**小批量本身**。现有 ZO 方法在一整步中对所有 B 个样本重复使用单个扰动方向,尽管损失是逐样本计算的。如果改为为每个样本生成 B 个伪独立方向——每个样本一个——按照标准蒙特卡洛方法,将使 SPSA(同时扰动随机近似)(Spall, 2002)估计器的方差降低 1/B 倍,且无需额外前向开销、无参数空间限制、无额外持久内存。在保持 MeZO 两次前向传播预算和推理级内存占用的情况下高效实现这一维度,是本文的核心设计问题。
我们提出 GRZO(Group-Relative Zeroth-Order Optimization,分组相对零阶优化),通过 Flipout 风格的符号分解(Wen et al., 2018)生成 B 个伪独立扰动,并通过 GRPO 风格的分组相对归一化(Shao et al., 2024)聚合所得逐样本损失差异,所有这些均在单步两次前向传播内完成。我们的贡献如下:
- • **算法**:一种 ZO 优化器,将小批量转化为伪独立扰动方向,同时保持 MeZO 的两次前向传播预算和推理级内存。
- • **理论**:我们证明 GRZO 的方向无偏性以及随批量大小缩放的方差缩减,得到比单方向 ZO 更紧的非凸收敛界。
- • **实验结果**:我们展示 GRZO 在多个语言模型上优于 MeZO 及其变体。我们进一步证明 GRZO 与稀疏、低秩和量化 ZO 变体互补,可结合使用以获得进一步性能提升。
代表性 ZO 方法的逐机制比较见表 4(附录 C);这些方法大多与 GRZO 正交并可组合。
请参考图注
图2:MeZO(左)和 GRZO(右)流水线并排对比。通过构建伪独立扰动和分组相对归一化,GRZO 在与 MeZO 相同的前向传播预算下实现了 B 个有效扰动方向和 1/B 的梯度方差。
## 2 背景与相关工作
### 2.1 零阶(ZO)优化
零阶(ZO)优化(Nesterov and Spokoiny, 2017; Ghadimi and Lan, 2013)仅通过损失 L(θ) 的正向查询来调整模型参数 θ∈ℝ^d,避免了反向传播中激活值和梯度缓冲区的内存开销。ZO 优化器仍然执行梯度下降更新 θ_t ← θ_{t-1} - αg,但通过 N 次前向传播近似梯度 g:
g ≈ ∇̂_θ L(θ) = ∑_{i=1}^N (1/(Nμ)) [L(θ+μξ_i) - L(θ)] ξ_i, (1)
其中 {ξ_i}_{i=1}^N 从各向同性分布 ρ(ξ)(如 N(0,I) 或 Rademacher 分布)中独立同分布采样,μ>0 为小的采样半径。估计器 ∇̂_θ L 关于平滑代理 f_μ(θ) := E_{ξ∼ρ}[L(θ+μξ)] 的梯度是无偏的,但关于真实梯度 ∇_θ L 是有偏的(Berahas et al., 2022),其方差在 μ=O(1/√N) 时携带维度相关因子 O(d/N)(Liu et al., 2020; Duchi et al., 2015; Gao and Sener, 2022)。
MeZO 是 LLM 微调中最受欢迎的 ZO 优化器之一,它是公式 (1) 在 N=1 时的双侧实例化:种子重生的方向 ξ∈ℝ^d 驱动两次对称前向传播 ℓ^± = L(θ±μξ; B),参数沿 -α(ℓ^+ - ℓ^-)ξ/(2μ) 就地更新,无需实例化扰动张量。两个旋钮控制估计器的质量:参数量 d(方差随其缩放)以及 SPSA 构造本身。ZO 微调文献分别处理这些旋钮。
### 2.2 降低有效维度
一类方法缩小更新空间以缓解 O(d) 方差缩放。DeepZero(Chen et al., 2024)和 Sparse-MeZO(Liu et al., 2025a)将更新限制在稀疏掩码内;MaZO(Zhang et al., 2025)将掩码扩展到多任务微调;低秩方法通过低秩矩阵(Chen et al., 2025)或张量(Zhao et al., 2023; Yang et al., 2024)重参数化扰动。这些方法利用 LLM 微调的低有效秩,但以全参数表达力为代价。沿正交方向,QuZO(Zhou et al., 2025)和 Poor-Man's Training(Zhao et al., 2025b)通过低位前向传播减少内存,而不改变 SPSA 估计器。
### 2.3 改进估计器构造
第二类研究保持全参数更新空间,并向估计器中注入额外信息。MeZO-SVRG(Gautam et al., 2024)每次探测与周期性全批量参考配对,作为 SVRG 风格的控制变量,但代价是持久内存翻倍;HiZOO(Zhao et al., 2025a)添加从每步一次额外前向传播估计的对角 Hessian 预处理器;FZOO(Dang et al., 2026)采样 N 个平行方向,以每步 N+1 次前向为代价实现 1/N 量级的方差缩减;子空间正交化(Lang et al., 2026)去相关跨步的方向序列;Ma 和 Huang (2025) 重新审视最小方差两点估计器设计;SharpZO(Yang et al., 2026)将仅前向范式扩展到锐度感知的 VLM 提示微调。在所有情况下,方差缩减都以额外前向、额外持久内存或两者为代价实现。
## 3 方法
第 2 节回顾的两种 ZO 系列均以一定成本实现方差缩减:缩小有效参数维度牺牲了全参数表达力,而丰富 SPSA 估计器则增加了前向传播或持久内存。GRZO 转而将小批量维度本身作为方差缩减的杠杆:单次两次前向传播步骤产生 B 个伪独立梯度方向,保留了 MeZO 的推理级内存和两次前向传播框架。第 3.1 节通过对共享基扰动的符号分解构造逐样本扰动方向;第 3.2 节接着将得到的 B 个逐样本损失信号转换为受 GRPO 优势启发的分组相对权重。图 2 对比了所得流水线与 MeZO。
### 3.1 通过结构化注入实现逐样本扰动
GRZO 通过最初为贝叶斯权重采样提出的符号分解(Wen et al., 2018)构造逐样本扰动。对于权重为 W∈ℝ^{d_out × d_in} 的线性层,我们首先在每一步从对称各向同性分布(例如 N(0,1) 或 Rademacher 条目)中生成共享基扰动矩阵 U∈ℝ^{d_out × d_in}。然后对于每个数据样本 {x_i, y_i}_{i=1}^B,我们使用逐样本符号向量 r_i∈{±1}^{d_out} 和 s_i∈{±1}^{d_in}(独立 Rademacher 对)调制 U,得到
ΔW_i = U ⊙ (r_i s_i^⊤), (2)
其中 ⊙ 表示逐元素(Hadamard)乘积。这种构造从单个共享基 U 产生 B 个伪独立逐样本扰动,而无需实例化 B 个单独的权重副本;参见图 2 的流水线以及附录 B 的向量化形式。开销是每个线性层的一个小常数(一次额外矩阵乘法加上逐元素符号调制)。
###### 引理 1 (各向同性与条件去相关)。令 z_i := vec(ΔW_i) = vec(U ⊙ (r_i s_i^⊤)),其中 U 和 {(r_i, s_i)}_{i=1}^B 如上定义。那么 E[z_i z_i^⊤] = I_d,且对于 i≠j,E[z_i z_j^⊤] = 0。相似文章
基于LMO方法的零阶无参数优化:高效微调的新方法
本文介绍了AdaNAGED,一种结合零阶优化、无参数自适应和非欧几里得更新几何的方法,用于大型语言模型的内存高效微调,具有理论收敛保证,并在OPT-1.3B模型上进行了验证。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。
GRASP:通过组相对策略优化强化语言模型匿名化器
介绍GRASP,一种使用组相对策略优化来训练小型设备端语言模型进行对抗性匿名化的方法,在运行成本仅为前沿教师模型的一小部分的同时,改善了相对于DPO蒸馏基线的隐私-效用权衡。
Learn2Zinc:针对MiniZinc中文本到模型翻译的小语言模型微调
本文研究了微调小语言模型(0.6B-20B参数)以从自然语言描述生成语法正确的MiniZinc模型,提出了一种跨模型错误自举方法,实现了高达98%的执行准确率,但求解准确率仍然有限。