GRPO 下基于梯度的 LoRA 秩分配:一项实证研究
摘要
本研究通过实证表明,在监督微调中有效的基于梯度的 LoRA 秩分配,在基于 GRPO 的强化学习中会导致性能下降,原因在于梯度景观更为平缓以及存在梯度放大效应。
arXiv:2605.07366v1 公告类型:新论文
摘要:LoRA 的自适应秩分配通过为重要层分配更多参数、为非重要层分配较少参数,在监督微调(SFT)下始终能提升效率。我们研究了这一成功是否能迁移至强化学习,特别是分组相对策略优化(GRPO)。通过在 Qwen 2.5 1.5B 上使用 GSM8K 数据集进行梯度幅度分析,我们发现答案是否定的:与均匀分配相比,比例秩分配尽管使用相同的参数预算,但准确率下降了 4.5 个百分点(70.0% 对比 74.5%)。我们识别出了导致这种失败的两个机制。首先,GRPO 下的梯度景观在根本上比 SFT 更平缓,最大与最小层重要性比率仅为 2.17 倍,而 SFT 文献中报告的比率通常超过 10 倍。所有层都承载着有意义的梯度信号,没有任何层真正处于闲置状态。其次,我们发现了梯度放大效应:非均匀分配将重要性差异从 2.17 倍扩大至 3.00 倍,形成了一种正反馈循环,即高秩层吸收更多梯度,而低秩层逐渐被“静音”。我们的结果表明,梯度重要性无法预测强化学习下的容量需求,应避免将 SFT 时代的秩分配策略天真地迁移到对齐训练中。
查看缓存全文
缓存时间: 2026/05/11 07:02
# GRPO 下的基于梯度的 LoRA 秩分配:一项实证研究
来源:https://arxiv.org/html/2605.07366
###### 摘要
对于 LoRA 的自适应秩分配——向重要层分配更多参数,向不重要层分配较少参数——在监督微调(SFT)下始终能提高效率。我们研究了这种成功是否可迁移到强化学习,特别是 Group Relative Policy Optimization (GRPO)。通过在 Qwen 2.5 1.5B 上使用 GSM8K 进行梯度幅度剖析,我们发现答案是否定的:与均匀分配相比,比例秩分配导致准确率下降 4.5 个百分点(70.0% 对比 74.5%),尽管使用的参数量预算相同。我们确定了导致这种失败的两个机制。首先,GRPO 下的梯度景观在本质上比 SFT 更平坦——最大层与最小层重要性之比仅为 2.17 倍,而 SFT 文献中报告的比例远大于 10 倍。所有层都承载有意义的梯度信号;没有哪一层是真正闲置的。其次,我们发现了一种**梯度放大效应**:非均匀分配将重要性差异从 2.17 倍扩大到 3.00 倍,形成了一个正反馈循环,其中高秩层吸收更多梯度,而低秩层逐渐被抑制。我们的结果表明,梯度重要性无法预测强化学习下的容量需求,且应避免将 SFT 时代的秩分配策略天真地迁移到对齐训练中。
## 1 引言
通过低秩适应(Low-Rank Adaptation, LoRA)进行的参数高效微调(Hu et al., 2022 [链接](https://arxiv.org/html/2605.07366#bib.bib4))已成为适配大型语言模型的标准方法。LoRA 将权重更新分解为低秩矩阵 $\Delta W=BA$,并在所有层上使用统一的秩 $r$。最近的工作挑战了这种统一假设。AdaLoRA(Zhang et al., 2023 [链接](https://arxiv.org/html/2605.07366#bib.bib9))根据重要性分数在训练期间动态剪枝奇异值。GoRA(He et al., 2025 [链接](https://arxiv.org/html/2605.07366#bib.bib3))在初始化时按梯度-权重积的比例分配秩。Aletheia(Saket, 2026 [链接](https://arxiv.org/html/2605.07366#bib.bib5))通过轻量级梯度探针选择层。ILA(Shi et al., 2024 [链接](https://arxiv.org/html/2605.07366#bib.bib7))表明,在 SFT 下只有 10–30% 的层对对齐显著重要。这些方法实现了显著的效率提升,确立了在监督目标下**梯度相关性与容量需求相关**这一事实。
随之而来的一个自然问题是:这种相关性在强化学习下是否依然成立?基于 RL 的对齐方法如 GRPO(Shao et al., 2024 [链接](https://arxiv.org/html/2605.07366#bib.bib6))优化的是一个根本不同的目标——优势加权的策略梯度,使用稀疏的二元奖励信号,而非密集的逐 token 交叉熵损失。理论工作表明,RL 梯度与 SFT 梯度的集中方式不同(Young, 2026 [链接](https://arxiv.org/html/2605.07366#bib.bib8)),这促使我们假设秩分配策略应当有所不同。
我们通过将基于梯度的秩剖析应用于 GRPO 训练来测试这一假设,并得出了一个惊人的结果:**自适应秩分配在 RL 下损害了性能**。我们的调查揭示了三个发现:
1. **平坦的梯度景观**:在 GRPO 下,层重要性的分布远比 SFT 均匀(最大/最小比率为 2.17 倍,对比 SFT 中的 >10 倍)。所有层都承载负载。
2. **梯度放大**:非均匀分配创建了正反馈循环——高秩层吸收更多梯度,而低秩层被抑制,将差异从 2.17 倍扩大到 3.00 倍。
3. **泛化差距**:模型训练效果相同(相同的奖励曲线),但泛化表现不同——秩重新分配造成的损害仅在评估时显现。
## 2 方法
### 2.1 GRPO 与 LoRA
GRPO 为每个提示生成 $K$ 个完成,计算奖励,并在组内标准化优势:
$$ \hat{A}_{i}=\frac{r_{i}-\mu_{\text{group}}}{\sigma_{\text{group}}} \quad (1) $$
当与 LoRA 结合时,梯度通过每层 $l$ 的适配器参数 $B^{(l)}, A^{(l)}$ 流动。
### 2.2 奖励敏感性剖析
我们将层 $l$ 的奖励敏感性分数定义为 $T$ 步训练中的平均梯度范数:
$$ S(l)=\frac{1}{T}\sum_{t=1}^{T}\sum_{m\in\mathcal{M}}\left\|\nabla_{\theta_{m}^{(l)}}\mathcal{L}_{t}\right\|_{2} \quad (2) $$
其中 $\mathcal{M}$ 是目标模块的集合(q/k/v/o/up/down/gate 投影)。该分数捕捉了每层的参数对 GRPO 奖励信号响应的程度。
### 2.3 秩分配
给定总秩预算 $R_{\text{total}}=L\times r_{\text{uniform}}$,我们分配每层秩:
$$ r^{(l)}=\text{clip}\left(\text{round}\left(\frac{S(l)}{\sum_{l^{\prime}}S(l^{\prime})}\times R_{\text{total}}\right),r_{\min},r_{\max}\right) \quad (3) $$
其中 $r_{\min}=4$ 且 $r_{\max}=64$,舍入为 4 的倍数。我们还评估了随机分配作为对照。
## 3 实验
### 3.1 设置
* **模型**:Qwen/Qwen2.5-1.5B-Instruct(28 个 Transformer 层)。
* **数据集**:GSM8K(Cobbe et al., 2021 [链接](https://arxiv.org/html/2605.07366#bib.bib1)),采用结构化 XML 输出格式。
* **奖励**:格式合规性(正确标签为 1.0)和答案正确性(正确数值答案为 1.0)。
* **LoRA**:应用于每层的所有 7 个投影模块(共 196 个适配器)。
* **均匀基线**:$r=32$。
* **GRPO**:$K=4$ 次生成,$\beta=0.05$ KL 系数,1000 步训练,学习率 $10^{-5}$,vLLM 协同生成。
### 3.2 GRPO 下的梯度景观
*图 1:GRPO 训练期间的每层梯度幅度(1000 步,28 层)。与 SFT 时代的发现相比,分布明显平坦。*
[图 1](https://arxiv.org/html/2605.07366#S3.F1) 显示了奖励敏感性映射。关键观察如下:
* **平坦分布**:最大/最小重要性比率为 2.17 倍(第 15 层最热,占 4.68%;第 26 层最冷,占 2.15%)。即使是最冷的层也承载了最热层 46% 的梯度信号。
* **中间层集中**:第 9–18 层承载了 43.0% 的梯度,但早期(29.8%)和晚期(27.2%)层仍然有意义——这与 SFT 不同,ILA(Shi et al., 2024 [链接](https://arxiv.org/html/2605.07366#bib.bib7))报告称 >80% 集中在前 30%。
* **时间稳定性**:早期与晚期训练的相关性为 0.962,表明稳定的结构模式,而非瞬态噪声。
* **模块重要性**:注意力(52.9%)和 FFN(47.1%)贡献大致相等。`up_proj` 模块对奖励最敏感(21.4%)。
### 3.3 秩分配结果
*表 1:不同秩分配下的 GSM8K 准确率(n=200 测试样本)。所有“相同预算”方法使用总秩 896(28×32)。置信区间为 Wilson 得分区间。*
[表 1](https://arxiv.org/html/2605.07366#S3.T1) 显示了我们的主要结果:**均匀分配优于所有非均匀变体**,包括感知梯度的比例分配。在相同参数量预算下,比例分配得分比均匀分配低 4.5 个百分点。随机分配——一种无梯度引导但秩非均匀的对照——得分更低,为 67.5%。减少预算的分配表现低于未训练的基础模型。
有两个观察结果引人注目。首先,**感知梯度的分配优于随机分配**(70.0% 对比 67.5%),证实了重要性信号是有意义的——它识别出真正重要的层。然而,两者都输给了均匀分配,这表明虽然信号方向正确,但在 GRPO 下,任何偏离均匀分配的行为都会损害性能。
其次,所有配置的训练奖励曲线几乎相同——到第 1000 步时,所有方法的正确性奖励均达到 0.74–0.77。性能差距**仅在评估时出现**,表明秩重新分配损害的是泛化能力而非训练动态。模型在训练分布上学习效果相同,但在迁移到未见问题的能力上存在差异。
### 3.4 梯度放大效应
*图 2:均匀分配与比例分配下的归一化层重要性。非均匀分配将原始重要性差异从 2.17 倍扩大到 3.00 倍。*
我们在**所有**训练运行期间剖析梯度,而不仅仅是均匀基线。[图 2](https://arxiv.org/html/2605.07366#S3.F2) 揭示了一个惊人的效应:在非均匀分配下,梯度重要性差异**扩大**。
* **均匀**:最大/最小比率 2.17 倍
* **比例(相同预算)**:3.00 倍(+38%)
* **减少 70%**:3.57 倍(+64%)
获得更高秩的层(例如,第 18 层:$r=40$)其梯度份额从 4.53%**增加**到 5.12%。相反,获得较低秩的层(例如,第 24 层:$r=20$)其份额从 2.23%**减少**到 1.71%。分配创建了正反馈循环:更多容量 $\rightarrow$ 更多梯度 $\rightarrow$ 显得甚至更“重要”。
关键在于,这种效应是**因果**的,而非相关的。随机分配实验——其中秩与梯度重要性无关——显示出同样强烈的放大效应。随机分配的分配秩与结果梯度移位之间的相关系数为 0.972,比例分配为 0.946。在随机分配下,第 1 层(通常占梯度的 3.09%)获得秩 48 并跃升至 4.21%;第 10 层(通常占 3.93%)获得秩 16 并降至 2.85%。**秩决定梯度重要性,反之亦然。**
这意味着一种分配下的梯度剖析不能可靠地指导另一种分配——“先剖析再重新训练”的范式对于 GRPO 来说是根本错误的。
有人可能会怀疑这可以简单地解释为更多参数产生更大的聚合梯度范数。然而,我们的奖励敏感性分数(公式 2)按模块数量归一化,即使检查相同维度下的单个模块(例如,所有层中 1536×1536 的 `q_proj`),放大效应依然存在。该效应反映了训练信号在网络中分布方式的真实变化,而不仅仅是参数计数的伪影。
这种放大效应在先前工作中未被报告,可能是因为基于 SFT 的方法显示出相反的模式——AdaLoRA 的动态剪枝通过在训练期间连续调整而非承诺固定分配来稳定重要性分布。
> ^1 我们还发现,PEFT 的 `rank_pattern` 通配符匹配(例如,`model.layers.*.q_proj`)在 Qwen 模型中静默失败,回退到默认秩。需要使用确切的模块路径(例如,`model.layers.N.self_attn.q_proj`)。
### 3.5 为什么 SFT 方法在 RL 下失效
根本区别在于梯度分布:
在 SFT 下,损失是逐 token 的交叉熵,其中少数层主导梯度景观。ILA(Shi et al., 2024 [链接](https://arxiv.org/html/2605.07366#bib.bib7))显示,前 30% 的层承载 >80% 的梯度信号,冻结其余层可提高性能。这种集中的结构使得自适应分配有效——确实存在可以安全重分配容量的闲置层。
在 GRPO 下,损失是优势加权的策略梯度,带有稀疏的二元奖励。我们的剖析揭示了一个根本更平坦的景观,其中前 30% 仅承载 35.7% 的信号。即使“最冷”的层也有意义贡献(占总量的 2.15%,或最热层的 46%)。减少它们的容量——即使是适度的,从 $r=32$ 到 $r=20$——会损害评估准确率,同时保持训练奖励不变。
我们假设,在 RL 下,低梯度层处理必要的结构功能:输出格式化、数值精度和连贯性维护。这些功能产生的梯度很小,因为预训练模型已经很好地处理了它们,但当容量减少时,它们会成为瓶颈。我们的模块级分析支持这一假设:注意力和 FFN 模块分别贡献 52.9% 和 47.1%,这是一个近乎均等的分布,不同于 SFT 中网络上半部分的 FFN 层占主导地位(Zhang et al., 2023 [链接](https://arxiv.org/html/2605.07366#bib.bib9))。`up_proj` 模块对奖励最敏感(21.4%),而 `q_proj` 仅贡献 9.5%——但两者对于正确的数学推理都是必不可少的。
我们的发现还表明,GRPO 下的梯度重要性映射在时间上是稳定的(早期与晚期训练相关性:0.962),排除了不同的剖析窗口会产生更有用的分配的可能性。平坦的景观是 GRPO 如何分配学习的结构特性,而非噪声训练阶段平均化的伪影。
## 4 相关工作
* **SFT 的自适应秩**:AdaLoRA(Zhang et al., 2023 [链接](https://arxiv.org/html/2605.07366#bib.bib9))在训练期间剪枝奇异值。GoRA(He et al., 2025 [链接](https://arxiv.org/html/2605.07366#bib.bib3))使用梯度-权重积进行初始化时分配。IGU-LoRA(Cui et al., 2026 [链接](https://arxiv.org/html/2605.07366#bib.bib2))应用集成梯度和不确定性感知评分。Aletheia(Saket, 2026 [链接](https://arxiv.org/html/2605.07366#bib.bib5))通过梯度探针选择层。**所有这些都仅在监督目标下运行**。
* **对齐中的层重要性**:ILA(Shi et al., 2024 [链接](https://arxiv.org/html/2605.07366#bib.bib7))学习二进制层掩码,显示 10–30% 的层足以进行 SFT 对齐。Young(2026 [链接](https://arxiv.org/html/2605.07366#bib.bib8))证明 RLHF 梯度集中在特定位置。我们的工作通过表明 RL 的梯度集中度**不足以**进行有效的秩分配,扩展了这一研究方向。
* **GRPO 与 LoRA**:DeepSeekMath(Shao et al., 2024 [链接](https://arxiv.org/html/2605.07366#bib.bib6))引入了用于数学推理的 GRPO。据我们所知,先前没有工作专门调查基于 RL 的对齐方法下的自适应秩分配。
## 5 局限性
我们的发现源自单一模型(Qwen 2.5 1.5B)、单一数据集(GSM8K)和单一 RL 算法(GRPO)。这些结果是否适用于更大的模型、其他领域(代码、安全对齐)或其他 RL 方法(PPO, DPO)仍是一个开放性问题。
我们的评估使用 $n=200$ 测试样本和单种子运行;[表 1](https://arxiv.org/html/2605.07366#S3.T1) 中的置信区间重叠,我们鼓励在更大规模上以多种种子进行复制以确立统计显著性。
我们通过引用先前工作而不是在同一模型和数据上运行直接的 SFT 基线来比较 SFT 梯度分布——直接比较将增强对比度。
最后,我们关于冷层处理结构功能(格式化、数值精度)的假设未经测试;每奖励梯度分解可能部分验证这一点。
## 6 结论
我们研究了基于梯度的秩分配——一种经证实的 SFT 技术——是否可迁移到通过 GRPO 进行的强化学习对齐。我们的实验表明答案是否定的:尽管参数量预算相同,比例分配使准确率下降 4.5 个百分点。我们确定 GRPO 下的平坦梯度景观和梯度放大效应是导致这种失败的关键机制。
这些发现具有实际意义:从业者不应天真地将 SFT 时代的秩分配策略应用于 RL 训练。随机对照证实,感知梯度的分配(70.0%)优于无信息的分配(67.5%),验证...相似文章
GRAIL:面向可验证奖励强化学习的梯度重加权优势方法
GRAIL 引入了梯度重加权优势,以改进 LLM 推理强化学习中的 token 级信用分配,在多个模型上优于 GRPO。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
在梯度与自然梯度之间:LoRA初始化的连续统
本文提出统一LoRA(ULoRA),一种用于低秩适配的双参数预条件梯度初始化家族,表明现有的LoRA初始化方法是该连续统上的点。作者证明,经过调优的ULoRA在RoBERTa-base上的GLUE任务中达到或超过全微调性能,并在LLaMA 2-7B上的GSM8K任务中具有竞争力,同时引入了ULoRA-Auto以实现零搜索部署。
超越 LoRA 与全参数微调:基于梯度引导优化器路由的大语言模型适配
本文提出了一种混合 LoRA 与全参数微调(MoLF)框架,利用梯度引导的优化器路由在 LoRA 和全参数微调之间进行自适应切换。旨在通过结合全参数微调的可塑性与 LoRA 的正则化特性,克服仅依赖静态适配方法的结构局限性。
平衡聚合:理解与修复 GRPO 中的聚合偏差
本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。