群组自适应裁剪策略优化

arXiv cs.LG 论文

摘要

本文提出群组自适应裁剪策略优化(GAPO),这是一种对GRPO方法的插件式修改,通过根据rollout优势自适应调整裁剪边界,在数学推理和编程基准测试中提升了Pass@1和Pass@k的表现。

arXiv:2609.00444v1 公告类型:新 摘要:具有可验证奖励(RLVR)的强化学习中的群组相对策略优化通常对所有rollout使用固定的重要性采样(IS)比率裁剪边界。我们识别出一个关键限制:在较难题目上罕见的正确rollout和在较简单题目上丰富的正确rollout被以相似的比率裁剪,尽管它们贡献的学习信号非常不同。群组成功率低的rollout表现出较大的IS比率,并携带更强的梯度信号用于探索和解决新问题,但却被固定裁剪不成比例地抑制。 为了解决这个问题,我们提出群组自适应裁剪策略优化(GAPO),这是一种对GRPO方法的插件式修改,根据rollout优势自适应调整裁剪边界。GAPO的动机源于反向KL信任域视角,该视角表明,具有较大学习信号的rollout应获得成比例更大的更新空间。GAPO不需要奖励塑形,并保留标准的PPO/GSPO代理,仅调整裁剪阈值。在Qwen和Llama模型上,GAPO在数学推理和编程基准测试中,相对于固定裁剪和优势塑化基线,一致地提高了Pass@1和Pass@k,其中基础模型的通过率相对较低。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:13

# 组自适应裁剪策略优化
来源: https://arxiv.org/html/2609.00444
###### 摘要

在使用可验证奖励的强化学习中,组相对策略优化通常采用固定的重要性采样比率裁剪边界来处理所有轨迹。我们发现了一个关键局限性:较难问题上稀少的正确轨迹和较简单问题上丰富的正确轨迹,尽管贡献的学习信号非常不同,却被以相似的比率进行裁剪。具有较低组成功率的轨迹展现出更大的重要性采样比率,并携带更强的梯度信号用于探索和解决新问题,但却被固定裁剪不成比例地抑制。

为了解决这个问题,我们提出了组自适应裁剪策略优化,这是对 GRPO 方法的一种即插即用的修改,能够根据轨迹优势自适应调整裁剪边界。GAPO 的动机源于反向 KL 信任域视角,该视角表明具有较大学习信号的轨迹应获得相应更大的更新空间。GAPO 无需奖励塑形,并保持了标准 PPO/GSPO 替代目标,仅自适应调整裁剪阈值。在 Qwen 和 Llama 模型上,GAPO 在数学推理和代码生成基准测试中,一致地提高了 Pass@1 和 Pass@k,超越了固定裁剪和优势塑形的基线方法,在这些测试中基础模型的通过率相对较低111代码可用:https://github.com/Sheng-J/GAPO。通讯作者:[[email protected]](mailto:[email protected])。

††† 共同指导。## 1 引言

图 1:在 RLVR 训练中,重要性采样比率按组内正确数量 c 分组的平均偏差。两种模式在所有算法中成立:(1) 对于稀少正确轨迹(小 c,每组正确解决方案较少),重要性采样比率始终更高;(2) 对于这些轨迹,该比率继续以等于或超过较简单问题轨迹(大 c)的速率增长。这两种模式共同促使我们根据问题难度调整裁剪边界:在固定边界下,难题上稀少的高优势轨迹首先达到裁剪点并被过早地不成比例地抑制。
使用可验证奖励的强化学习使用 PPO 风格的裁剪策略优化来训练语言模型(Schulman 等人,2017 (https://arxiv.org/html/2609.00444#bib.bib18)),其中固定的重要性采样比率边界通过在策略偏离其前一迭代太远时抑制更新来近似信任域。在诸如 GRPO(Shao 等人,2024 (https://arxiv.org/html/2609.00444#bib.bib8))、GSPO(Zheng 等人,2025 (https://arxiv.org/html/2609.00444#bib.bib13))和 DAPO(Yu 等人,2025 (https://arxiv.org/html/2609.00444#bib.bib12))等组相对 RLVR 方法中,轨迹相对于来自同一提示的其他样本被分配优势。具体来说,在 k 个轨迹中,有 c 个正确解决方案的组中,正确轨迹获得优势 \(A_i = (k - c) / k\),创建了一个从稀少、高优势正确轨迹(低 c)到丰富、低优势正确轨迹(高 c)的结构化谱。

固定裁剪边界统一对待此谱,尽管学习信号存在显著差异。我们观察到,在裁剪激活之前,重要性采样比率与优势成比例增长:较难题上稀少的正确轨迹远离参考策略的速度远快于较简单问题上丰富的正确轨迹(图 1 (https://arxiv.org/html/2609.00444#S1.F1))。然而,一旦裁剪开始,在统一边界下,两者的截断比率相似。这造成了不匹配:为探索和解决新问题提供宝贵信号的稀少正确轨迹被裁剪得过于激进,而丰富的冗余轨迹尽管对改进贡献较少,却被授予了相等的更新空间。

一个自然的回应可能是统一地加宽裁剪边界,如 DAPO(Yu 等人,2025 (https://arxiv.org/html/2609.00444#bib.bib12))中所探讨的。然而,这未能解决核心问题:问题不在于裁剪边界的绝对宽度,而在于其在具有根本不同优势的轨迹之间的均匀性。必须改变的是不同组成功率水平之间的*相对*裁剪宽度。

从反向 KL 信任域视角来看,单个提示上的最优策略更新按比例分配概率给具有相应优势的响应,产生一个随优势指数级缩放的信任域最优重要性采样比率(Chen 等人,2018 (https://arxiv.org/html/2609.00444#bib.bib17))。这表明了一个简单的裁剪原则:具有较大学习信号的轨迹应获得相应更大的更新空间。将重要性采样比率显著推过此最优值要么违反信任域,要么以牺牲替代方案为代价过度分配概率质量给单个响应,使得最优比率成为自适应裁剪的天然指南。

我们利用这一观察引入了组自适应策略优化(GAPO),这是对组相对策略优化的一个简单即插即用修改,它将每个轨迹的裁剪阈值自适应调整为轨迹优势。在 RLVR 中,二元奖励仅诱导少量离散的正优势水平,允许自适应裁剪阈值直接从组成功率统计量 c 计算得出。GAPO 保持了标准的 PPO/GSPO 替代目标,仅修改了裁剪边界。与奖励或优势塑形方法不同,GAPO 继续直接优化 pass@1,并且不会出现基于难度塑形目标可能导致的 pass@1 偏移(Plyusov 等人,2026 (https://arxiv.org/html/2609.00444#bib.bib15))、推理时 pass@k(Walder 和 Karkhanis,2025 (https://arxiv.org/html/2609.00444#bib.bib22);Chen 等人,2025b (https://arxiv.org/html/2609.00444#bib.bib23);Tang 等人,2025 (https://arxiv.org/html/2609.00444#bib.bib24))或多样性(Li 等人,2025 (https://arxiv.org/html/2609.00444#bib.bib21))问题。我们做出以下贡献:

- •我们识别了 RLVR 中的一个*裁剪不对称性*:在统一裁剪边界下,稀少正确轨迹(低 c,高优势)被裁剪的比率与丰富正确轨迹相当,尽管它们携带着强得多的学习信号(图 3 (https://arxiv.org/html/2609.00444#S2.F3))。我们展示了反向 KL 信任域视角(公式 5 (https://arxiv.org/html/2609.00444#S2.E5)、6 (https://arxiv.org/html/2609.00444#S3.E6))自然地促成了*优势相关裁剪*,产生了一个随优势指数级缩放的信任域最优重要性采样比率,并通过组统计量 c 在 RLVR 中简化为一个实用的闭式裁剪规则(公式 8 (https://arxiv.org/html/2609.00444#S3.E8))。
- •我们引入了组自适应裁剪策略优化(GAPO),这是对 PPO/GSPO 的一个简单即插即用修改,仅自适应调整裁剪边界,同时保持标准的替代目标和对 pass@1 的直接优化(公式 11 (https://arxiv.org/html/2609.00444#S3.E11))。
- •我们在 Qwen2.5-Math-1.5B、Llama-3.2-3B-Instruct 和 DeepSeek-R1-Distill-Qwen-1.5B 上的数学推理和代码生成基准测试中,展示了 pass@1 和 pass@k 的一致改进(表 1 (https://arxiv.org/html/2609.00444#S4.T1)、2 (https://arxiv.org/html/2609.00444#S4.T2)、3 (https://arxiv.org/html/2609.00444#S4.T3),图 4 (https://arxiv.org/html/2609.00444#S4.F4)),同时在整个训练过程中保持重要性采样比率与优势之间的强相关性(图 5 (https://arxiv.org/html/2609.00444#S4.F5))。图 7 (https://arxiv.org/html/2609.00444#A2.F7) 展示了一个检查点干预实验,以排除常见的混杂因素。

图 2:(a) 对称裁剪 (b) 非对称裁剪 (c) 自适应裁剪。每一行代表一个正确轨迹,具有组统计量 c 和优势 \(A_i\)。实线箭头表示保留的梯度;虚线红色箭头表示因重要性采样比率超过裁剪阈值而丢失的梯度。(a) GSPO 对称:统一边界不成比例地裁剪稀少正确轨迹。(b) GSPO 非对称:更宽的上边界但在 c 上仍然统一。(c) GAPO:基于 c 的自适应边界方程 11 (https://arxiv.org/html/2609.00444#S3.E11) 即使在裁剪开始触发时,也能保持梯度更新与优势方程 8 (https://arxiv.org/html/2609.00444#S3.E8) 成比例。
## 2 预备知识

### 2.1 使用可验证奖励的强化学习

我们考虑用于语言模型后训练的具有可验证奖励的强化学习。给定从数据集 \(\mathcal{D}\) 中抽取的提示 \(x\),策略 \(\pi_\theta\) 生成一个完整的响应 \(y \sim \pi_\theta(\cdot \mid x)\),该响应从自动验证器获得一个二元可验证奖励 \(R(x,y) \in \{0,1\}\)。训练目标是期望奖励

\[
J(\theta) = \mathbb{E}\left[R(x,y)\right], \quad x \sim \mathcal{D}, \; y \sim \pi_\theta(\cdot \mid x).
\tag{1}
\]
在每提示 \(k\) 个轨迹的组相对策略优化中 \(\{y_i\}_{i=1}^{k} \sim \pi_{\theta_{\text{old}}}(\cdot \mid x)\),一个在具有 \(c\) 个正确轨迹的组中的正确轨迹 \(i\) 具有优势

\[
A_i = r_i - \bar{r} = 1 - \frac{c}{k} = \frac{k-c}{k},
\tag{2}
\]
其中 \(r_i \in \{0,1\}\)。稀少正确轨迹 (\(c=1\)) 获得较大的优势 \((k-1)/k\),而丰富正确轨迹 (\(c=k-1\)) 获得较小的优势 \(1/k\)。在本工作中,我们不执行优势归一化以进行无偏优势估计(Liu 等人,2025 (https://arxiv.org/html/2609.00444#bib.bib4))。

标准的 PPO 风格裁剪对所有轨迹统一应用固定的信任域 \([1-\epsilon, 1+\epsilon]\)。我们观察到,这不成比例地抑制了高优势(稀少)的轨迹,这些轨迹推动其重要性比率最快超过裁剪边界。

### 2.2 信任域策略优化

##### 信任域与反向 KL。

我们建立在 Schulman 等人 (2015) (https://arxiv.org/html/2609.00444#bib.bib16) 的策略改进保证之上。在 RLVR 设置中,该界限的形式为

\[
J(\theta) \geq L_{\pi_{\theta_{\text{old}}}}(\pi_\theta) - C \cdot \max_x D_{\mathrm{KL}}(\pi_{\theta_{\text{old}}}(\cdot \mid x) \| \pi_\theta(\cdot \mid x)),
\tag{3}
\]
其中替代目标,以重要性采样形式写出,为

\[
L_{\pi_{\theta_{\text{old}}}}(\pi_\theta) = \widehat{\mathbb{E}}_i\!\left[\frac{\pi_\theta(y_i \mid x)}{\pi_{\theta_{\text{old}}}(y_i \mid x)} A_i\right]
\tag{4}
= \widehat{\mathbb{E}}_i\!\left[\rho_i A_i\right],
\]
其中 \(\widehat{\mathbb{E}}_i\!\left[\cdot\right]\) 表示从 \(\pi_{\theta_{\text{old}}}(\cdot \mid x)\) 中抽取的轨迹批次 \(\{(x, y_i)\}\\) 上的经验期望,而 \(C\) 仅取决于奖励范围。该界限源自应用于策略间最差情况总变差距离的 Pinsker 不等式;最大化其右侧保证在每次更新时 \(J(\theta)\) 的单调改进。

公式 3 (https://arxiv.org/html/2609.00444#S2.E3) 是用正向方向 \(D_{\mathrm{KL}}(\pi_{\theta_{\text{old}}} \| \pi_\theta)\) 陈述的,但相同的保证也适用于反向方向(Chen 等人,2018 (https://arxiv.org/html/2609.00444#bib.bib17))。原因是对称性:因为 \(D_{\mathrm{TV}}(P,Q) = D_{\mathrm{TV}}(Q,P)\),Pinsker 不等式从任一侧限定相同的量,所以 \(D_{\mathrm{KL}}(\pi_\theta \| \pi_{\theta_{\text{old}}})\) 可以在公式 3 (https://arxiv.org/html/2609.00444#S2.E3) 中替换 \(D_{\mathrm{KL}}(\pi_{\theta_{\text{old}}} \| \pi_\theta)\) 而不会削弱保证。因此我们求解的约束优化问题为

\[
\max_{\theta} \quad \widehat{\mathbb{E}}_i\!\left[\rho_i A_i\right]
\tag{5}
\quad \text{s.t.} \quad \widehat{\mathbb{E}}_i\!\left[D_{\mathrm{KL}}(\pi_\theta(\cdot \mid x) \| \pi_{\theta_{\text{old}}}(\cdot \mid x))\right] \leq \delta,
\]
其中用批次上的经验期望替换了最差情况最大值以提高可处理性,类似于 PPO(Schulman 等人,2017 (https://arxiv.org/html/2609.00444#bib.bib18))。

图 3:在 Qwen2.5-Math-1.5B 训练过程中,按组正确数 c 划分的标记裁剪比例。在 c 对应的轨迹内被裁剪的标记比例。在固定裁剪下(GSPO 对称/非对称),较难题上稀少的正确轨迹(低 c,较大优势 \(A_i\) 方程 2 (https://arxiv.org/html/2609.00444#S2.E2))被裁剪的比率与丰富正确轨迹(高 c)相当。GAPO 裁剪更多高 c 轨迹,裁剪更少低 c 轨迹,从而在对探索最有价值的稀少正确轨迹上保留梯度。

## 3 组自适应策略优化

### 3.1 每提示信任域优化

遵循 Chen 等人 (2018) (https://arxiv.org/html/2609.00444#bib.bib17),我们考虑在状态 \(s\) 下的局部策略优化,在我们的案例中即提示 \(x\)。这使得公式 5 (https://arxiv.org/html/2609.00444#S2.E5) 中的批次级约束变为每提示的,仅对单提示批次精确成立(见局限性)。在给定 \(x\) 下最大化公式 5 (https://arxiv.org/html/2609.00444#S2.E5) 的拉格朗日函数为

\[
\mathcal{L}_x = \sum_{y} \pi_\theta(y|x) A(x,y)
\tag{6}
- \lambda D_{\mathrm{KL}}(\pi_\theta(\cdot \mid x) \| \pi_{\theta_{\text{old}}}(\cdot \mid x)).
\]
通过求解以下欧拉-拉格朗日方程(Gelfand 和 Fomin,2000 (https://arxiv.org/html/2609.00444#bib.bib19)),

\[
\frac{\partial \mathcal{L}_x}{\partial \pi_\theta(y|x)} = A(x,y) - \lambda \left(\log\frac{\pi_\theta(y|x)}{\pi_{\theta_{\text{old}}}(y|x)} + 1\right)
\tag{7}
= 0.
\]
我们得到目标策略 \(\pi_\theta\) 的驻点 \(\pi^*_\theta(y|x) \propto \pi_{\theta_{\text{old}}}(y|x) \exp\left(\frac{A(x,y)}{\lambda}\right)\)。对于提示 \(x\) 的每个轨迹 \(i\),最优重要性采样比率为

\[
\rho_i^* = \frac{\pi^*_\theta(y_i|x)}{\pi_{\theta_{\text{old}}}(y_i|x)} \propto \exp(A_i/\lambda).
\tag{8}
\]
##### 关于最优重要性采样比率的解释。

\(\rho_i^*\) 描述了为了最大化提示 \(x\) 上的期望回报,应将生成响应 \(y_i\) 的概率提高多少。将 \(\rho_i\) 推过 \(\rho_i^*\) 意味着要么违反了信任域约束,要么过度分配了生成

相似文章

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。

组熵控制策略优化

Hugging Face Daily Papers

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。