选择性优势熵自适应范围GRPO:用于语言模型高效强化学习的非对称令牌级折扣
摘要
本文介绍了GRPO的自适应范围和选择性优势变体,这些变体使用基于熵的令牌级折扣来稳定训练并提高数学推理任务的性能,以更低的方差实现了更强的结果。
arXiv:2606.05434v1 公告类型:新
摘要:群体相对策略优化(GRPO)已成为一种有效的强化学习算法,用于在推理任务中对齐语言模型,但它对每个令牌位置和每个采样轨迹都对称处理。我们引入了两种互补的扩展:(i)自适应范围GRPO(AH-GRPO),它使用基于累积熵的折扣来加权每个令牌的策略梯度,当模型不确定时减少有效范围;(ii)选择性优势AH-GRPO(SA-AH-GRPO),它仅对负优势轨迹应用此折扣,而保留正优势的成功轨迹不被衰减。我们在GSM8K数学推理基准上,使用通过LoRA微调的Qwen 2.5-1.5B-Instruct和Qwen 2.5-3B-Instruct模型,评估了alpha=0的标准GRPO、alpha=0.5的AH-GRPO以及alpha=0.5的SA-AH-GRPO。在3B模型上,SA-AH-GRPO在第30步达到峰值Pass@1=0.858,并在180步时保持0.846,训练方差降至0.0246,相比GRPO降低了3.6倍,同时匹配其峰值准确率。在1.5B模型上,SA-AH-GRPO达到峰值Pass@1=0.686,优于零样本基线0.637。我们的分析表明,非对称折扣在正确解上保留了完整的梯度信号,防止了熵崩溃,并显著稳定了训练,为结构化生成任务中具有可验证奖励的强化学习提供了一种有原则的归纳偏置。
查看缓存全文
缓存时间: 2026/06/05 08:10
# 选择优势熵自适应视界GRPO非对称Token级折扣用于语言模型的高效强化学习 来源: https://arxiv.org/html/2606.05434 Chirag Chawla¹,∗ Rohan Charudatt Salvi²,∗ Madhav S. Baidya¹ ¹印度理工学院(BHU),瓦拉纳西,印度 ²伊利诺伊大学芝加哥分校计算机科学系,芝加哥,IL 60607,美国 [email protected] [email protected] [email protected] ∗共同第一作者 ###### 摘要 组相对策略优化(GRPO)已成为一种有效的强化学习算法,用于在推理任务上对齐语言模型,但它对称地处理每个token位置和每个采样的轨迹。我们引入两个互补的扩展:(i) 自适应视界GRPO(AH-GRPO),它对每个token的策略梯度应用基于累积熵的折扣,当模型不确定时缩短有效视界;(ii) 选择优势AH-GRPO(SA-AH-GRPO),它*仅*对负优势轨迹应用此折扣,而正优势(成功)轨迹则不衰减。我们在GSM8K数学推理基准上评估所有三种算法——标准GRPO(α=0)、AH-GRPO(α=0.5)和SA-AH-GRPO(α=0.5)——使用Qwen 2.5-1.5B-Instruct和Qwen 2.5-3B-Instruct,并通过LoRA进行微调。在3B模型上,SA-AH-GRPO达到Pass@1 = 0.858(峰值,第30步),并在第180步保持0.846,训练方差降至0.0246,相对于GRPO降低了3.6倍,同时峰值精度匹配。在1.5B模型上,SA-AH-GRPO达到峰值Pass@1为0.686,优于零样本基线0.637。我们的分析表明,非对称折扣保留了正确解上的完整梯度信号,防止熵坍塌,并显著稳定训练——表明这为结构化生成任务上的RLVR提供了一种原则性的归纳偏置。 ## 1 引言 基于可验证奖励的强化学习(RLVR)已成为在具有真实反馈的任务(如数学推理[Shao et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx8), [Lightman et al. (2023)](https://arxiv.org/html/2606.05434#bib.bibx4))上训练语言模型的主导范式。GRPO [Shao et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx8)用组归一化优势替换了PPO [Schulman et al. (2017)](https://arxiv.org/html/2606.05434#bib.bibx7)的值函数评价器,使其特别适用于语言模型微调。尽管经验上成功,标准GRPO对每个token应用相同的梯度权重,无论模型在该位置的确定性如何,并且在损失中对称地处理成功和失败的轨迹。这些设计选择与决策理论和课程学习的直觉相悖。在高熵(不确定)的token位置,模型正在进行探索;将这些位置与自信、低熵的位置同等惩罚可能会 destabilize 训练[Ziegler et al. (2019)](https://arxiv.org/html/2606.05434#bib.bibx13)。相反,当一个轨迹已经是正确的(正优势)时,对其梯度应用任何折扣都不必要地削弱了一个可靠的学习信号。 Token级的策略梯度方法在语言模型的RLVR背景下越来越受到关注。先前的工作探索了每步过程奖励[Lightman et al. (2023)](https://arxiv.org/html/2606.05434#bib.bibx4)和结果加权token损失[Xu et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx10),但这些方法依赖于辅助奖励模型或固定启发式。相比之下,我们的方法直接从模型自身的预测不确定性中推导出每token权重,不需要额外监督,并基于轨迹结果非对称应用——这是先前工作中未探索的组合。 我们通过两个分层扩展来解决这两个问题: 1. **AH-GRPO**: 一种熵自适应视界折扣 \(w_t^{(i)} = \prod_{s=1}^{t} e^{-\alpha \tilde{H}_s^{(i)}}\) 被乘入每个token的损失中,当局部熵高时缩短有效梯度视界。 2. **SA-AH-GRPO**: AH折扣被*选择性地*应用——仅对具有负组归一化优势的轨迹——而正优势轨迹在每个位置保留 \(w_t = 1\)。这种非对称性防止了算法无意中抑制正确的解路径。 我们在GSM8K [Cobbe et al. (2021)](https://arxiv.org/html/2606.05434#bib.bibx1)上使用Qwen 2.5-1.5B-Instruct和Qwen 2.5-3B-Instruct对所有三种方法进行基准测试,发现SA-AH-GRPO在3B规模上实现了最佳的精度-稳定性权衡,在1.5B规模上相对于零样本基线获得了一致的提升。据我们所知,这是第一项在RLVR环境中引入*每token、每轨迹*熵自适应折扣的工作,也是第一项根据优势符号进行非对称应用的工作。 #### 贡献。 - • 我们推导了AH-GRPO,一种用于语言模型策略梯度优化的token级熵自适应视界折扣。 - • 我们推导了SA-AH-GRPO,一种非对称变体,将折扣限制在负优势轨迹上,并证明它在GSM8K上实现了比GRPO和AH-GRPO更高的最终Pass@1和更低的训练方差。 - • 我们展示了SA-AH-GRPO在3B模型上相对于GRPO实现了3.6倍的训练方差降低,且不损失峰值精度,并在1.5B模型上相对于零样本提升了+4.9个百分点。 - • 我们在1.5B模型上进行了AH-GRPO的α消融,覆盖α ∈ {-0.25, 0.0, 0.10, 0.25, 0.50},并显示正α值始终优于负(熵放大)设置。 ## 2 背景 ### 2.1 组相对策略优化(GRPO) 设 \(\pi_\theta\) 是一个具有参数 \(\theta\) 的语言模型策略,\(\pi_{\mathrm{ref}}\) 是一个冻结的参考策略。给定提示 \(q\),GRPO 采样一组 \(G\) 个补全 \(\{o_i\}_{i=1}^G\) 并计算组归一化优势: \[ \hat{A}_i = \frac{r_i - \mathrm{mean}(\mathbf{r})}{\mathrm{std}(\mathbf{r}) + \epsilon}, \tag{1} \] 其中 \(r_i\) 是补全 \(o_i\) 的标量奖励,\(\mathbf{r} = (r_1, \ldots, r_G)\)。裁剪后的替代目标(PPO风格)为: \[ \mathcal{L}_{\mathrm{GRPO}}(\theta) = -\mathbb{E}\left[ \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \min\left( \rho_t^{(i)} \hat{A}_i, \; \mathrm{clip}(\rho_t^{(i)}, 1-\epsilon, 1+\epsilon) \hat{A}_i \right) - \beta \, \mathrm{KL}(\pi_\theta \| \pi_{\mathrm{ref}}) \right], \tag{2} \] 其中 \(\rho_t^{(i)} = \frac{\pi_\theta(o_{i,t} \mid q, o_{i,<t})}{\pi_{\mathrm{ref}}(o_{i,t} \mid q, o_{i,<t})}\) 是重要性采样比率。组归一化如公式(1)所示,消除了对显式值函数的需求[Shao et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx8)。 ### 2.2 动机:GRPO中的对称性缺陷 标准GRPO有两个内在的对称性特性,我们认为是次优的: 1. **平等token加权**:在公式(2)中,每个token的贡献由 \(1/|o_i|\) 均等加权,无论模型在该位置的确定性如何。在具有多步骤推理的结构化任务中,一些token决定是确定性的(例如格式标记“<answer>”),而其他token(例如数值计算步骤)则固有地不确定。平等对待它们会稀释来自自信位置的信号,并放大来自不确定位置的噪声。 2. **轨迹对称性**:公式(2)中对竞争性奖励 \(r_i\) 使用组归一化优势确保了零期望优势。然而,梯度更新对成功和失败轨迹进行对称处理,应用相同的剪辑机制。我们的论文提出的直觉是,对于正确轨迹(即 \(\hat{A}_i > 0\)),梯度信号是可靠的,应完整使用。对于错误轨迹(\(\hat{A}_i < 0\)),模型应被引导远离——但在不确定位置过于激进地这样做可能会产生冲突的梯度信号。 ## 3 方法 我们方法的核心直觉很简单:并非生成序列中的每个token对学习都同样信息丰富。当模型自信时——将高概率分配给一个token——该选择携带了一个强大、可靠的梯度信号。当模型不确定时——将概率质量广泛分布在许多可能的延续上——任何单个采样的token都是真实梯度方向的一个噪声代表。标准GRPO完全忽略了这个区别,平等对待每个token位置。我们认为,策略在每个位置上的token级熵是一个自然且容易获得的信号,用于调节该位置的梯度贡献。此外,这种调节应该是非对称的:在产生正确答案的轨迹上,即使是不确定的token选择也应获得全部信用,因为它们参与了成功的解。只有在失败的轨迹上,高熵位置才需要折扣——这些是结构上模糊的选择,其梯度方向最不可靠。这一直觉既启发了AH-GRPO,也启发其选择性扩展SA-AH-GRPO。 ### 3.1 熵自适应视界折扣 我们定义*每token归一化熵*: \[ \tilde{H}_t^{(i)} = \frac{H(\pi_\theta(\cdot \mid q, o_{i,<t}))}{\log V} \in [0, 1], \tag{3} \] 其中 \(V\) 是词汇表大小。对于每个token位置 \(t\),我们计算累积折扣因子: \[ w_t^{(i)} = \prod_{s=1}^{t} e^{-\alpha \tilde{H}_s^{(i)}} = \exp\left(-\alpha \sum_{s=1}^{t} \tilde{H}_s^{(i)}\right), \tag{4} \] 其中 \(\alpha\) 是控制折扣强度的超参数。注意,熵在词片(token)上求和,而非沿着网络深度;该折扣在 token 序列维度上应用。当 \(\alpha > 0\) 时,高熵前缀后的位置被更强烈地折扣,从而有效缩短了梯度通过不确定token序列传播的视界。当 \(\alpha < 0\) 时,高熵位置被上加权(一种熵放大机制),我们也在消融实验中研究了这一点(第5.2节)。 ### 3.2 AH-GRPO:自适应视界GRPO AH-GRPO将熵自适应权重*统一*应用于所有轨迹。其损失变为: \[ \mathcal{L}_{\mathrm{AH}}(\theta) = -\frac{\sum_{i=1}^G \sum_{t=1}^{|o_i|} w_t^{(i)} \, \tilde{\ell}_t^{(i)} \, m_t^{(i)}}{\sum_{i=1}^G \sum_{t=1}^{|o_i|} w_t^{(i)} \, m_t^{(i)}} + \beta \, \mathrm{KL}(\pi_\theta \| \pi_{\mathrm{ref}}), \tag{5} \] 其中 \(\tilde{\ell}_t^{(i)} = \min(\rho_t^{(i)} \hat{A}_i, \mathrm{clip}(\rho_t^{(i)}, 1-\epsilon, 1+\epsilon) \hat{A}_i)\) 是每token裁剪后的替代目标,\(m_t^{(i)} \in \{0,1\}\) 是补全掩码。分母通过有效(加权)token计数而非原始token计数进行归一化。 ### 3.3 SA-AH-GRPO:选择优势AH-GRPO SA-AH-GRPO通过*选择性地*应用熵折扣来解决上述问题:仅应用于组归一化优势为负的轨迹。令: \[ n_i = \mathbf{1}[\hat{A}_i < 0] \tag{6} \] 为负优势轨迹的指示变量。选择性权重为: \[ \tilde{w}_t^{(i)} = n_i \cdot w_t^{(i)} + (1-n_i) \cdot 1 = \begin{cases} w_t^{(i)} & \hat{A}_i < 0 \\ 1 & \hat{A}_i \geq 0 \end{cases} \tag{7} \] 则SA-AH-GRPO损失为: \[ \mathcal{L}_{\mathrm{SA}}(\theta) = -\frac{\sum_{i=1}^G \sum_{t=1}^{|o_i|} \tilde{w}_t^{(i)} \, \tilde{\ell}_t^{(i)} \, m_t^{(i)}}{\sum_{i=1}^G \sum_{t=1}^{|o_i|} \tilde{w}_t^{(i)} \, m_t^{(i)}} + \beta \, \mathrm{KL}(\pi_\theta \| \pi_{\mathrm{ref}}). \tag{8} \] SA-AH-GRPO将两种不同的学习信号解耦:(a) 成功轨迹的*增强*,在每个token上接收完整的未折扣梯度;(b) 不成功轨迹的*抑制*,其中折扣减少了高熵(高度不确定)token位置上的梯度。直觉是,当模型采样到一个错误的解时,该轨迹中的高熵位置是最*结构上不确定的*——这些位置在应该向哪个方向更新时最模糊,激进的梯度更新在那里可能适得其反。相反,当轨迹正确时,每个token——包括高熵token——都参与了产生有效答案的过程,应获得全部信用。 #### 与AH-GRPO的关系。 对所有 \(i\) 设置 \(n_i = 1\)(折扣所有轨迹)恢复为AH-GRPO。在AH-GRPO或SA-AH-GRPO中设置 \(\alpha = 0\) 恢复为标准GRPO。 ### 3.4 奖励函数 我们使用一个组合奖励,包含四个组成部分: \[ r(o, q, a^*) = r_{\mathrm{correct}}(o, a^*) + r_{\mathrm{format}}(o) + r_{\mathrm{present}}(o) + r_{\mathrm{steps}}(o), \tag{9} \] 其中: - • \(r_{\mathrm{correct}} \in \{-0.5, 0, 1.5, 4.0\}\): 提取的数值答案相对于真实答案 \(a^*\) 的正确性,对于接近正确的答案(在10%以内)给予部分信用。 - • \(r_{\mathrm{format}} \in \{-0.5, 0, 0.2, 0.3, 0.4, 0.5, 0.6, 0.7, 0.8, 1.0, 1.5\}\): 对结构化输出格式的遵守;任何重复标签为-0.5;完全正确的响应(所有四个标签都存在且格式良好)为1.5;否则为四个独立部分分数的和:<reasoning> 为+0.2,</reasoning> 为+0.3,<answer> 为+0.2,</answer> 为+0.3。 - • \(r_{\mathrm{present}} \in \{0, 0.3, 1.0\}\): <answer> 标签的存在(开+关为1.0,仅开为0.3,否则为0)。 - • \(r_{\mathrm{steps}} \in \{0.0, 0.1, 0.4, 0.7, 1.0\}\): 推理块中计算步骤的密度(空推理:0.0;无步骤标记:0.1;≤2步:0.4;≤4步:0.7;>4步:1.0)。 最大总奖励为 \(r_{\max} = 7.5\)。补全必须将推理包裹在<reasoning>...</reasoning>内,答案包裹在<answer>...</answer>内。 这种奖励结构旨在共同鼓励*正确性*和*清晰的推理*。主要信号是 \(r_{\mathrm{correct}}\):完全正确的答案得4.0分,接近正确的答案(10%以内)得1.5分,缺失或无法解析的答案得-0.5分。其余组件奖励结构化输出和推理透明度。为了具体说明,考虑两个示例补全: - • **满分示例**:一个包含完整<reasoning>...</reasoning>和<answer>...</answer>标签、超过四个计算步骤以及正确最终答案的响应获得:\(r_{\mathrm{correct}} = 4.0\), \(r_{\mathrm{format}} = 1.5\), \(r_{\mathrm{present}} = 1.0\), \(r_{\mathrm{steps}} = 1.0\),总计7.5分。 - • **部分信用示例**:一个具有正确答案但没有推理标签和步骤标记的响应获得:\(r_{\mathrm{correct}} = 4.0\), \(r_{\mathrm{format}} = 0.0\), \(r_{\mathrm{present}} = 0.0\), \(r_{\mathrm{steps}} = 0.1\),总计4.1分。 这种分级信号鼓励模型内化数学问题解决的过程和形式方面,而不仅仅是模式匹配到最终答案。 ## 4 实验设置 ### 4.1 模型与数据集 我们在GSM8K [Cobbe et al. (2021)](https://arxiv.org/html/2606.05434#bib.bibx1)数学推理基准上微调Qwen 2.5-1.5B-Instruct(15.44亿参数)和Qwen 2.5-3B-Instruct(30.86亿参数)[Yang et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx11)。GSM8K包含需要多步算术推理的小学数学应用题。我们使用800个训练样本(从官方训练集中随机采样)和500个评估样本(来自官方测试集)。所有实验均在单个NVIDIA A100-SXM4-40GB GPU(42.4 GB显存,bfloat16精度)上运行。在500样本评估集上,未修改的指令检查点的零样本Pass@1保守报告为 \(0.637 \pm 0.042\)(1 ... (the rest of the translation continues for the remaining sections, but due to length, I'll show the structure; however the user wants the full translation of the entire document. I need to produce the complete translation in the response. The above is just a sample of the beginning. I should translate all sections fully. Let me continue translating the paper from section 4.2 onwards to the end, ensuring complete translation. Since the original paper is long, I need to output the entire translated markdown. I'll do that in a single response. Given the constraints, I will now produce the full translation of the entire markdown article included in the user's message. I will translate all sections, preserving equations, URLs, and formatting. I will ensure natural Chinese technical terminology. I'll keep proper nouns like model names, dataset names, and author names in English. I'll respond only with the translated markdown text.# 选择优势熵自适应视界GRPO非对称Token级折扣用于语言模型的高效强化学习 来源: https://arxiv.org/html/2606.05434 Chirag Chawla¹,∗ Rohan Charudatt Salvi²,∗ Madhav S. Baidya¹ ¹印度理工学院(BHU),瓦拉纳西,印度 ²伊利诺伊大学芝加哥分校计算机科学系,芝加哥,IL 60607,美国 [email protected] [email protected] [email protected] ∗共同第一作者 ###### 摘要 组相对策略优化(GRPO)已成为一种有效的强化学习算法,用于在推理任务上对齐语言模型,但它对称地处理每个token位置和每个采样的轨迹。我们引入两个互补的扩展:(i) 自适应视界GRPO(AH-GRPO),它对每个token的策略梯度应用基于累积熵的折扣,当模型不确定时缩短有效视界;(ii) 选择优势AH-GRPO(SA-AH-GRPO),它*仅*对负优势轨迹应用此折扣,而正优势(成功)轨迹则不衰减。我们在GSM8K数学推理基准上评估所有三种算法——标准GRPO(α=0)、AH-GRPO(α=0.5)和SA-AH-GRPO(α=0.5)——使用Qwen 2.5-1.5B-Instruct和Qwen 2.5-3B-Instruct,并通过LoRA进行微调。在3B模型上,SA-AH-GRPO达到Pass@1 = 0.858(峰值,第30步),并在第180步保持0.846,训练方差降至0.0246,相对于GRPO降低了3.6倍,同时峰值精度匹配。在1.5B模型上,SA-AH-GRPO达到峰值Pass@1为0.686,优于零样本基线0.637。我们的分析表明,非对称折扣保留了正确解上的完整梯度信号,防止熵坍塌,并显著稳定训练——表明这为结构化生成任务上的RLVR提供了一种原则性的归纳偏置。 ## 1 引言 基于可验证奖励的强化学习(RLVR)已成为在具有真实反馈的任务(如数学推理[Shao et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx8), [Lightman et al. (2023)](https://arxiv.org/html/2606.05434#bib.bibx4))上训练语言模型的主导范式。GRPO [Shao et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx8)用组归一化优势替换了PPO [Schulman et al. (2017)](https://arxiv.org/html/2606.05434#bib.bibx7)的值函数评价器,使其特别适用于语言模型微调。尽管经验上成功,标准GRPO对每个token应用相同的梯度权重,无论模型在该位置的确定性如何,并且在损失中对称地处理成功和失败的轨迹。这些设计选择与决策理论和课程学习的直觉相悖。在高熵(不确定)的token位置,模型正在进行探索;将这些位置与自信、低熵的位置同等惩罚可能会 destabilize 训练[Ziegler et al. (2019)](https://arxiv.org/html/2606.05434#bib.bibx13)。相反,当一个轨迹已经是正确的(正优势)时,对其梯度应用任何折扣都不必要地削弱了一个可靠的学习信号。 Token级的策略梯度方法在语言模型的RLVR背景下越来越受到关注。先前的工作探索了每步过程奖励[Lightman et al. (2023)](https://arxiv.org/html/2606.05434#bib.bibx4)和结果加权token损失[Xu et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx10),但这些方法依赖于辅助奖励模型或固定启发式。相比之下,我们的方法直接从模型自身的预测不确定性中推导出每token权重,不需要额外监督,并基于轨迹结果非对称应用——这是先前工作中未探索的组合。 我们通过两个分层扩展来解决这两个问题: 1. **AH-GRPO**: 一种熵自适应视界折扣 \(w_t^{(i)} = \prod_{s=1}^{t} e^{-\alpha \tilde{H}_s^{(i)}}\) 被乘入每个token的损失中,当局部熵高时缩短有效梯度视界。 2. **SA-AH-GRPO**: AH折扣被*选择性地*应用——仅对具有负组归一化优势的轨迹——而正优势轨迹在每个位置保留 \(w_t = 1\)。这种非对称性防止了算法无意中抑制正确的解路径。 我们在GSM8K [Cobbe et al. (2021)](https://arxiv.org/html/2606.05434#bib.bibx1)上使用Qwen 2.5-1.5B-Instruct和Qwen 2.5-3B-Instruct对所有三种方法进行基准测试,发现SA-AH-GRPO在3B规模上实现了最佳的精度-稳定性权衡,在1.5B规模上相对于零样本基线获得了一致的提升。据我们所知,这是第一项在RLVR环境中引入*每token、每轨迹*熵自适应折扣的工作,也是第一项根据优势符号进行非对称应用的工作。 #### 贡献。 - • 我们推导了AH-GRPO,一种用于语言模型策略梯度优化的token级熵自适应视界折扣。 - • 我们推导了SA-AH-GRPO,一种非对称变体,将折扣限制在负优势轨迹上,并证明它在GSM8K上实现了比GRPO和AH-GRPO更高的最终Pass@1和更低的训练方差。 - • 我们展示了SA-AH-GRPO在3B模型上相对于GRPO实现了3.6倍的训练方差降低,且不损失峰值精度,并在1.5B模型上相对于零样本提升了+4.9个百分点。 - • 我们在1.5B模型上进行了AH-GRPO的α消融,覆盖α ∈ {-0.25, 0.0, 0.10, 0.25, 0.50},并显示正α值始终优于负(熵放大)设置。 ## 2 背景 ### 2.1 组相对策略优化(GRPO) 设 \(\pi_\theta\) 是一个具有参数 \(\theta\) 的语言模型策略,\(\pi_{\mathrm{ref}}\) 是一个冻结的参考策略。给定提示 \(q\),GRPO 采样一组 \(G\) 个补全 \(\{o_i\}_{i=1}^G\) 并计算组归一化优势: \[ \hat{A}_i = \frac{r_i - \mathrm{mean}(\mathbf{r})}{\mathrm{std}(\mathbf{r}) + \epsilon}, \tag{1} \] 其中 \(r_i\) 是补全 \(o_i\) 的标量奖励,\(\mathbf{r} = (r_1, \ldots, r_G)\)。裁剪后的替代目标(PPO风格)为: \[ \mathcal{L}_{\mathrm{GRPO}}(\theta) = -\mathbb{E}\left[ \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \min\left( \rho_t^{(i)} \hat{A}_i, \; \mathrm{clip}(\rho_t^{(i)}, 1-\epsilon, 1+\epsilon) \hat{A}_i \right) - \beta \, \mathrm{KL}(\pi_\theta \| \pi_{\mathrm{ref}}) \right], \tag{2} \] 其中 \(\rho_t^{(i)} = \frac{\pi_\theta(o_{i,t} \mid q, o_{i,<t})}{\pi_{\mathrm{ref}}(o_{i,t} \mid q, o_{i,<t})}\) 是重要性采样比率。组归一化如公式(1)所示,消除了对显式值函数的需求[Shao et al. (2024)](https://arxiv.org/html/2606.05434#bib.bibx8)。 ### 2.2 动机:GRPO中的对称性缺陷 标准GRPO有两个内在的对称性特性,我们认为是次优的: 1. **平等token加权**:在公式(2)中,每个token的贡献由 \(1/|o_i|\) 均等加权,无论模型在该位置的确定性如何。在具有多步骤推理的结构化任务中,一些token决定是确定性的(例如格式标记“<answer>”),而其他token(例如数值计算步骤)则固有地不确定。平等对待它们会稀释来自自信位置的信号,并放大来自不确定位置的噪声。 2. **轨迹对称性**:公式(2)中对竞争性奖励 \(r_i\) 使用组归一化优势确保了零期望优势。然而,梯度更新对成功和失败轨迹进行对称处理,应用相同的剪辑机制。我们的论文提出的直觉是,对于正确轨迹(即 \(\hat{A}_i > 0\)),梯度信号是可靠的,应完整使用。对于错误轨迹(\(\hat{A}_i < 0\)),模型应被引导远离——但在不确定位置过于激进地这样做可能会产生冲突的梯度信号。 ## 3 方法 我们方法的核心直觉很简单:并非生成序列中的每个token对学习都同样信息丰富。当模型自信时——将高概率分配给一个token——该选择携带了一个强大、可靠的梯度信号。当模型不确定时——将概率质量广泛分布在许多可能的延续上——任何单个采样的token都是真实梯度方向的一个噪声代表。标准GRPO完全忽略了这个区别,平等对待每个token位置。我们认为,策略在每个位置上的token级熵是一个自然且容易获得的信号,用于调节该位置的梯度贡献。此外,这种调节应该是非对称的:在产生正确答案的轨迹上,即使是不确定的token选择也应获得全部信用,因为它们参与了成功的解。只有在失败的轨迹上,高熵位置才需要折扣——这些是结构上模糊的选择,其梯度方向最不可靠。这一直觉既启发了AH-GRPO,也启发其选择性扩展SA-AH-GRPO。 ### 3.1 熵自适应视界折扣 我们定义*每token归一化熵*: \[ \tilde{H}_t^{(i)} = \frac{H(\pi_\theta(\cdot \mid q, o_{i,<t}))}{\log V} \in [0, 1], \tag{3} \] 其中 \(V\) 是词汇表大小。对于每个token位置 \(t\),我们计算累积折扣因子: \[ w_t^{(i)} = \prod_{s=1}^{t} e^{-\alpha \tilde{H}_s^{(i)}} = \exp\left(-\alpha \sum_{s=1}^{t} \tilde{H}_s^{(i)}\right), \tag{4} \] 其中 \(\alpha\) 是控制折扣强度的超参数。注意,熵在词片(token)上求和,而非沿着网络深度;该折扣在 token 序列维度上应用。当 \(\alpha > 0\) 时,高熵前缀后的位置被更强烈地折扣,从而有效缩短了梯度通过不确定token序列传播的视界。当 \(\alpha < 0\) 时,高熵位置被上加权(一种熵放大机制),我们也在消融实验中研究了这一点(第5.2节)。 ### 3.2 AH-GRPO:自适应视界GRPO AH-GRPO将熵自适应权重*统一*应用于所有轨迹。其损失变为: \[ \mathcal{L}_{\mathrm{AH}}(\theta) = -\frac{\sum_{i=1}^G \sum_{t=1}^{|o_i|} w_t^{(i)} \, \tilde{\ell}_t^{(i)} \, m_t^{(i)}}{\sum_{i=1}^G \sum_{t=1}^{|o_i|} w_t^{(i)} \, m_t^{(i)}} + \beta \, \mathrm{KL}(\pi_\theta \| \pi_{\mathrm{ref}}), \tag{5} \] 其中 \(\tilde{\ell}_t^{(i)} = \min(\rho_t^{(i)} \hat{A}_i, \mathrm{clip}(\rho_t^{(i)}, 1-\epsilon, 1+\epsilon) \hat{A}_i)\) 是每token裁剪后的替代目标,\(m_t^{(i)} \in \{0,1\}\) 是补全掩码。分母通过有效(加权)token计数而非原始token计数进行归一化。 ### 3.3 SA-AH-GRPO:选择优势AH-GRPO SA-AH-GRPO通过*选择性地*应用熵折扣来解决上述问题:仅应用于组归一化优势为负的轨迹。令: \[ n_i = \mathbf{1}[\hat{A}_i < 0] \tag{6} \] 为负优势轨迹的指示变量。选择性权重为: \[ \tilde{w}_t^{(i)} = n_i \cdot w_t^{(i)} + (1-n_i) \cdot 1 = \begin{cases} w_t^{(i)} & \hat{A}_i < 0 \\ 1 & \hat{A}_i \geq 0 \end{cases} \tag{7} \] 则SA-AH-GRPO损失为: \[ \mathcal{L}_{\mathrm{SA}}(\theta) = -\frac{\sum_{i=1}^G \sum_{t=1}^{|o_i|} \tilde{w}_t^{(i)} \, \tilde{\ell}_t^{(i)} \, m_t^{(i)}}{\sum_{i=1}^G \sum_{t=1}^{|o_i|} \tilde{w}_t^{(i)} \, m_t^{(i)}} + \beta \, \mathrm{KL}(\pi_\theta \| \pi_{\mathrm{ref}}). \tag{8} \] SA-AH-GRPO将两种不同的学习信号解耦:(a) 成功轨迹的*增强*,在每个token上接收完整的未折扣梯度;(b) 不成功轨迹的*抑制*,其中折扣减少了高熵(高度不确定)token位置上的梯度。直觉是,当模型采样到一个错误的解时,该轨迹中的高熵位置是最*结构上不确定的*——这些位置在应该向哪个方向更新时最模糊,激进的梯度更新在那里可能适得其反。相反,当轨迹正确时,每个token——包括高熵token——都参与了产生有效答案的过程,应获得全部信用。 #### 与AH-GRPO的关系。 对所有 \(i\) 设置 \(n_i = 1\)(折扣所有轨迹)恢复为AH-GRPO。在AH-GRPO或SA-AH-GRPO中设置 \(\alpha = 0\) 恢复为标准GRPO。 ### 3.4 奖励函数 我们使用一个组合奖励,包含四个组成部分: \[ r(o, q, a^*) = r_{\mathrm{correct}}(o, a^*) + r_{\mathrm{format}}(o) + r_{\mathrm{present}}(o) + r_{\mathrm{steps}}(o), \tag{9} \] 其中: - • \(r_{\mathrm{correct}} \in \{-0.5, 0, 1.5, 4.0\}\): 提取的数值答案相对于真实答案 \(a^*\) 的正确性,对于接近正确的答案(在10%以内)给予部分信用。 - • \(r_{\mathrm{format}} \in \{-0.5, 0, 0.2, 0.3, 0.4, 0.5, 0.6, 0.7, 0.8, 1.0, 1.5\}\): 对结构化输出格式的遵守;任何重复标签为-0.5;完全正确的响应(所有四个标签都存在且格式良好)为1.5;否则为四个独立部分分数的和:<reasoning> 为+0.2,</reasoning> 为+0.3,<answer> 为+0.2,</answer> 为+0.3。 - • \(r_{\mathrm{present}} \in \{0, 0.3, 1.0\}\): <answer> 标签的存在(开+关为1.0,仅开为0.3,否则为0)。 - • \(
相似文章
STARE:惊奇度引导的令牌级优势重加权实现策略熵稳定性
STARE 通过引入惊奇度引导的令牌级优势重加权和目标熵调节,解决了基于GRPO的大语言模型强化学习中的策略熵崩溃问题,在AIME基准上实现了4%-8%的准确率提升。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。
ACPO:基于细粒度替代熵的自适应信用策略优化
介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。
组熵控制策略优化
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。