低方差奖励下群组相对优化中的优势尺度校准不平衡:诊断与有界恢复

arXiv cs.CL 论文

摘要

本文针对低方差奖励下群组相对优化中的优势尺度校准问题,提出了如Reward-Resolution Protocol和MaxNorm-AC等方法,以过滤亚分辨率抖动并为可信差距提供有界恢复。

arXiv:2609.19164v1 公告类型:新 摘要:在验证器风格的RLVR中,群组相对优化常将优势尺度视为实现细节。本文区分两种低方差情况:亚分辨率抖动,不应成为偏好信号;以及可信但小的基数差距,应在不扭曲KL校准的情况下学习。我们提出一种优势尺度三重校准接口:相同的群组内尺度分母同时决定奖励分支强度、提示级批权重,以及在原始基数尺度上重新表达奖励分支时诱导的有效KL校准。该接口解释了为何RLOO / Dr.GRPO会让可信的小差距被KL主导,而GRPO的标准差分母能无界放大微小差距。基于此接口,我们进一步引入Reward-Resolution Protocol和MaxNorm-AC,分别过滤亚分辨率差距,并为可信非零差距提供有界基数恢复。在稠密/MoE架构和数学/代码推理中,MaxNorm-AC在截断低方差逆尺度尾部的同时,优于最强的鲁棒尺度基线。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:52

# 低方差奖励下群组相对优化中优势规模校准不平衡问题的诊断与有界恢复
来源:https://arxiv.org/html/2609.19164
刘润豪¹ 张永康¹ 廖宇浩¹ 曾子健¹ 杨慧明¹

###### 摘要

在验证器式强化学习与可验证奖励(RLVR)中,群组相对优化常将优势规模视为实现细节。本文区分了两种低方差情形:不应成为偏好信号的亚分辨率抖动,以及无需扭曲KL校准即可学习的可信但较小的基数差距。我们提出了优势规模的三路校准接口:同一群组内规模分母同时决定奖励分支强度、提示级批处理权重,以及当奖励分支在原始基数尺度上重新表达时所诱导的有效KL校准。该接口解释了为何RLOO/Dr.GRPO可能让可信的小差距被KL主导,而GRPO的标准差分母可能无界放大小差距。基于此接口,我们进一步引入奖励分辨率协议(Reward-Resolution Protocol)与MaxNorm-AC算子,分别过滤亚分辨率差距,并在可信非零差距上提供有界基数恢复。在密集/MoE架构及数学/代码推理任务上,MaxNorm-AC优于预设百分位数规模参考值(p=90,此后称为p90参考),同时截断了低方差逆规模尾部。

¹ 阿里巴巴集团
² 清华大学

图1:两个低方差区间在一个奖励规模接口处暴露三种现有失效。对于亚分辨率抖动qₙ,GRPO将x=O(σₙ)恢复为O(1),但1/σₙ无一致界且在固定批处理中重新加权提示。对于可信小差距q_c,RLOO/Dr.GRPO的O(ε_c)奖励推动可能相对被固定KL主导。规模路径、弹簧与平衡器编码了无界放大、KL压力与批处理重加权;本方法未显示。

## 引言

在推理任务的验证器式RLVR训练中,群组相对优化通过同一提示的多个响应构建优势,并避免显式价值函数。我们区分两种低方差情形:亚分辨率差距是低于最小可信奖励分辨率的数值抖动,不应作为偏好信号使用。可信的低方差差距可能源于部分得分、过程质量(Wang等,2026b;Yue等,2025)、置信度或错误严重性;此类差距应被学习,但其规模需校准。奖励分辨率协议在任何群组相对更新前首先合并亚分辨率差距,并跳过零差距组的奖励与KL更新。

在此协议之后,我们关注组内可信但非零的小型奖励差距。在此区间中,提示级规模是一个三路接口:它设定奖励分支强度、该提示所见的KL校准以及该提示在批处理内的权重。因此标准差归一化并非普通预处理。若无规模恢复,RLOO/Dr.GRPO可能在奖励信号减弱时被KL主导;使用标准差恢复时,GRPO恢复了信号但引入无界放大、有效KL失衡,以及当组内标准差趋近零时的提示级重加权。图1将这三种现有失效映射到一台规模机器的传动轴、固定KL弹簧与批处理平衡器;我们的有界恢复则单独在图2中展示。

本文将低方差群组相对更新识别为一个三路规模校准接口,并给出一个最小有界基数算子,该算子仅替换组内规模分母。此最小干预保持KL正则化、策略比率、裁剪、token聚合与长度归一化不变,使机制更易归因、证据更可审计、实际迁移成本更低。MaxNorm-AC用奖励分辨率下限下的最大绝对原始优势替换标准差分母,并将结果冻结为当前优化步骤的损失权重,从而联合约束奖励放大、有效KL下界与提示级权重尾部;精确边界在下文理论部分总结。主要实例MaxNorm-RLOO仅是附加此有界规模算子的一种方式。若奖励幅度不可信且仅组内排序可靠,则本方法的适用性假设不再成立;纯排序方法应被视为外部边界,而非本论文确立其优越性的对象。完全相同的组内奖励同样是信号构造边界而非规模校准情况。

贡献如下:
- 据我们所知,我们首次将RLVR中的组内分母表述为统一的规模校准问题,包含三种失效模式:亚分辨率抖动的O(1)放大、可信小非零差距的O(ε)奖励分支衰减、以及由1/s_q诱导的提示级批处理重加权;因此该分母应共同保留可信基数差距、抑制亚分辨率抖动,并控制KL校准与提示级重加权;
- 我们提出奖励分辨率协议,通过有界分箱、死区与零差距跳过,在所有群组相对更新前分离亚分辨率噪声与可信基数差距;
- 我们提出KL校准的有界规模作为诊断准则,并使用MaxNorm-AC作为验证它的最小有界干预;该算子仅替换组内规模分母,保持KL正则化、策略比率、裁剪、token聚合与长度归一化不变;
- 我们提供涵盖密集/MoE架构与数学/代码RLVR的真实基准测试,与预设p90参考值、MAD、Huber、GRPO+β_q-comp及REINFORCE++对比,并通过受控亚分辨率诊断、逆规模、奖励/KL梯度比、方向余弦与KL P95验证机制。

## 背景与相关工作

本文研究无价值函数的群组相对策略优化。RLOO使用留一法REINFORCE基线(Ahmadian等,2024);GRPO通过组内标准差对中心化奖励进行归一化(Shao等,2024);Dr.GRPO移除该标准差归一化并固定长度归一化(Liu等,2025c);REINFORCE++使用全局优势归一化(Hu等,2025);DAPO通过系统级方案(如动态采样与token级损失)扩展GRPO风格训练(Yu等,2025)。这些工作使优势分母成为核心算法选择而非简单记录。

相关工作研究难度偏差、群组加权、KL放置、齐次奖励、奖励损坏、零方差信号构造、轨迹级校正、难例选择及多目标/负例流程(Fontana等,2026;Yao等,2026;Liu等,2025a;He等,2026b;Mansouri等,2026;Le等,2026;Pang、Luo与Jin,2026;Pikus、Tiwari与Ye,2025;Li等,2025;Liu与Xiao,2026)。近期的GRPO设计空间研究(包括λ-GRPO、混合GRPO、MEML-GRPO、步进/谱式策略优化、尖锐度引导GRPO及在/离策略GRPO分析)重塑token偏好、滚动构造、监督或更新尖锐度,而非为可信低方差基数差距提供固定有界分母(Wang等,2025;Sane,2025;Jia等,2025;Chen等,2026;Le、Van与Le,2026;Mroueh等,2025)。RLVR的计算监督分析进一步激励将验证器质量、奖励可靠性与滚动结构视为学习问题的一部分(Mitsuhashi等,2026)。排序/列表目标、鲁棒规模与有界比率更新是重要边界或基线(Choi等,2026;Xiao、Zhang与Cao,2025;Zeng等,2026;Ao等,2026)。鲁棒规模分母(如预设p90参考值、MAD、Huber与标准差下限)可缓解离群规模或逆规模尾部,但无法同时满足我们提出的三路规模校准约束。我们更窄的目标是*有界基数优势校准*:在明确控制归一化优势、有效KL下界与提示权重尾部的同时保留可信奖励差距。详细定位见补充材料。

## 问题设定:低方差奖励困境

在基于群组的大语言模型强化学习中,常见做法是为同一提示采样多个响应,并从同一组响应的奖励构建相对优势。本文不研究所有组内学习算法,而是聚焦于更具体的问题:在奖励差距可信、低方差但非零的验证器式RLVR中,群组相对优势是否应除以标准差?标准差是否是合适的分母?

#### 统一符号。
设r_{q,i}为提示q的第i个响应的奖励,\(\bar{r}_q\)与\(\sigma_q\)为组均值与标准差,\(x_{q,i}=r_{q,i}-\bar{r}_q\)为中心化奖励。为避免符号过载,我们使用u_{q,i}表示原始分子,c_{q,i}=u_{q,i}/s_q表示规模校准优势,w_{q,i}=\operatorname{sg}(c_{q,i})表示冻结的损失权重:

u_{q,i} \displaystyle u_{q,i} \quad \text{原始分子}, \quad c_{q,i} \displaystyle c_{q,i}=u_{q,i}/s_q, \quad w_{q,i} \displaystyle w_{q,i}=\operatorname{sg}(c_{q,i}).

仅w_{q,i}进入策略梯度损失。GRPO使用A^{\mathrm{std}}_{q,i}=x_{q,i}/\sigma_q,其中\(\sigma_q=(G^{-1}\sum_j (r_{q,j}-\bar{r}_q)^2)^{1/2}\)。RLOO使用a^{\mathrm{RLOO}}_{q,i}=r_{q,i}-(G-1)^{-1}\sum_{j\neq i}r_{q,j}\)。因此主要问题是规模选择:RLOO/Dr.GRPO保留原始差距但可能遭遇信号耗竭,而GRPO恢复幅度但引入依赖提示的权重1/\sigma_q。MaxNorm-AC在约束该权重的同时保留可信基数差距;MaxNorm-RLOO将该算子应用于RLOO分子。

## 无标准差除法:RLOO/Dr.GRPO与信号耗竭

RLOO自然源于带留一法基线的REINFORCE,并非GRPO变体。若组均值包含当前样本,a^{\mathrm{RLOO}}_{q,i}=\frac{G}{G-1}(r_{q,i}-\bar{r}_q),因此RLOO分子与中心化GRPO分子具有相同符号、排序与方向;推导见补充材料。核心区别在于中心化信号是否除以\(\sigma_q\)。移除该分母可避免随机提示重加权,但在低方差奖励下也可能使奖励分支过于微弱。

## 信号耗竭的后果:KL主导与策略退化

若同一提示下的可信奖励差距很小,原始RLOO/Dr.GRPO优势也会变小。对于r=[0.51,0.50,0.49,0.50],RLOO优势约为[0.0133,0,-0.0133,0]。带KL正则化的更新可抽象为

g_{\mathrm{total}}=g_R-\beta g_{\mathrm{KL}}. \tag{1}

当低方差使\|g_R\|低于\beta\|g_{\mathrm{KL}}\|时,总方向更接近-g_{\mathrm{KL}},更新主要减小当前策略与参考策略间的KL,而非沿改进任务奖励的方向移动。此现象非常态平台期:若策略偏离参考的方向正是获得推理收益的方向,KL主导的更新可能将模型拉回参考模型,表现为准确率或奖励下降伴KL降低。

因此,避免规模恢复虽防止GRPO分母爆炸,却暴露了相反失效模式:可信的低幅度差距可能无法提供足够强的奖励信号。梯度范数界与KL降低条件见补充材料。

## KL主导与性能退化的等效解释

设g_R为未衰减奖励梯度,g_{\mathrm{KL}}为KL梯度。若可信低方差信号将奖励分支缩小至\alpha g_R,0<\alpha<1,则总更新方向为

g_{\alpha}=\alpha g_R-\beta g_{\mathrm{KL}}=\alpha\left(g_R-\frac{\beta}{\alpha}g_{\mathrm{KL}}\right). \tag{2}

因此,就整体正缩放不改变方向而言,低方差信号衰减等效于将KL系数增至

\beta_{\mathrm{eff}}=\frac{\beta}{\alpha}. \tag{3}

若\alpha\|g_R\|<\beta\|g_{\mathrm{KL}}\|,更新更接近-g_{\mathrm{KL}},可在减小至参考KL的同时降低任务性能。我们仅用此作为局部诊断;严格的小步证明见补充材料。

## 标准差归一化:信号恢复与规模重标

标准差归一化可恢复低方差信号,但它恢复的是重新校准的代理目标而非原始基数奖励目标本身。对于单个提示q,设g_{R,q}^0为无标准差除法的基数奖励梯度,g_{\mathrm{KL},q}为KL梯度,s_q为组内规模分母。GRPO式更新可写为

g_q^{\mathrm{GR}}=\frac{1}{s_q}g_{R,q}^0-\beta g_{\mathrm{KL},q}=\frac{1}{s_q}\left(g_{R,q}^0-\beta s_q g_{\mathrm{KL},q}\right). \tag{4}

若s_q趋近零,有效KL系数β s_q趋近零,但1/s_q趋近无穷,同时放大奖励与提示权重。

相似文章

偏好优化的归一化奖励

arXiv cs.LG

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

校准内容如何塑造基于注意力的重排序

arXiv cs.CL

本文展示,基于注意力的重排序中的校准内容在详细指令下可能降低性能,并提出插值空校准作为一种无需训练的方法,以在指令密集的任务上恢复排名。

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

校准偏好学习:以标签排序为例

arXiv cs.LG

本文形式化了概率标签排序的校准定义,引入了校准概念的层次结构,并表明常见模型校准不佳。进一步展示了在RLHF奖励模型中的应用,其中校准与准确性相关但不完全相同。