@msjgriffiths: 哦,真有意思。过去一年我一直有个疑问:GRPO(一种简单的方法)应该与斯坦因悖论有关……
摘要
本文提出了基于可验证奖励的收缩基线方法,用于强化学习领域,以此降低策略梯度估计器的方差并提升训练稳定性。
查看缓存全文
缓存时间: 2026/09/08 15:34
哦,真有意思。过去一年里我一直有个疑问:GRPO这种简单方法其实与斯坦因悖论存在关联。结果发现早在我就有这个想法之前,已经有人建立了这种联系了:https://t.co/O42JW1T7jp https://t.co/b063epS9YF — # 减少方差:基于可验证奖励的强化学习收缩基线 方法来源:https://arxiv.org/html/2511.03710 作者:Zhaoyi Zhou 所属机构:卡内基梅隆大学 Daman Arora 所属机构:卡内基梅隆大学 Andrea Zanette 所属机构:卡内基梅隆大学 邮箱联系地址:[email protected] ###### 摘要 基于可验证奖励的强化学习(RLVR)作为一种强大的范式,能够利用GRPO等策略梯度方法对大型推理模型(LRM)进行训练后优化。为稳定训练过程,这些方法通常会通过减去每个提示的实证均值来对轨迹奖励进行居中处理。从统计学角度来看,这种居中操作相当于一种控制变量或基线,能够降低策略梯度估计量的方差。通常情况下,均值奖励是通过批量中每个提示的实证平均值来估算的。受到斯坦因悖论的启发,我们提出了使用收缩估计量,通过结合单个提示的均值与跨多个提示的均值,从而提升整体单个提示均值的估算精度——尤其是在RLVR常见的低生成次数场景下。从理论上讲,我们构建了一种基于收缩的基线,能够证明该基线可在各类算法中产生更低方差的策略梯度估计量。我们所提出的基线可直接替代现有的单个提示均值基线,无需额外的超参数或计算开销。实证结果表明,收缩基线的性能始终优于传统的实证均值基线,不仅能降低梯度更新的方差,还能提升训练稳定性。 ###### 关键词:强化学习、最大似然估计、大型语言模型、推理 ††机构说明:\icml理论贡献## 1 引言 如OpenAI-o1(OpenAI,2024年(https://arxiv.org/html/2511.03710#bib.bib16))和DeepSeek-R1(Guo等人,2025年(https://arxiv.org/html/2511.03710#bib.bib1))这类大型推理模型所展现出的出色推理能力,充分体现了强化学习技术在模型训练后的优化作用。而在推理模型微调方面,基于可验证奖励的强化学习(RLVR)是一种尤为有效的范式——在这种方法中,模型会通过基于规则的稀疏标量奖励来优化自身表现,这些奖励能够明确指示模型最终答案的正确性。对于那些需要明确且可验证的逻辑推理任务,比如数学或逻辑推理问题,RLVR风格的训练方式展现出了巨大的潜力。RLVR常用的方法包括REINFORCE(Williams,1992年(https://arxiv.org/html/2511.03710#bib.bib22))以及GRPO(Shao等人,2024年(https://arxiv.org/html/2511.03710#bib.bib3))等更现代的策略梯度方法,这些方法通过随机梯度估计来最大化预期奖励。策略梯度方法面临的一个众所周知的挑战是,这类梯度估计量的方差较高(Sutton和Barto,2018年(https://arxiv.org/html/2511.03710#bib.bib5)),这会阻碍训练的稳定性。为了解决这一问题,强化学习方法引入了基线——在统计学中被称为控制变量——即通过对奖励进行与状态相关的调整,在不引入偏差的情况下降低梯度的方差(Sutton等人,1998年(https://arxiv.org/html/2511.03710#bib.bib36);Greensmith等人,2004年(https://arxiv.org/html/2511.03710#bib.bib29))。最常用的基线是价值函数,它被定义为在当前策略下,从给定状态或RLVR中的初始状态出发所能获得的预期回报。尽管价值函数只是一种启发式方法,并非理论上最优的基线,但由于其估算较为简单,同时又能显著降低方差,因此被广泛采用(Sutton和Barto,2018年(https://arxiv.org/html/2511.03710#bib.bib5))。通常情况下,价值函数本身是未知的,需要通过估算才能获得。价值函数估算方法大致可分为两类:传统强化学习方法会引入一个辅助神经网络来近似计算价值函数(Barto等人,1989年(https://arxiv.org/html/2511.03710#bib.bib25);Mnih等人,2016年(https://arxiv.org/html/2511.03710#bib.bib26);Haarnoja等人,2018年(https://arxiv.org/html/2511.03710#bib.bib27);Schulman等人,2015a年(https://arxiv.org/html/2511.03710#bib.bib28);Schulman等人,2017年(https://arxiv.org/html/2511.03710#bib.bib2))。如果调整得当,这种策略确实有效,但也存在诸多实际问题:对超参数的敏感度较高,工程实现复杂,还需要额外训练和维护一个网络来降低方差。与之相比,近期的推理模型方法——包括GRPO(Shao等人,2024年(https://arxiv.org/html/2511.03710#bib.bib3))、RLOO(Ahmadian等人,2024年(https://arxiv.org/html/2511.03710#bib.bib13))、ReMax(Li等人,2023年(https://arxiv.org/html/2511.03710#bib.bib15))、REINFORCE++(Hu,2025年(https://arxiv.org/html/2511.03710#bib.bib14))、DAPO(Yu等人,2025年(https://arxiv.org/html/2511.03710#bib.bib17)以及CISPO(MiniMax,2025年(https://arxiv.org/html/2511.03710#bib.bib43))——则不再采用显式的价值函数近似方法。相反,它们直接从蒙特卡洛回报中构建基线,通常使用每个提示的生成响应的实证平均值。这种方式避免了额外网络的开销,能够得到无偏或接近无偏的估计结果,因此非常适合大型推理模型。不过,与传统领域相比,基于大语言模型的强化学习训练通常会使用较大的批量大小,但由于推理成本较高,每个提示的迭代次数却相对较少。即便在工业级的大语言模型训练中(Guo等人,2025年(https://arxiv.org/html/2511.03710#bib.bib1);DeepSeek-AI等人,2025年(https://arxiv.org/html/2511.03710#bib.bib60)),每个提示的迭代次数也往往仅限于16次或更少。这就带来了一个新的挑战:当样本数量较小时,准确估算基线本身就会变得十分困难。在这项工作中,我们重新探讨了RLVR中价值函数估算的问题。虽然单个提示的样本均值是一种无偏估计量,但它会将每个提示视为独立个体。如果我们意识到价值函数需要同时基于批次中的所有提示来估算,那么就可以构建出一种价值函数乃至梯度的估计量,其均方误差会显著更低。具体而言,我们提出了一种受经典James–Stein收缩原理启发的新基线估计器(James等人,1961年(https://arxiv.org/html/2511.03710#bib.bib7);Stein等人,1956年(https://arxiv.org/html/2511.03710#bib.bib9))。这种估计器通过用少量的基线偏差来换取整体效率的提升,从而降低方差。关键的是,尽管使用了有偏的基线,最终的策略梯度估计量仍然保持无偏,并且在标准假设下其方差能够得到证明性的降低。我们提出的基线无需额外的超参数,可以直接替代现有的无评论家强化学习方法。它完全基于频率主义原理,无需对任务难度、训练数据分布或模型架构做任何假设。更重要的是,这种收缩基线的计算开销极低。在多种模型、任务和迭代设置下的大量实验表明,收缩基线估计量在降低方差方面始终优于其他常见的基线。此外,我们还观察到策略梯度方差出现了显著下降,这一结果与我们的理论预测一致。 ## 2 基础知识 让πθ\pi_{\theta}表示由θ\theta参数化的语言模型。给定来自分布D\mathcal{D}的提示xx,模型会输出响应y∼πθ(⋅∣x)y\sim\pi_{θ}(\cdot\mid x),并会收到一个确定的、可验证的奖励r(x,y)r(x,y\)——比如数学任务中的正确性得分。强化学习的目标是最大化预期奖励J(θ):=Ex∼D,y∼πθ(⋅∣x)[r(x,y)]\。\displaystyle J(θ):=\mathbb{E}_{x\sim\mathcal{D},y\sim\pi_{θ}(\cdot\mid x)}[r(x,y)]\。传统的REINFORCE算法(Williams,1992年(https://arxiv.org/html/2511.03710#bib.bib22))会将策略梯度表示为∇θJ(θ)=Ex∼D,y∼πθ(⋅∣x)[r(x,y)∇θlogπθ(y∣x)],\displaystyle\nabla_{θ}J(θ)=\mathbb{E}_{x\sim\mathcal{D},y\sim\pi_{θ}(\cdot\mid x)}[r(x,y)\nabla_{θ}\log\pi_{θ}(y\mid x)],这样就可以仅通过一个在线样本来估算梯度:gvanilla(x,y,θ)=r(x,y)∇θlogπθ(y∣x))。\n\displaystyle g^{\mathrm{vanilla}}(x,y;θ)=r(x,y)\nabla_{θ}\log\pi_{θ}(y\mid x))。为了进一步降低梯度方差,同时保持梯度无偏,还可以添加一个与提示相关的标量基线b(x)∈Rb(x)\in\mathbb{R}\)(Sutton等人,1998年(https://arxiv.org/html/2511.03710#bib.bib36)):gbaseline(x,y,θ):=(r(x,y)−b(x))∇θlogπθ(y∣x))。\n\displaystyle g^{\mathrm{baseline}}(x,y;θ):=(r(x,y)-b(x))\nabla_{θ}\log\pi_{θ}(y\mid x))。更多的样本则能进一步降低方差。因此,在每个强化学习步骤中,通常会从D\mathcal{D}中采样n个提示x=(x1,…,xn)\textstyle\mathbf{x}=(x_{1},\ldots,x_{n})i。对于每个提示xix_{i},模型会基于πθ(⋅∣xi)\pi_{θ}(\cdot\mid x_{i})生成mm个响应yi=(yi1,…,yim)\textstyle\mathbf{y}_{i}=(y_{i}^{1},\ldots,y_{i}^{m}),对应的奖励为rij:=r(xi,yij)\textstyle r_{i}^{j}:=r(x_{i},y_{i}^{j})。令Y=(y1,…,yn)\textstyle\mathbf{Y}=(\mathbf{y}_{1},\ldots,\mathbf{y}_{n})。策略梯度可以通过g(x,Y,θ):=1nm∑i,j(rij−bij)∇θlogπθ(yij|xi))来估算。\n\displaystyle\boxed{g(\mathbf{x},\mathbf{Y};θ)\;:=\;\tfrac{1}{nm}\textstyle\sum_{i,j}(r_{i}^{j}-b_{i}^{j})\nabla_{θ}\log\pi_{θ}(y_{i}^{j}|x_{i})\。}(1)这里bijb_{i}^{j)是样本(xi,yij)(x_{i},y_{i}^{j})的基线。通常这里的基线是与提示相关的,但我们也允许使用基于单个奖励的基线,以便实现RLOO(Ahmadian等人,2024年(https://arxiv.org/html/2511.03710#bib.bib13))这类留一估计器。RLOO是通过平均除正在被估算的奖励之外的同一提示的其他奖励来计算每个基线,从而确保bijb_{i}^{j}与rijr_{i}^{j}相互独立,进而实现无偏性。基线的另一个要求是无偏性。正如命题1(https://arxiv.org/html/2511.03710#Thmproposition1)和方程1(https://arxiv.org/html/2511.03710#S2.E1)所示,只要对于所有的1≤i≤n,1≤j≤m1\leq i\leq n,1\leq j\leq m,bijb_{i}^{j}与rijr_{i}^{j}是独立的,那么方程1(https://arxiv.org/html/2511.03710#S2.E1)给出的就是策略梯度∇θJ(θ)\nabla_{θ}J(θ)的无偏估计。\n###### 命题1(无偏性)。假设对于所有的i,ji,j,bijb_{i}^{j}与yijy_{i}^{j}是独立的,那么g(x,Y,θ)g(\mathbf{x},\mathbf{Y};θ)是无偏的,即E[g(x,Y,θ)]=∇θJ(θ)\mathbb{E}[g(\mathbf{x},\mathbf{Y};θ)]=\nabla_{θ}J(θ)。其证明详见章节A.1(https://arxiv.org/html/2511.03710#A1.SS1)。带有基线的REINFORCE其实是方程1(https://arxiv.org/html/2511.03710#S2.E1)的一种特例,此时n=m=1。除了这种基本形式之外,还有多种实用的算法被开发出来用于提升训练稳定性。PPO(近端策略优化)(Schulman等人,2017年(https://arxiv.org/html/2511.03710#bib.bib2))由于具有防止策略更新幅度过大的截断机制,被广泛用于语言模型的RLHF流程中。它的定义如下:首先需要定义优势估计量Ai,j,tA_{i,j,t},其具体形式可另行指定。JPPO(θ)=1nm∑i,j1|yij|∑t=1|yij|min(ρtAt,clip(ρt,1±ε)At),\displaystyle\textstyle\mathcal{J}_{\mathrm{PPO}}(θ)=\tfrac{1}{nm}\sum_{i,j}\tfrac{1}{|y_{i}^{j}|}\sum_{t=1}^{|y_{i}^{j}|}\min\bigl(\rho_{t}A_{t},\,\mathrm{clip}(\rho_{t},1\pm\epsilon)\,A_{t}\bigr),其中ρt=πθ(yi,tj∣xi,yi,0\delta>0,用于避免除以零的情况:Ai,jGRPO=(rij−μi)/(σi+δ),\displaystyle\textstyle A_{i,j}^{\mathrm{GRPO}}=(r_{i}^{j}-\mu_{i})/(\sigma_{i}+\delta),其中μi=1m∑j=1mrij,σi=1m∑j=1m(rij−μi)2。\n\displaystyle\textstyle\mu_{i}=\tfrac{1}{m}\sum_{j=1}^{m}r_{i}^{j},\quad\sigma_{i}=\sqrt{\tfrac{1}{m}\sum_{j=1}^{m}(r_{i}^{j}-\mu_{i})^{2}}。最近的研究表明,除以σi\sigma_{i}会导致目标函数出现偏差(Liu等人,2025年(https://arxiv.org/html/2511.03710#bib.bib18)),且无法提升实证性能,因此可以省略这一操作(DeepSeek-AI等人,2025年(https://arxiv.org/html/2511.03710#bib.bib60);Khatri等人,2025年(https://arxiv.org/html/2511.03710#bib.bib8))。 ## 3 方法的推导 ### 3.1从策略梯度方差到价值函数估算器 强化学习基线的核心作用是充当控制变量,从而降低策略梯度估计量的方差。基线bb的选择应当能够最小化方程1(https://arxiv.org/html/2511.03710#S2.E1)中梯度估计量的方差。由于g(x,Y,θ)g(\mathbf{x},\mathbf{Y};θ)是向量形式的,其方差自然可以用协方差矩阵Var[g(x,Y,θ)]\mathrm{Var}[g(\mathbf{x},\mathbf{Y};θ)]来表示。一个常见的标量度量方式是该矩阵的迹,即各分量方差的之和,它本质上等同于估计量的均方误差:Var[g]\displaystyle\textstyle\mathrm{Var}[g]:=Tr(Var[g(x,Y,θ)])\displaystyle\textstyle:=\mathrm{Tr}(\mathrm{Var}[g(\mathbf{x},\mathbf{Y};θ)])=E[‖g(x,Y,θ)−∇θJ(θ)‖22]\。\n\displaystyle\textstyle=\mathbb{E}[\|g(\mathbf{x},\mathbf{Y};θ)-\nabla_{θ}J(θ)\|_{2}^{2}]\。(2)一般来说,对于给定的提示xx,降低方差的最优基线取决于得分函数∇θlogπθ(y∣x)\nabla_{θ}\log\pi_{θ}(y\mid x)的平方范数,而计算该得分函数通常成本较高(Greensmith等人,2004年(https://arxiv.org/html/2511.03710#bib.bib29))。正因如此,文献中通常会采用一种简化的处理方式:忽略对得分函数的依赖,直接寻找一个能够最小化基线估计量相对于观测奖励的均方误差的基线函数b(x)b(x)。换句话说,从理论上讲,应当选择一个基线bb,使得所有状态xx的总体均方误差最小:μ(x)=argminbE[(r(x,y)−b(x))2]\。\n\displaystyle\textstyle\mu(x)=\argmin_{b}\mathbb{E}[(r(x,y)-b(x))^{2}]\。(3)最优的基线其实就是价值函数,即当前策略下奖励的贝叶斯最优预测器:μ(x):=Ey∼πθ(⋅∣x)[r(x,y)],∀x。\n\textstyle\mu(x):=\mathbb{E}_{y\sim\pi_{θ}(\cdot\mid x)}[r(x,y)],\quad\forall x。价值函数基线已成为强化学习中降低方差的标准方法(Sutton和Barto,2018年(https://arxiv.org/html/2511.03710#bib.bib5)),它也是传统演员-评论家方法(例如A3C(Mnih等人,2016年(https://arxiv.org/html/2511.03710#bib.bib26))、SAC(Haarnoja等人,2018年)的核心理论基础。
相似文章
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
GRAIL:面向可验证奖励强化学习的梯度重加权优势方法
GRAIL 引入了梯度重加权优势,以改进 LLM 推理强化学习中的 token 级信用分配,在多个模型上优于 GRPO。
@neural_avb: 今年早些时候发布的这篇后训练文章完全被我忽略了。强烈推荐给我的GRP…
推荐一篇关于GRPO/RLVR的后训练文章,该文章今年早些时候被忽视,适合对基于可验证奖励的强化学习感兴趣的人。
@probablynotaz9: ICML 单作者论文警报:是否曾想用经典策略梯度对扩散 LLM 进行后训练,而无需……
这篇 ICML 单作者论文介绍了摊销式组相对策略优化(AGRPO),旨在为扩散语言模型实现高效的强化学习后训练。
不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。