GUPO:梯度不确定性感知策略优化用于大语言模型后训练
摘要
本文提出了GUPO,一种梯度不确定性感知策略优化方法,通过使用贝叶斯方法建模梯度不确定性来处理组间梯度冲突,从而改进大语言模型的后训练。
arXiv:2608.17411v1 Announce Type: new
摘要:群组相对策略优化(GRPO)已成为推理大语言模型后训练的一种广泛使用的方法。在GRPO中,同一小批次中由不同查询引起的群组梯度被直接平均以形成策略更新。然而,这些群组梯度可能指向冲突的方向。我们的实证分析表明,群组梯度冲突往往与效果较差的策略更新相关,这促使需要在冲突下获得可靠的聚合更新方向。标准的GRPO聚合将实现的群组梯度视为确定性贡献,未考虑聚合过程中可靠性的差异。为了解决这个问题,我们提出了梯度不确定性感知策略优化(GUPO),它在贝叶斯公式下将每个群组梯度建模为一个随机变量,并估计其概率分布。然后,GUPO使用基于狄利克雷(Dirichlet)的公式推导梯度不确定性,并用它在聚合期间校准每个群组梯度的贡献。在多个基准上的大量实验表明了GUPO的有效性。
查看缓存全文
缓存时间: 2026/08/19 10:28
# GUPO:基于梯度不确定性的策略优化方法,用于大语言模型后训练
来源:https://arxiv.org/html/2608.17411
作者:Jianqi Zhang, Xingyu Zhang, Yun Fan, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang\\corresponding
###### 摘要
群体相对策略优化(GRPO)已成为用于大语言模型(LLM)推理能力后训练的广泛采用的方法。在GRPO中,同一小批量内由不同查询引发的群体梯度被直接平均以形成策略更新。然而,这些群体梯度可能指向相互冲突的方向。我们的实证分析表明,群体梯度冲突往往与效果较差的策略更新相关,这促使我们需要一个在冲突情况下可靠的聚合更新方向。标准的GRPO聚合将已实现的群体梯度视为确定性贡献,而在聚合过程中未考虑其可靠性的差异。为了解决这个问题,我们提出了基于梯度不确定性的策略优化(GUPO),该方法在贝叶斯框架下将每个群体梯度建模为随机变量并估计其概率分布。GUPO随后使用基于狄利克雷的公式推导梯度不确定性,并利用它来校准聚合过程中每个群体梯度的贡献。在多个基准上的大量实验证明了GUPO的有效性。
## 引言
大语言模型(LLM)在语言理解、文本生成和复杂推理方面展现出强大的能力(7 (https://arxiv.org/html/2608.17411#bib.bib2);9 (https://arxiv.org/html/2608.17411#bib.bib3);17 (https://arxiv.org/html/2608.17411#bib.bib5);29 (https://arxiv.org/html/2608.17411#bib.bib4))。基于强化学习的后训练,特别是群体相对策略优化(GRPO)(27 (https://arxiv.org/html/2608.17411#bib.bib1)),已成为进一步提升LLM推理能力的重要方法。对于每个查询,GRPO采样一组响应,从其奖励中推导出群体相对优势,并使用这些优势来加权token级策略梯度项。由此产生的梯度贡献被聚合以更新策略参数。参见标题图1:梯度不确定性和冲突的解释。来自同一GRPO小批量的两个群体梯度的二维示例。参见标题(a)低冲突小批量 参见标题(b)高冲突小批量 (c)冲突分布(d)冲突与性能 图2:GRPO中群体梯度冲突的实证结果。(a)和(b)显示了具有低和高冲突水平的代表性小批量的成对余弦相似度矩阵。(c)呈现了群体梯度间成对余弦相似度的分布。(d)比较了低、中、高冲突率小批量上的验证集ΔNLL。在GRPO中,对于每个查询,其采样响应组引发的梯度被聚合成一个群体梯度,代表该查询组对小批量更新的贡献。然后通过对所有查询的群体梯度取平均来获得小批量梯度,如图3所示(https://arxiv.org/html/2608.17411#Sx1.F3)(12 (https://arxiv.org/html/2608.17411#bib.bib15);23 (https://arxiv.org/html/2608.17411#bib.bib16);22 (https://arxiv.org/html/2608.17411#bib.bib17);5 (https://arxiv.org/html/2608.17411#bib.bib18))。基于这种更新机制,我们观察到一个有趣的现象:同一小批量内由不同查询引发的群体梯度可能指向相互冲突的方向。具体而言,对于每个小批量,我们计算群体梯度并量化其成对的方向冲突。然后我们分析梯度冲突与相应策略更新有效性之间的关联。如图2所示(https://arxiv.org/html/2608.17411#Sx1.F2),在某些小批量中群体梯度基本对齐,而在其他小批量中则出现明显的方向冲突。冲突严重的小批量往往表现出有限的验证集更新增益。这激发了本文的核心问题:当同一GRPO小批量内由不同查询引发的群体梯度发生冲突时,我们如何获得一个可靠的聚合更新方向?在此背景下,一个可靠的更新方向可以被理解为合理反映小批量所支持的总体优化趋势的方向,而不是过度受少数冲突梯度的影响。梯度不确定性为评估这种聚合中不同群体梯度的可靠性提供了一个可能的基础(13 (https://arxiv.org/html/2608.17411#bib.bib32);1 (https://arxiv.org/html/2608.17411#bib.bib30))。具体来说,群体梯度可以被视为随机变量,并表示为描述可能的梯度值范围及其可能性的概率分布。如果分布集中,其大部分概率质量位于均值附近的狭窄范围内,表明分布所支持的梯度值相似。这些值之间的有限变化对应于较低的梯度不确定性和较高的可靠性。如果分布更分散,其概率质量则延伸到更广泛的、差异显著的梯度值范围。这些值之间的较大变化对应于较高的梯度不确定性和较低的可靠性。图1提供了一个二维示例以作说明。g1和g2代表两个查询组的平均梯度,而周围的等高线代表它们的概率分布。g1的分布将更多的概率质量集中在平均梯度附近,对应于较低的不确定性和较高的可靠性。相比之下,g2的分布覆盖了更广泛的梯度值范围,对应于较高的不确定性和较低的可靠性。直接聚合为两个群体梯度分配相等的系数,而未考虑这种可靠性的差异。因此,更不确定的群体梯度可能对直接聚合的方向gda施加过度的影响。基于此分析,我们提议显式地建模群体梯度不确定性并将其纳入梯度聚合,在梯度冲突发生时强调更可靠的群体梯度,同时减弱不那么可靠的梯度的影响,以期获得可靠的更新方向。为此,我们提出了基于梯度不确定性的策略优化(GUPO),显式建模每个小批量内群体梯度的不确定性以实现可靠的策略更新。我们不将每个群体梯度仅仅视为确定性向量,而是将其建模为由概率分布表示的随机变量。具体来说,在贝叶斯框架下(11 (https://arxiv.org/html/2608.17411#bib.bib20);6 (https://arxiv.org/html/2608.17411#bib.bib19)),我们首先估计每个群体梯度的概率分布。然后将所得分布的精度映射为梯度证据。根据主观逻辑中证据、信念和不确定性之间的关系(16 (https://arxiv.org/html/2608.17411#bib.bib21);4 (https://arxiv.org/html/2608.17411#bib.bib22);26 (https://arxiv.org/html/2608.17411#bib.bib23)),我们通过基于狄利克雷的证据公式推导出每个群体梯度的逐维信念和整体不确定性。由此产生的群体级不确定性被纳入梯度聚合,增加低不确定性群体梯度的相对贡献,同时减弱高不确定性梯度的贡献。通过这种方式,GUPO旨在缓解高度不确定梯度的过度影响,并在群体梯度冲突发生时获得更可靠的聚合更新方向。在多个基准上的实验表明了我们方法的有效性。主要贡献可总结如下:(i) 我们识别了同一GRPO小批量内由不同查询引发的群体梯度之间的方向冲突,并实证表明冲突可能与效果较差的策略更新相关,从而引出了获取可靠聚合更新方向的问题。(ii) 我们从梯度不确定性的角度分析了这个问题,并提出了GUPO,它在贝叶斯框架下将每个群体梯度建模为概率分布,通过基于狄利克雷的证据公式推导其不确定性,并将所得不确定性纳入梯度聚合。(iii) 跨多个基准的大量实验证明了GUPO的有效性,表明将群体梯度不确定性纳入策略优化可以改善基于GRPO的后训练。参见标题图3:GRPO梯度优化过程示意图。
## 相关工作
#### LLM后训练中的梯度冲突
强化学习已成为LLM后训练的重要方法,其中GRPO(27 (https://arxiv.org/html/2608.17411#bib.bib1))因其能提升推理能力而被广泛研究。然而,GRPO优化过程中产生的不同梯度可能导致方向不兼容,从而干扰有效的策略更新。近期研究从优化过程的不同层面调查了基于GRPO后训练中的此类梯度冲突。DaGRPO(30 (https://arxiv.org/html/2608.17411#bib.bib24))研究了滚动组内的冲突,将其与采样响应间区分度不足联系起来,并应用序列级梯度校正。PCR(24 (https://arxiv.org/html/2608.17411#bib.bib26))研究了GRPO中可塑性与稳定性梯度之间的冲突,并通过概率投影来解决。ResRL(19 (https://arxiv.org/html/2608.17411#bib.bib25))分析了正负响应之间的梯度干扰,并使用投影残差调制负梯度。这些研究表明梯度冲突可能源于不同来源和不同粒度。与先前工作不同,我们关注同一GRPO小批量内与不同查询相关的群体梯度之间的冲突,并从梯度不确定性的角度进行分析。我们提出了一个优化框架,显式表征这些查询级群体梯度的不确定性,并在小批量梯度聚合中校准它们的贡献。
#### LLM后训练中的不确定性估计
不确定性估计提供了一种原则性的方法来量化模型输出或评估信号的可靠性,并广泛应用于LLM以评估生成响应和对齐信号的可靠性。不确定性感知奖励模型(21 (https://arxiv.org/html/2608.17411#bib.bib28))通过建模随机的人类偏好和奖励模型间的分歧来量化学习到的奖励模型预测的不确定性。SEED-GRPO(8 (https://arxiv.org/html/2608.17411#bib.bib27))从多个采样响应的语义多样性中估计查询级不确定性,并使用它来调制相应的优势。CAPO(28 (https://arxiv.org/html/2608.17411#bib.bib29))研究了GRPO中与不确定性无关的优势估计相关的过度自信问题,并引入了不确定性感知优势以提高推理性能和置信度校准。近期工作表明,不确定性可以作为预测或标量评估应受信任程度的明确度量。与先前方法不同,我们关注同一GRPO小批量内与不同查询相关的群体梯度之间的冲突,并从梯度不确定性的角度进行分析。我们在贝叶斯框架下将每个群体梯度建模为由概率分布表示的随机变量,并推导出不确定性估计以反映其更新信号的可靠性。由此产生的不确定性进一步被纳入梯度聚合,以缓解梯度冲突的不利影响,并引导更有效的策略更新。
## 问题设定与分析
#### 问题设定
对于给定的查询q∼P(Q),GRPO从旧策略πθold中采样一组G个候选输出{oi}i=1G。每个输出oi通过自回归方式生成为oi={oi,1,oi,2,...,oi,Ti},其中Ti表示第i个输出的长度。生成后,每个输出由结果奖励函数ri=Rout(q,oi)进行评估。在可验证的推理任务中,Rout通常根据最终答案是否正确来定义。GRPO估计每个输出在采样组内的相对优势,鼓励策略提高获得更高奖励输出的概率。Ai=ri-mean(r1,r2,...,rG)/std(r1,r2,...,rG)。 (1) GRPO目标函数可以写为JGRPO(θ)=Eq∼P(Q),{oi}i=1G∼πθold 1/G∑i=1G 1/Ti∑t=1Ti[min(ρi,t(θ)Ai,clip(ρi,t(θ),1−ε,1+ε)Ai)−βDKLi,t], (2) 其中ε是裁剪系数,β控制KL正则化的强度。GRPO使用当前策略πθ和旧策略πθold之间的重要性比率:ρi,t(θ)=πθ(oi,t∣q,oi,<t)/πθold(oi,t∣q,oi,<t)。策略梯度由优势加权的对数概率导数组成:∇θJGRPO(θ)≈1/G∑i=1G 1/Ti∑t=1Ti Ai ∇θ log πθ(oi,t∣q,oi,<t)。在实践中,参数更新通过随机梯度上升进行。
#### 群体梯度冲突分析
在同一小批量内,每个查询qj产生一个群体梯度gj(θ),代表其响应组对策略更新的贡献。当存在冲突时,不同gj(θ)可能指向不同的甚至相反的方向,导致直接平均它们可能产生一个不能很好代表任何单个查询优化方向的聚合梯度。这种现象可能导致训练不稳定和次优更新。我们通过计算同一小批量内不同查询群体梯度之间的成对余弦相似度来量化冲突程度。相似度越低,冲突越强。实验表明,具有高冲突度的小批量往往表现出较小的性能提升,这表明需要一种更可靠的方法来聚合这些冲突的梯度。
#### 梯度不确定性
为了处理冲突,我们建议将群体梯度视为具有不确定性的量。一个直观的想法是,如果一个群体梯度分布广泛(高不确定性),它可能更不可靠,在聚合时应被赋予较低的权重。相反,集中(低不确定性)的梯度可能更可靠。我们采用贝叶斯视角,将策略参数θ视为随机变量,并基于观测数据D推断其后验分布q(θ|D)。然后,对于每个查询的群体梯度gj(θ),由于θ是随机的,gj(θ)本身也是一个随机变量,其分布反映了梯度值的不确定性。我们使用贝叶斯线性回归的近似来建模这种关系:gj(θ)≈Φxj + ε,其中Φ是特征矩阵,xj是与查询j相关的特征向量,ε是噪声。给定一组观测到的群体梯度{g1,...,gB},我们可以通过最大化似然来估计后验分布q(Φ|D)。采用高斯近似,我们得到q(Φ|D)=N(Φ|Φ0, H^-1),其中H是精度矩阵,Φ0是先验均值。使用对角经验Fisher近似,我们得到H≈Diag(FΦ)+δI, δ>0。
#### 群体梯度分布估计
基于近似的参数分布,我们接下来估计每个群体梯度上诱导的分布。如问题设定中所定义,与查询qj相关的群体梯度记为gj(θ)。由于策略概率及其导数都依赖于策略参数,Φ的不同值可能产生不同的群体梯度。因此,当Φ∼q(Φ|D)时,相应的群体梯度可以被视为一个随机变量。由于gj(Φ)的分布通常难以解析推导,我们通过蒙特卡洛采样来近似它。具体来说,我们从参数分布{Φ(m)}m=1M∼q(Φ|D)中抽取M个参数样本。对于每个参数样本Φ(m),我们构建相应的完整策略参数集θ(m)=θ(Φ(m)),然后计算对应的群体梯度gj(m)=gj(θ(m))。这样我们就得到每个群体梯度的经验分布。
#### 基于狄利克雷的不确定性建模
为了量化每个群体梯度gj的不确定性,我们将其离散化为一组可能的方向桶,并计算每个桶的概率,形成一个概率单纯形。然后,我们使用狄利克雷分布Dir(αj)作为这个概率分布的先验,其中αj是浓度参数向量。给定观测到的梯度样本{gj(1),...,gj(M)},我们更新后验分布Dir(αj'),其中αj' = αj + count_j,count_j是落入每个桶的梯度样本计数。狄利克雷分布的期望概率向量为αj'/sum(αj'),其方差(不确定性)可以通过浓度参数sum(αj')来度量:总和越大,不确定性越小。
#### 不确定性感知的梯度聚合
现在,我们使用估计的不确定性来调整聚合过程。对于小批量中的每个查询j,我们计算其群体梯度gj和不确定性Uj(例如,基于狄利克雷分布的总和)。然后,我们计算不确定性权重wj = 1/(1+Uj)或wj = exp(-λUj),其中λ是超参数。聚合梯度变为g_agg = sum_j wj * gj / sum_j wj。这确保了更确定的梯度对最终更新方向有更大的影响,从而在存在冲突时提供更可靠的方向。
## 实验
#### 实验设置
我们在多个推理基准上评估GUPO,包括数学推理(GSM8K, MATH)、代码生成(HumanEval)和常识推理。基线方法是标准的GRPO。我们使用Qwen-2.5系列模型作为基础模型。训练细节遵循标准GRPO协议,包括组大小G=8,学习率3e-6,KL系数β=0.04。对于GUPO,我们设置λ=1.0,使用M=10个采样进行不确定性估计。
#### 主要结果
GUPO在所有基准上持续优于标准GRPO。例如,在GSM8K上,GUPO将准确率从78.5%提高到81.2%。在MATH上,改进更为显著,从42.3%提高到46.7%。这些结果表明,通过考虑梯度不确定性来缓解冲突,可以获得更有效的策略更新。我们还观察到,冲突程度高的查询组从GUPO中受益更多,这证实了该方法的有效性。
#### 分析
我们分析了GUPO的影响。(1) **冲突缓解**:我们发现GUPO后群体梯度间的平均余弦相似度有所提高,表明冲突减少。(2) **可靠性权重**:可视化权重显示,冲突严重的小批量中权重差异更大,GUPO正确地降低了不可靠梯度的权重。(3) **不确定性与性能**:我们发现梯度不确定性与后续性能提升呈负相关,验证了不确定性作为可靠性指标的作用。(4) **消融研究**:去除不确定性加权会导致性能下降,证明了其必要性。
## 结论
我们提出了GUPO,一种用于LLM后训练的不确定性感知策略优化方法。通过将群体梯度建模为具有不确定性的随机变量,并在聚合中校准它们的贡献,GUPO有效缓解了梯度冲突,获得了更可靠的更新方向。在多个基准上的实验证明了其优势。未来工作包括将GUPO扩展到在线学习设置,并探索更复杂的不确定性建模。相似文章
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
GD^2PO: 通过组动态奖励解耦策略优化缓解多奖励冲突
GD^2PO引入了一种冲突感知过滤机制,以缓解大型语言模型强化学习中的多奖励冲突,防止信号抵消并加速训练效率。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。
MGUP:一种用于随机优化的动量-梯度对齐更新策略
提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。