BV-Blend: 不确定性加权历史基线用于可验证奖励下稳定无评论家强化学习

arXiv cs.AI 论文

摘要

BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。

arXiv:2606.28707v1 公告类型: new 摘要: 基于可验证奖励的无评论家强化学习(RLVR),以组相对策略优化(GRPO)为代表,避免了训练价值函数(评论家),相比基于评论家的PPO流程减少了内存和计算开销,用于对齐大型语言模型。然而,GRPO风格的优势估计依赖于提示本地(提示组内)奖励统计,可能不稳定。特别是,当提示组中的所有生成结果获得相同的奖励时,组内奖励方差变为零,组归一化导致该组的优势为零,从而阻碍了在冷启动场景下使用二元验证器的学习。我们引入了BV-Blend,这是一个无评论家框架,通过将提示本地在线策略统计与语义聚类条件历史矩相结合来稳定优势估计。BV-Blend维护每个聚类的EMA跟踪奖励矩,从均值标准误(SEM)代理推导出置信权重,并使用该权重将历史和提示本地基线及方差统计混合为一个标准化的优势用于PPO风格的裁剪更新。在可验证推理基准上的实验表明,BV-Blend提高了训练稳定性和性能,并且在组归一化方法可能停滞的情况下依然稳健。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:31

# BV-Blend:基于不确定性加权的历史基线的稳定无Critic可验证奖励强化学习  
来源:https://arxiv.org/html/2606.28707  
Yupeng Chang¹, Yuan Wu¹¹¹通讯作者, Yi Chang¹,²,³  
¹吉林大学人工智能学院  
²教育部知识驱动人机智能工程研究中心  
³吉林大学未来科学国际中心  
changyp23@mails\.jlu\.edu\.cn, \{yuanwu, yichang\}@jlu\.edu\.cn  

###### 摘要  
无Critic可验证奖励强化学习(RLVR),以群体相对策略优化(GRPO)为代表,避免了训练价值函数(Critic),并相对于基于Critic的PPO流程降低了大语言模型对齐中的内存和计算开销。然而,GRPO风格的优势估计依赖于提示局部(组内)奖励统计,可能不稳定。特别是,当提示组内的所有生成结果获得相同的奖励时,组内奖励方差为零,组标准化为该组产生*零*优势,从而在具有二元验证器的冷启动场景中阻碍学习。我们提出了**BV-Blend**,一种无Critic框架,通过结合提示局部在策略统计与基于语义聚类的历史矩来稳定优势估计。BV-Blend为每个聚类维护EMA追踪的奖励矩,从均值标准误(SEM)代理推导出置信权重,并使用该权重将历史与提示局部的基线和方差统计混合,为PPO风格的裁剪更新生成标准化优势。在可验证推理基准上的实验表明,BV-Blend提高了训练稳定性和性能,并在组标准化方法可能停滞的场景中保持鲁棒性。

# BV-Blend:基于不确定性加权的历史基线的稳定无Critic可验证奖励强化学习  
Yupeng Chang¹, Yuan Wu¹¹¹通讯作者, Yi Chang¹,²,³  
¹吉林大学人工智能学院  
²教育部知识驱动人机智能工程研究中心  
³吉林大学未来科学国际中心  
changyp23@mails\.jlu\.edu\.cn, \{yuanwu, yichang\}@jlu\.edu\.cn  

## 1 引言  
可验证奖励强化学习(RLVR)最近已成为一种实用的范式,用于在具有*客观*正确性信号的领域(如数学和代码)中对大语言模型(LLM)进行对齐,其中输出可以自动验证(例如,与参考答案精确匹配、形式化证明检查或通过单元测试)(Yu et al., 2025b (https://arxiv.org/html/2606.28707#bib.bib110); Yan et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib67); Gui et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib111))。与过程级监督(如过程奖励模型PRMs (Lightman et al., 2023 (https://arxiv.org/html/2606.28707#bib.bib26)))相比,RLVR优化基于结果的奖励,无需对中间推理步骤进行评分。当验证器可靠时,每个提示收集多个生成结果自然能改善探索并增加观察到正确解的机会,这支撑了最近几个以推理为中心的RL系统 (Guo et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib71))。除了结构化领域,当参考信号或鲁棒验证器可用时,RLVR也已扩展到更多样化的场景 (Su et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib28))。

然而,将事实上的RLHF配方——带有学习到的Critic的PPO (Ziegler et al., 2019 (https://arxiv.org/html/2606.28707#bib.bib57); Ouyang et al., 2022 (https://arxiv.org/html/2606.28707#bib.bib30)) 直接应用于RLVR暴露了一个实际的矛盾。使用稀疏的、轨迹级可验证奖励时,学习准确的价值函数可能具有挑战性,而额外的Critic在LLM规模上引入了不可忽略的内存和计算开销,以及额外的训练复杂性 (Ouyang et al., 2022 (https://arxiv.org/html/2606.28707#bib.bib30))。这些考虑加速了对无Critic对齐的兴趣。偏好优化方法如DPO (Rafailov et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib33)) 避免了显式奖励建模和在线RL,但主要是在偏好或效用监督下研究,而非在直接可用的、编程式结果奖励的场景中。因此,我们专注于*直接奖励、无Critic*的策略优化,其中GRPO (Shao et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib41)) 是一个突出的基线,它通过在每个提示组内进行提示局部奖励归一化来推导优势。

尽管简单,提示局部归一化可能不稳定。由此产生的优势估计可能强烈依赖于暂时性的组内统计,导致高方差和不稳定的学习动态,这激发了越来越多的分析和修复工作 (Liang, 2025 (https://arxiv.org/html/2606.28707#bib.bib122); Chen et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib123); Mroueh, 2025 (https://arxiv.org/html/2606.28707#bib.bib124); Yu et al., 2025a (https://arxiv.org/html/2606.28707#bib.bib44))。此外,RLVR通常会遇到一个冷启动场景,其中当前策略主要生成错误的解;在二元验证器下,许多提示组变得有效确定(例如,全部失败),产生(接近)零的组内奖励方差。在这个*零方差*场景中,标准的组内归一化产生(接近)零的优势,从而消除了这些提示组的学习信号 (Le et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib27))。

为了解决这种不稳定性,我们提出了**BV-Blend**,一种无Critic框架,通过结合(i)在策略的提示局部信号和(ii)在语义相似提示上聚合的低方差历史矩来稳定优势估计。BV-Blend从历史统计的均值标准误(SEM)代理中计算一个不确定性感知的置信权重,当历史估计得到更好支持时,更多地依赖它,同时降低不可靠历史信息的影响。因此,BV-Blend缓解了零方差提示组上的优势崩溃,无需训练Critic,并且与PPO风格优化兼容。我们的贡献是:

- • 我们分析了直接奖励、无Critic RL中提示局部(组归一化)优势估计的*零方差*失效模式,其中当提示组内所有生成结果获得相同奖励时,归一化的学习信号消失。
- • 我们提出了**BV-Blend**,一种不确定性感知的历史混合机制,通过利用基于语义聚类的历史矩来稳定提示局部优势估计,无需训练Critic。
- • 我们通过实验证明,BV-Blend在可验证推理基准上提高了训练稳定性和性能,并且在标准组归一化方法可能停滞的场景中保持鲁棒性。

## 2 相关工作  
##### 基于Critic和基于偏好的对齐。  
策略梯度方法通常通过学到的价值函数基线来降低方差;GAE (Schulman et al., 2015 (https://arxiv.org/html/2606.28707#bib.bib114))(通常与PPO (Schulman et al., 2017 (https://arxiv.org/html/2606.28707#bib.bib95)) 配对使用)产生比蒙特卡洛估计器(如REINFORCE (Williams, 1992 (https://arxiv.org/html/2606.28707#bib.bib120)))更低方差的优势。在RLHF风格的LLM对齐中,PPO流程通常在RL微调期间训练一个辅助的值头与策略一起 (Ouyang et al., 2022 (https://arxiv.org/html/2606.28707#bib.bib30))。另一条工作线通过直接优化来自偏好或效用监督的目标来避免在线RL和Critic训练,例如DPO (Rafailov et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib33))、KTO (Ethayarajh et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib36)) 和SimPO (Meng et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib40))。这些方法主要是在偏好或效用监督(或隐式奖励)下研究的,而不是显式的基于结果的可验证奖励。

##### 直接奖励、无Critic策略优化。  
我们的工作建立在具有可验证奖励的无Critic策略优化之上,以群体相对策略优化(GRPO)为例 (Shao et al., 2024 (https://arxiv.org/html/2606.28707#bib.bib41))。GRPO通过在每个提示组内归一化奖励来避免学到的Critic,但学习信号可能对暂时性的组内统计敏感,并且当组内奖励方差接近零时可能会崩溃。最近的工作探索了相关问题及其修复措施,包括纠正GRPO风格目标中的优化偏差(Dr. GRPO)(Liu et al., 2025b (https://arxiv.org/html/2606.28707#bib.bib45)),通过轻量级贝叶斯或卡尔曼风格更新进行时间平滑基线(KRPO)(Wang et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib131)),将GRPO风格优化扩展到多轮工具使用场景(ARPO)(Dong et al., 2025a (https://arxiv.org/html/2606.28707#bib.bib132)),以及从零方差提示中提取学习信号(RL-ZVP)(Le et al., 2025 (https://arxiv.org/html/2606.28707#bib.bib27))。其他工作也通过数据或采样级别的干预来缓解零方差或低信号训练场景,例如动态采样 (Yu et al., 2025a (https://arxiv.org/html/2606.28707#bib.bib44))。

我们的方法与那些无需训练Critic就能稳定GRPO风格优势估计的方法最为相关。与主要跨训练步骤平滑统计的KRPO相比,BV-Blend维护基于提示语义聚类的历史奖励矩。与专门针对零方差提示的RL-ZVP相比,BV-Blend使用不确定性感知的混合,将提示局部和聚类条件历史统计结合起来,为所有提示组形成统一的标准化优势。与基于动态采样的补救措施相比,BV-Blend在优势估计器层面操作,而不是在数据选择策略层面。总体而言,BV-Blend是一种无Critic的方法,它修改了优势估计器,同时保持与标准PPO风格训练流程兼容。

参照图片说明  
图1:BV-Blend概览。对于每个提示 \(q^{(m)}\),我们用行为策略采样 \(G\) 条轨迹 \(\{\tau_i^{(m)}\}\) 并获得验证器奖励 \(\{R_i^{(m)}\}\)。我们计算提示局部统计量 (\(\mu_{\mathcal{G}}^{(m)}, \sigma_{\mathcal{G}}^{(m)}\)),嵌入 \(q^{(m)}\),并将其分配给一个语义聚类 \(k^{(m)}\)。使用*更新前*的EMA矩 (\(\mu_{\mathrm{hist}}(k), v_{\mathrm{hist}}(k), N_k^{\mathrm{eff}}\)),我们计算基于SEM的置信度 \(w_k\) (公式 (9 (https://arxiv.org/html/2606.28707#S3.E9));冷启动:对于未见过的聚类 \(w_k = 0\)),混合基线和方差统计以获得 (\(b^{(m)}, s^{(m)}\)) (公式 (10 (https://arxiv.org/html/2606.28707#S3.E10))),并形成优势 \(A_i^{\mathrm{BV},(m)}\) (公式 (11 (https://arxiv.org/html/2606.28707#S3.E11))) 用于PPO风格的更新。EMA矩在*更新后*使用当前批次进行更新。

## 3 方法  
用于LLM对齐的无Critic策略优化通常依赖于提示局部(组依赖)优势归一化(例如,GRPO风格估计器),但当组内奖励分散度很小时,提示局部标准化可能产生接近零的优势,从而有效消除该提示组的学习信号。我们提出了**BV-Blend**,它通过结合提示局部统计与基于语义聚类的历史矩,并使用从均值标准误(SEM)代理推导出的置信权重,为每条轨迹构造一个*单一*优势。具体来说,BV-Blend混合基线和方差统计,然后使用产生的尺度进行一次标准化。BV-Blend保持PPO风格的裁剪目标不变 (Schulman et al., 2017 (https://arxiv.org/html/2606.28707#bib.bib95)),仅修改优势估计器:SEM权重从*更新前*的EMA统计量计算,而EMA矩在*更新后*使用当前批次更新(图1 (https://arxiv.org/html/2606.28707#S2.F1))。与其他基于组的归一化方法一样,我们停止所有奖励统计量的梯度,并且不假设生成的归一化估计器是无偏的。

### 3.1 背景:无Critic RL中的提示局部归一化  
一个训练批次包含 \(M\) 个提示 \(\{q^{(m)}\}_{m=1}^{M}\)。对于每个提示 \(q^{(m)}\),行为策略 \(\pi_{\theta_{\mathrm{old}}}\) 采样 \(G\) 条轨迹 \(\mathcal{G}(q^{(m)}) = \{\tau^{(m)}_i\}_{i=1}^{G}\)。每条轨迹 \(\tau^{(m)}_i = (y^{(m)}_{i,1}, \dots, y^{(m)}_{i,T^{(m)}_i})\) 从外部验证器接收一个标量轨迹级奖励 \(R^{(m)}_i\)。对于 \(\tau^{(m)}_i\) 中的 token 位置 \(t\),定义重要性比率 \(r_{i,t}^{(m)}(\theta) = \frac{\pi_{\theta}(y_{i,t}^{(m)} \mid q^{(m)}, y_{i, < t}^{(m)})}{\pi_{\theta_{\mathrm{old}}}(y_{i,t}^{(m)} \mid q^{(m)}, y_{i, < t}^{(m)})}\) 及其裁剪版本 \(\tilde{r}_{i,t}^{(m)}(\theta) = \operatorname{clip}\left(r_{i,t}^{(m)}(\theta), 1-\varepsilon, 1+\varepsilon\right)\)。

GRPO风格的提示局部优势通过组归一化定义:
\[
A_i^{\text{GRPO},(m)} = \frac{R_i^{(m)} - \mu_{\mathcal{G}}^{(m)}}{\sigma_{\mathcal{G}}^{(m)}}, \quad 
\mu_{\mathcal{G}}^{(m)} = \frac{1}{G}\sum_{i=1}^{G} R_i^{(m)}, \quad 
\sigma_{\mathcal{G}}^{(m)} = \sqrt{\frac{1}{G}\sum_{i=1}^{G} \left(R_i^{(m)} - \mu_{\mathcal{G}}^{(m)}\right)^2 + \delta}
\tag{1-3}
\]
其中 \(\delta > 0\) 是一个小常数。如果 \(G < 2\),我们设 \(\sigma_{\mathcal{G}}^{(m)} = 0\),得到 \(A_1^{\text{GRPO},(m)} = 0\)。裁剪的代理目标为:
\[
\mathcal{J}_{\text{GRPO}}(\theta) = \mathbb{E}_m \left[ \frac{1}{G} \sum_{i=1}^{G} \mathbb{E}_{t \sim \tau_i^{(m)}} \left[ \min\left( r_{i,t}^{(m)}(\theta) A_i^{\text{GRPO},(m)}, \tilde{r}_{i,t}^{(m)}(\theta) A_i^{\text{GRPO},(m)} \right) \right] \right].
\tag{4}
\]
当 \(\sigma_{\mathcal{G}}^{(m)} \approx 0\) 时,公式 (3 (https://arxiv.org/html/2606.28707#S3.E3)) 倾向于零优势,从而有效消除该提示组的学习信号。

### 3.2 BV-Blend:基于SEM的历史与提示局部基线混合  
BV-Blend通过混合*基线和方差统计*然后进行一次标准化(取平方根得到尺度)来计算单一的标准化优势 \(A_i^{\mathrm{BV},(m)}\),它遵循常见形式 \(A = (R - b)/s\):GRPO使用提示局部 \((b,s) = (\mu_{\mathcal{G}}^{(m)}, \sigma_{\mathcal{G}}^{(m)})\),而BV-Blend在提示局部统计和*基于语义聚类*的EMA矩之间进行插值,插值由一个基于SEM的置信度 \(w_k\) 控制。

#### 3.2.1 提示聚类  
每个提示 \(q^{(m)}\) 由一个冻结的编码器 \(E(\cdot)\) 嵌入,并分配到一个固定的 \(K\)-means 码本 \(\{c_j\}_{j=1}^{K}\):
\[
k^{(m)} = \arg\min_{j \in \{1, \dots, K\}} \|E(q^{(m)}) - c_j\|_2^2.
\tag{5}
\]
码本在代表性提示语料库上离线训练,并在RL期间保持固定以避免聚类身份漂移。为了可重复性,我们报告编码器选择、\(K\) 值、码本训练语料库以及 \(K\)-means 设置(实现、种子和迭代次数)。

#### 3.2.2 历史统计量,使用EMA更新

相似文章

分层优势加权:面向稀疏回合结果的VLA在线强化学习微调

Hugging Face Daily Papers

本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。

RLVR稳定性与Winner Advantage Policy Optimization的梯度视角

Hugging Face Daily Papers

本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

超越可验证的RL(8分钟阅读)

TLDR AI

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。