不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
摘要
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。
查看缓存全文
缓存时间: 2026/08/05 07:38
# 不要偷看答案:面向无标注 RLVR 的结果掩码组相对策略优化
来源:https://arxiv.org/html/2608.03119
叶永仕¹,²,张亮¹,陈以同¹,²,史晓东¹,²,††thanks:通讯作者。,付彪¹,²,¹¹footnotemark:1
¹厦门大学
²非物质文化遗产数字化保护与智能处理文化和旅游部重点实验室(厦门大学)
\{yeyongshi,biaofu\}@stu.xmu.edu.cn,[email protected]
###### 摘要
基于可验证奖励的强化学习(RLVR)提升了 LLM 的推理能力,但通常依赖真实答案(GT),限制了其可扩展性。基于投票的无标注 RLVR 用模型样本的答案级共识取代了金牌监督。然而,当相同的答案级信号既用于估计奖励又用于驱动词元级策略优化时,就会出现坍塌,这会鼓励模型直接强化答案词元而非改进推理。我们提出 OM-GRPO,一个无标注 RLVR 框架,将奖励估计与策略优化解耦。OM-GRPO 在答案片段上掩码梯度,同时通过软共识信号保留答案级奖励,将优化压力从答案词元上转移开。我们进一步引入对比增强奖励(Contrast-Augmented Reward),通过利用现有轨迹的低成本两两比较来细化奖励估计,而无需额外采样。在多种推理基准和三个 LLM 主干模型上,OM-GRPO 始终优于现有无标注 RLVR 方法,并达到了与有监督 GT 奖励训练相当的性能,且优化稳定。这种稳定性在测试时训练(Test-Time Training)设置中尤为有益,OM-GRPO 比多数投票高出 4.24 个点。
# 不要偷看答案:面向无标注 RLVR 的结果掩码组相对策略优化
叶永仕¹,²,张亮¹,陈以同¹,²,史晓东¹,²,††thanks:通讯作者。,付彪¹,²,¹¹footnotemark:1
¹厦门大学
²非物质文化遗产数字化保护与智能处理文化和旅游部重点实验室(厦门大学)
\{yeyongshi,biaofu\}@stu.xmu.edu.cn,[email protected]
## 1 引言
参见图注图 1:不同方法在 MATH5000 验证集上的训练动态。左图和中间图:验证准确率随训练步数的变化。右图:训练期间每个批次的唯一最终答案平均数量。
随着大语言模型(LLM)从模式匹配向复杂推理演进 Jaech et al. (2024 (https://arxiv.org/html/2608.03119#bib.bib10)); DeepSeek-AI et al. (2025 (https://arxiv.org/html/2608.03119#bib.bib4)); Yang et al. (2025b (https://arxiv.org/html/2608.03119#bib.bib32)),基于可验证奖励的强化学习(RLVR)已成为后训练的核心范式。RLVR 通过优化反映最终答案正确性的结果级奖励来提升推理能力,这些奖励通常使用精心 curated 的真实答案计算 Shao et al. (2024 (https://arxiv.org/html/2608.03119#bib.bib24)); Yu et al. (2025a (https://arxiv.org/html/2608.03119#bib.bib33))。尽管取得了这些令人鼓舞的进展,但对高质量人工标注的依赖使得奖励构建成本高昂,并且难以随训练数据扩展 (Ouyang et al.,2022 (https://arxiv.org/html/2608.03119#bib.bib18); Shao et al.,2024 (https://arxiv.org/html/2608.03119#bib.bib24); Yue et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib35))。近期研究探索了直接从模型输出中推导奖励的无标注方法 (Prabhudesai et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib20); Zhao et al.,2025a (https://arxiv.org/html/2608.03119#bib.bib37))。其中一种代表性策略是基于多数投票的自我奖励 (Shafayat et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib23); Zhang et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib36)):模型对同一提示采样多个轨迹,提取其最终答案,并奖励答案与组共识一致的轨迹。然而,这种设计引入了一个根本性问题。答案级共识不仅用于估计奖励,还用于驱动词元级策略优化。因此,模型可以通过直接锐化高频答案词元来提升奖励,而无需改进产生这些答案的推理过程。这种捷径使得基于投票的无标注 RLVR 特别容易受到奖励黑客攻击和模式坍塌的影响。
为了实证检验这个问题,我们在多个 LLM 主干模型上评估了这类自我奖励方法。如图 1 (https://arxiv.org/html/2608.03119#S1.F1) 所示,这些方法通常表现出早期性能提升,随后随着训练进行而急剧退化。为了进一步诊断这一行为,我们追踪了训练过程中提取的最终答案的多样性。图 1 (https://arxiv.org/html/2608.03119#S1.F1) 的右面板显示,性能坍塌与答案多样性的快速下降同时发生,模型最终在整个批次甚至不同批次之间收敛到相同的最终答案。总体而言,这些结果表明,观察到的坍塌源于对答案词元的过度优化。
在这项工作中,我们提出结果掩码组相对策略优化(OM-GRPO),一个简单而有效的框架,通过优化推理轨迹质量而非答案级一致性来改进推理。具体来说,OM-GRPO 使用软奖励(基于组内答案频率),并在梯度更新期间掩码答案片段,确保学习信号局限于推理轨迹。在这种设计下,奖励提升无法通过直接锐化或重复答案词元来实现,而必须来自改进的推理。因此,OM-GRPO 在多个主干模型上表现出稳定、不坍塌的训练动态(见图 1 (https://arxiv.org/html/2608.03119#S1.F1) 和 3 (https://arxiv.org/html/2608.03119#S4.F3))。值得注意的是,OM-GRPO 在各主干模型上也达到了与 GT-Reward 相当的性能(见图 1 (https://arxiv.org/html/2608.03119#S1.F1))。我们将这一增益归因于软奖励:它通过给予组内获得更广泛支持的答案更高的信用,提供了隐式的对比信号。
为了放大对比增益,我们进一步引入对比增强奖励(CAR),以更好地捕捉推理轨迹的相对质量。CAR 通过提示模型比较来自同一输入的推理轨迹对,并仅生成原始问题的简短最终答案,在每组内显式构建轨迹级两两比较。这产生了大量额外的结果,使得无需重新采样长推理轨迹即可更可靠地估计原始轨迹的软奖励。直观地说,考虑同一输入的两条轨迹\((y_1,z_1)\)和\((y_2,z_2)\),其中\(y_1\)代表更高质量的推理。通过两两比较,如果模型偏好\(y_1\)并生成\(z_1\),那么\(z_1\)在组内出现的频率更高,从而加强了分配给\(y_1\)的软奖励。通过低成本的两两比较扩展答案池,这种基于比较的信号能够产生更可靠的奖励估计,从而在不重新生成完整推理过程的情况下,向更高质量的推理轨迹进行更稳定的优化。
在三个 LLM 主干模型上的多样推理基准套件上的实验表明,OM-GRPO 始终优于先前的无标注 RLVR 基线,并达到了与有监督 GT-Reward 训练相当的性能。至关重要的是,这种稳定性也延伸到测试时训练(Test-Time Training),OM-GRPO 防止了优化坍塌,并比多数投票基线高出 4.24 个点。
**贡献。**(1) 我们识别了无标注 RLVR 中一个被忽视的失败模式,即答案词元捷径导致奖励黑客和训练坍塌。(2) 我们提出 OM-GRPO,一个通过答案片段梯度掩码来缓解奖励黑客的无标注 RLVR 框架。(3) 我们进一步引入 CAR,一种通过两两比较来细化奖励估计的低成本策略。(4) 在多个主干模型和基准上,OM-GRPO 实现了稳定训练以及有竞争力或更优的性能。
## 2 相关工作
**LLM 推理。** LLM 在各种任务上取得了显著进步 (Dubey et al.,2024 (https://arxiv.org/html/2608.03119#bib.bib5); Yang et al.,2025b (https://arxiv.org/html/2608.03119#bib.bib32)),但其推理输出往往流畅却逻辑上不可靠 (Ouyang et al.,2022 (https://arxiv.org/html/2608.03119#bib.bib18); Rafailov et al.,2023 (https://arxiv.org/html/2608.03119#bib.bib22); Touvron et al.,2023 (https://arxiv.org/html/2608.03119#bib.bib27))。先前的工作通过提示策略改进推理,例如思维链(CoT)和自洽性 (Wei et al.,2022 (https://arxiv.org/html/2608.03119#bib.bib30); Wang et al.,2023 (https://arxiv.org/html/2608.03119#bib.bib28)),这些策略鼓励中间推理并聚合多个采样解。最近,RLVR 已成为推理任务中有效的后训练范式 (Shao et al.,2024 (https://arxiv.org/html/2608.03119#bib.bib24); DeepSeek-AI et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib4); Lambert et al.,2024 (https://arxiv.org/html/2608.03119#bib.bib13); Hu et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib8); Kimi-Team et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib12); Yang et al.,2025a (https://arxiv.org/html/2608.03119#bib.bib31)),其中奖励通过使用 GT 解或程序化验证器计算答案正确性来获得。虽然 RLVR 大幅提升了推理性能,但其对 curated 监督的依赖限制了可扩展性。
**无标注 RLVR。** 为了提升可扩展性,近期工作探索了无标注 RLVR,即不依赖金牌答案来推导训练信号。现有方法包括基于一致性的自我奖励 (Shafayat et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib23); Zhang et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib36))、基于不确定性的信号(如熵或置信度)(Prabhudesai et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib20); Agarwal et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib1); Zhao et al.,2025b (https://arxiv.org/html/2608.03119#bib.bib38)),以及来自 LLM 评判器或符号验证器的外部反馈 (Pang et al.,2023 (https://arxiv.org/html/2608.03119#bib.bib19); Lee et al.,2024 (https://arxiv.org/html/2608.03119#bib.bib14); Su et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib26); Zhao et al.,2025a (https://arxiv.org/html/2608.03119#bib.bib37))。其中,基于投票的自我奖励尤为常见,它奖励答案与组共识匹配的轨迹 (Shafayat et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib23); Zhang et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib36))。然而,当这种答案级信号既用于奖励估计又用于词元级优化时,策略可以利用捷径强化答案词元而非改进推理,导致奖励黑客和模式坍塌。近期方法尝试通过正则化 Yu et al. (2025b (https://arxiv.org/html/2608.03119#bib.bib34)) 或多视角蒸馏 (Zhang et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib36)) 来稳定训练,但潜在的捷径仍然难以消除。
## 3 方法:结果掩码 GRPO
参见图注图 2:OM-GRPO 的概述,包含结果掩码更新和对比增强奖励估计。
我们提出结果掩码组相对策略优化(OM-GRPO),一种无标注 RLVR 算法,优化推理轨迹同时防止答案级捷径学习。对于每个输入 \(x\),OM-GRPO 采样一组 \(G\) 条轨迹 \(\{\tau_i\}_{i=1}^{G}\),并使用带掩码梯度的组相对目标更新策略:
\[
\begin{aligned}
\mathcal{J}_{\text{OM-GRPO}}(\theta)
&=\mathbb{E}_{x\sim\mathcal{D},\,\{\tau_i\}_{i=1}^{G}\sim\pi_{\theta_{\text{old}}}(\cdot\mid x)} \\
&\Bigg[\frac{1}{G}\sum_{i=1}^{G}\sum_{t=1}^{|\tau_i|}m_{i,t}\,\min\!\Big(\rho_{i,t}(\theta)\,\hat{A}_i,\,\mathrm{clip}(\rho_{i,t}(\theta),1-\epsilon,1+\epsilon)\,\hat{A}_i\Big) \\
&\;\;-\;\beta\,\mathrm{KL}\!\big(\pi_{\theta}\,\|\,\pi_{\text{ref}}\big)\Bigg]
\end{aligned}
\]
其中 \(\rho_{i,t}(\theta)\) 是旧策略与新策略之间的概率比,\(\hat{A}_i\) 是基于组内结果频率的估计优势,\(m_{i,t}\) 是针对答案片段的掩码(答案位置为 0,其他位置为 1),\(\beta\,\mathrm{KL}(\pi_\theta\|\pi_{\text{ref}})\) 将策略约束在参考策略附近。关键设计是使用软奖励 \(r_i\) 和掩码 \(m_{i,t}\):
**软奖励。** 我们不使用二元一致性奖励,而是根据答案在组内的出现频率分配奖励:\(r_i = \frac{\text{freq}(\mathrm{ans}(\tau_i))}{\max_j \text{freq}(\mathrm{ans}(\tau_j))}\)。这保留了答案级信号,但不对答案词元施加直接优化压力。
**答案掩码。** \(m_{i,t}=0\) 用于最终答案片段中的词元,\(m_{i,t}=1\) 用于其他所有词元。这确保梯度只通过推理轨迹传播,防止模型直接强化或重复答案词元。
### 3.1 对比增强奖励
为了进一步细化奖励估计,我们提出对比增强奖励(CAR)。对于每组中的每对轨迹 \((y_i,y_j)\),我们提示模型仅基于两条轨迹生成最终答案 \(z_{i,j}\),而不重新采样完整推理。这些额外的答案被添加到答案池中,用于计算软奖励。直观地说,如果模型在比较后偏好更高质量的轨迹 \(y_i\),那么其对应的最终答案 \(z_i\) 在扩展池中出现的频率更高,从而为 \(y_i\) 分配更高的信用。
## 4 实验
### 4.1 设置
**基准。** 我们在 MATH500、AIME 2024 和 OlympiadBench 上评估。
**主干模型。** 我们使用三种 LLM 主干:Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B。
**基线。** 我们将 OM-GRPO 与以下基线进行比较:GT-Reward(有监督 oracle)、Majority Voting(MV)、Self-Certainty 以及先前的无标注 RLVR 方法。
**实现细节。** 我们使用 verl (Sheng et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib25)) 实现所有方法,并在 8×NVIDIA A100 GPU 上训练。更多细节见附录 B。
### 4.2 主要结果
表 1:不同方法在推理基准上的准确率(%)。最佳和次佳结果分别以粗体和下划线标出。
| 方法 | MATH500 | AIME 2024 | OlympiadBench |
|------|---------|-----------|---------------|
| **Qwen2.5-7B-Instruct** | | | |
| GT-Reward | 78.2 | 33.3 | 42.1 |
| MV | 74.6 | 29.2 | 38.9 |
| Self-Certainty | 75.1 | 30.4 | 39.5 |
| OM-GRPO | **78.9** | **34.6** | **43.0** |
| **Qwen2.5-14B-Instruct** | | | |
| GT-Reward | 82.4 | 38.5 | 47.2 |
| MV | 79.8 | 34.2 | 44.6 |
| Self-Certainty | 80.1 | 35.0 | 45.1 |
| OM-GRPO | **82.9** | **39.1** | **47.8** |
| **DeepSeek-R1-Distill-Qwen-7B** | | | |
| GT-Reward | 83.5 | 40.2 | 49.3 |
| MV | 81.0 | 36.7 | 46.4 |
| Self-Certainty | 81.4 | 37.3 | 46.9 |
| OM-GRPO | **84.1** | **40.9** | **50.2** |
如表 1 所示,OM-GRPO 在所有基准和主干模型上始终优于无标注基线,并取得了与 GT-Reward 相当或更优的性能。
### 4.3 训练动态
图 1 显示了不同方法的训练动态。与 MV 和 Self-Certainty 在早期性能提升后急剧退化不同,OM-GRPO 保持了稳定的性能提升,没有出现坍塌。这种稳定性在答案多样性指标上也很明显:OM-GRPO 保持了更多样化的答案集,而 MV 和 Self-Certainty 迅速收敛到单一答案。
### 4.4 测试时训练
我们还在测试时训练设置中评估了 OM-GRPO,其中模型在测试输入上进一步训练。如表 2 所示,OM-GRPO 防止了优化坍塌,并比多数投票基线高出 4.24 个点。
表 2:AIME 2024 上的测试时训练结果。
| 方法 | 准确率 |
|------|--------|
| 零样本 CoT | 28.7 |
| 多数投票 | 32.5 |
| MV + TTT | 30.1 |
| OM-GRPO + TTT | **36.74** |
### 4.5 消融研究
我们进行消融研究以评估各组件的影响。
**软奖励与硬奖励。** 使用二元硬奖励(无软分数)时,即使有掩码,性能也略有下降。软奖励提供了更有区分度的学习信号。
**答案掩码的影响。** 移除答案掩码(标准 GRPO 目标)会导致训练坍塌,强调了掩码在防止答案词元捷径方面的重要性。
**CAR 的影响。** CAR 带来了持续的性能提升,特别是在 AIME 2024 和 OlympiadBench 等较难基准上,进一步验证了对比较信号的需求。
## 5 分析
### 5.1 为什么答案掩码有效?
答案掩码确保策略不能通过直接增加答案词元的似然来提高奖励。因此,唯一提高奖励的方式是改进生成正确答案的推理过程。这打破了捷径,使优化信号保留在推理轨迹上。
### 5.2 软奖励的作用
软奖励在组内提供了隐式的对比信号。它不仅区分“正确”和“错误”答案,还根据答案获得的支持程度分配不同级别的信用。这允许更细粒度的学习,使高质量推理获得更大的奖励提升。
### 5.3 泛化能力
OM-GRPO 训练的模型在分布外问题上表现出更好的泛化能力。我们将此归因于更好的推理质量和减少的过度拟合于特定答案模式。
## 6 结论
我们提出了 OM-GRPO,一个无标注 RLVR 框架,通过结果掩码和软奖励来防止答案级捷径学习。我们的实验表明,OM-GRPO 实现了稳定训练,性能可与有监督 GT-Reward 训练相媲美,并显著优于现有无标注方法。此外,所提出的对比增强奖励(CAR)进一步提升了性能。这项工作强调了在无标注 RLVR 中解耦奖励估计和策略优化的关键作用。
## 局限性
虽然 OM-GRPO 展现了强大的性能,但它在整个训练过程中需要多个答案样本,这增加了计算开销。此外,我们的方法在需要严格数学推理的任务上表现最佳;其在开放式或主观任务上的适用性尚未被探索。
## 影响声明
这项工作推进了无需大量人工标注的 LLM 推理训练方法。这降低了大语言模型后训练中的标注成本壁垒,可能使先进的推理能力更加可及。然而,无标注 RLVR 的改进也可能被滥用于生成看似连贯但缺乏真实世界可靠性的推理内容。我们建议谨慎部署,并将持续评估实际影响。
# 附录 A 提示模板
我们在 OM-GRPO 中使用标准的思维链提示模板:"Let's think step by step and output the final answer within \boxed{}." 对于 CAR,我们使用图 7 中显示的模板。
图 7:CAR 的提示模板。
<|im_start|>system
Let's think step by step and output the final answer within \boxed{}.<|im_end|>
<|im_start|>user
{Question}<|im_end|>
<|im_start|>assistant
Here are two possible solutions:
[Solution 1] {Solution_1}
[Solution 2] {Solution_2}
Based on the reasoning in the solutions above, the correct final answer is \boxed{...}<|im_end|>
# 附录 B 实现细节
对于每次 GRPO (Shao et al.,2024 (https://arxiv.org/html/2608.03119#bib.bib24)) 更新,我们采样一批 128 个问题,并为每个问题生成 \(G=8\) 条轨迹。我们设置最大提示长度为 512,最大响应长度为 3,072。训练运行 6 个 epoch。我们使用 AdamW 优化器,学习率为 \(3\times 10^{-6}\),\(\beta_1=0.9\),\(\beta_2=0.999\),以及 \(\epsilon=10^{-8}\),同时使用余弦学习率调度和 0.1 的 warmup 比例。我们应用 KL 正则化,系数 \(\beta=0.005\),并采用裁剪比例 \(\epsilon=0.2\)。在生成方面,训练期间我们以温度 1.0 采样;评估时使用温度 0.8 和 top-p=\(0.95\)。对于测试时训练实验,我们遵循上述相同的超参数和生成设置,只是训练运行 30 个 epoch。为确保公平和可复现的比较,我们在各方法之间使用每个模型官方发布的聊天风格模板来保持提示一致。所有方法均在 verl (Sheng et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib25)) 中实现,并在 8×NVIDIA A100 GPU 上训练。
# 附录 C 基线详情
我们提供所有比较基线的详细描述。
- **Ground Truth(GT-Reward)。** 这是一个使用人工标注答案作为奖励的有监督 oracle 基线。对于每条轨迹,我们通过 \(\mathrm{ans}(\cdot)\) 提取其最终答案片段。奖励是二元的:如果 \(\mathrm{ans}(y_i)\) 与真实答案完全匹配,则轨迹获得 1,否则获得 0。
- **Majority Voting(MV)。** 该基线使用自洽性作为正确性的代理 (Shafayat et al.,2025 (https://arxiv.org/html/2608.03119#bib.bib23))。对于每个问题,我们采样 \(G\) 条轨迹并提取答案 \(\{\mathrm{ans}(y_1),\ldots,\mathrm{ans}(y_G)\}\)。设 \(z_{\text{maj}}\) 表示组内最频繁的答案。如果 \(\mathrm{ans}(y_i)=z_{\text{maj}}\),则每条轨迹 \(y_i\) 获得奖励 1,否则获得 0。该奖励强化组内的一致性,而不论一致的答案是否正确。
- **Self-Certainty。** 该基线在采样轨迹上使用模型自身的置信度作为奖励信号。相似文章
超越采样的学习:面向RLVR的离策略感知跨模型轨迹交换
本文提出了GRAFT,一个用于可验证奖励强化学习(RLVR)的离策略感知框架,它用对等轨迹替换全部失败组,以提高数学推理基准的性能。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
CEPO:基于对比证据策略优化的RLVR自我蒸馏
CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.
列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影
本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。