RLVR稳定性与Winner Advantage Policy Optimization的梯度视角

Hugging Face Daily Papers 论文

摘要

本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。

基于可验证奖励的强化学习(RLVR)提升了语言模型的推理能力,但GRPO风格的优化仍然容易崩溃。我们通过token级梯度动态分析了这种不稳定性,推导出一个分类法,该分类法预测更新如何影响下一个token的概率和熵。该分类法表明,稳定性同时取决于当前策略下的优势符号和token分布。受此发现启发,我们提出了Winner Advantage Policy Optimization(WAPO),一个简单的在线裁剪策略梯度目标,仅在正优势的完成序列上进行更新。在数学推理和多跳问答基准测试中,WAPO提升了训练稳定性,并在多个模型家族上匹配或超越了基线。完整代码可在https://github.com/layer6ai-labs/wapo获取。
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:35

论文页面 - RLVR稳定性与胜者优势策略优化的梯度视角

来源:https://huggingface.co/papers/2606.16154 论文没有将训练崩溃视为黑盒,而是分析了令牌级别的梯度动态,并推导出一个简单的分类法,表明更新的效果共同取决于优势符号和当前策略下令牌的概率。这为熵有时为何会突然崩溃提供了直观的解释。

由此产生的算法——胜者优势策略优化(WAPO)——简单得令人惊讶:仅对正优势完成序列执行裁剪策略更新。尽管这一改动很小,但它持续提升了训练稳定性,同时在数学推理和多跳问答任务上达到或超越了GRPO风格的基线。

相似文章

不要让收益FADE:解析强化学习中的策略梯度权重

arXiv cs.LG

本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

RL用于LLM的价值梯度假说

arXiv cs.LG

本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。