RLVR稳定性与Winner Advantage Policy Optimization的梯度视角
摘要
本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。
查看缓存全文
缓存时间: 2026/06/17 03:35
论文页面 - RLVR稳定性与胜者优势策略优化的梯度视角
来源:https://huggingface.co/papers/2606.16154 论文没有将训练崩溃视为黑盒,而是分析了令牌级别的梯度动态,并推导出一个简单的分类法,表明更新的效果共同取决于优势符号和当前策略下令牌的概率。这为熵有时为何会突然崩溃提供了直观的解释。
由此产生的算法——胜者优势策略优化(WAPO)——简单得令人惊讶:仅对正优势完成序列执行裁剪策略更新。尽管这一改动很小,但它持续提升了训练稳定性,同时在数学推理和多跳问答任务上达到或超越了GRPO风格的基线。
相似文章
不要让收益FADE:解析强化学习中的策略梯度权重
本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。
不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。
GRAIL:面向可验证奖励强化学习的梯度重加权优势方法
GRAIL 引入了梯度重加权优势,以改进 LLM 推理强化学习中的 token 级信用分配,在多个模型上优于 GRPO。
RL用于LLM的价值梯度假说
本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。
PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR
This paper introduces PAIR, a pairwise-aware inclusion reweighting method for adaptive rollout allocation in RLVR, improving sample efficiency and accuracy over pointwise allocators by correcting biases in pairwise gradient estimation.