重新思考PPO中的评论家学习:理解与缓解价值平坦化
摘要
本文识别出价值平坦化是PPO评论家学习在LLMs中的一种失败模式,并引入SP3O,一种稀疏监督方法,来缓解它,实验中显示持续改进。
查看缓存全文
缓存时间: 2026/09/17 06:52
论文页面 - 重新思考PPO中的评论家学习:理解与缓解价值扁平化
来源:https://huggingface.co/papers/2609.18708 发布于9月16日
·
由https://huggingface.co/ramiroluo提交
Luo (https://huggingface.co/ramiroluo)于9月17日
作者:
,
,
,
,
,
,
,
,
,
,
摘要
在大语言模型的强化学习中,近端策略优化(PPO)通常使用评论家来估计状态值并减少策略更新的方差。然而,我们发现PPO评论家存在一种系统性失效模式,我们称之为“价值扁平化”:基于多个蒙特卡洛连续体估计的状态值在中间状态间发生剧烈变化,而评论家的预测却相对平坦。我们在受控的FrozenLake环境中也观察到了这一现象,并发现随着状态空间的增大,该现象变得更加显著。我们的理论和实验分析将价值扁平化与评论家损失函数中隐含的方差惩罚以及时间相关状态下梯度相似导致的冗余更新联系起来。基于这些发现,我们提出了稀疏近端策略优化(SP^3O),该方法在每个回复中仅对少数分隔良好的状态施加价值损失,以缓解这两种影响。在Qwen3-Base上的实验表明,SP^3O即使每个回复只监督三个状态,也能缓解价值扁平化,并在不同模型规模和评估套件中持续提升所学策略。总之,我们的研究结果揭示了价值扁平化是标准PPO中评论家学习一个被忽视的重要失效模式,并表明简单的稀疏监督策略可以缓解它。
查看arXiv页面 (https://arxiv.org/abs/2609.18708)查看PDF (https://arxiv.org/pdf/2609.18708)项目页面 (https://dodojordi.github.io/SP3O/)GitHub (https://github.com/Dodojordi/SP3O)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.18708)
通过您的代理获取此论文:
hf papers read 2609\.18708
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.18708以从该页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.18708以从该页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2609.18708以从该页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从该页面链接。
相似文章
弱批评者造就强学习者:面向可扩展监督的在线策略批评蒸馏
提出使用弱模型作为批评者的在线策略批评蒸馏(OPCD),为强模型提供修正方向,从而增强推理能力和对齐,无需弱模型解决任务。
你的语言模型就是其自身的评论者:利用演员内部状态进行价值估计的强化学习
本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。
KLip-PPO: 从逐样本KL角度解读PPO-Clip
本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。
RL用于LLM的价值梯度假说
本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。
@johnschulman2: PPO在LLM时代迎来了第二波,原因超出了原始论文的预期——重要性比率目标会修正由数值误差、异步训练和前向传播噪声引起的偏差——而裁剪目标通过一种我们当初发表时未知的机制影响熵(DAPO, https://arxiv.org/abs/2509.26114)
本文揭示了PPO和GRPO中的裁剪机制在LLM的RLVR中引入了熵偏差:低裁剪增加熵,高裁剪减少熵。作者证明,即使在随机奖励的情况下,标准裁剪也会降低熵,并表明调整低裁剪可以防止熵塌陷并促进探索。