重新思考PPO中的评论家学习:理解与缓解价值平坦化

Hugging Face Daily Papers 论文

摘要

本文识别出价值平坦化是PPO评论家学习在LLMs中的一种失败模式,并引入SP3O,一种稀疏监督方法,来缓解它,实验中显示持续改进。

在大型语言模型的强化学习中,近端策略优化(PPO)通常使用评论家来估计状态值并减少策略更新的方差。然而,我们发现PPO评论家中存在一种系统性的失败模式,我们称之为价值平坦化:从多个蒙特卡洛延续中估计的状态值在中间状态间急剧变化,而评论家预测则相对平坦。我们在受控的FrozenLake环境中进一步观察到这一现象,并发现随着状态空间的增长,它变得更加明显。我们的理论和实证分析将价值平坦化与评论家损失中的隐式方差惩罚以及来自具有相似梯度的时间相关状态的冗余更新联系起来。基于这些发现,我们引入了稀疏近端策略优化(SP^3O),它将价值损失仅应用于每个响应中少数几个分离良好的状态,以缓解这两种影响。在Qwen3-Base上的实验表明,SP^3O每响应仅监督三个状态就能缓解价值平坦化,并在不同模型规模和评估套件中持续改进学习到的策略。总之,我们的结果识别出价值平坦化是标准PPO中评论家学习的一个重要但被忽视的失败模式,并表明一种简单的稀疏监督策略可以缓解它。
查看原文
查看缓存全文

缓存时间: 2026/09/17 06:52

论文页面 - 重新思考PPO中的评论家学习:理解与缓解价值扁平化

来源:https://huggingface.co/papers/2609.18708 发布于9月16日

·

由https://huggingface.co/ramiroluo提交

Luo (https://huggingface.co/ramiroluo)于9月17日

作者:

,

,

,

,

,

,

,

,

,

,

摘要

在大语言模型的强化学习中,近端策略优化(PPO)通常使用评论家来估计状态值并减少策略更新的方差。然而,我们发现PPO评论家存在一种系统性失效模式,我们称之为“价值扁平化”:基于多个蒙特卡洛连续体估计的状态值在中间状态间发生剧烈变化,而评论家的预测却相对平坦。我们在受控的FrozenLake环境中也观察到了这一现象,并发现随着状态空间的增大,该现象变得更加显著。我们的理论和实验分析将价值扁平化与评论家损失函数中隐含的方差惩罚以及时间相关状态下梯度相似导致的冗余更新联系起来。基于这些发现,我们提出了稀疏近端策略优化(SP^3O),该方法在每个回复中仅对少数分隔良好的状态施加价值损失,以缓解这两种影响。在Qwen3-Base上的实验表明,SP^3O即使每个回复只监督三个状态,也能缓解价值扁平化,并在不同模型规模和评估套件中持续提升所学策略。总之,我们的研究结果揭示了价值扁平化是标准PPO中评论家学习一个被忽视的重要失效模式,并表明简单的稀疏监督策略可以缓解它。

查看arXiv页面 (https://arxiv.org/abs/2609.18708)查看PDF (https://arxiv.org/pdf/2609.18708)项目页面 (https://dodojordi.github.io/SP3O/)GitHub (https://github.com/Dodojordi/SP3O)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.18708)

通过您的代理获取此论文:

hf papers read 2609\.18708

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.18708以从该页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.18708以从该页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2609.18708以从该页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从该页面链接。

相似文章

KLip-PPO: 从逐样本KL角度解读PPO-Clip

arXiv cs.LG

本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。

RL用于LLM的价值梯度假说

arXiv cs.LG

本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。

@johnschulman2: PPO在LLM时代迎来了第二波,原因超出了原始论文的预期——重要性比率目标会修正由数值误差、异步训练和前向传播噪声引起的偏差——而裁剪目标通过一种我们当初发表时未知的机制影响熵(DAPO, https://arxiv.org/abs/2509.26114)

X AI KOLs Following

本文揭示了PPO和GRPO中的裁剪机制在LLM的RLVR中引入了熵偏差:低裁剪增加熵,高裁剪减少熵。作者证明,即使在随机奖励的情况下,标准裁剪也会降低熵,并表明调整低裁剪可以防止熵塌陷并促进探索。