用于LLM强化学习的预测性散度掩码

Hugging Face Daily Papers 论文

摘要

提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。

大型语言模型(LLM)的强化学习通常依赖信任区域掩码来稳定离策略更新。主流的PPO风格方法使用采样令牌的重要性比率作为两个准则:一个接近性准则,判断策略是否偏离行为策略太远;以及一个方向准则,判断更新是否使其更远。近期工作DPPO通过用行为策略与训练策略之间的概率散度替代PPO基于比率的测试,改进了接近性准则。然而,其方向准则仍然继承自PPO。只有当采样令牌的重要性比率偏离1时,令牌才会被掩码。我们观察到,这种基于比率的方向准则是一个单样本代理,其符号可能与定义接近性准则的散度变化不一致。因此,我们提出预测性散度掩码,其判断下一步策略梯度步骤将增加还是减少信任区域所使用的同一散度。针对LLM强化学习中使用的离散Softmax策略,我们推导出了该预测的闭式解。由于生产环境的推理引擎只暴露词汇表的截断视图(Top-K),我们为此预测开发了两种轻量级Top-K估计器。详细分析表明,基于散度的方向比采样比率更符合散度的实际变化,且由此产生的掩码在不同模型规模和精度设置下均能提升强化学习训练效果。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - 大语言模型强化学习的预测性散度掩码

来源: https://huggingface.co/papers/2607.10848

摘要

针对大语言模型(LLMs)的强化学习通常依赖信任区域掩码来稳定离策略更新。主流的PPO风格方法将采样令牌的重要性比率用于两个准则:邻近性准则(判断策略是否偏离行为策略过远)和方向性准则(判断更新是否使其进一步偏离)。近期工作DPPO通过用行为策略与训练策略之间的概率散度替换PPO基于比率的测试,改进了邻近性准则。然而,其方向性准则仍然继承自PPO:只有当采样令牌的重要性比率偏离1时,该令牌才会被掩码。我们观察到这种基于比率的方向性准则是一种单样本代理,可能在其符号上与定义邻近性准则的散度变化不一致。因此,我们提出预测性散度掩码,它判断下一步策略梯度更新会增加还是减少信任区域所使用的同一散度。针对LLM强化学习中使用的离散softmax策略,我们以封闭形式推导了该预测。由于生产级部署引擎仅暴露词汇表的截断(top-K)视图,我们开发了两种轻量级top-K估计器用于该预测。详细分析表明,基于散度的方向性比基于采样比率的方向性更符合散度的实际变化,并且所得到的掩码在不同模型规模和精度设置下都能改善强化学习训练。

查看 arXiv 页面 (https://arxiv.org/abs/2607.10848)查看 PDF (https://arxiv.org/pdf/2607.10848)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10848)

在你的 Agent 中获取此论文:

hf papers read 2607\.10848

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

没有模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.10848,以便从此页面链接。

引用本论文的数据集0

没有数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.10848,以便从此页面链接。

引用本论文的 Space0

没有 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.10848,以便从此页面链接。

包含本论文的收藏集0

没有收藏集包含此论文

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以便从此页面链接。

相似文章

重新思考LLM强化学习中的散度正则化

Hugging Face Daily Papers

本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。

RL用于LLM的价值梯度假说

arXiv cs.LG

本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。

超越LLM强化学习中的统一令牌级信任区域

Hugging Face Daily Papers

本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。