用于LLM强化学习的预测性散度掩码
摘要
提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - 大语言模型强化学习的预测性散度掩码
来源: https://huggingface.co/papers/2607.10848
摘要
针对大语言模型(LLMs)的强化学习通常依赖信任区域掩码来稳定离策略更新。主流的PPO风格方法将采样令牌的重要性比率用于两个准则:邻近性准则(判断策略是否偏离行为策略过远)和方向性准则(判断更新是否使其进一步偏离)。近期工作DPPO通过用行为策略与训练策略之间的概率散度替换PPO基于比率的测试,改进了邻近性准则。然而,其方向性准则仍然继承自PPO:只有当采样令牌的重要性比率偏离1时,该令牌才会被掩码。我们观察到这种基于比率的方向性准则是一种单样本代理,可能在其符号上与定义邻近性准则的散度变化不一致。因此,我们提出预测性散度掩码,它判断下一步策略梯度更新会增加还是减少信任区域所使用的同一散度。针对LLM强化学习中使用的离散softmax策略,我们以封闭形式推导了该预测。由于生产级部署引擎仅暴露词汇表的截断(top-K)视图,我们开发了两种轻量级top-K估计器用于该预测。详细分析表明,基于散度的方向性比基于采样比率的方向性更符合散度的实际变化,并且所得到的掩码在不同模型规模和精度设置下都能改善强化学习训练。
查看 arXiv 页面 (https://arxiv.org/abs/2607.10848)查看 PDF (https://arxiv.org/pdf/2607.10848)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10848)
在你的 Agent 中获取此论文:
hf papers read 2607\.10848
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.10848,以便从此页面链接。
引用本论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.10848,以便从此页面链接。
引用本论文的 Space0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.10848,以便从此页面链接。
包含本论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以便从此页面链接。
相似文章
重新思考LLM强化学习中的散度正则化
本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。
SLIM-RL: 基于风险预算的随机掩码强化学习用于扩散语言模型,无需轨迹切分
SLIM-RL 提出了一种基于风险预算的随机掩码强化学习方法,用于扩散语言模型,避免了轨迹切分,在数学和代码基准测试中以显著更少的训练样本取得了最先进的结果。
列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影
本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。
RL用于LLM的价值梯度假说
本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。
超越LLM强化学习中的统一令牌级信任区域
本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。