模型改变其决策之处:用于高效强化学习与可验证奖励的Hindsight-Divergence Localization
摘要
介绍了Hindsight-Divergence Localization (HDL),这是一种用于高效强化学习与可验证奖励的方法,通过基于token对数似然变化选择分支点,降低生成成本并在数学、代码和代理任务中提升性能。
查看缓存全文
缓存时间: 2026/09/30 04:20
论文页面 - 模型如何改变想法:基于事后分歧定位的高效强化学习与可验证奖励
来源:https://huggingface.co/papers/2609.36864
摘要
基于群体相对方法的可验证奖励强化学习(RLVR)通过 rollout 结果的差异进行学习。独立采样完整轨迹成本高昂,且未明确探索关键位置的决策空间。对完整轨迹的反馈可能揭示策略重新考虑的早期选择,从而指出何处采样替代后续路径。我们提出事后分歧定位(HDL),利用事后诱导的 token 对数似然变化来选择分支点。HDL 生成少量完整根轨迹,并在原始任务上下文中从选定位置为每个训练组填充延续路径。每条延续路径重用其根前缀,仅通过新生成的后缀贡献策略更新,从而降低生成成本,同时将额外探索和学习聚焦于分支后的决策。
在数学、代码和智能体任务上的三个模型实验表明,HDL 在 rollout 效率和任务性能方面均有提升。与相同组大小和训练步数的 GRPO 相比,HDL 可减少多达 2.5 倍的生成 token 数,并将 rollout 挂钟时间加速 1.8 倍。尽管生成预算减少,HDL 在所有三个领域均提升了性能,智能体任务的增益高达 12.5 个百分点。
查看 arXiv 页面 (https://arxiv.org/abs/2609.36864) 查看 PDF (https://arxiv.org/pdf/2609.36864) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36864)
在智能体中获取本文:
hf papers read 2609.36864
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.36864 以从此页链接。
引用本文的数据集 0
暂无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.36864 以从此页链接。
引用本文的 Space 0
暂无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.36864 以从此页链接。
包含本文的收藏 0
暂无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页链接。
相似文章
Learning More from Less: 从后见之明中进行强化学习
介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。
H^2SD:混合事后自我蒸馏
提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。
HINT-SD: 面向长程智能体的目标性事后自我蒸馏
HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。
方向对齐缓解语言模型强化学习中的奖励作弊
本文通过更新几何研究语言模型强化学习中的奖励作弊,识别出优化漂移是一个关键因素。它提出可信方向投影,将梯度约束在干净的参考子空间内,从而延迟捷径利用并保持任务性能。
基于可验证奖励的强化学习用于小型搜索智能体
本文将基于可验证奖励的强化学习应用于采用检索增强生成的小型语言模型,实现了无需蒸馏的3.8倍性能提升,并强调了针对小型模型进行奖励设计的重要性。