模型改变其决策之处:用于高效强化学习与可验证奖励的Hindsight-Divergence Localization

Hugging Face Daily Papers 论文

摘要

介绍了Hindsight-Divergence Localization (HDL),这是一种用于高效强化学习与可验证奖励的方法,通过基于token对数似然变化选择分支点,降低生成成本并在数学、代码和代理任务中提升性能。

用于可验证奖励的群组相对方法(RLVR)从展开结果的差异中学习。独立采样完整轨迹成本高昂,且未明确探索关键位置的决策空间。对完整轨迹的反馈可以揭示策略重新考虑的早期选择,建议在何处采样替代续接。我们引入Hindsight-Divergence Localization (HDL),它利用后见之明引起的token对数似然变化来选择分支点。HDL生成少量完整的根轨迹,并在原始任务上下文中从选定位置填充每个训练组的续接。每个续接重用其根前缀,并仅通过新生成的后缀贡献策略更新,降低生成成本,同时将额外的探索和学习集中在分支后的决策上。在三个模型上进行数学、代码和代理任务的实验显示,展开效率和任务性能均有提升。与在匹配的群组大小和训练步骤下的GRPO相比,HDL最多减少2.5倍的生成token,并加速1.8倍的展开实际时间。尽管生成预算减少,HDL在所有三个领域都提升了性能,在代理任务中最多提高12.5分。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:20

论文页面 - 模型如何改变想法:基于事后分歧定位的高效强化学习与可验证奖励

来源:https://huggingface.co/papers/2609.36864

摘要

基于群体相对方法的可验证奖励强化学习(RLVR)通过 rollout 结果的差异进行学习。独立采样完整轨迹成本高昂,且未明确探索关键位置的决策空间。对完整轨迹的反馈可能揭示策略重新考虑的早期选择,从而指出何处采样替代后续路径。我们提出事后分歧定位(HDL),利用事后诱导的 token 对数似然变化来选择分支点。HDL 生成少量完整根轨迹,并在原始任务上下文中从选定位置为每个训练组填充延续路径。每条延续路径重用其根前缀,仅通过新生成的后缀贡献策略更新,从而降低生成成本,同时将额外探索和学习聚焦于分支后的决策。

在数学、代码和智能体任务上的三个模型实验表明,HDL 在 rollout 效率和任务性能方面均有提升。与相同组大小和训练步数的 GRPO 相比,HDL 可减少多达 2.5 倍的生成 token 数,并将 rollout 挂钟时间加速 1.8 倍。尽管生成预算减少,HDL 在所有三个领域均提升了性能,智能体任务的增益高达 12.5 个百分点。

查看 arXiv 页面 (https://arxiv.org/abs/2609.36864) 查看 PDF (https://arxiv.org/pdf/2609.36864) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36864)

在智能体中获取本文:

hf papers read 2609.36864

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2609.36864 以从此页链接。

引用本文的数据集 0

暂无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2609.36864 以从此页链接。

引用本文的 Space 0

暂无 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2609.36864 以从此页链接。

包含本文的收藏 0

暂无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页链接。

相似文章

Learning More from Less: 从后见之明中进行强化学习

arXiv cs.LG

介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。

H^2SD:混合事后自我蒸馏

Hugging Face Daily Papers

提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。

HINT-SD: 面向长程智能体的目标性事后自我蒸馏

Hugging Face Daily Papers

HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。

方向对齐缓解语言模型强化学习中的奖励作弊

Hugging Face Daily Papers

本文通过更新几何研究语言模型强化学习中的奖励作弊,识别出优化漂移是一个关键因素。它提出可信方向投影,将梯度约束在干净的参考子空间内,从而延迟捷径利用并保持任务性能。