超越采样的学习:面向RLVR的离策略感知跨模型轨迹交换

Hugging Face Daily Papers 论文

摘要

本文提出了GRAFT,一个用于可验证奖励强化学习(RLVR)的离策略感知框架,它用对等轨迹替换全部失败组,以提高数学推理基准的性能。

可验证奖励强化学习(RLVR)方法,如GRPO,依赖于成功的自生成轨迹,但有限的展开预算可能产生没有基于奖励的策略梯度信号的全部失败组。虽然额外的展开以更高的成本提高了成功的概率,但一个模型的展开中缺失的成功轨迹可能已经被另一个模型发现。事实上,我们观察到异构模型通常在互补的提示上成功,创造了无需指定更强教师的相互学习机会。为了利用这种互补性,我们提出了GRAFT(门控替换答案失败组与对等轨迹),一个离策略感知框架,用信息丰富的对等组替换全部失败组。GRAFT传输成功和不成功的对等响应及其对等计算的优势,同时通过序列级兼容性加权和token级重要性比率裁剪来控制跨模型不匹配。在三对异构模型和五个数学推理基准上,GRAFT在相同的每模型展开预算下,持续改进两个模型相对于GRPO的性能,平均提升2.1分,模型级平均性能最高提升4.5分。存储的对等轨迹保留了大部分收益,在没有同时共同训练的情况下,平均改进GRPO 1.8分。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:22

论文页面 - 超越采样局限:面向离线策略的跨模型轨迹交换用于可验证奖励强化学习

来源: https://huggingface.co/papers/2609.37868

摘要

基于可验证奖励的强化学习方法(如GRPO)依赖于模型自身生成的成功轨迹,但有限的实验预算可能导致完全失败的轨迹组无法产生基于奖励的策略梯度信号。尽管增加实验次数可以提高成功率(但成本更高),但一个模型轨迹中缺失的成功案例可能已被另一个模型发现。我们注意到,异构模型往往在不同的提示上互补成功,这为在没有指定更强教师模型的情况下进行互学创造了机会。为利用这种互补性,我们提出了GRAFT(基于门控替换,将答案失败组替换为同类模型轨迹),这是一个具有离线策略感知的框架,能够用信息丰富的同类模型组替换全部失败的组。GRAFT在传输成功和失败的同类模型响应及其计算出的优势值的同时,通过序列级兼容性加权和令牌级重要性比率裁剪来控制跨模型的不匹配性。在三组异构模型对和五个数学推理基准测试中,GRAFT在相同模型实验预算下均持续优于GRPO,平均提升2.1个百分点,模型层面平均性能最高提升达4.5个百分点。存储的同类模型轨迹保留了大部分收益,在无须同时协同训练的情况下,平均仍比GRPO提升1.8个百分点。

查看arXiv页面 (https://arxiv.org/abs/2609.37868)
查看PDF (https://arxiv.org/pdf/2609.37868)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37868)

在您的智能体中获取本文:

hf papers read 2609\.37868

尚未使用最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型的README.md中引用arxiv.org/abs/2609.37868以从此页面链接。

引用本文的数据集0

无数据集链接本文

在数据集的README.md中引用arxiv.org/abs/2609.37868以从此页面链接。

引用本文的Space0

无Space链接本文

在Space的README.md中引用arxiv.org/abs/2609.37868以从此页面链接。

包含本文的收藏集0

无收藏集包含本文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

StraTA:通过策略轨迹抽象激励智能体强化学习

Hugging Face Daily Papers

StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。

通用推理的可迁移性:多领域RLVR的自动化课程设计

Hugging Face Daily Papers

本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。

Tandem Reinforcement Learning with Verifiable Rewards

arXiv cs.AI

提出了串联强化学习(Tandem Reinforcement Learning, TRL),将串联训练范式扩展到基于可验证奖励的强化学习(RLVR),以提升推理在较弱模型和人类中的兼容性与可读性。结果表明,TRL在保持单模型性能的同时,增强了交接鲁棒性并减少了分布偏移。