超越采样的学习:面向RLVR的离策略感知跨模型轨迹交换
摘要
本文提出了GRAFT,一个用于可验证奖励强化学习(RLVR)的离策略感知框架,它用对等轨迹替换全部失败组,以提高数学推理基准的性能。
查看缓存全文
缓存时间: 2026/09/30 04:22
论文页面 - 超越采样局限:面向离线策略的跨模型轨迹交换用于可验证奖励强化学习
来源: https://huggingface.co/papers/2609.37868
摘要
基于可验证奖励的强化学习方法(如GRPO)依赖于模型自身生成的成功轨迹,但有限的实验预算可能导致完全失败的轨迹组无法产生基于奖励的策略梯度信号。尽管增加实验次数可以提高成功率(但成本更高),但一个模型轨迹中缺失的成功案例可能已被另一个模型发现。我们注意到,异构模型往往在不同的提示上互补成功,这为在没有指定更强教师模型的情况下进行互学创造了机会。为利用这种互补性,我们提出了GRAFT(基于门控替换,将答案失败组替换为同类模型轨迹),这是一个具有离线策略感知的框架,能够用信息丰富的同类模型组替换全部失败的组。GRAFT在传输成功和失败的同类模型响应及其计算出的优势值的同时,通过序列级兼容性加权和令牌级重要性比率裁剪来控制跨模型的不匹配性。在三组异构模型对和五个数学推理基准测试中,GRAFT在相同模型实验预算下均持续优于GRPO,平均提升2.1个百分点,模型层面平均性能最高提升达4.5个百分点。存储的同类模型轨迹保留了大部分收益,在无须同时协同训练的情况下,平均仍比GRPO提升1.8个百分点。
查看arXiv页面 (https://arxiv.org/abs/2609.37868)
查看PDF (https://arxiv.org/pdf/2609.37868)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37868)
在您的智能体中获取本文:
hf papers read 2609\.37868
尚未使用最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型的README.md中引用arxiv.org/abs/2609.37868以从此页面链接。
引用本文的数据集0
无数据集链接本文
在数据集的README.md中引用arxiv.org/abs/2609.37868以从此页面链接。
引用本文的Space0
无Space链接本文
在Space的README.md中引用arxiv.org/abs/2609.37868以从此页面链接。
包含本文的收藏集0
无收藏集包含本文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
StraTA:通过策略轨迹抽象激励智能体强化学习
StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。
通用推理的可迁移性:多领域RLVR的自动化课程设计
本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。
Tandem Reinforcement Learning with Verifiable Rewards
提出了串联强化学习(Tandem Reinforcement Learning, TRL),将串联训练范式扩展到基于可验证奖励的强化学习(RLVR),以提升推理在较弱模型和人类中的兼容性与可读性。结果表明,TRL在保持单模型性能的同时,增强了交接鲁棒性并减少了分布偏移。