从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
摘要
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - 从 RLVR 到 RLSVR:任务转换诱导自可验证奖励,用于开放式 LLM 自我改进
摘要
具有可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)通过支持大规模优化,推动了面向推理的大语言模型(LLM)的近期进展。然而,其适用性在很大程度上仍局限于数学和编程等正确性可以确定性验证的领域。开放式任务反而往往依赖人类偏好、奖励模型或基于 LLM 的评判,从而引入评估偏差、评判能力瓶颈以及额外推理成本。借鉴自监督学习的原则——即构造前置任务以从数据本身获取监督信号——我们提出了具有自可验证奖励的强化学习(Reinforcement Learning with Self-Verifiable Rewards, RLSVR),一种基于任务转换的训练范式,旨在将 RLVR 扩展到开放式任务。RLSVR 将开放式任务转换为可验证的代理环境,其内部规则和交互结果会自动生成奖励信号。我们用 SpyRL 实例化了 RLSVR,这是一个受“谁是卧底?”启发的多智能体自博弈环境。智能体接收不对称信息,完成相同的目标任务,并投票识别指定卧底。由于卧底身份是预先确定的,投票结果提供完全可验证的奖励,而成功识别与输出质量密切相关。在文本摘要、创意写作和数学推理上的实验表明,SpyRL 在不可验证任务上优于现有自我改进方法,并在可验证推理任务上取得一致的增益。这些结果表明,任务转换可以将可扩展的基于 RLVR 的自我改进扩展到固有可验证领域之外。模型和代码已在 https://github.com/wangqinsi1/SpyRL 发布。
查看 arXiv 页面 (https://arxiv.org/abs/2607.23802) 查看 PDF (https://arxiv.org/pdf/2607.23802) 项目页面 (https://github.com/wangqinsi1/RLSVR/tree/SpyRL) GitHub (https://github.com/wangqinsi1/RLSVR) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2607.23802)
在您的智能体中获取此论文:
hf papers read 2607\.23802
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.23802 可从此页面链接该模型。
引用此论文的数据集 0
暂无链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.23802 可从此页面链接该数据集。
引用此论文的 Spaces 0
暂无链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.23802 可从此页面链接该 Space。
包含此论文的收藏集 0
暂无包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 可从此页面链接该收藏集。
相似文章
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
超越下一个词元预测:面向Atlassian工作流程中工具使用智能体的RLVR概念验证
本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。
RLVR中的奖励粒度:比较小语言模型数学推理中的过程奖励与结果奖励结构
本文系统比较了小语言模型在数学推理中用于可验证奖励强化学习(RLVR)的过程奖励与结果奖励结构。研究发现,仅过程监督相比仅结果监督显著提高了准确性和推理轨迹保真度,并分析了失败模式。