从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励

Hugging Face Daily Papers 论文

摘要

本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。

基于可验证奖励的强化学习(RLVR)通过支持大规模优化,推动了面向推理的大语言模型(LLM)的最新进展。然而,其适用性在很大程度上仍局限于数学和编程等领域,这些领域中的正确性可以通过确定性方式验证。开放式任务则通常依赖人类偏好、奖励模型或基于LLM的评判者,从而引入评估偏差、评判能力瓶颈以及额外的推理成本。 借鉴自监督学习通过构造预文本任务从数据自身获取监督信号的原理,我们提出了基于自可验证奖励的强化学习(RLSVR),这是一种基于任务变换的训练范式,旨在将RLVR扩展到开放式任务。RLSVR将开放式任务转换为可验证的代理环境,其内部规则和交互结果会自动生成奖励信号。我们通过SpyRL实例化RLSVR,这是一个受《谁是卧底?》启发的多智能体自博弈环境。智能体接收不对称信息,完成相同的目标任务,并投票指认指定卧底。由于卧底身份是预先确定的,投票结果提供完全可验证的奖励,而能否成功识别卧底与输出质量密切相关。 在文本摘要、创意写作和数学推理上的实验表明,SpyRL在不可验证任务上优于现有的自我改进方法,并在可验证推理任务上取得一致的性能提升。这些结果表明,任务变换可以将基于RLVR的可扩展自我改进扩展到固有可验证领域之外。模型和代码已在 https://github.com/wangqinsi1/SpyRL 发布。
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:30

论文页面 - 从 RLVR 到 RLSVR:任务转换诱导自可验证奖励,用于开放式 LLM 自我改进

摘要

具有可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)通过支持大规模优化,推动了面向推理的大语言模型(LLM)的近期进展。然而,其适用性在很大程度上仍局限于数学和编程等正确性可以确定性验证的领域。开放式任务反而往往依赖人类偏好、奖励模型或基于 LLM 的评判,从而引入评估偏差、评判能力瓶颈以及额外推理成本。借鉴自监督学习的原则——即构造前置任务以从数据本身获取监督信号——我们提出了具有自可验证奖励的强化学习(Reinforcement Learning with Self-Verifiable Rewards, RLSVR),一种基于任务转换的训练范式,旨在将 RLVR 扩展到开放式任务。RLSVR 将开放式任务转换为可验证的代理环境,其内部规则和交互结果会自动生成奖励信号。我们用 SpyRL 实例化了 RLSVR,这是一个受“谁是卧底?”启发的多智能体自博弈环境。智能体接收不对称信息,完成相同的目标任务,并投票识别指定卧底。由于卧底身份是预先确定的,投票结果提供完全可验证的奖励,而成功识别与输出质量密切相关。在文本摘要、创意写作和数学推理上的实验表明,SpyRL 在不可验证任务上优于现有自我改进方法,并在可验证推理任务上取得一致的增益。这些结果表明,任务转换可以将可扩展的基于 RLVR 的自我改进扩展到固有可验证领域之外。模型和代码已在 https://github.com/wangqinsi1/SpyRL 发布。

查看 arXiv 页面 (https://arxiv.org/abs/2607.23802) 查看 PDF (https://arxiv.org/pdf/2607.23802) 项目页面 (https://github.com/wangqinsi1/RLSVR/tree/SpyRL) GitHub (https://github.com/wangqinsi1/RLSVR) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2607.23802)

在您的智能体中获取此论文:

hf papers read 2607\.23802

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2607.23802 可从此页面链接该模型。

引用此论文的数据集 0

暂无链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.23802 可从此页面链接该数据集。

引用此论文的 Spaces 0

暂无链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.23802 可从此页面链接该 Space。

包含此论文的收藏集 0

暂无包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 可从此页面链接该收藏集。

相似文章

从 RLVR 到 RLSVR(GitHub 仓库)

TLDR AI

介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。

超越可验证的RL(8分钟阅读)

TLDR AI

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。