SVR-R1:在强化学习中通过自验证引导多模态推理
摘要
提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。
查看缓存全文
缓存时间: 2026/07/20 21:26
论文页面 - SVR-R1:在强化学习中利用自验证引导多模态推理
来源:https://huggingface.co/papers/2607.10966
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们提出了自验证推理器(Self-Verified Reasoner, SVR-R1),这是一个多轮强化学习框架,将模型自身的验证能力转化为多模态推理的学习信号。对于每个查询,模型使用相同权重给出答案,并输出一个二进制自验证判决(Yes/No)。“No” 触发第二次机会重新思考;“Yes” 或达到轮次上限则最终确定输出,用于计算基于结果的奖励。SVR-R1 基于 GRPO 和异步多轮 rollout 框架实现,无需外部监督或辅助评判器。我们在视觉-语言推理基准上评估 SVR-R1,结果表明其准确率相比强大的标准 GRPO 基线有大幅提升。训练动态显示模型对验证的依赖逐渐降低——验证轮次减少,但测试准确率反而提高——这表明随着策略将自我纠正内化,并通过我们的框架选择最置信的答案,验证与生成之间的差距在不断缩小。SVR-R1 填补了 VLM 中推理时自我精炼与强化学习训练之间尚未被充分探索的交集,为引导多模态推理提供了一种简单而有效的方案。我们将开源 SVR-R1,以促进 VLM 领域的未来研究。
查看 arXiv 页面 (https://arxiv.org/abs/2607.10966)查看 PDF (https://arxiv.org/pdf/2607.10966)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10966)
在您的智能体中获取这篇论文:
hf papers read 2607.10966
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.10966,以便从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.10966,以便从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.10966,以便从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
Tandem Reinforcement Learning with Verifiable Rewards
提出了串联强化学习(Tandem Reinforcement Learning, TRL),将串联训练范式扩展到基于可验证奖励的强化学习(RLVR),以提升推理在较弱模型和人类中的兼容性与可读性。结果表明,TRL在保持单模型性能的同时,增强了交接鲁棒性并减少了分布偏移。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型
介绍 iVGR,一种强化学习框架,将视觉定位内化到多模态语言模型的文本推理中,在提升细粒度感知性能的同时,消除了推理过程中显式视觉基础的需求。
CORA:通过一致性导向推理对齐分析与弥合多模态RLVR中的思考-答案差距
本文分析了大型视觉语言模型中多模态可验证奖励强化学习(RLVR)中的思考-答案不一致性,并提出CORA方法,该方法引入了一致性奖励模型和混合奖励优势拆分,以提高忠实性和任务性能。