SVR-R1:在强化学习中通过自验证引导多模态推理

Hugging Face Daily Papers 论文

摘要

提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。

我们提出Self-Verified Reasoner (SVR-R1),一种多轮强化学习框架,将模型自身的验证转化为多模态推理的学习信号。对于每个查询,模型使用相同的权重提出答案,并给出二元自判定(是/否)。若判定为“否”,则触发第二次思考机会;若为“是”或达到轮次上限,则输出最终结果用于计算基于结果的奖励。SVR-R1基于GRPO和异步多轮展开框架实现,无需外部监督或辅助评判器。我们在视觉-语言推理基准上评估SVR-R1,结果显示其准确率大幅超过强标准GRPO基线。训练动态显示,对验证的依赖逐渐减少(验证轮次更少),但测试准确率更高——这表明随着策略内化自我纠正并通过我们的框架选择最自信的答案,验证与生成之间的差距在缩小。SVR-R1 填补了推理时自我精炼与 VLM 强化学习训练这一较少被探索的交集领域,为引导多模态推理提供了一种简单而有效的方案。我们将开源 SVR-R1 以促进 VLM 的未来研究。
查看原文
查看缓存全文

缓存时间: 2026/07/20 21:26

论文页面 - SVR-R1:在强化学习中利用自验证引导多模态推理

来源:https://huggingface.co/papers/2607.10966

作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们提出了自验证推理器(Self-Verified Reasoner, SVR-R1),这是一个多轮强化学习框架,将模型自身的验证能力转化为多模态推理的学习信号。对于每个查询,模型使用相同权重给出答案,并输出一个二进制自验证判决(Yes/No)。“No” 触发第二次机会重新思考;“Yes” 或达到轮次上限则最终确定输出,用于计算基于结果的奖励。SVR-R1 基于 GRPO 和异步多轮 rollout 框架实现,无需外部监督或辅助评判器。我们在视觉-语言推理基准上评估 SVR-R1,结果表明其准确率相比强大的标准 GRPO 基线有大幅提升。训练动态显示模型对验证的依赖逐渐降低——验证轮次减少,但测试准确率反而提高——这表明随着策略将自我纠正内化,并通过我们的框架选择最置信的答案,验证与生成之间的差距在不断缩小。SVR-R1 填补了 VLM 中推理时自我精炼与强化学习训练之间尚未被充分探索的交集,为引导多模态推理提供了一种简单而有效的方案。我们将开源 SVR-R1,以促进 VLM 领域的未来研究。

查看 arXiv 页面 (https://arxiv.org/abs/2607.10966)查看 PDF (https://arxiv.org/pdf/2607.10966)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10966)

在您的智能体中获取这篇论文:

hf papers read 2607.10966

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.10966,以便从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.10966,以便从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.10966,以便从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

Tandem Reinforcement Learning with Verifiable Rewards

arXiv cs.AI

提出了串联强化学习(Tandem Reinforcement Learning, TRL),将串联训练范式扩展到基于可验证奖励的强化学习(RLVR),以提升推理在较弱模型和人类中的兼容性与可读性。结果表明,TRL在保持单模型性能的同时,增强了交接鲁棒性并减少了分布偏移。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。