UniVR:在视觉空间中思考以实现统一视觉推理
摘要
UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。
查看缓存全文
缓存时间: 2026/07/20 09:42
论文页面 - UniVR:在视觉空间中思考以进行统一视觉推理
来源:https://huggingface.co/papers/2607.12800 从原始视觉数据中直接学习广泛的世界知识是智能的一项基本能力。我们提出UniVR,这是首个研究如何从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划的工作。其核心是VR-GRPO,一种强化学习范式,结合了互补的全局和步级奖励。该方法在整个推理过程中强制实现逻辑一致性和物理一致性,无需任务特定的启发式规则或图像-文本对。为了训练和评估UniVR,我们构建了VR-X,这是一个从16个不同来源精选的大规模基准,涵盖长期操作、空间谜题和物理推理。它是首个在纯视觉协议下评估这些异构能力的综合套件。值得注意的是,UniVR在VR-X上取得了高达25%的提升,其优越的视觉推理能力也提升了各种多模态理解基准的性能。这些发现强调了在视觉空间中进行推理的巨大潜力,所有代码、数据和模型都将开源以供进一步研究。
Clipboard_Screenshot_1784263692 (https://cdn-uploads.huggingface.co/production/uploads/64e1cabf12a5504dda7e4948/aakHxABTSj0nJvR7B9ZO4.png)
相似文章
学习自适应推理路径以实现高效视觉推理
AVR是一种自适应视觉推理框架,能够动态选择最优推理格式,在视觉推理任务中减少50-90%的token使用量同时保持准确性。该方法通过将视觉推理分解为三种认知功能并使用FS-GRPO训练来鼓励高效格式选择,从而解决推理路径冗余问题。
UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG
UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。
SVR-R1:在强化学习中通过自验证引导多模态推理
提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型
介绍 iVGR,一种强化学习框架,将视觉定位内化到多模态语言模型的文本推理中,在提升细粒度感知性能的同时,消除了推理过程中显式视觉基础的需求。
通过视觉动作结果推理对齐连接物理推理与任务泛化
VAORA提出了一种新颖的奖励设计,用于视觉语言模型,将推理与视觉上下文和动作结果对齐,提升了物理推理能力和在未见任务及环境中的泛化能力。