UniVR:在视觉空间中思考以实现统一视觉推理

Hugging Face Daily Papers 论文

摘要

UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。

直接从原始视觉数据中学习广泛的世界知识是智能的基本能力。我们介绍了UniVR,这是首次研究如何从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划。UniVR的核心是VR-GRPO,一种强化学习范式,具有互补的全局和逐步奖励。这种方法在整个推理过程中强制逻辑一致性和物理一致性,无需特定任务的启发式规则或图像-文本对。为了训练和评估UniVR,我们构建了VR-X,一个大规模基准测试,包含来自16个不同来源的数据,涵盖长期操作、空间谜题和物理推理。这是第一个在纯视觉协议下评估这些异构能力的综合套件。值得注意的是,UniVR在VR-X上实现了高达25%的提升,其优越的视觉推理能力也提升了多个多模态理解基准的性能。这些发现强调了在视觉空间内推理的巨大潜力,所有代码、数据和模型均已开源,以供进一步研究。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - UniVR:在视觉空间中思考以进行统一视觉推理

来源:https://huggingface.co/papers/2607.12800 从原始视觉数据中直接学习广泛的世界知识是智能的一项基本能力。我们提出UniVR,这是首个研究如何从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划的工作。其核心是VR-GRPO,一种强化学习范式,结合了互补的全局和步级奖励。该方法在整个推理过程中强制实现逻辑一致性和物理一致性,无需任务特定的启发式规则或图像-文本对。为了训练和评估UniVR,我们构建了VR-X,这是一个从16个不同来源精选的大规模基准,涵盖长期操作、空间谜题和物理推理。它是首个在纯视觉协议下评估这些异构能力的综合套件。值得注意的是,UniVR在VR-X上取得了高达25%的提升,其优越的视觉推理能力也提升了各种多模态理解基准的性能。这些发现强调了在视觉空间中进行推理的巨大潜力,所有代码、数据和模型都将开源以供进一步研究。

Clipboard_Screenshot_1784263692 (https://cdn-uploads.huggingface.co/production/uploads/64e1cabf12a5504dda7e4948/aakHxABTSj0nJvR7B9ZO4.png)

相似文章

学习自适应推理路径以实现高效视觉推理

Hugging Face Daily Papers

AVR是一种自适应视觉推理框架,能够动态选择最优推理格式,在视觉推理任务中减少50-90%的token使用量同时保持准确性。该方法通过将视觉推理分解为三种认知功能并使用FS-GRPO训练来鼓励高效格式选择,从而解决推理路径冗余问题。

UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG

Hugging Face Daily Papers

UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。