VBVR-Pro: 一个用于原生视觉推理的可扩展且可验证的套件
摘要
VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。
查看缓存全文
缓存时间: 2026/08/27 03:18
论文详情 - VBVR-Pro:面向原生视觉推理的可扩展可验证工具套件
来源:https://huggingface.co/papers/2608.26105 发布于 8 月 26 日
#3 当日热门论文 (https://huggingface.co/papers/date/2026-08-27) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
VBVR-Pro 引入了一个闭环测试平台,通过在多种视觉基质上进行生成,实现可扩展、可验证且可控的原生视觉推理。
原生视觉推理 (https://huggingface.co/papers?q=Native%20visual%20reasoning) 将视觉生成 (https://huggingface.co/papers?q=visual%20generation) 视为推理本身的媒介:视觉状态(即图像和视频)不仅仅是需要理解的输入或需要渲染的输出,而是作为超越语言的、用于问题解决的一等基质。然而,由于缺乏可扩展的训练任务、可靠的反馈以及跨生成基质的可控比较,相关进展仍受瓶颈限制。在这项工作中,我们介绍了 VBVR-Pro,一个使生成式的原生视觉推理 (https://huggingface.co/papers?q=native%20visual%20reasoning) 可训练、可验证、可优化且在实验上可控的闭环测试平台。1) 任务扩展。VBVR-Pro 将视觉推理转化为包含 300 个程序化生成任务的可控任务空间。在 VBVR-Pro 上训练的模型在包括 RISE-Video、MME-CoF-Pro 和 BabyVision 在内的七个外部视觉推理基准测试中,展现出强大的跨套件迁移能力。2) 可验证奖励。VBVR-Pro 提供用于任务基础评估的可验证奖励评分器 (https://huggingface.co/papers?q=verifiable%20reward%20scorers)。通过对主流多模态大语言模型 (https://huggingface.co/papers?q=MLLMs) 作为评判者的系统研究,我们识别了当前流行的 VLM-as-a-judge (https://huggingface.co/papers?q=VLM-as-a-judge) 范式中反复出现的失败模式。相比之下,所提出的评分器基于确定性的、特定任务的规则实现,并与人类判断达到细粒度对齐。重要的是,它们作为大规模多任务强化学习 (https://huggingface.co/papers?q=multi-task%20reinforcement%20learning) 的可靠奖励信号,并在视觉推理任务上展现出更强的强化学习后性能。3) 机制研究。VBVR-Pro 支持跨超过 30 个图像、视频和交错生成器的受控模态研究。我们的分析表明,视频生成在需要持续时空状态跟踪的任务中仍然最强,而交错生成 (https://huggingface.co/papers?q=interleaved%20generation) 则提供了一种计算高效的替代方案。至关重要的是,消融实验和探测表明存在对视觉推理至关重要的视觉原生轨迹 (https://huggingface.co/papers?q=vision-native%20trajectories)。我们公开所有数据、模型、评分器和代码。
查看 arXiv 页面 (https://arxiv.org/abs/2608.26105) 查看 PDF (https://arxiv.org/pdf/2608.26105) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26105)
通过您的代理获取此论文:
hf papers read 2608\.26105
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.26105 以从此页面链接它。
引用本文的数据集 0
无数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.26105 以从此页面链接它。
引用本文的 Spaces 0
无 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2608.26105 以从此页面链接它。
包含本文的收藏 1
相似文章
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
UniVR:在视觉空间中思考以实现统一视觉推理
UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。
通过闭环验证推理解锁复杂视觉生成
介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。
SVR-R1:在强化学习中通过自验证引导多模态推理
提出SVR-R1,一种多轮强化学习框架,该框架利用模型自身的验证作为多模态推理的学习信号,在视觉-语言推理基准上相较于标准GRPO基线取得了显著的准确率提升。
CollabVR:基于视觉语言模型与视频生成模型的协作式视频推理
CollabVR 是一篇研究论文,提出了一种闭环框架,该框架通过协作整合视觉语言模型与视频生成模型,以改善视觉推理并实时纠正推理失败。