VBVR-Pro: 一个用于原生视觉推理的可扩展且可验证的套件

Hugging Face Daily Papers 论文

摘要

VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。

原生视觉推理将视觉生成视为推理本身的媒介:视觉状态(即图像和视频)不仅是需要理解的输入或需要渲染的输出,而是超越语言的问题解决的一等基底。然而,进展仍受限于缺乏可扩展的训练任务、可靠的反馈以及跨生成基底的受控比较。在这项工作中,我们引入了 VBVR-Pro,一个闭环测试平台,使通过生成的原生视觉推理变得可训练、可验证、可优化且实验可控。1) 任务扩展。VBVR-Pro 将视觉推理转化为一个由 300 个程序生成任务组成的受控任务空间。在 VBVR-Pro 上训练的模型在七个外部视觉推理基准(如 RISE-Video、MME-CoF-Pro 和 BabyVision)上表现出强大的跨套件迁移能力。2) 可验证奖励。VBVR-Pro 提供用于任务基础评估的可验证奖励评分器。通过对领先 MLLMs 作为评判者的系统研究,我们识别出流行的 VLM-as-a-judge 范式的常见失败模式。相比之下,提出的评分器基于确定性、特定任务的规则,实现与人类判断的细粒度对齐。重要的是,它们作为大规模多任务强化学习的可靠奖励信号,并在视觉推理任务上展示了更强的强化学习后性能。3) 机制研究。VBVR-Pro 使得跨超过 30 个图像、视频和交错生成器的受控模态研究成为可能。我们的分析表明,对于需要持久时空状态跟踪的任务,视频生成仍然最强,而交错生成提供了一种计算高效的替代方案。关键的是,消融和探测表明存在对视觉推理至关重要的视觉原生轨迹。我们发布了所有数据、模型、评分器和代码。
查看原文
查看缓存全文

缓存时间: 2026/08/27 03:18

论文详情 - VBVR-Pro:面向原生视觉推理的可扩展可验证工具套件

来源:https://huggingface.co/papers/2608.26105 发布于 8 月 26 日

#3 当日热门论文 (https://huggingface.co/papers/date/2026-08-27) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

VBVR-Pro 引入了一个闭环测试平台,通过在多种视觉基质上进行生成,实现可扩展、可验证且可控的原生视觉推理。

原生视觉推理 (https://huggingface.co/papers?q=Native%20visual%20reasoning) 将视觉生成 (https://huggingface.co/papers?q=visual%20generation) 视为推理本身的媒介:视觉状态(即图像和视频)不仅仅是需要理解的输入或需要渲染的输出,而是作为超越语言的、用于问题解决的一等基质。然而,由于缺乏可扩展的训练任务、可靠的反馈以及跨生成基质的可控比较,相关进展仍受瓶颈限制。在这项工作中,我们介绍了 VBVR-Pro,一个使生成式的原生视觉推理 (https://huggingface.co/papers?q=native%20visual%20reasoning) 可训练、可验证、可优化且在实验上可控的闭环测试平台。1) 任务扩展。VBVR-Pro 将视觉推理转化为包含 300 个程序化生成任务的可控任务空间。在 VBVR-Pro 上训练的模型在包括 RISE-Video、MME-CoF-Pro 和 BabyVision 在内的七个外部视觉推理基准测试中,展现出强大的跨套件迁移能力。2) 可验证奖励。VBVR-Pro 提供用于任务基础评估的可验证奖励评分器 (https://huggingface.co/papers?q=verifiable%20reward%20scorers)。通过对主流多模态大语言模型 (https://huggingface.co/papers?q=MLLMs) 作为评判者的系统研究,我们识别了当前流行的 VLM-as-a-judge (https://huggingface.co/papers?q=VLM-as-a-judge) 范式中反复出现的失败模式。相比之下,所提出的评分器基于确定性的、特定任务的规则实现,并与人类判断达到细粒度对齐。重要的是,它们作为大规模多任务强化学习 (https://huggingface.co/papers?q=multi-task%20reinforcement%20learning) 的可靠奖励信号,并在视觉推理任务上展现出更强的强化学习后性能。3) 机制研究。VBVR-Pro 支持跨超过 30 个图像、视频和交错生成器的受控模态研究。我们的分析表明,视频生成在需要持续时空状态跟踪的任务中仍然最强,而交错生成 (https://huggingface.co/papers?q=interleaved%20generation) 则提供了一种计算高效的替代方案。至关重要的是,消融实验和探测表明存在对视觉推理至关重要的视觉原生轨迹 (https://huggingface.co/papers?q=vision-native%20trajectories)。我们公开所有数据、模型、评分器和代码。

查看 arXiv 页面 (https://arxiv.org/abs/2608.26105) 查看 PDF (https://arxiv.org/pdf/2608.26105) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26105)

通过您的代理获取此论文:

hf papers read 2608\.26105

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.26105 以从此页面链接它。

引用本文的数据集 0

无数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.26105 以从此页面链接它。

引用本文的 Spaces 0

无 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2608.26105 以从此页面链接它。

包含本文的收藏 1

相似文章

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。