CollabVR:基于视觉语言模型与视频生成模型的协作式视频推理

Hugging Face Daily Papers 论文

摘要

CollabVR 是一篇研究论文,提出了一种闭环框架,该框架通过协作整合视觉语言模型与视频生成模型,以改善视觉推理并实时纠正推理失败。

近期的“通过视频思考”(Thinking with Video)方法利用视频生成模型(VGM)进行视觉推理,通过生成时间上连贯的“帧链”(Chain-of-Frames)作为推理产物。然而,即使是强大的 VGM 在处理目标导向任务时,也表现出两种反复出现的失败模式:多步骤任务中的长期视野漂移,以及中程剪辑模拟错误导致的误差累积。这两者都源于缺乏基于 VGM 短期视觉先验的显式推理,而这一角色本应由视觉语言模型(VLM)自然承担。然而,VLM 的放置位置并非易事:前置规划在未生成任何帧之前就做出了承诺,而后置的整段视频批评则介入过晚。我们提出了 VLM-VGM 协作式视频推理(CollabVR),这是一种将 VLM 与 VGM 在步骤级别粒度上耦合的闭环框架:VLM 规划即时下一步动作,检查 VGM 生成的视频片段,并将验证器的诊断结果直接融入下一个动作提示中,以修复检测到的失败。在 Gen-ViRe 和 VBVR-Bench 基准测试中,在同等算力条件下,CollabVR 在单次推理、Pass@k 以及先前的测试时缩放基线方面,均提升了开源和闭源 VGM 的性能,且在最具挑战性的任务上提升幅度最大。此外,它在经过推理微调的 VGM 基础上也带来了进一步的改进,表明步骤级的 VLM 监督与面向推理的微调是正交且可叠加的。我们在项目页面提供了视频样本和额外的定性结果:https://joow0n-kim.github.io/collabvr-project-page。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:29

论文主页 - CollabVR:利用视觉语言模型和视频生成模型进行协作视频推理

来源:https://huggingface.co/papers/2605.08735

摘要

一种闭环框架在步骤级别上将视觉语言模型与视频生成模型协作整合,通过实现视频生成过程中的实时故障检测与纠正,从而提升视觉推理能力。

最近的“视频思维”(Thinking with Video)方法使用视频生成模型(Video Generation Models, VGMs)进行视觉推理,其通过生成时间上连贯的帧链(Chain-of-Frames)作为推理产物。然而,即使是强大的 VGMs,在目标导向任务上也表现出两种反复出现的故障模式:多步骤任务中的长程漂移(long-horizon drift)以及累积放大的中段片段模拟错误(mid-clip simulation errors)。这两者都源于 VGM 缺乏基于其短程视觉先验的显式推理能力,而这一角色本应由视觉语言模型(Vision-Language Models, VLMs)自然填补,但 VLM 的介入时机并非显而易见:前置规划会在任何帧生成之前做出承诺,而针对整个视频的事后批评则干预过晚。我们提出了 VLM-VGM 协作视频推理(CollabVR),这是一个闭环框架,在步骤粒度上将 VLM 与 VGM 耦合:VLM 规划立即执行的下一步动作,检查 VGM 生成的片段,并将验证器的诊断结果直接折叠到下一个动作提示中,以修复检测到的故障。在 Gen-ViRe 和 VBVR-Bench 基准测试中,与匹配计算量的单次推理、Pass@k 以及先前的测试时扩展基线相比,CollabVR 提升了开源和闭源 VGMs 的性能,在最具挑战性的任务上增益最大。它还在经过推理微调的 VGM 基础上带来了进一步的改进,表明步骤级别的 VLM 监督与面向推理的微调是正交且可叠加的。我们在项目主页提供了视频样本和额外的定性结果:https://joow0n-kim.github.io/collabvr-project-page。

查看 arXiv 页面 (https://arxiv.org/abs/2605.08735) 查看 PDF (https://arxiv.org/pdf/2605.08735) 项目主页 (https://joow0n-kim.github.io/collabvr-project-page/) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.08735)

引用此论文模型 0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.08735 即可从此页面建立链接。

引用此论文的数据集 0

没有链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.08735 即可从此页面建立链接。

引用此论文的应用空间(Spaces) 0

没有链接此论文的应用空间

在应用空间 README.md 中引用 arxiv.org/abs/2605.08735 即可从此页面建立链接。

包含此论文的合集 0

没有包含此论文的合集

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从此页面建立链接。

相似文章

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。