CollabVR:基于视觉语言模型与视频生成模型的协作式视频推理
摘要
CollabVR 是一篇研究论文,提出了一种闭环框架,该框架通过协作整合视觉语言模型与视频生成模型,以改善视觉推理并实时纠正推理失败。
查看缓存全文
缓存时间: 2026/05/12 07:29
论文主页 - CollabVR:利用视觉语言模型和视频生成模型进行协作视频推理
来源:https://huggingface.co/papers/2605.08735
摘要
一种闭环框架在步骤级别上将视觉语言模型与视频生成模型协作整合,通过实现视频生成过程中的实时故障检测与纠正,从而提升视觉推理能力。
最近的“视频思维”(Thinking with Video)方法使用视频生成模型(Video Generation Models, VGMs)进行视觉推理,其通过生成时间上连贯的帧链(Chain-of-Frames)作为推理产物。然而,即使是强大的 VGMs,在目标导向任务上也表现出两种反复出现的故障模式:多步骤任务中的长程漂移(long-horizon drift)以及累积放大的中段片段模拟错误(mid-clip simulation errors)。这两者都源于 VGM 缺乏基于其短程视觉先验的显式推理能力,而这一角色本应由视觉语言模型(Vision-Language Models, VLMs)自然填补,但 VLM 的介入时机并非显而易见:前置规划会在任何帧生成之前做出承诺,而针对整个视频的事后批评则干预过晚。我们提出了 VLM-VGM 协作视频推理(CollabVR),这是一个闭环框架,在步骤粒度上将 VLM 与 VGM 耦合:VLM 规划立即执行的下一步动作,检查 VGM 生成的片段,并将验证器的诊断结果直接折叠到下一个动作提示中,以修复检测到的故障。在 Gen-ViRe 和 VBVR-Bench 基准测试中,与匹配计算量的单次推理、Pass@k 以及先前的测试时扩展基线相比,CollabVR 提升了开源和闭源 VGMs 的性能,在最具挑战性的任务上增益最大。它还在经过推理微调的 VGM 基础上带来了进一步的改进,表明步骤级别的 VLM 监督与面向推理的微调是正交且可叠加的。我们在项目主页提供了视频样本和额外的定性结果:https://joow0n-kim.github.io/collabvr-project-page。
查看 arXiv 页面 (https://arxiv.org/abs/2605.08735) 查看 PDF (https://arxiv.org/pdf/2605.08735) 项目主页 (https://joow0n-kim.github.io/collabvr-project-page/) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.08735)
引用此论文模型 0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.08735 即可从此页面建立链接。
引用此论文的数据集 0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.08735 即可从此页面建立链接。
引用此论文的应用空间(Spaces) 0
没有链接此论文的应用空间
在应用空间 README.md 中引用 arxiv.org/abs/2605.08735 即可从此页面建立链接。
包含此论文的合集 0
没有包含此论文的合集
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从此页面建立链接。
相似文章
通过闭环验证推理解锁复杂视觉生成
介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
CORA:通过一致性导向推理对齐分析与弥合多模态RLVR中的思考-答案差距
本文分析了大型视觉语言模型中多模态可验证奖励强化学习(RLVR)中的思考-答案不一致性,并提出CORA方法,该方法引入了一致性奖励模型和混合奖励优势拆分,以提高忠实性和任务性能。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。