VLX-VR:一种智能体感知的视频推理模型

arXiv cs.CL 论文

摘要

VLX-VR是一种智能体感知的视频推理模型,它使用思考-记忆-观察循环和强化学习来自适应地收集证据,在MINERVA基准测试中达到了最先进的性能。

arXiv:2609.09985v1 Announce Type: new 摘要:现实世界的视频理解需要整合分布在视频中的视觉、音频、文本和时间证据。然而,许多流程使用固定的视频上下文和单次推理,这在观察不完整、模糊或冲突时限制了自适应证据获取。我们提出了VLX-VR,一种在由思考--记忆--观察循环定义的视频推理框架内训练的智能体感知视频推理模型。在每一步,VLX-VR确定所需证据,调用read_memory或write_memory,整合返回的观察,并决定是继续还是生成任务输出。我们使用多模态数据(包括视频和智能体轨迹)通过强化学习训练VLX-VR,以学习证据获取、记忆使用和终止。在MINERVA上,VLX-VR在我们比较的模型中达到了最先进的性能,准确率为78.79%。在原始的三个持续时间组中,其准确率分别为76.70%、78.73%和80.92%,跨持续时间准确率方差为2.97~$\mathrm{pp}^2$。在正确回答的样本中,VLX-VR的96.20%的推理痕迹与MINERVA参考推理痕迹及其描述的证据一致,而约75.80%的评估样本同时满足答案正确性和这种基于证据的痕迹标准。这些结果表明了强大的性能和跨持续时间的广泛稳定行为,同时计数、状态变化、因果推理和空间感知仍然具有挑战性。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:17

# VLX-VR:一种智能体感知的视频推理模型
来源:https://arxiv.org/html/2609.09985
彭刘、张倩倩、赵天成
所属机构:Om AI 研究院
邮箱:[tianchez@zju\-bj\.com](mailto:)
所属机构:通讯作者:赵天成

###### 摘要

真实的视频理解需要整合分散在视频中的视觉、音频、文本和时序证据。然而,许多流程采用固定的视频上下文和单次推理,这限制了在观测不完整、模糊或矛盾时对证据的自适应获取。我们提出了VLX\-VR,这是一种在由“思考–记忆–观察”循环定义的视频推理框架内训练的智能体感知视频推理模型。在每个步骤中,VLX\-VR确定所需的证据,调用`read_memory`或`write_memory`,整合返回的观察结果,并决定是继续执行还是生成任务输出。我们使用多模态数据(包括视频和智能体轨迹)并通过强化学习训练VLX\-VR,使其学会获取证据、使用记忆和终止决策。在MINERVA基准上,VLX\-VR在我们比较的模型中达到了最先进水平,准确率为78.79%。在原始的三个时长分组中,其准确率分别为76.70%、78.73%和80.92%,跨时长准确率方差为2.97pp。在正确回答的样本中,96.20%的VLX\-VR推理轨迹与MINERVA参考推理轨迹及其描述的证据一致;而约75.80%的评估样本同时满足答案正确性和基于证据的轨迹标准。这些结果表明模型性能强劲且在不同视频时长上行为稳定,但计数、状态变化、因果推理和空间感知仍具挑战性。

## 1引言

在日常场景中,人们通过结合视觉、音频、文本和时序证据来分析事件并做出判断,从而理解视频。确定发生了什么、为什么发生或情况如何变化,可能需要定位相关时刻、比较事件前后的状态、读取场景中的文本,并将语音内容与视觉动作关联起来。支持这种真实的推理所需的远不止识别对象或孤立帧:模型必须在得出可靠结论之前,识别、整合和重新评估分散在视频中的证据。

在许多标准的视频分析和视频问答流程中,视频大型语言模型(如Video\-LLaVA[8]、Qwen3\-VL[16]和VideoLLaMA 3[26])通常接收采样的帧或视频片段作为固定输入,并通过单次推理产生输出。这种固定输入、单次推理的模式无法完全满足上述真实的事件分析需求。在此类场景中,模型可能需要重新审视早期事件、在初步观察后寻求额外证据,或在做出判断前比较分布在时间和模态中的信息。由于证据在推理开始前就已确定,模型无法在检测到缺失、模糊或矛盾的信息后自适应地获取新证据。结果是,不充分的观察可能会遗漏决定性的事件,而不加区分的观察则会增加上下文长度和推理成本。

现有的视频智能体通过迭代信息收集、时序定位和记忆查询,更接近这些真实世界的需求[18, 4, 31]。然而,当通用视觉语言模型只是被置于外部智能体循环中,而未针对其在该循环中的角色进行训练时,它们可能仍有所不足。在这种设置下,模型不一定学会将证据获取、记忆使用和终止作为其推理策略的一部分。它可能请求冗余证据、未能保留重要的中间状态,或在可用证据不足时就产生结果。因此,要可靠地分析真实世界视频中的事件并做出判断,仍然需要更强的时序定位、多模态证据选择、状态维护以及推理与实际观察之间的一致性[11]。

这些局限性促使了以下问题:*一个视频推理模型能否不仅仅学习参与智能体流程,而是将证据获取、记忆使用和终止作为其推理过程的内在部分来学习?*

为了解决这个问题,我们引入了一个组织为“思考–记忆–观察”循环的视频推理框架,并提出了VLX\-VR,这是一种训练用于在此框架内操作的智能体感知视频推理模型。VLX\-VR针对需要时序定位、多模态证据选择、状态跟踪和在短视频及长视频上进行多步推理的视频分析任务。VLX\-VR不依赖固定的视频上下文,而是通过框架定义的、可直接访问多模态记忆的循环来学习获取和重新评估多模态证据。我们使用多模态数据和智能体轨迹,通过强化学习训练VLX\-VR,使证据获取、记忆使用和终止成为其学习到的推理策略的一部分。第3节详细描述了该框架和训练过程。

我们的贡献是:
1. 我们引入了一个视频推理框架,该框架将任务条件下的证据获取组织为一个可直接访问多模态记忆的“思考–记忆–观察”循环。
2. 我们使用多模态数据和智能体轨迹,通过强化学习将VLX\-VR训练为一个智能体感知的视频推理模型,使模型能够在框架定义的循环内学习证据获取、记忆读写行为、基于观察的推理和终止。
3. VLX\-VR在MINERVA上达到了最先进性能,在我们比较的模型中准确率达到78.79%。我们进一步评估了其跨时长稳定性,以及其推理轨迹与MINERVA参考推理轨迹之间基于证据的一致性。

## 2相关工作

### 2.1通用视频理解模型

视觉语言模型为语言模型扩展了视觉感知和跨模态对齐,为多模态视频理解奠定了基础[15]。Video\-LLaVA学习了图像和视频的共享表示空间[8]。Qwen2\.5\-VL在视觉理解、时序定位和长视频处理方面取得了进展[1],而VideoLLaMA 3则开发了一种以视觉为中心的训练策略,用于通用图像和视频理解[26]。这些模型支持诸如视频描述、对话、事件解释、时序分析和视频问答等任务。在这条研究路线中,OmChat[30]专注于原生多模态建模,具备强大的长上下文和视频理解能力。它将动态视觉编码与渐进式多模态预训练相结合,在统一模型中处理图像、多图像和长视频。VLX\-Flow将模型级的视频理解从离线片段扩展到连续的视频流。它增量维护视觉上下文和语义记忆,允许重用先前观察到的内容而无需重新处理完整的视频历史[12]。

这些研究加强了视频理解所需的感知、对齐、时序建模和上下文维护能力。VLX\-VR建立在这些基础之上,但关注的是一个更广泛的控制问题:学习如何获取任务相关证据、保留有用的中间信息,以及确定可用证据是否足以完成当前的视频分析任务。

### 2.2从感知到视觉推理

除了感知和跨模态对齐,最近的研究越来越关注使模型能够执行显式的、多步推理[22, 27]。思维链提示证明了生成中间推理步骤可以提高复杂语言任务的性能[20, 28, 23]。推理模型如OpenAI o1和DeepSeek\-R1进一步表明,强化学习可以训练模型在产生最终回复之前优化中间推理策略[13, 3]。

这一方向随后被扩展到视觉推理。VLM\-R1将基于规则的强化学习应用于通用视觉语言任务,并研究了R1式训练在VLM中的稳定性和泛化能力[14]。Video\-R1为视频推理引入了时序感知的强化学习,并在训练中结合了图像和视频推理数据[5]。总的来说,这些研究标志着从识别视觉内容到通过对视觉和时序证据进行结构化推理来得出结论的转变。

VLX\-VR遵循这一转变,但将学习目标扩展到生成中间推理轨迹之外。其推理过程还控制多模态记忆的读写,整合这些操作返回的观察结果,并决定在生成任务输出之前是否需要额外证据。因此,推理不仅用于解释结果,还用于控制模型如何观察和分析视频。

### 2.3用于视觉分析的多模态智能体

一个互补的研究方向将多模态模型与记忆、工具和迭代交互相结合[19, 10]。ReAct建立了推理–行动–观察范式,其中中间结果指导后续的推理和行动[24]。针对复杂的视频理解,OmAgent引入了一个多模态智能体框架,该框架存储和检索相关的视频帧,并使用任务分而治之的循环来动态调用工具并处理复杂的视频分析请求[29]。

相关的视频智能体系统探索了不同的自适应证据获取机制[9, 25]。Wang等人的VideoAgent使用视觉工具迭代地从长视频中识别和收集任务相关的视觉信息[18]。Fan等人的VideoAgent构建结构化的事件和对象记忆,并使用时序定位和记忆查询工具[4]。VideoAgent2进一步采用不确定性感知推理来调节信息收集[31]。这些研究表明,迭代观察、外部记忆和工具使用可以减少分析固定且预先选择的视频上下文的局限性。

基于这些智能体方法,VLX\-VR被训练为一个智能体感知的VLM,而不是仅仅依赖外部的推理时控制。在框架定义的“思考–记忆–观察”循环内,VLX\-VR根据任务指令、当前推理状态、累积的多模态记忆和返回的观察结果来调整其决策。记忆直接提供`read_memory`和`write_memory`操作;VLX\-VR选择其中一个操作,整合产生的证据或更新状态,并决定是继续循环还是生成任务输出。核心目标是使与多模态记忆的交互成为模型学习到的推理策略的一部分。

## 3所提方法

### 3.1框架概述

给定一个视频和任务指令,智能体感知的VLX\-VR模型在框架定义的“思考–记忆–观察”循环内运行。VLX\-VR首先执行“思考”以确定需要什么证据。然后进入“记忆”并直接调用提供的`read_memory`或`write_memory`操作,以检索相关的多模态证据或保留中间状态。结果作为“观察”返回,VLX\-VR用其更新推理状态。然后VLX\-VR决定是收集更多证据还是生成最终结果。如图1所示,证据获取是基于任务目标、累积的记忆和返回的观察结果进行调节的,而不是在推理开始前就固定。

![图1:用于训练和运行智能体感知的视频推理模型VLX\-VR的框架定义“思考–记忆–观察”循环概述。记忆直接提供`read_memory`和`write_memory`;VLX\-VR调用其中一个操作,产生的观察结果指导下一步“思考”或最终输出。](https://arxiv.org/html/2609.09985#S3.F1)图1概述了用于训练和运行智能体感知的视频推理模型VLX\-VR的框架定义“思考–记忆–观察”循环。记忆直接提供`read_memory`和`write_memory`;VLX\-VR调用其中一个操作,产生的观察结果指导下一步“思考”或最终输出。
### 3.2思考–记忆–观察循环

在推理步骤\(t\),VLX\-VR维护一个状态\(s_{t}\),包括任务指令、观察到的证据、存储在记忆中的多模态内容、当前输出假设和未解决的不确定性。VLX\-VR从\(s_{t}\)生成“思考”,并决定在“记忆”期间是调用`read_memory`还是`write_memory`,或是终止。这种状态相关的决策允许随着新的观察结果变得可用而改变证据请求。

推理循环包括三个阶段:
- • **思考**:VLX\-VR解释任务目标,提出下一个证据需求,并估计当前证据是否充足。
- • **记忆**:记忆直接提供`read_memory`和`write_memory`;VLX\-VR调用其中一个操作来检索或保留多模态证据。
- • **观察**:选定的记忆操作的结果返回给VLX\-VR以进行下一个决策。

当证据充足时,VLX\-VR在支持性证据的基础上生成最终输出。当证据不足或矛盾时,模型返回“思考”并开始另一个“记忆”步骤。最小化的操作空间避免了对大量专门工具的依赖,使得训练和评估更容易标准化。

多模态记忆作为外部可检查的推理状态,而不仅仅是文本摘要的缓存。视频、音频、支持性证据、观察结果和中间状态可以在推理步骤中被读取、写入、记录和重用。这种设计也使得分析最终输出是否基于推理过程中实际观察到的证据成为可能。

证据和推理轨迹在VLX\-VR中扮演不同但相关的角色。证据是指从视频中获取或由记忆返回的任务相关多模态内容,包括视觉区域、音频片段、文本线索、时间戳和中间状态信息。推理轨迹是VLX\-VR如何解释任务、选择记忆操作、整合返回的观察结果、跨步骤连接证据以及得出最终输出的有序记录。因此,证据提供了

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。