基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架

arXiv cs.AI 论文

摘要

ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。

arXiv:2607.24794v1 公告类型:新 摘要:虽然多模态大语言模型(MLLMs)在基础视频任务中表现出优越的泛化能力,但受限的上下文窗口限制了其长视频理解能力。为了适应这一限制,模型通常采用关键帧选择。然而,均匀采样或静态查询引导的选择往往忽略了关键的时间上下文,无法适应不同的查询时间粒度。在本文中,我们提出 ReMem,一种时间粒度自适应的关键帧选择框架,用于免训练的长视频问答(LongVideoQA)。ReMem引入了双层记忆增强的适配机制。在查询层面,记忆驱动的问题解析(Memory-Driven Question Parsing)利用LLM的长期记忆来解码问题的时间粒度并提取语义实体。在视频层面,协同双语义帧对齐(Synergistic Dual-Semantic Frame Alignment)利用内在的结构记忆来对齐帧与查询语义,指导结构感知的动态帧路由(Structure-Aware Dynamic Frame Routing)对事件进行聚类并最优分配采样预算。通过记忆机制显式保留时间信息,ReMem抑制了冗余,并使MLLMs能够进行鲁棒的多粒度视频推理。在四个流行的LongVideoQA基准上使用三个MLLMs进行评估,展示了高效的最先进零样本性能;值得注意的是,结合ReMem的LLaVA-Video在LVBench上达到54.5%(+12.3%),在LongVideoBench上达到67.1%(+8.2%)。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:52

# 基于记忆的推理:一种时间粒度自适应框架用于免训练长视频理解
来源:https://arxiv.org/html/2607.24794
11机构名称:新加坡国立大学,新加坡
11邮箱:menglinghao25@u\.nus\.edu; ymjin@nus\.edu\.sg
22机构名称:高性能计算研究所,新加坡科技研究局(A\*STAR),新加坡
22邮箱:hzfu@ieee\.org
33机构名称:南洋理工大学,新加坡
33邮箱:cs\-qiankun\.li@ntu\.edu\.sg
44机构名称:中国科学技术大学,安徽,中国
55机构名称:吉林大学,吉林,中国
钱坤李\* 毛俊源 廖璞金 何志成 张恩博 王坤 刘洋 胡华柱\(✉\) 金跃明\(✉\)

###### 摘要

尽管多模态大语言模型(MLLMs)在基础视频任务中展现出卓越的泛化能力,但受限的上下文窗口限制了它们对长视频的理解。为应对这一限制,模型通常采用关键帧选择。然而,均匀采样或静态查询引导的选择往往忽略关键的时间上下文,无法适应不同查询的时间粒度。本文提出**ReMem**,一种时间粒度自适应的关键帧选择框架,用于免训练的长视频问答(LongVideoQA)。ReMem引入了一种**双层记忆增强自适应**机制。在查询层面,**记忆驱动的查询解析**利用LLM的长期记忆来解码问题的时间粒度并提取语义实体。在视频层面,**协同双语义帧对齐**利用视频内在的结构记忆将帧与查询语义对齐,指导**结构感知的动态帧路由**进行事件聚类并最优分配采样预算。通过显式利用记忆机制保留时间信息,ReMem抑制了冗余,并使MLLMs能够执行鲁棒的多粒度视频推理。在四个主流LongVideoQA基准上使用三种MLLMs进行的评估表明,实现了高效的、最先进的零样本性能;值得注意的是,使用ReMem的LLaVA-Video在LVBench上达到54.5%(+12.3%),在LongVideoBench上达到67.1%(+8.2%)。代码已开源:ReMem (https://github.com/jinlab-imvr/ReMem)。

††脚注:\*共同第一作者。
✉通讯作者。

## 1 引言

近年来,多模态大语言模型(MLLMs)通过将视觉编码器与LLMs对齐,在跨模态推理方面取得了显著突破[liu2023visual, zhu2023minigpt, bai2023qwen]。通过集成时间建模,这种架构扩展到视频领域,将静态感知适应为动态理解[lin2024video, maaz2024video, li2025videochat, li2024llama, zhang2026bimm]。因此,MLLMs继承了强大的指令遵循能力,并在基础视频任务中展现出卓越的泛化性能[jin2024chat, zhang2025collaboratively]。

尽管取得了这些进展,标准MLLMs在处理长视频理解任务时仍面临困难[fu2025video, zhou2024mlvu, wang2025lvbench]。大量的帧数超出了有限的上下文窗口,无法处理所有帧[zhang2024long, song2024moviechat, zhang2025q]。因此,模型通常采用稀疏均匀采样,但这会无意中遗漏关键证据,导致错误预测[wang2023internvid, tang2025adaptive]。为解决这一问题,近期研究致力于在有限的帧预算内选择最具区分能力的关键帧[zhang2024simple, tang2025adaptive, li2025frameoracle, yu2023self]。

参见图注Figure 1:查询自适应方法孤立地评估帧,缺乏时间理解。我们的**ReMem**通过记忆增强的时间粒度自适应采样克服了这一瓶颈,实现了长视频推理的更高准确性和效率。

然而,当前方法通常依赖静态的查询-帧相似度进行关键帧选择[ren2024timechat, tang2025adaptive, zhang2025q],无法适应不同问题的变化时间粒度。如图1 (https://arxiv.org/html/2607.24794#S1.F1)所示,纯查询自适应采样往往从局部高分段过度采样冗余帧。因此,虽然这种方法适用于细粒度查询,但会忽略重要的时间依赖关系,导致在需要连续时间推理的任务上性能不佳。此外,现有方法忽略了问题中蕴含的潜在概念,未能增强文本信噪比以实现有效的查询-帧对齐。

为在免训练设置下解决这些限制,**记忆**这一概念可作为双重机制来处理和对齐查询与视频。对于查询,LLM固有的**长期记忆**蕴含丰富的认知先验,能够提供分析时间粒度和建立语义关联的直觉[achiam2023gpt]。对于视觉内容,挖掘视频内在的**结构记忆**能够捕捉其连续的时间演化,有效弥合分散帧之间的上下文鸿沟。基于这一洞察,我们提出**ReMem**(基于记忆的推理),一种时间粒度自适应的免训练关键帧选择框架,用于由记忆机制增强的零样本LongVideoQA。

ReMem构建了一个记忆增强的双层自适应框架,将问题语义与视频视觉及时间动态对齐。在**查询层面**,推理LLM利用长期记忆执行**记忆驱动的查询解析**,评估查询的时间粒度并提取关键实体以指导视觉检索。在**视频层面**,**协同双语义帧对齐**将帧与查询语义对齐,指导**结构感知的动态帧路由**进行事件聚类和预算分配。这种记忆增强策略抑制了时间冗余,保留了因果结构,使MLLMs能够执行鲁棒的多粒度视频推理。

我们在四个LongVideoQA基准上使用三种MLLMs评估ReMem,实现了最先进的零样本性能和高效率。在LVBench[wang2025lvbench]和LongVideoBench[wu2024longvideobench]上,使用ReMem的LLaVA-Video分别达到54.5%(+12.3%)和67.1%(+8.2%)的准确率。这些显著提升在所有评估的MLLMs上一致观察,凸显了ReMem作为一个无需参数调优的通用框架。

本文的主要贡献总结如下:

- ❶我们提出**ReMem**,一种免训练框架,执行时间粒度自适应关键帧选择用于长视频理解,使MLLMs能在严格的上下文约束下对长视频进行推理。
- ❷我们引入了一种**记忆驱动的双层自适应机制**,利用LLM长期记忆解析查询时间粒度,并利用视频结构记忆通过结构感知动态路由对齐帧。
- ❸跨三种MLLM架构和四个主流LongVideoQA基准的大量实验表明,ReMem达到了新的最先进零样本性能。

## 2 相关工作

### 2.1 视频大语言模型

近期,视频大语言模型在视觉-文本对齐和时空建模方面取得了显著进展[zhang2024llava, bai2025qwen3, li2024llava, liu2024llavanext, bai2025qwen2, wang2024internvideo2, zhang2025collaboratively, zhang2026bimm]。例如,LLaVA-OneVision[li2024llava]和LLaVA-NeXT-QW2[liu2024llavanext]引入了AnyRes策略和动态视觉池化,以有效处理不同场景下的高分辨率帧。VideoLLaMA3[zhang2025videollama]通过先进的视觉语言架构进一步增强了时空表示,而Chat-UniVi-V1.5[jin2024chat]采用动态令牌合并以在保持性能的同时优化计算效率。

为应对长视频理解的计算挑战,专门架构应运而生以解耦序列长度与内存成本。LongVA[zhang2024long]和LongVILA[chen2024longvila]通过引入高效的时空池化和系统级训练优化,显著扩展了上下文窗口。Video-XL[shu2025video]利用潜在视觉总结令牌将小时级视频压缩为可管理的KV缓存。类似地,LongVU[shen2024longvu]和Video-CCAM[fei2024video]引入了时空上下文压缩和因果交叉注意力掩码,有效减轻了繁重的内存负担。此外,Video-R1[feng2025video]和VideoChat-R1[li2025videochat-r1]将演绎推理轨迹集成到视频理解中,生成中间逻辑步骤,使MLLMs能够基于复杂时间证据和结构化视觉线索进行推理。

### 2.2 关键帧选择

处理密集视频令牌的计算瓶颈推动了关键帧选择的发展[zhao2023search, zhu2025focus, guo2025logic, tang2025adaptive, song2026ktv],其目标是从视频内容中识别信息量最大的帧。这些方法大致可分为基于训练和免训练两类。

基于训练的方法通常学习专用模块以提取相关证据(例如,Frame-Voyager[yu2024frame]、KeyVideoLLM[liang2024keyvideollm]、FrameOracle[li2025frameoracle]),或微调轻量级LLM作为即插即用过滤器,如Selector[hu2025m]。或者,近期工作如CoF[ghazanfari2025chain]和GenS[yao2025generative]通过训练视频LLM生成时间轨迹,将选择直接集成到推理过程中。

免训练方法提供与现成模型的即插即用兼容性,从静态均匀采样过渡到查询自适应策略。例如,AKS[tang2025adaptive]优化了相关性和覆盖度之间的平衡,而Q-Frame[zhang2025q]和FlexSelect[zhang2025flexselect]分别通过多分辨率和上下文感知的概率采样动态调整视觉预算。此外,BOLT[liu2025bolt]采用动态路由将证据与意图匹配,MDP3[sun2025mdp3]利用行列式点过程实现列表级多样性。然而,这些方法主要基于孤立的静态语义评估帧,忽略了复杂长视频推理所需的连续时间动态和远程因果依赖。

## 3 方法

我们提出ReMem,一种免训练框架,自适应地选择信息量最大的帧用于零样本长视频问答(LongVideoQA)。如图2 (https://arxiv.org/html/2607.24794#S3.F2)所示,ReMem对长视频理解执行全面的双层记忆自适应:❶查询层面自适应,推理LLM利用长期记忆评估问题的粒度并提取关键实体;❷视频层面自适应,通过记忆增强的视觉证据蒸馏选择关键帧。整体流程包含三个核心模块:**记忆驱动的查询解析**(⊳\triangleright第3.1节 (https://arxiv.org/html/2607.24794#S3.SS1))、**协同双语义帧对齐**(⊳\triangleright第3.2节 (https://arxiv.org/html/2607.24794#S3.SS2))和**结构感知的动态帧路由**(⊳\triangleright第3.3节 (https://arxiv.org/html/2607.24794#S3.SS3))。

参见图注Figure 2:ReMem概述。ReMem对免训练LongVideoQA执行双层自适应:❶查询层面自适应,LLM评估问题的时间粒度并提取实体;❷视频层面自适应,记忆增强的双语义证据协助选择关键帧。流程包含三个模块:记忆驱动的查询解析、协同双语义帧对齐和结构感知的动态帧路由。

### 3.1 记忆驱动的查询解析

#### 粒度分析。

先前的免训练LongVideoQA方法在选择信息帧时通常不考虑问题语义中变化的复杂时间粒度。为解决此问题,我们将粒度分析形式化为一个连续的推理过程 \(f_{\text{granularity}}: Q \to g\),其中LLM借助其**长期记忆**对查询 \(Q\) 进行评分,得到 \(g \in [0,1]\) 以量化其时间粒度。具体来说,较低的 \(g\) 表示局部事件,需要从狭窄时间窗口中提取密集视觉证据;较高的 \(g\) 反映全局性查询,需要长距离上下文集成(例如,“视频中太阳出现了多少次?” \(\to g=0.90\))。

#### 实体提取。

除时间粒度外,原始查询通常缺乏明确的视觉线索以实现精确对齐。为弥合这一差距,我们将实体提取形式化为 \(f_{\text{entity}}: Q, \{C_i\} \to \{E_i\}\),其中LLM利用其**长期记忆**从问题 \(Q\) 和候选选项 \(\{C_i\}\) 中提取具体视觉签名(例如,“视频展示了多少个姆巴佩的精彩进球?” 和 \(\{“6”, “5”, “4”, “3”\} \to \{“姆巴佩进球庆祝”, “球网晃动”, “姆巴佩球衣号码”\}\))。

### 3.2 协同双语义帧对齐

#### 查询增强。

我们提取问题 \(Q\) 和提取实体 \(\{E_i\}\) 的CLIP文本嵌入 \( \bm{v}_q \in \mathbb{R}^D \) 和 \( \bm{v}_e \in \mathbb{R}^{N \times D} \)。通过交叉注意力残差流将 \( \bm{v}_e \) 动态注入 \( \bm{v}_q \):

\[
\bm{v}_{anc} = \text{LN}\left( \bm{v}_q + \bm{W}_f \left[ \bm{v}_q \parallel \text{Softmax}\left( \frac{(\bm{W}_q \bm{v}_q)(\bm{W}_k \bm{v}_e)^\top}{\sqrt{D}} \right) (\bm{W}_v \bm{v}_e) \right] \right),
\tag{1}
\]

其中 \(\text{LN}(\cdot)\) 表示层归一化,\(\bm{W}_q, \bm{W}_k, \bm{W}_v \in \mathbb{R}^{D \times D}\) 是投影矩阵,\([\cdot \parallel \cdot]\) 表示沿特征维度的拼接操作,\(\bm{W}_f \in \mathbb{R}^{2D \times D}\) 是融合权重。由此得到 \(\bm{v}_{anc}\),一个视觉引导的增强查询锚点,其在后续帧检索中具有显著提高的信噪比。

#### 静态视觉-语义对齐。

令 \(\mathcal{I} = \{I_i\}_{i=1}^M\) 表示从原始视频中均匀采样的帧序列。对于每帧 \(I_i\),提取CLIP视觉嵌入 \(\bm{v}_i \in \mathbb{R}^D\)。为在控制尺度与高阶相关性的同时度量语义亲和力,ReMem定义静态视觉-语义相似度为:

\[
\mathcal{S}_{\text{v}}(\bm{v}_i, \bm{v}_{anc}) = \alpha \frac{(\bm{W}_s \bm{v}_{anc})^\top (\bm{W}_s \bm{v}_i)}{\|\bm{W}_s \bm{v}_{anc}\|_2 \|\bm{W}_s \bm{v}_i\|_2} + \beta \left( \frac{\bm{v}_{anc}^\top \bm{W}_c \bm{v}_i}{\sqrt{D}} \right)^2,
\tag{2}
\]

其中 \(\bm{W}_s, \bm{W}_c \in \mathbb{R}^{D \times D}\) 表示投影权重矩阵。

相似文章