VideoMM:用于高效视频MLLMs的自适应宏微观推理
摘要
VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。
arXiv:2609.16722v1 公告类型:新
摘要:将多模态大语言模型 (MLLMs) 扩展到长视频理解时,视觉token的爆炸性增长成为瓶颈,这会饱和上下文窗口并带来高昂的成本。当前解决方案主要依赖辅助模型进行token缩减,但面临一个基本困境:轻量级编码器驱动的方法往往忽略关键语义信息,而重量级MLLM驱动的缩减则抵消了效率收益。{在本研究中,我们发现了这一困境背后更根本的低效性:虽然细粒度的视觉细节对于详细理解至关重要,但对于选择语义相关区域的初步任务而言,它们在很大程度上是冗余的。} 基于此,我们引入了 \textbf{VideoMM},标志着从以模型为中心的缩减向自适应感知粒度的范式转变。具体而言,我们的框架 {将选择与推理解耦},通过在成本效益高的 \textit{宏代理}(源自降采样帧)上执行语义过滤,并仅在必要时将选定区域投影到高保真 \textit{微观token} 上进行详细理解。大量评估表明,VideoMM 显著优于现有解决方案。它在LongVideoBench上相比全上下文基线实现了6.13倍的速度提升和7.4%的准确率增益,并且相比当前领先方法进一步加速推理2.73倍,建立了长视频理解的高度可扩展范式。我们的代码可在以下地址获取:https://github.com/adfh917k/VideoMM。
查看缓存全文
缓存时间: 2026/09/16 09:02
# 自适应宏观-微观推理实现高效视频多模态大语言模型
来源:https://arxiv.org/html/2609.16722
## VideoMM:面向高效视频多模态大语言模型的自适应宏观-微观推理致谢:∗\\ast同等贡献:\{haoyuguo, yfung\}@mail\.ustc\.edu\.cn致谢:†\\dagger通讯作者:xkxie@ustc\.edu\.cn
郭浩宇1,3,∗\\ast,冯源2,3,∗\\ast,吕俊林2,3,肖明军2,3,周思凯1,3,谢希科1,3,†\\dagger所属机构:1中国科学技术大学生物医学工程学院 2中国科学技术大学计算机科学学院 3中国苏州先进技术研究院MIRACLE中心数据黑暗实验室
###### 摘要\.
将多模态大语言模型\(MLLMs\)扩展到长视频理解受限于视觉token数量的爆炸性增长,这既会超出上下文窗口限制,也会带来难以承受的计算成本。现有解决方案主要依赖辅助模型进行token缩减,但面临一个根本性困境:轻量级编码器驱动的方法常忽略关键语义信息,而重量级MLLM驱动的缩减则抵消了效率提升。本研究指出该困境背后更深层的效率问题:虽然细粒度视觉细节对详细理解至关重要,但在选择语义相关区域的初步任务中,这些细节大部分是冗余的。基于此发现,我们提出VideoMM框架,标志着从以模型为中心的缩减转向自适应感知粒度的范式转变。具体而言,本框架通过在成本低廉的宏观代理(源自降尺度帧)上执行语义过滤来解耦选择与推理过程,并仅在必要时将所选区域投影为高保真微观token进行详细理解。大量评估表明VideoMM显著优于现有解决方案:在LongVideoBench基准测试中,相比全上下文基线模型实现6.13倍推理加速和7.4%准确率提升,并在当前领先方法基础上进一步加速2.73倍,为长视频理解建立了高度可扩展的范式。我们的代码已开源:https://github\.com/adfh917k/VideoMM\.
## 1\.引言
多模态大语言模型\(MLLMs\)\(Team, 2025 (https://arxiv.org/html/2609.16722#bib.bib27);Bai et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib3);Team et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib28);Zohar et al\., 2024 (https://arxiv.org/html/2609.16722#bib.bib45);Tang et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib25)\)在静态图像和短视频片段解读方面已取得显著成功。然而,将这些能力扩展到长视频理解仍是一项关键挑战。尽管长视频分析能实现高价值应用——如视频问答、时序事件定位和长时程动作识别\(Liu et al\., 2025a (https://arxiv.org/html/2609.16722#bib.bib20);AlShami et al\., 2024 (https://arxiv.org/html/2609.16722#bib.bib2);Liu et al\., 2021 (https://arxiv.org/html/2609.16722#bib.bib22)\)——但它会引入严重的可扩展性瓶颈。主要限制来自海量视觉token的涌入:例如在广泛采用的Qwen-3-VL模型中,一个10分钟的720p视频以1 fps采样会产生超过30万token。如此庞大的数量会迅速耗尽当前模型有限的上下文窗口,导致计算成本高得令人望而却步。
(a)Qwen2\.5\-VL\-7B(b)GLM\-4\.1V\-9B(c)Qwen3\-VL\-8B
图1\.VideoMM在LongVideoBench上建立了新的精度-效率前沿:相比原始基线模型实现6.13倍推理加速并提升7.4%准确率,相比FlexSelect在无精度损失情况下实现2.73倍加速。为缓解此问题,现有研究聚焦于在完整推理前通过辅助模型减少视觉token数量,但这些方法面临一个根本性困境。轻量级编码器驱动方法\(Bolya et al\., 2023 (https://arxiv.org/html/2609.16722#bib.bib4);Liu et al\., 2025b (https://arxiv.org/html/2609.16722#bib.bib23);Yang et al\., 2024 (https://arxiv.org/html/2609.16722#bib.bib39)\)虽然高效,但因有限的语义感知能力常丢弃语义关键信息;而MLLM驱动的选择\(zhang et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib43)\)虽能提升精度,却需付出巨大的计算开销。因此,现有以模型为中心的缩减方法难以平衡token选择的精度与效率。我们认为该瓶颈源于一个更基础的冗余性:在长视频理解中,推理的不同阶段本质上需要不同层次的感知保真度。
虽然高保真视觉细节对精确语义理解至关重要,但对于识别哪些区域相关的初步任务而言,这些细节大多不必要。因此,直接在原始高分辨率视觉token上进行语义过滤本质上是一种浪费。
借鉴人类感知由粗到细的特性——先把握全局上下文(宏观),再聚焦特定细节(微观)——我们提出VideoMM,一种将语义定位与细粒度推理解耦的宏观-微观范式。VideoMM首先使用从降尺度帧派生的轻量级宏观代理识别相关区域。随后采用共识机制控制自适应计算:仅在确认需要细粒度推理时,才选择性激活高分辨率微观token。通过严格遵循这种由粗到细的流程,VideoMM确保重计算仅保留在需要精细审查的区域,从而在保证语义保真度的同时最小化冗余计算。在三个基准测试上的广泛评估验证了该方法的有效性。值得注意的是,如图1 (https://arxiv.org/html/2609.16722#S1.F1)所示,VideoMM在具有挑战性的LongVideoBench上相比原始基线平均实现6.1倍加速和7.0%准确率提升,并在相当精度下比最新先进方法加速超过2.73倍。
总结来说,我们的贡献如下:
- •我们指出现有token缩减方法中存在的根本性困境源于以模型缩减为中心,难以平衡精度与效率。为此,我们提出从模型规模转向感知粒度的范式转变,利用视觉信息的由粗到细特性来协调选择精度与开销之间的冲突。
- •我们提出VideoMM,一种模拟人类由粗到细感知的宏观-微观范式:通过宏观视图代理进行分组选择,利用轻量级代理将token选择与密集处理解耦;自适应宏观-微观推理则仅在模糊情况下动态调用特定细节。
- •广泛评估验证了VideoMM的有效性:在LongVideoBench上实现6.1倍加速和7.0%准确率提升。通过进一步分析宏观-微观变体,我们证明了这种面向感知粒度范式的内在有效性,建立了超越现有以模型为中心视角的基础且具有前景的方向。
## 2\.相关工作
鉴于视频MLLM中视觉token数量的不断增加,token缩减对高效推理至关重要。当前策略通常采用额外的降尺度模型在完整推理前修剪不重要token。根据使用的降尺度模型,这些策略主要分为两类:(1)轻量级编码器驱动方法\(Bolya et al\., 2023 (https://arxiv.org/html/2609.16722#bib.bib4);Yang et al\., 2024 (https://arxiv.org/html/2609.16722#bib.bib39);Liu et al\., 2025b (https://arxiv.org/html/2609.16722#bib.bib23);Tao et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib26)\)仅使用ViT编码器选择token。例如VisionZip\(Yang et al\., 2024 (https://arxiv.org/html/2609.16722#bib.bib39)\)首先利用ViT注意力选择主导视觉token子集,然后基于嵌入相似性通过平均合并剩余较不重要的token,从而实现有效的token缩减。相比之下,VidCom\(Liu et al\., 2025b (https://arxiv.org/html/2609.16722#bib.bib23)\)使用ViT嵌入的多样性表示帧级重要性,随后对不同帧应用不同的token压缩比。然而这些方法容易发生错误修剪,因为轻量级ViT缺乏充分捕捉复杂视频语义的能力。(2)近期重量级MLLM驱动方法\(Chen et al\., 2024b (https://arxiv.org/html/2609.16722#bib.bib8);Zhang et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib42);zhang et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib43)\)进一步利用小型MLLM更准确地检测和保留关键视觉token。例如当前SOTA方法FlexSelect\(zhang et al\., 2025 (https://arxiv.org/html/2609.16722#bib.bib43)\)采用缩减规模的MLLM通过跨模态注意力识别重要token,随后仅将这些选定token和文本查询输入目标MLLM进行推理。虽然这种方法提高了精度,但计算开销仍然很大;辅助MLLM引入的开销实际上抵消了通过token缩减获得的延迟收益。
总体而言,当前过分强调降尺度模型规模以实现快速token缩减导致了精度-效率困境。相比之下,VideoMM通过将焦点从模型规模转向感知粒度实现了范式转变。通过构建宏观级代理进行快速token缩减,VideoMM显著降低了此过程的计算开销——即使使用MLLM引导压缩——而不牺牲语义深度。实证表明,VideoMM在保持MLLM驱动策略精度优势的同时,实现了比轻量级编码器驱动方法更快的推理速度。111更广泛的相关工作在附录A (https://arxiv.org/html/2609.16722#A1)中讨论
见标题图2\.VideoMM框架。(a)阶段1:宏观视图代理分组选择,高效识别信息区域。(b)阶段2:自适应宏观-微观推理,通过共识评估语义充分性,仅在必要时整合微观视图视频。
## 3\.方法
我们考虑标准MLLM通常包含两个主要组件:视觉Transformer编码器\(ViT\)和大型语言模型LLM。给定输入视频\(\\mathbf{V}\\in\\mathbb{R}^{T\\times H\\times W\\times 3}\),ViT编码器直接将帧处理成视觉token序列:
\(1\) \(\\mathbf{X}\_{V}=\\text{ViT}(\\mathbf{V})\\in\\mathbb{R}^{N\\times D}\),其中\(N=T\\times H\_{p}\\times W\_{p}\)是视觉token总数,\(T\)为采样视频帧数,\(H\_{p},W\_{p}\)分别表示补丁高度和宽度,\(D\)是ViT的隐藏维度。最后,视觉token \(\\mathbf{X}\_{V}\)与文本查询token \(\\mathbf{X}\_{Q}\)拼接。LLM \(\\mathbf{M}\)通过建模条件概率自回归生成响应\(\\mathbf{Y}=\\{y\_{i}\\}\_{i=1}^{L}\):
\(p(\\mathbf{Y}\\mid\\mathbf{X}\_{V},\\mathbf{X}\_{Q})=\\prod\_{i=1}^{L}p(y\_{i}\\mid\\mathbf{X}\_{V},\\mathbf{X}\_{Q},y\_{<i})\),其中\(y\_{<i}\)表示第\(i\)步前生成的token。
### 3\.1\.VideoMM整体架构
我们提出VideoMM,一个将人类感知由粗到细特性操作化的框架,以解决长视频理解中的效率-精度困境。驱动我们架构的核心见解是:虽然长视频包含海量token,但语义密度是稀疏的——宏观视图通常足以进行通用推理,而微观细节仅在特定模糊片段中必要。如图2 (https://arxiv.org/html/2609.16722#S2.F2)所示,VideoMM通过两个不同阶段的流水线协作实现这一理念。(1)宏观代理分组选择:此阶段充当轻量级语义侦察兵。通过对空间降尺度的代理进行操作,在MLLM指导下快速隔离语义相关的时间区域,从而规避处理原始高分辨率帧的高昂计算成本。(2)自适应宏观-微观推理:此阶段模拟人类注意力放大的认知过程——仅在全局感知存在模糊时才调用细粒度细节。模型不是不加区分地处理高分辨率token,而是通过共识机制评估宏观视图的充分性。如果全局上下文能产生可靠答案,推理提前终止;仅在解决不确定性需要时才激活高分辨率微观token。这种分层设计确保计算资源精准分配到需要的地方,在不影响模型解析细微视觉细节能力的前提下实现显著的推理加速。
### 3\.2\.阶段I:宏观代理分组选择
为平衡MLLM引导token选择的精度与计算效率,我们在输入视频的空间降尺度表示上操作。该策略基于一个重要发现:降尺度能显著减少数据量,同时保留关键特征的空间一致性。通过在轻量级代理上识别显著区域,我们大幅降低了选择过程的计算开销。阶段I伪代码请参见算法1 (https://arxiv.org/html/2609.16722#alg1)。
算法1 阶段I:宏观代理分组选择
1:视频
\(\\mathbf{V}\\in\\mathbb{R}^{T\\times H\\times W\\times 3}\),查询
\(Q\),缩放因子
\(k\),分组数
\(G\),token预算
\(B\)
2:宏观级token集
\(\\mathcal{T}^{\\prime}\)
3:1. 空间降尺度生成宏观代理
4:
\(\\mathbf{V}^{\\prime}\\leftarrow\\text{Downscale}(\\mathbf{V},k)\) ▷\(\\mathbf{V}^{\\prime}\\in\\mathbb{R}^{T\\times\\frac{H}{k}\\times\\frac{W}{k}\\times 3}\)
5:
\(\\mathbf{X}\_{V^{\\prime}}\\leftarrow\\mathrm{ViT}(\\mathbf{V}^{\\prime})\) ▷token数量减少\(k^{2}\)倍
6:
\(\\mathcal{T}^{\\prime}\\leftarrow\\emptyset\)
7:2. MLLM引导的分组选择
8:将帧\(f\_{1:T}\)交织成
\(G\)组
\(\{\\mathcal{F}\_{j}\}\)
9:对每组
\(\\mathcal{F}\_{j}\)
10:为视觉token\(i\)提取跨模态
\(A\_{q,i}^{(l,h)}\)
11:
\(s\_{i}=\\max\_{l\\in\\mathcal{L}\_{\\text{mid}}}\\max\_{h}\\max\_{q}A\_{q,i}^{(l,h)}\)
12:对每帧\(f\\in\\mathcal{F}\_{j}\)计算
\(s\_{f}\\leftarrow\\sum\_{i\\in f}s\_{i}\)
13:// 保留前50%的帧
14:
\(\\mathcal{F}\_{j}^{\\prime}\\leftarrow\\operatorname{TopRatio}(\\mathcal{F}\_{j},\\alpha,\\text{key}=s\_{f})\)
15:// 从保留帧中选择top token
16:
\(\\mathcal{T}\_{j}^{\\prime}\\leftarrow\\operatorname{TopK}(\\{\\mathbf{X}\_{V^{\\prime}}\\in\\mathcal{F}\_{j}^{\\prime}\\},B/G,\\text{key}=s\_{i})\)
17:
\(\\mathcal{T}^{\\prime}\\leftarrow\\mathcal{T}^{\\prime}\\cup\\mathcal{T}\_{j}^{\\prime}\)相似文章
选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究
本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。
AdaCodec:面向视频多模态大模型的预测性视觉编码
AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
Mage-VL:一种高效的编解码原生流式多模态基础模型
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。