OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型

arXiv cs.LG 论文

摘要

OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。

arXiv:2607.03050v1 公告类型:新 摘要:全模态大语言模型(OmniLLMs)因其能够联合处理音频和视频而受到广泛关注,但在音视频输入下会生成大量令牌序列,导致推理成本显著。现有的音视频令牌压缩方法通常依赖于单模态引导,忽略了音视频输入中查询相关证据的时间局部性,并隐含地假设两种模态共享时间对齐的信息密度分布。我们提出 \textbf{OmniFocus},一种无需训练、查询引导的令牌压缩方法,用于OmniLLMs,它对视频和音频进行独立的重要性估计,实现了模态对称的压缩设计,在保持音视频对齐的同时保留模态特定的显著证据,从而减轻了单模态引导压缩可能导致的模态偏差问题。在Qwen2.5-Omni模型系列上进行的四个音视频基准实验表明,OmniFocus在低令牌保留比率下保持强劲的压缩性能,并在25%令牌保留时在多个主要基准得分上优于现有基线。在DailyOmni上,使用Qwen2.5-Omni-7B在25%令牌保留时,OmniFocus保持59.40的准确率,同时相对于全令牌基线提供高达1.38$\times$预填充加速,凸显了有利的实际精度-效率权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:40

# OmniFocus:面向全模态大语言模型的查询引导模态均衡令牌压缩  
来源:https://arxiv.org/html/2607.03050  
Shijie Cao¹,², Qingyu Zhang², Boxi Yu³, Yuzhong Zhang⁴, Boxi Cao², Yaojie Lu², Hongyu Lin², Xianpei Han², Le Sun²,  
¹中国科学院大学先进交叉科学学院  
²中国科学院软件研究所中文信息处理实验室  
³利默里克大学  
⁴香港中文大学(深圳)  
{boxi2020, luyaojie, hongyu, xianpei, sunle}@iscas.ac.cn  
[email protected]  
[email protected]  
[email protected]  

###### 摘要  
全模态大语言模型(OmniLLM)因其联合处理音频和视频的能力而受到广泛关注,但它们在音视频输入下会产生大量令牌序列,导致推理成本高昂。现有的音视频令牌压缩方法通常依赖单模态引导,忽略了音视频输入中查询相关证据的时间局部性,并隐式假设两种模态具有时间对齐的信息密度分布。我们提出 OmniFocus,一种免训练的查询引导令牌压缩方法,用于 OmniLLM,它对视频和音频进行独立的显著性估计,实现模态对称的压缩设计,保留模态特有的显著证据,同时维持音视频对齐,从而缓解单模态引导压缩可能导致的模态偏差问题。在 Qwen2.5-Omni 模型家族上对四个音视频基准的实验表明,OmniFocus 在低令牌保留率下保持强大的压缩性能,并在 25% 令牌保留时在几个主要基准分数上优于现有基线。在 DailyOmni 上使用 Qwen2.5-Omni-7B 并保留 25% 令牌时,OmniFocus 保持 59.40 的准确率,同时相对于全令牌基线实现高达 1.38 倍的预填充加速,突显了有利的实际准确率-效率权衡。

## 1 引言  
全模态大语言模型(OmniLLM)将语言模型扩展到联合音视频理解,在音视频理解 [19 (https://arxiv.org/html/2607.03050#bib.bib9)]、社交与共情理解 [23 (https://arxiv.org/html/2607.03050#bib.bib14),33 (https://arxiv.org/html/2607.03050#bib.bib13),31 (https://arxiv.org/html/2607.03050#bib.bib36)] 以及音频字幕 [36 (https://arxiv.org/html/2607.03050#bib.bib5),4 (https://arxiv.org/html/2607.03050#bib.bib38)] 等任务中展现出广泛潜力。然而,音视频输入产生大量令牌序列,限制了 OmniLLM 在长时音视频场景和资源受限环境中的适用性。令牌压缩作为一种降低推理成本的方法,已在视觉、音频和长文本场景中得到广泛应用 [39 (https://arxiv.org/html/2607.03050#bib.bib25),24 (https://arxiv.org/html/2607.03050#bib.bib30),28 (https://arxiv.org/html/2607.03050#bib.bib4),15 (https://arxiv.org/html/2607.03050#bib.bib45),22 (https://arxiv.org/html/2607.03050#bib.bib32),26 (https://arxiv.org/html/2607.03050#bib.bib51)]。通过移除冗余令牌同时保留关键证据,令牌压缩可以提高推理效率并减少 GPU 内存使用,而不会牺牲太多性能。与单模态压缩不同,OmniLLM 中的令牌压缩必须同时保留音频证据、视觉证据和跨模态对齐,这对压缩设计提出了独特挑战。在先前工作中,研究者通常使用一种模态作为引导模态来评估事件信息的密度,并据此为两种模态设计不对称的压缩策略 [29 (https://arxiv.org/html/2607.03050#bib.bib2),7 (https://arxiv.org/html/2607.03050#bib.bib1),18 (https://arxiv.org/html/2607.03050#bib.bib3)]。这种单模态引导的不对称压缩策略存在两个局限性:(1) 它忽略了查询相关证据的时间局部性,(2) 它隐式假设两种模态具有时间对齐的信息密度分布。如图1 (https://arxiv.org/html/2607.03050#S1.F1) 所示,音频引导的压缩较好地保留了以音频为中心的性能,但在视觉和联合音视频理解任务上退化更为明显。这表明,使用单一模态作为压缩引导可能导致对该模态的证据过度拟合,而忽视另一模态中可能重要的信息。

为弥补这一不足,我们提出 OmniFocus¹¹¹https://github.com/icip-cas/OmniFocus,一种面向 OmniLLM 的免训练查询引导令牌压缩方法。OmniFocus 通过计算查询-令牌相似度来评估不同时间块的重要性,解决了先前方法忽略时间局部性的问题,并对重要时间块赋予更高的保留率。对视频和音频进行独立的重要性估计,使得 OmniFocus 成为一种对称的压缩方法,避免了对单模态的过度依赖,并减轻了单模态引导压缩可能导致的模态偏差问题。具体来说,OmniFocus 从查询-令牌相似度中计算模态特定的块重要性,将这些分数转换为块级的局部丢弃比率,并使用互补的跨模态关联和模态内峰值分数来保留选中的令牌。这种设计在压缩设置下同时保留了音视频对应关系和模态特有的显著证据。

在 Qwen2.5-Omni 模型家族上对四个音视频基准的实验表明,OmniFocus 实现了良好的准确率-效率权衡,并在多个基准分数上达到最佳或并列最佳的压缩结果。这些结果表明,对于长时音视频理解,查询引导的模态对称压缩比单模态引导的令牌预算分配是更可靠的设计选择。例如,在 DailyOmni 上使用 Qwen2.5-Omni-7B 并保留 25% 令牌时,OmniFocus 达到 59.40 的准确率,同时相对于全令牌基线实现 1.38 倍的预填充加速和 1.32 倍的端到端加速。我们的贡献总结如下:
- •我们识别并实证验证了 OmniLLM 中单模态引导音视频令牌压缩的模态偏差局限性。
- •我们提出 OmniFocus,一种免训练的查询引导令牌压缩方法,执行模态对称压缩,在低令牌保留率下同时保留跨模态关联和模态内峰值证据。
- •在 Qwen2.5-Omni 模型家族上对多个音视频基准的广泛实验表明,OmniFocus 实现了良好的准确率-效率权衡,并在多个基准分数上达到最佳或并列最佳的压缩结果。

请参阅图注  
图 1:单模态引导音视频令牌压缩局限性的说明。音频引导的压缩较好地保留了以音频为中心的性能,但在视觉和联合音视频理解任务上退化更为明显,这促使采用查询引导和模态均衡的压缩策略。模态类型标注协议在附录 B (https://arxiv.org/html/2607.03050#A2) 中描述。

## 2 相关工作  
### 2.1 全模态大语言模型  
全模态大语言模型(OmniLLM)将视觉、听觉和文本理解统一在单一骨干网络中 [16 (https://arxiv.org/html/2607.03050#bib.bib23),34 (https://arxiv.org/html/2607.03050#bib.bib15),35 (https://arxiv.org/html/2607.03050#bib.bib27),36 (https://arxiv.org/html/2607.03050#bib.bib5),30 (https://arxiv.org/html/2607.03050#bib.bib6),20 (https://arxiv.org/html/2607.03050#bib.bib12),31 (https://arxiv.org/html/2607.03050#bib.bib36),12 (https://arxiv.org/html/2607.03050#bib.bib37),38 (https://arxiv.org/html/2607.03050#bib.bib40)]。代表性的专有和开源系统,包括 GPT-4o、Gemini [5 (https://arxiv.org/html/2607.03050#bib.bib21)]、Qwen-Omni [36 (https://arxiv.org/html/2607.03050#bib.bib5),30 (https://arxiv.org/html/2607.03050#bib.bib6)]、Baichuan-Omni [21 (https://arxiv.org/html/2607.03050#bib.bib41)]、Mini-Omni [34 (https://arxiv.org/html/2607.03050#bib.bib15),35 (https://arxiv.org/html/2607.03050#bib.bib27)] 和 InteractiveOmni [32 (https://arxiv.org/html/2607.03050#bib.bib48)] 表明,联合音视频推理可以整合到通用多模态模型中。尽管这些系统都致力于统一的音视频推理,它们在音频和视频表示进入语言骨干网络之前的组织方式上有所不同。一些 OmniLLM 将音频和视频令牌组织成时间对齐的窗口以加强跨模态对应,而另一些则在语言骨干网络之前采用更直接的音视频融合。尽管存在这些设计差异,长时音视频输入仍然会产生大量的多模态令牌序列,并显著增加推理成本。最近的基准进一步要求对日常生活视频 [41 (https://arxiv.org/html/2607.03050#bib.bib7)]、真实世界同步全模态感知 [14 (https://arxiv.org/html/2607.03050#bib.bib8)]、协同音视频推理 [19 (https://arxiv.org/html/2607.03050#bib.bib9)] 以及跨不同时间尺度的视频问答 [8 (https://arxiv.org/html/2607.03050#bib.bib10),10 (https://arxiv.org/html/2607.03050#bib.bib11),9 (https://arxiv.org/html/2607.03050#bib.bib39)] 进行长时音视频推理。这些需求使得高效且模态忠实的音视频处理成为一个重要问题。

### 2.2 多模态模型的令牌压缩  
令牌压缩通过移除冗余令牌同时保留任务相关信息来降低推理成本。先前的工作探索了视觉令牌缩减 [1 (https://arxiv.org/html/2607.03050#bib.bib16),2 (https://arxiv.org/html/2607.03050#bib.bib17),13 (https://arxiv.org/html/2607.03050#bib.bib44),40 (https://arxiv.org/html/2607.03050#bib.bib19),39 (https://arxiv.org/html/2607.03050#bib.bib25),15 (https://arxiv.org/html/2607.03050#bib.bib45),25 (https://arxiv.org/html/2607.03050#bib.bib52),37 (https://arxiv.org/html/2607.03050#bib.bib53)]、语音或音频令牌剪枝 [22 (https://arxiv.org/html/2607.03050#bib.bib32),17 (https://arxiv.org/html/2607.03050#bib.bib55)] 以及面向大型多模态模型的多模态令牌压缩 [24 (https://arxiv.org/html/2607.03050#bib.bib30),28 (https://arxiv.org/html/2607.03050#bib.bib4),11 (https://arxiv.org/html/2607.03050#bib.bib35)],实现了无需重新训练骨干网络的高效推理。长视频理解方面的相关效率工作也通过自适应视觉选择或事件聚焦压缩来减少时间冗余 [27 (https://arxiv.org/html/2607.03050#bib.bib34),3 (https://arxiv.org/html/2607.03050#bib.bib33),6 (https://arxiv.org/html/2607.03050#bib.bib56)]。与单模态或视觉语言设置相比,OmniLLM 中的令牌压缩必须同时保留音频证据、视觉证据和跨模态对齐。OmniZip [29 (https://arxiv.org/html/2607.03050#bib.bib2)] 是这一设置中最接近的先前方法:它从音频侧注意力中估计时间重要性,并使用该信号引导音视频令牌预算。这种机制是高效的,但当查询相关证据稀疏、模态特定或在音频和视频之间时间不对齐时,它可能引入模态偏差。OmniFocus 的不同之处在于分别估计音频和视频的查询相关性,并执行模态对称压缩,而不是使用一种模态作为另一种模态的压缩引导。

## 3 方法  
在本节中,我们首先介绍 OmniLLM 中的音视频令牌组织,然后介绍 OmniFocus 的总体流程,包括查询感知模态评分、块级预算分配和令牌选择。

### 3.1 预备知识  
给定一个音视频输入 \( [V, A] \),其中 \( V \) 表示视频流,\( A \) 表示音频流,OmniLLM 首先使用模态特定的编码器将两种模态映射为令牌序列:
\[
x_a = \text{Encoder}_a(A), \quad x_v = \text{Encoder}_v(V) \tag{1}
\]
其中 \( x_a \in \mathbb{R}^{N_a \times D} \) 和 \( x_v \in \mathbb{R}^{N_v \times D} \),\( N_a \) 和 \( N_v \) 分别表示音频和视频令牌的数量。模型将两个流划分为对齐的时间窗口,并将同一窗口中的令牌按顺序排列。这产生一个交错的令牌序列 \( X_{\mathrm{av}} = [x_{v_1}, x_{a_1}, x_{v_2}, x_{a_2}, \dots, x_{v_T}, x_{a_T}] \),其中 \( x_{v_i} \) 和 \( x_{a_i} \) 分别表示时间块 \( i \) 中的视频和音频令牌。OmniFocus 在令牌被 LLM 骨干网络使用之前对 \( X_{\mathrm{av}} \) 进行操作。

### 3.2 OmniFocus  
请参阅图注  
图 2:OmniFocus 概述。给定文本查询和时间对齐的音视频块,OmniFocus 估计模态特定的查询相关性,在经校准的全局模态预算下分配块级局部丢弃比率,并使用跨模态关联和模态内峰值分数选择保留的令牌,然后将压缩后的序列输入 LLM 骨干网络。

给定一个文本查询 \( q \) 和按 \( T \) 个时间块组织的交错音视频令牌序列 \( X_{\mathrm{av}} \),OmniFocus 在令牌被输入 LLM 骨干网络之前对音频和视频令牌进行压缩。该方法免训练,不修改底层的 OmniLLM。如图 2 (https://arxiv.org/html/2607.03050#S3.F2) 所示,OmniFocus 包含三个阶段:(1) 估计每个块中每种模态的查询感知重要性,(2) 在全局模态预算下将这些重要性分数转换为块级丢弃比率,(3) 使用跨模态关联和模态内显著性保留令牌。

#### 基于查询相关性的模态重要性评分。  
由于查询相关证据通常集中在少数时间块中,并可能出现在不同的模态中,OmniFocus 为每个音视频块估计相对于文本查询的模态特定相关性。我们从 LLM 令牌嵌入层提取查询令牌,如同标准 LLM 输入处理一样,因此查询令牌与 LLM 消费的音频和视频令牌处于相同的输入嵌入空间。令 \( q = \{q_1, q_2, \dots, q_L\} \in \mathbb{R}^{L \times D} \) 表示嵌入的查询特征。我们通过对 \( \ell_2 \) 归一化的查询令牌进行均值池化并对结果归一化来获得单个查询表示:
\[
\bar{q} = \mathrm{Normalize}\!\left(\frac{1}{L}\sum_{l=1}^{L}\hat{q}_l\right), \quad \hat{q}_l = \frac{q_l}{\|q_l\|_2} \tag{2}
\]
对于每个时间块 \( i \in \{1,\dots,T\} \),OmniFocus 独立地为视频和音频测量查询相关性。令 \( x_{v_i} = \{x_{v_i}^1, \dots, x_{v_i}^{n_v^i}\} \) 和 \( x_{a_i} = \{x_{a_i}^1, \dots, x_{a_i}^{n_a^i}\} \) 分别表示块 \( i \) 中的视频和音频令牌。块级相关性分数为:
\[
s_v^i = \max_j \; \hat{x}_{v_i}^j \cdot \bar{q}, \quad s_a^i = \max_j \; \hat{x}_{a_i}^j \cdot \bar{q} \tag{3}
\]
其中 \( \hat{x} \) 表示 \( \ell_2 \)-归一化后的令牌。

相似文章

面向高效全模态LLM的阶段自适应Token选择方法

Hugging Face Daily Papers

SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。

超越文本主导:理解全模态大语言模型的模态偏好

Hugging Face Daily Papers

# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa