通过CoRe注意力头对多模态大语言模型中功能稀疏性的机制洞察
摘要
本文识别了多模态大语言模型中一种特殊的注意力头子集,称为CoRe头,它们在跨模态检索中表现出功能稀疏性。因果干预实验表明,这些头对多模态推理至关重要,利用这种稀疏性可以加速推理。
arXiv:2606.05843v1 公告类型:新
摘要:尽管多模态大语言模型(MLLMs)在复杂的视觉-语言任务上展现出卓越的能力,但它们如何从复杂、嘈杂的上下文中提取与查询相关的视觉特征的机制仍然不透明。在本文中,我们提出一项深入的可解释性研究,揭示了多模态大语言模型中的一个深刻结构属性:跨模态检索中的功能稀疏性。利用一种称为检索注意力质量(RAM)的令牌级度量,我们识别并描述了一个高度专门化的注意力头子集,称为上下文感知检索(CoRe)头。在不同的视觉领域和模型规模上,我们观察到明确的功能分工:CoRe头充当专用信息提取器,而大多数其他头则将注意力分布在更广泛的上下文区域。因果干预进一步证明了这些专门化头的必要性。仅消融前5%的CoRe头就会导致多模态推理性能显著下降,而消融排名较低的头影响甚微。此外,加速实验验证了CoRe头的实用性,表明利用这种局部稀疏性可以显著加速推理,同时保持稳健的任务性能。我们的发现揭示了多模态大语言模型中功能稀疏性的结构原则,完善了对机制可解释性的当前理解,并为未来架构设计和模型优化奠定了理论基础。
查看缓存全文
缓存时间: 2026/06/05 08:08
# 通过CoRe Heads理解多模态大语言模型中功能稀疏性的机制洞见
来源:https://arxiv.org/html/2606.05843
Ruoxi Sun¹,Quantong Qiu¹,Juntao Li¹,Zecheng Tang¹,Yihang Lou²,Min Zhang¹
¹苏州大学 ²北京大学
{ljt}@suda.edu.cn
###### 摘要
尽管多模态大语言模型(MLLMs)在复杂的视觉-语言任务中展现出卓越的能力,但它们从复杂、嘈杂的上下文中提取与查询相关的视觉特征的具体机制仍不透明。本文提出了一项深入的可解释性研究,揭示了MLLMs中一个深刻的结构属性:跨模态检索中的功能稀疏性。利用一种名为检索注意力质量(RAM)的令牌级度量,我们识别并刻画了一个高度专业化的注意力头子集,称为上下文感知检索(CoRe)头。在多种视觉领域和模型规模下,我们观察到明确的功能分工:CoRe头充当专用的信息提取器,而大多数其他头则将注意力分布到更广泛的上下文区域。因果干预进一步证明了这些专门化头的必要性。仅消融前5%的CoRe头就会导致多模态推理性能显著下降,而消融排名较低的头则影响甚微。此外,加速实验验证了CoRe头的实用性,表明利用这种局部稀疏性可以显著加速推理,同时保持稳健的任务性能。我们的发现揭示了MLLMs中功能稀疏性的结构原理,完善了当前对机制可解释性的理解,并为未来架构设计和模型优化奠定了理论基础。
## 1 引言
请见图注 图1:MLLMs注意力头在RefCOCOg上的功能专业化。左侧(CoRe头):高注意力区域对应上下文相关对象。右侧(底部头):高注意力区域与上下文相关性较弱。
多模态大语言模型(MLLMs)在复杂的视觉-语言任务中展现出卓越的能力[11 (https://arxiv.org/html/2606.05843#bib.bib2), 18 (https://arxiv.org/html/2606.05843#bib.bib1), 26 (https://arxiv.org/html/2606.05843#bib.bib3)]。这些模型将高维视觉信号映射到大语言模型的语义空间中[15 (https://arxiv.org/html/2606.05843#bib.bib4)]。然而,现实世界的视觉输入通常包含大量冗余信息。因此,稳健的多模态推理依赖于模型从这些杂乱或复杂的时空场景中选择性检索并分离出稀疏的、与任务相关的视觉线索的能力。然而,尽管MLLMs取得了巨大的实证成功,但控制这种关键跨模态信息检索的内部精确机制仍未得到探索,这在我们对多模态机制可解释性的理解中留下了一个重要空白。
请见图注 图2:MLLMs注意力头在VidSTG上功能专业化的机制证据。左侧(CoRe头):一个稀疏的专门化头子集充当精确的信息提取器,通过对关键帧中的背景噪声进行滤波,精确隔离上下文相关的实体(例如“红色汽车”、“穿白色衣服的成年人”)。右侧(底部头):绝大多数头表现出语义分散,将注意力分散到不相关的区域,未能正确关注指令。
尽管最近的可解释性研究已经识别出MLLMs中的专门化注意力头[3 (https://arxiv.org/html/2606.05843#bib.bib9), 16 (https://arxiv.org/html/2606.05843#bib.bib10), 2 (https://arxiv.org/html/2606.05843#bib.bib18)],但这些模型如何进行跨模态信息检索仍知之甚少。当前的框架依赖于粗粒度的统计启发式方法,如空间熵[17 (https://arxiv.org/html/2606.05843#bib.bib15)]和注意力聚合[12 (https://arxiv.org/html/2606.05843#bib.bib17)],通常在简单的静态图像上评估。因此,这些方法在密集或复杂的时空场景中难以捕捉细粒度的、基于查询的令牌级注意力。缺乏严格的定量方法来表征这些检索机制,限制了我们对MLLM失效模式和内部效率的理解。
我们发现,在MLLMs内部,一个专门化的注意力头子集在多模态理解过程中始终如一地捕获任务相关的视觉信息,我们将其称为CoRe头。为了识别这些头,我们量化了从上下文令牌到语义相关视觉令牌的注意力质量。我们在多个互补数据集上进行了评估,这些数据集涵盖不同的视觉领域,包括基于视频的时空推理(VidSTG [29 (https://arxiv.org/html/2606.05843#bib.bib24)])、文档布局理解(MMDocIR [6 (https://arxiv.org/html/2606.05843#bib.bib5)])、对象级视觉定位(RefCOCOg [9 (https://arxiv.org/html/2606.05843#bib.bib23)])和长上下文多模态推理(MMLongBench [22 (https://arxiv.org/html/2606.05843#bib.bib25)])。我们进一步分析了一系列MLLMs,包括Llava-onevision [10 (https://arxiv.org/html/2606.05843#bib.bib6)]、InternVL3.5 [21 (https://arxiv.org/html/2606.05843#bib.bib7)]和Qwen3-VL家族 [1 (https://arxiv.org/html/2606.05843#bib.bib8)],参数规模从大到小均有涉及。我们的分析揭示了一个明显的功能二分法:CoRe头执行局部视觉提取,而标准视觉头则促进全局特征聚合。此外,我们注意到,随着模型容量的增大,这些CoRe头逐渐集中在中层到高层。在多种多模态数据集上的评估揭示了一个全局一致但局部变化的范式:大约30个特定的头被普遍激活,而其他头则根据具体数据分布动态调整。
为了严格确定它们的功能必要性,我们通过注意力掩码进行了因果干预。关键的是,消融仅前5%的CoRe头就会导致性能显著下降,证实了它们在跨模态视觉检索中不可或缺的作用。注意力权重的空间可视化进一步揭示了视觉-语言推理过程中的显著功能二分法。如图1 (https://arxiv.org/html/2606.05843#S1.F1) 和图2 (https://arxiv.org/html/2606.05843#S1.F2) 所示,在图像和视频模态中,排名靠前的CoRe头精确地定位上下文相关的视觉实体。相比之下,排名靠后的头表现出模糊的激活模式,主要覆盖非显著的背景区域。与我们的定量消融结果相辅相成,这些观察证实了细粒度、上下文感知的视觉选择完全由一个稀疏的高度专门化头子集支配。
CoRe头的发现对MLLMs的机制可解释性和优化具有深远意义。我们的发现揭示了一个多模态处理中的结构化组织,即一个稀疏、一致的头子集在多种模态和规模下支配着跨模态提取。正如我们的因果干预所证明的,多模态推理对这些特定头高度敏感,突出了它们不可替代的必要性。至关重要的是,这种局部功能稀疏性为高效的模型优化铺平了道路,表明仅对一小部分关键头进行操作可以显著加速推理,同时保持精确的语义选择。
## 2 相关工作
### 2.1 MLLMs的机制可解释性
近期关于MLLMs机制可解释性的研究表明,它们的感知和推理能力依赖于专门化且稀疏激活的注意力头。对跨模态注意力的统计和结构分析表明,某些头具有功能偏好。近期工作表明,MLLMs中的某些注意力头与视觉感知和空间推理等功能角色相关[16 (https://arxiv.org/html/2606.05843#bib.bib10)]。基于响应评分[19 (https://arxiv.org/html/2606.05843#bib.bib11)]、基于信号的方法[2 (https://arxiv.org/html/2606.05843#bib.bib18)]和熵度量[17 (https://arxiv.org/html/2606.05843#bib.bib15)]的定量分析表明,一个头子集对任务特定适应和视觉表示编码的贡献不成比例。此外,因果干预技术,包括激活修补和表示编辑,已被用于研究候选功能回路(例如视觉计数 [4 (https://arxiv.org/html/2606.05843#bib.bib16)])以及注意力头与前馈网络之间的层次交互[12 (https://arxiv.org/html/2606.05843#bib.bib17)]。这些机制洞见还使得无训练干预成为可能,以提高模型的可靠性和效率。例如,先前研究探索了因果头调制[20 (https://arxiv.org/html/2606.05843#bib.bib12)]、将注意力从视觉汇点重加权到信息头[7 (https://arxiv.org/html/2606.05843#bib.bib13)],以及利用异常注意力模式进行零样本幻觉检测[28 (https://arxiv.org/html/2606.05843#bib.bib14)]等干预措施。这些方法展示了在提升VQA性能、减轻幻觉和降低推理成本方面的潜在优势。尽管取得了这些进展,但现有的分析主要局限于静态数据集,限制了它们在动态或密集结构化视觉环境中捕捉细粒度注意力模式的能力。
### 2.2 跨模态信息检索
当前的MLLMs在复杂多模态推理任务中表现出强劲性能,如多跳问答[14 (https://arxiv.org/html/2606.05843#bib.bib19)]。然而,它们在密集视觉上下文中定位和提取任务相关视觉特征背后的机制仍不清楚。现有文献主要通过两个不同的分析视角来研究这种跨模态信息检索:头级结构稀疏性和令牌级可解释性。对于前者,受纯文本LLMs [23 (https://arxiv.org/html/2606.05843#bib.bib20)] 的启发,研究人员识别出专门用于视觉定位和定位行为的注意力头子集[8 (https://arxiv.org/html/2606.05843#bib.bib21), 25 (https://arxiv.org/html/2606.05843#bib.bib22)]。与这些宏观层面的洞见并行,更细粒度的令牌级方法试图直接将自回归生成追溯到特定视觉区域[5 (https://arxiv.org/html/2606.05843#bib.bib29), 13 (https://arxiv.org/html/2606.05843#bib.bib30)],并采用诸如视觉引导注意力之类的显式机制,将生成的文本锚定到有形的视觉线索上[30 (https://arxiv.org/html/2606.05843#bib.bib31)]。具体来说,这些令牌级策略通常计算文本指令与视觉补丁之间的语义对齐分数,迫使模型对相关对象分配更高的重要性。虽然在标准视觉上下文中有效,但这些技术主要依赖静态结构先验或事后归因。因此,现有的方法难以在现代化、密集且动态的数据集上执行稳健的跨模态信息检索,在这些数据集中,目标特征被复杂、不断演变的背景干扰物深深嵌入并严重遮蔽。
## 3 通过检索注意力质量分离CoRe头
为了系统地分离负责精确视觉检索和过滤背景噪声的注意力头,我们将QRhead [27 (https://arxiv.org/html/2606.05843#bib.bib26)] 的纯文本探测框架扩展到多模态场景。我们的核心思想很简单:一个有用的注意力头应该将更多的注意力从查询令牌分配到**相关视觉区域**,而不仅仅是序列中的任意位置。基于这一直觉,我们定义了一个称为**检索注意力质量(RAM)**的令牌级度量,用于量化一个头向目标视觉内容分配的注意力多少。对于每个注意力头hh,我们将其RAM分数定义为:
M_RAM^(h)(q → V^*) = E_{x∈q} [ Σ_{y∈Ω(V^*)} A_{x→y}^(h) ] (1)
其中q表示指令查询令牌的集合,Ω(V^*)表示与关键视觉实体V^*相对应的令牌化空间或时间跨度。项A_{x→y}^(h)是头hh中从令牌x到令牌y的注意力权重。直观上,该度量衡量了一个头从查询到相关视觉区域的信息检索强度。通过对所有查询令牌求平均,RAM反映了头的预期检索强度。重要的是,由于我们将求和限制在真实区域Ω(V^*)上,高RAM值表示定向检索,而非一般的注意力累积。这使我们能够区分真正的检索头和注意力汇点——后者吸收概率质量但没有贡献有意义的跨模态锚定。
请见图注 图3:CoRe头探测流水线概述。输入的多模态序列被划分为通用文本令牌、关键目标视觉令牌(tv)和指令查询令牌(tq)。在MLLM推理期间,我们提取内部自注意力图。通过聚合从tq到tv的注意力权重,我们计算出路由度量(M_RAM^(h))以分离负责跨模态信息检索的稀疏CoRe头。
如图3 (https://arxiv.org/html/2606.05843#S3.F3) 所示,我们首先将多模态输入分为三部分:文本上下文、查询令牌和关键视觉令牌。在标准前向传播过程中,我们提取所有层和头的完整自注意力图Softmax(QK^T/√d)。然后,我们仅关注**文本到视觉**的注意力,即查询令牌关注视觉令牌的子矩阵。这一步骤去除了无关的模态内交互(例如文本到文本或视觉到视觉的注意力),显著降低了噪声。通过应用公式 (1) (https://arxiv.org/html/2606.05843#S3.E1),我们将这些注意力值聚合成每个头的标量RAM分数。总体而言,这产生了一个全局的M_RAM^(h)分布,其中只有一小部分头显示出高分。我们将这些高分头定义为**CoRe头**,因为它们负责集中的跨模态检索。详细实现和伪代码见附录D.2 (https://arxiv.org/html/2606.05843#A4.SS2)。
表1:CoRe头检测实验配置
**统一评估协议**。为了测试CoRe头是否跨任务泛化,我们设计了一个统一的评估协议,涵盖四个不同的多模态数据集(详见表1 (https://arxiv.org/html/2606.05843#S3.T1) 和附录B (https://arxiv.org/html/2606.05843#A2))。为捕捉不同类型的检索,我们对每个任务定义了不同的目标V^*:空间定位(RefCOCOg)的边界框、视频定位(VidSTG)的时空管、多跳推理(MMLongBench)的多证据区域,以及多模态检索(MMDocIR)的文档区域。由于这些注释是连续的(在空间或时间上),但模型输入是离散的……(原文截断)相似文章
Mind the Heads: 多模态大语言模型的拓扑表示对齐
HeRA 在多模态大型语言模型 (MLLMs) 中对齐单个注意力头,以保留跨模态的局部邻域关系,从而提升视觉中心任务的性能并减少视觉幻觉。
推理时上下文稀疏性:幻象还是机遇?
本文认为,极端的上下文稀疏性是LLM推理的一个有原则且可行的基础,展示了当前模型能够容忍高达100倍的稀疏性而无质量损失,并且稀疏解码内核可以在现有硬件上将处理速度提升10倍。
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。
多模态大语言模型评估中我们缺失了什么?
本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。
MiniMax 稀疏注意力
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。