层级、汇聚与缩放:多模态大语言模型的自适应证据选择
摘要
本文提出AREA,一种无需训练的推理时方法,自适应分配多模态大语言模型中的证据高亮,提升在基于知识的视觉问答和标准多模态基准测试上的性能。
arXiv:2609.16795v1 公告类型:新
摘要:多模态大语言模型(MLLMs)可以通过结合图像的视觉证据和从外部来源检索的事实来回答知识密集型视觉问题。然而,MLLMs可能忽略两种模态中的相关证据,对正确答案所需的文本句子或视觉区域关注不足。最近的尝试通过在生成前高亮检索到的文本和标记视觉区域来解决这个问题,但应用了固定的、一次性的策略,无法适应三种变化来源:是否需要高亮、不同示例需要多少证据,以及在答案展开过程中不同文本证据何时变得相关。我们引入自适应相关性引导的证据分配(AREA),一种无需训练的推理时方法,将证据高亮表述为自适应分配。AREA生成一个单一的探测令牌,从固定骨干层读取视觉和文本相关性,然后做出三个决策:i)是否干预(由自然注意力覆盖和视觉汇聚污染控制),ii)暴露多少证据(由相关性熵决定),以及iii)在生成过程中何时刷新文本(由因果上下文注意力峰值触发)。在四个KB-VQA和七个标准多模态基准测试中,使用九个冻结的MLLM检查点,AREA在无需训练的高亮方法中建立了最佳性能。
查看缓存全文
缓存时间: 2026/09/16 09:04
# 层数、汇点与缩放:面向多模态大语言模型的自适应证据选择 来源: https://arxiv.org/html/2609.16795 ###### 摘要 多模态大语言模型(MLLMs)能够通过结合来自图像的视觉证据和从外部来源检索的事实来回答知识密集型视觉问题。然而,MLLMs可能会忽视两种模态中的相关证据,对文本句子或正确答案所需的视觉区域的注意力较弱。近期的研究通过在生成前高亮显示检索到的文本和标记视觉区域来解决此问题,但采用的是固定的、一次性的策略,无法适应三个方面的变异:高亮显示是否必要、不同样例需要多少证据、以及随着答案展开,何时需要不同的文本证据。我们提出了自适应相关性引导的证据分配(AREA),这是一种无需训练的推理时方法,将证据高亮表述为自适应分配问题。AREA生成一个探测令牌来从固定的骨干网络层读取视觉和文本相关性,然后做出三个决策:i) 是否进行干预(由自然注意力覆盖度和视觉汇点污染度控制),ii) 暴露多少证据(由相关性熵决定),以及iii) 在生成过程中何时刷新文本(由因果上下文注意力峰值触发)。在四个KB-VQA和七个标准多模态基准测试中,使用九个冻结的MLLM检查点进行评估,AREA在无需训练的高亮方法中建立了最佳性能。 四川大学 [email protected] 11脚注:张磊是通讯作者 代码:https://github.com/wongzbb/AREA ## 1 引言 基于知识的视觉问答(KB-VQA)要求多模态大语言模型(MLLMs)结合来自外部知识源的局部视觉线索和检索到的事实(Chen et al. 2023 (https://arxiv.org/html/2609.16795#bib.bib12); Mensink et al. 2023 (https://arxiv.org/html/2609.16795#bib.bib14))。然而,提供两种模态并不能解决问题:模型仍需确定哪些文本陈述和图像区域是共同回答问题所需的。检索到的段落混合了关键事实与无关或弱相关的内容(Caffagni et al. 2024 (https://arxiv.org/html/2609.16795#bib.bib2)),而图像则包含许多超出答案承载区域的显著对象和区域(Kang et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib11))。因此,模型可能会遗漏所需的句子、关注错误的视觉区域,或未能连接跨模态的互补证据,即使所有所需证据都可用,也会产生错误答案。因此,挑战不仅在于获取相关证据,还在于确保生成器利用其输入中已有的证据。 虽然检索和过滤方法改善了到达模型的外部内容质量(Hong et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib5); Yan and Xie 2024 (https://arxiv.org/html/2609.16795#bib.bib6); Yang et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib7); Ye et al. 2026 (https://arxiv.org/html/2609.16795#bib.bib8)),但另一条互补的研究路线则专注于推理时的证据利用。近期的无需训练方法通过显式高亮来改善证据利用:SelfElicit高亮相关的上下文句子,而两次查看(LoT)则将干预扩展到检索的文本和视觉区域(Liu et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib10); Morini et al. 2026 (https://arxiv.org/html/2609.16795#bib.bib1))。通过将选定的证据转换为句子标记和视觉裁剪,此类方法在不更新模型参数的情况下使潜在证据显式化。然而,它们将高亮实例化为一个固定的、一次性的策略:在答案生成之前,一次性选择相同数量的句子和相同的视觉范围。这种设计忽略了样例之间和生成步骤之间的差异,如图1(https://arxiv.org/html/2609.16795#S1.F1)所示。在某些情况下,模型已经在使用相关证据,因此额外的高亮是不必要的。所需的证据范围也各不相同:有些问题可能只需要一个句子或一个紧凑的图像区域,而另一些则依赖于多个句子或更广泛的视觉上下文。随着答案的展开,相关的文本证据可能会发生变化,后期令牌依赖于解码前未选中的上下文。静态的证据分配因此无法匹配异构且时变的需求。一个有效的策略必须决定是否进行干预、暴露多少证据以及何时刷新文本证据。 *(参照说明文字)* 图1:固定的一次性证据高亮与证据需求之间三个不匹配的示意图。(a)当模型已经在使用相关证据时,高亮是多余的。(b)固定的句子预算可能会遗漏多句证据链的一部分。(c)在解码前选定的证据可能在后续答案令牌需要不同文本证据时变得过时。蓝色标记固定选择,金色标记相应阶段已使用或需要的证据,红色标签标记由此产生的不匹配。 我们提出自适应相关性引导的证据分配(AREA),这是一种无需训练的推理时方法,将证据高亮转化为自适应分配。一个探测令牌从固定的、骨干网络特定的层组中读取视觉和文本相关性。AREA使用文本和视觉相关性分布的熵来设置选定句子的数量和裁剪范围。然后它独立地门控两种模态:文本门度量选定句子已获得的注意力程度,视觉门度量未过滤的视觉相关性中分配给检测到的汇点令牌的比例。在生成过程中,AREA监控对原始检索上下文令牌的注意力。当其熵超过先前解码步骤计算出的阈值时,该方法会重新选择相关句子,并将其附加在当前解码位置,遵循固定的刷新预算。这些操作共同实现了是否进行干预、暴露多少证据以及何时刷新文本证据的自适应调整,同时保持所有模型参数冻结。 本工作的主要贡献总结如下: - 我们通过三个决策为冻结的MLLMs形式化了自适应证据分配:是否标记选定的上下文句子以及是否添加视觉裁剪,标记多少句子以及裁剪应覆盖的空间范围,以及在哪些解码步骤重新选择并附加标记的句子。 - 我们开发了AREA,这是一种针对冻结MLLMs的无需训练方法,它在一次探测传递中获取层分解的视觉和文本相关性,利用它来设置句子数量和裁剪范围,使用选定句子的注意力意外值和原始视觉汇点质量来门控文本和视觉,并在固定预算下触发基于解码时上下文注意力的文本刷新。 - 我们使用九个冻结的MLLM检查点在四个KB-VQA和七个标准多模态基准测试上评估了AREA,在冻结骨干网络推理协议下,它在知识密集型和标准多模态设置中都持续建立了最先进的性能。 ## 2 相关工作 ### 2.1 KB-VQA与多模态检索 KB-VQA结合图像理解和来自外部源的事实。像百科全书式VQA、InfoSeek和ViQuAE这样的基准测试检验模型能否回答关于细粒度实体、未见知识或需要多步推理的事实(Mensink et al. 2023 (https://arxiv.org/html/2609.16795#bib.bib14); Chen et al. 2023 (https://arxiv.org/html/2609.16795#bib.bib12); Lerner et al. 2022 (https://arxiv.org/html/2609.16795#bib.bib13))。在这些任务上表现良好的系统通常改进上游证据管道:基于结构化知识的分层检索(Caffagni et al. 2024 (https://arxiv.org/html/2609.16795#bib.bib2))、用于优先排序相关段落的多模态重排(Yan and Xie 2024 (https://arxiv.org/html/2609.16795#bib.bib6); Yang et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib7))、学习检索相关性决策(Cocchi et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib3))、推理增强检索(Compagnoni et al. 2026 (https://arxiv.org/html/2609.16795#bib.bib4))、面向问题的过滤(Ye et al. 2026 (https://arxiv.org/html/2609.16795#bib.bib8))以及多模态知识图谱集成(Yuan et al. 2026 (https://arxiv.org/html/2609.16795#bib.bib9))。这些方法决定了哪些外部内容到达模型。AREA解决的是一个互补的问题:鉴于相关证据已在输入中可用,应如何呈现它以确保冻结的生成器使用它?这种区分允许在相同检索条件下进行受控比较,将证据利用与检索质量隔离开来。 ### 2.2 推理时证据高亮 无需训练的证据高亮提供了一种直接改善证据利用的方法,无需更改检索管道或更新模型参数。SelfElicit使用模型推导的相关性来选择和标记上下文句子,而LoT则通过结合文本高亮和视觉定位将此方法扩展到MLLMs(Liu et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib10); Morini et al. 2026 (https://arxiv.org/html/2609.16795#bib.bib1))。这些方法共同表明,来自冻结模型的相关性信号可以指导推理期间如何呈现可用证据。然而,现有方法在单个解码前步骤中进行干预,并遵循预定的分配策略。AREA通过独立地为文本和视觉调整干预、将暴露的证据规模调整为每个样例的需要,并在生成过程中刷新文本证据,从而推进了这一方向。 ## 3 方法 ### 3.1 问题设置与概述 给定图像I、问题Q和包含N_C个令牌的候选上下文C,AREA使用冻结的MLLM F_θ生成答案;对于纯视觉任务,N_C=0。视觉前端将I映射为N_V = G^2个空间补丁令牌,排列在G×G的网格上。解码器有L层,每层有N_H个注意力头,隐藏宽度为d。从未高亮的分词提示符中,F_θ恰好生成一个探测令牌。令S_p表示生成的序列长度,i_p表示该令牌占据的最终位置。对于层ℓ∈{1,...,L}和头h∈{1,...,N_H},探测传递暴露softmax后的因果注意力A_p^{ℓ,h}∈[0,1]^{S_p×S_p}和隐藏状态H_p^{ℓ}∈ℝ^{S_p×d}。条目A_p^{ℓ,h}[r,s]给出从查询位置r到键位置s的注意力。分词将视觉补丁v映射到其绝对提示位置χ_vis(v),并且当N_C>0时,将原始上下文令牌j映射到χ_ctx(j)。我们的目标是根据每个样例和生成步骤的证据需求分配可用的视觉和文本证据。因此AREA决定是否干预每种模态、通过选定句子的数量和视觉裁剪范围暴露多少证据,以及在解码过程中何时刷新文本证据,同时保持F_θ冻结。图2(https://arxiv.org/html/2609.16795#S3.F2)将层分解的证据读出与熵校准的证据缩放以及模态特定干预门控联系起来,随后是生成过程中的因果文本证据刷新。算法1(https://arxiv.org/html/2609.16795#alg1)展示了完整的推理序列。 *(参照说明文字)* 图2:AREA概述。一个探测令牌从冻结MLLM的固定骨干网络特定层组中读取视觉和文本相关性。独立的门控使用选定句子的注意力覆盖度和原始视觉汇点质量来决定是否进行干预,而句子级和汇点过滤后的空间相关性分布则设置句子数量和裁剪范围。预热期后,两个门控都使用先验样本中值,仅在做出决定后才更新其历史。在同一个自回归流中,上下文注意力熵的严格因果峰值触发有界文本刷新;视觉证据和初始门控保持固定。 ### 3.2 层分解的证据读出 我们使用非空的、固定的、骨干网络特定的层组L_vis, L_txt ⊆ {1,...,L}分别用于视觉和文本相关性读出,以及用于基于激活的视觉汇点检测的非空固定汇点维度D_sink ⊆ {1,...,d}(Kang et al. 2025 (https://arxiv.org/html/2609.16795#bib.bib11))。固定的问题解析器识别目标对象短语;令O表示其绝对提示位置的非空集合。相同的探测传递为每个补丁v生成原始视觉相关性,并且当上下文存在时,为每个原始上下文令牌j生成文本相关性: a_vis,v^{raw} = \frac{\sum_{o∈O} \sum_{\ell∈L_vis} \sum_{h=1}^{N_H} \mathbf{A}_p^{\ell,h}[o, \chi_{vis}(v)]}{|O| |L_vis| N_H}, \quad (1) a_txt,j = \frac{\sum_{\ell∈L_txt} \sum_{h=1}^{N_H} \mathbf{A}_p^{\ell,h}[i_p, \chi_{ctx}(j)]}{|L_txt| N_H}. 收集这些分数得到原始视觉相关性向量\mathbf{a}_{vis}^{raw}∈ℝ_{\geq 0}^{N_V}和文本相关性向量\mathbf{a}_{txt}∈ℝ_{\geq 0}^{N_C}。因此视觉分支读取对象到补丁的注意力,而文本分支读取探测到上下文的注意力。两者都直接对其固定层和所有头的原始softmax后权重取平均。 #### 视觉汇点过滤 视觉汇点令牌将激活集中在一小部分隐藏维度中,可能扭曲用于定位目标对象的相关性图。我们通过将D_sink中最强激活除以所有d个隐藏维度的均方根来评估这种集中度: s_sink,v = \frac{1}{|L_vis|} \sum_{\ell∈L_vis} \frac{\max_{r∈D_sink} | \mathbf{H}_p^{\ell}[\chi_{vis}(v), r] |}{\sqrt{\frac{1}{d} \sum_{q=1}^{d} (\mathbf{H}_p^{\ell}[\chi_{vis}(v), q])^2}}. \quad (2) 对于视觉汇点阈值τ,满足s_sink,v > τ的令牌形成I_sink。我们通过设置a_vis = (a_vis,1, ..., a_vis,N_V)∈ℝ_{\geq 0}^{N_V}来定义\mathbf{a}_{vis},...
相似文章
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
CLEAR: 面向医学大语言模型的跨源证据裁决框架
本文提出CLEAR,一种用于跨源证据裁决的代理框架,旨在通过处理来自多个知识源的冲突来提升医学领域大语言模型的性能。该框架在多个基准测试中表现出竞争力,在直接推理或检索能力较弱的场景中取得了显著提升。
EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
多视角证据合成与推理的无监督多模态实体链接
MSR-MEL 提出一种无监督框架,利用大语言模型对多视角证据进行合成与推理,实现多模态实体链接,在标准基准上全面超越既有方法。