先定位后排序:重新审视基于知识的VQA中的免训练实体识别
摘要
本文提出了一种免训练的“先识别后回答”(IBA)框架,用于基于知识的视觉问答(KB-VQA),该框架将实体识别与证据排序解耦,在降低复杂度的同时优于微调的多模态检索增强生成基线。
arXiv:2606.23881v1 公告类型:新提交
摘要:基于知识的视觉问答(KB-VQA)需要将视觉查询与图像中无法直接观察到的外部知识进行 grounding。虽然最近的多模态大语言模型(MLLMs)展现出强大的感知能力,但在需要同时进行细粒度实体和证据层面 groundings 的 KB-VQA 任务上表现不佳。大多数现有的多模态检索增强生成(MM-RAG)方法将实体判别和章节级证据排序紧密耦合在单个重排序阶段,导致成本高且泛化能力有限。在这项工作中,我们从工作流的角度重新审视现有的 MM-RAG 解决方案,并认为实体层面和事实层面的 grounding 都是关键瓶颈。我们观察到,尽管 MLLMs 在开放式实体命名中常常失败,但当从一小部分候选名称中选择时,它们能更好地识别正确的实体。基于这一见解,我们提出了一种简单且免训练的“先识别后回答”(IBA)框架,将实体识别与章节级重排序解耦。我们的方法提示 MLLM 仅使用候选名称选择高置信度的实体,然后使用现成的文本重排序器进行证据选择。在 Encyclopedic-VQA 和 InfoSeek 上的实验表明,我们的方法在降低训练和推理复杂度的同时,持续优于微调的多模态重排序基线。额外的分析表明,改进不仅来自更好的实体识别,还来自在正确实体固定后选择更具信息量的证据。我们的实现已公开以方便复现。
查看缓存全文
缓存时间: 2026/06/24 07:43
# 先识别再排序:基于训练自由实体识别的知识型VQA再探
**来源:** https://arxiv.org/html/2606.23881
钱马¹,琼吴²,正义周²,姚马¹
¹伦斯勒理工学院
²AT&T首席数据办公室
\{maq5,may13\}@rpi\.edu, \{qw6547,zz547k\}@att\.com
*本工作在第一作者于AT&T CDO实习期间发起并完成。琼吴和姚马为共同通讯作者。*
###### 摘要
知识型视觉问答(KB-VQA)需要将视觉查询与图像中可直接观察内容之外的、外部世界知识相关联。尽管近期多模态大语言模型(MLLMs)展现出强大的感知能力,但在需要细粒度实体和证据层面双重定位的KB-VQA任务上表现不佳。现有的多模态检索增强生成(MM-RAG)方法大多将实体判别与章节级别证据排序紧密耦合到单一的重排序阶段,导致成本高昂且泛化能力有限。本文从工作流角度重新审视现有MM-RAG解决方案,并论证实体层面和事实层面的定位是关键瓶颈。我们观察到,尽管MLLMs在开放式实体命名时常常失败,但在从少量候选名称中选择时,它们能更准确地识别正确实体。基于这一发现,我们提出了一种简单且无需训练的“先识别再回答”(IBA)框架,将实体识别与章节级别重排序解耦。我们的方法提示MLLM仅使用候选名称选择高置信度实体,然后使用现成的文本重排序器进行证据选择。在Encyclopedic-VQA和InfoSeek上的实验表明,我们的方法在降低训练和推理复杂度的同时,一致优于经过微调的多模态重排序基线。进一步分析表明,性能提升不仅来自更好的实体识别,还来自在确定正确实体后选择更具信息量的证据。我们的实现已公开以促进可复现性:https://github.com/VAN-QIAN/ACL26-IBA/。
# 先识别再排序:基于训练自由实体识别的知识型VQA再探
钱马¹∗,琼吴²,正义周²,姚马¹
¹伦斯勒理工学院
²AT&T首席数据办公室
\{maq5,may13\}@rpi\.edu, \{qw6547,zz547k\}@att\.com
## 1 引言
知识型视觉问答(KB-VQA)扩展了标准VQA,需要超出图像中可直接观察内容的外部世界知识[14, 13]。尽管近期多模态大语言模型(MLLMs)在感知驱动的VQA上表现强劲,但KB-VQA查询往往依赖于识别正确的真实世界实体并定位无法仅从像素中推断的细粒度事实信息[18, 19]。这种对实体级别知识的依赖使得KB-VQA成为多模态智能的一个具有挑战性的基准。现代MLLMs[32, 33, 34]在通用VQA任务上取得了显著进展,但在相关知识稀疏、长尾且难以编码进模型参数的KB-VQA任务上仍不可靠[25, 14]。因此,近期系统主要采用多模态检索增强生成(MM-RAG)范式[49, 50],首先检索一组潜在相关的知识条目(例如维基百科文章),然后对文本章节进行重排序以支持答案生成,如图1所示。
尽管取得了成功,但我们认为现有MM-RAG方法在其工作流程上存在根本性局限。产生正确且可验证的答案需要两个不同级别的定位:(i) **实体级别定位**,确保检索到的上下文指向图像中描绘的正确实体;以及(ii) **章节级别定位**,在该实体文章中找到与问题相关的段落。然而,现有大多数方法[1, 2, 3]隐含地将这两个具有挑战性的任务耦合到一个对所有候选章节进行单一重排序的步骤中。这种纠缠的表述迫使单一的评分函数同时区分实体和排序文本证据,常常导致文本相关但实体错误的上下文,或正确实体但配以不相关的章节。
相比之下,人类在解决KB-VQA问题时自然地将这两个步骤解耦。在初始检索或回忆出可能候选后,人们通常会首先识别或缩小图像中描绘的实体,然后只检查少量相关文章以定位支持证据。这种分解减少了干扰项并简化了后续推理,暗示了一种更原则性的范式。受此启发,我们重新审视了MLLMs在实体识别中的作用。虽然直接从图像中命名实体对当前模型仍具挑战性[41],但我们做出了一个令人惊讶的实证观察:仅仅提供候选实体名称就能使MLLMs以更高的准确率识别正确实体。这表明MLLMs通常拥有不完整但可用的实体知识,这些知识在开放式生成下难以利用,但可以在任务被重新构建为受限鉴别问题时被有效激活。这种行为类似于“舌尖现象”[48],我们仅将其用作直觉类比。ToT描述了人类专家也可能遇到的情况:他们对实体具备专业知识,但无法直接从零开始回忆起名称。然而,一旦呈现几个合理的候选名称(例如图1中的“Lapsana communis”和“Crepis tectorum”),他们就能利用专业知识从视觉线索进行推理,选择正确的那个。
基于这一见解,我们为KB-VQA提出了一种简单而有效的**IBA**框架。我们的方法明确地将一个轻量级的实体识别步骤插入到MM-RAG工作流程中。初始检索后,MLLM仅使用名称对候选实体进行评分,保留一个高置信度实体的小子集,然后应用预训练的标准文本重排序器在此缩小的范围内选择支持章节。这种无需训练的设计将实体识别与证据选择解耦,提高了准确性和效率。
我们的贡献总结如下:
- • 据我们所知,我们首次报告了MLLMs在KB-VQA中的“舌尖现象”,即提供候选实体名称显著增强了模型的推理能力,使其能更好地识别查询图像中的实体。
- • 基于这一发现,我们提出了一个简单而有效的框架,将明确的识别步骤集成到现有MM-RAG工作流程中,无需额外微调或任务特定训练即可提高答案准确性和计算效率。
- • 我们在两个主流KB-VQA基准上验证了我们的方法,在与现有MM-RAG系统相比提高了效率的同时,取得了新的最先进结果。
## 2 相关工作
### 2.1 MLLMs用于KB-VQA
多模态大语言模型(MLLMs)通过视觉编码器和跨模态对齐机制扩展了纯文本LLMs,实现了对图像和文本的联合推理。近期模型如LLaVA [32, 33]和Qwen-VL [34]在感知驱动的VQA基准上取得了强劲表现,其中答案可以直接从视觉内容或广泛学习的参数化知识中推断。然而,新兴评估[37, 38]一致显示,即使是当前最先进的MLLMs,在需要细粒度、以实体为中心或长尾百科知识的KB-VQA任务上表现不佳。这一局限性促使通过外部知识源增强MLLMs,以支持超越其参数化能力的显式定位和推理。
### 2.2 KB-VQA与基于MM-RAG的解决方案
KB-VQA基准通过要求图像本身不包含的外部知识(如实体属性或百科事实)扩展了传统VQA。早期数据集如OK-VQA [16]和A-OKVQA [17]强调常识或一般知识,这些知识越来越多地落入大规模MLLMs的训练范围内。最近的基准如Encyclopedic-VQA(E-VQA)[18]和InfoSeek [19]通过要求显式定位到细粒度维基百科实体和支持章节,提高了难度。为应对这些挑战,许多方法采用多模态检索增强生成(MM-RAG),通常包括检索器、重排序阶段和答案生成器。代表性方法如EchoSight [1]、ReflectiVA [2]和CoRe-MMRAG [3]在相关性评估方式上有所不同,从显式训练的多模态重排序器到通过微调隐式学习相关性。尽管取得了成功,这些方法通常将实体判别和章节选择耦合到一个单一的重排序过程中,可能导致训练成本高昂且对数据可用性敏感。
### 2.3 我们工作的定位
与之前的MM-RAG方法不同,我们从工作流角度重新审视KB-VQA流程。我们不是将实体识别和章节级别的证据选择纠缠在单个重排序模块中,而是显式地解耦这两个阶段。通过在章节重排序之前引入一个轻量级的识别步骤,我们的方法隔离了实体级别的定位问题,并利用现成的组件,无需任务特定的重排序器训练或MLLM微调。这种设计从根本上不同于以往依赖于学习到的多模态相关性函数的方法,使得KB-VQA流程在不同知识分布的数据集上更具可解释性和可迁移性。
## 3 方法
在本节中,我们介绍无需训练的IBA(先识别再回答)框架,该框架显式地将实体级识别与章节级证据选择解耦。我们首先介绍整体工作流程,然后详细描述每个组件,包括问题定义、初始检索、识别后重排序和答案生成。

**图1:** 现有MM-RAG方法与我们的IBA方法之间的整体工作流程比较。
**上:** 现有的MM-RAG流程从大型知识库中检索前K篇候选文章,直接使用训练好的重排序器或微调的VLM进行章节级重排序,然后从排名最高的上下文中生成答案。
**下:** 我们无需训练的IBA在重排序之前插入了一个显式的实体识别步骤。给定查询图像和检索到的候选名称,VLM选择一个高置信度实体的小子集,然后用现成的文本重排序器缩小章节级重排序的范围。
### 3.1 问题定义
给定查询图像I和问题Q,KB-VQA系统旨在通过关联外部知识生成答案y。在检索增强生成中,这通常通过从外部知识库中选择支持文本片段来实现。我们将知识库建模为KB = \{(P_i, I_i)\}_{i=1}^N,其中每个页面P_i由多个文本章节P_i = \{S_{i,j}\}_{j=1}^{n_i}组成,并关联一个代表性图像I_i。由于知识库规模庞大(N可达百万级),实际系统首先检索一个小的候选集,然后进行细粒度重排序。KB-VQA的目标是选择最相关的章节S_{i,j},该章节提供足够的证据来支持生成正确的答案y。
### 3.2 初始检索
初始检索的目标是从庞大的外部知识库中获取一个小的候选知识条目集。这一粗粒度步骤通过将搜索空间从数百万条目缩小到可管理的top-K集,确保了可行性。遵循先前工作[1, 2, 3],我们采用图像到图像的检索策略。每个知识库页面使用冻结的EVA-CLIP-8B视觉编码器[42]进行索引。图像嵌入从最后一层池化并使用FAISS [44]进行索引。给定查询图像,使用余弦相似度检索视觉上最相似的前K个候选页面,然后传递给后续的“识别后重排序”阶段。
### 3.3 识别后重排序
在初始检索后,现有MM-RAG方法直接对所有K个候选条目进行章节级重排序。相比之下,我们显式地引入一个实体级识别步骤,以进一步缩小重排序范围。正如我们在第1节中讨论的,KB-VQA的关键挑战之一是实体识别,以确保实体级别的定位。即使对于人类专家,直接从图像中命名准确的真实世界实体也并非易事,尤其是当视觉线索细微或实体属于细粒度类别时。这种困难在MLLMs的开放式生成设置下进一步放大,模型必须从巨大的输出空间中产生正确的实体名称,且没有明确的约束。同时,现代MLLMs已经在包含广泛百科知识的大规模高质量语料库上进行了训练,其中许多知识源自维基百科类资源。这样的训练赋予了模型潜在的专门知识,可以支持实体识别。我们利用一个关键观察:虽然MLLM在开放式命名设置下难以准确命名实体,但当提供一组候选名称时,它能够以高准确率识别正确实体。因此,我们提出以下步骤:
1. **候选实体提取**:从初始检索到的页面中,提取所有唯一实体的名称(如页面标题)。这些名称形成候选集C = \{e_1, e_2, ..., e_m\},其中m通常远小于K。
2. **MLLM协助的实体选择**:向MLLM提供查询图像I和候选名称列表C。MLLM被要求仅从列表中选择最相关的实体(或排名靠前的子集)。我们使用简单的提示(例如,“给定图像,从以下列表中选择最匹配的实体名称”)。MLLM输出一个或多个置信度高的实体。
3. **章节级重排序**:将选择的高置信度实体对应的页面作为章节重排序的输入。使用现成的文本重排序器(如预训练的交叉编码器)对这些实体的章节进行排序,选择最相关的章节作为答案生成的上下文。
这种方法将实体识别从章节选择中解耦,使得每个步骤可以使用专门且高效的组件。实体识别步骤减少了需要排序的章节数量,从而降低了重排序的计算成本。此外,由于实体识别只需要候选名称而不是完整页面,它利用了MLLM对实体名称的辨别能力,而无需检索大量文本。
### 3.4 答案生成
在选定了最相关的支持章节后,我们使用一个文本生成器(如LLaMA或GPT系列模型)基于查询图像、问题和选定的上下文生成最终答案。我们冻结生成器,仅使用预先存在的模型进行解码,无需额外训练。
## 4 实验
### 4.1 实验设置
**数据集:** 我们在两个主流KB-VQA基准上进行评估:Encyclopedic-VQA(E-VQA)[18]和InfoSeek [19]。E-VQA包含约20万对图像-问题对,涵盖不同难度的实体识别和知识查询。InfoSeek包含约3.5万对,侧重于细粒度百科知识。我们使用标准分割,并报告准确率(对于多选问题)或精确匹配(对于自由形式问题)。
**基线方法:** 我们将我们的方法与以下基线进行比较:
- **单阶段MLLM**:直接使用MLLM(如LLaVA-1.5、Qwen-VL)在无检索情况下生成答案。
- **检索+生成(RAG)**:检索top-K页面,然后使用MLLM阅读并生成答案,无重排序。
- **EchoSight [1]**:使用多模态重排序器。
- **ReflectiVA [2]**:使用显式训练的多模态相关性函数。
- **CoRe-MMRAG [3]**:使用联合实体-章节重排序。
**实现细节:** 我们使用EVA-CLIP-8B [42]进行初始检索,top-K=50。实体识别使用Qwen-VL [34](7B版本),候选实体基于初始检索的页面标题。章节重排序使用预训练的MS MARCO交叉编码器(如ColBERTv2 [45])。答案生成使用LLaMA-2-7B [46]。
### 4.2 主要结果
| 方法 | E-VQA (准确率) | InfoSeek (精确匹配) |
|------|----------------|---------------------|
| 单阶段MLLM (LLaVA-1.5) | 42.3 | 38.1 |
| RAG (无重排序) | 53.7 | 49.2 |
| EchoSight [1] | 58.4 | 53.8 |
| ReflectiVA [2] | 60.1 | 55.3 |
| CoRe-MMRAG [3] | 61.5 | 56.7 |
| **IBA (本研究)** | **63.2** | **58.4** |
从表1可以看出,我们的方法在两个基准上均优于所有基线,包括那些使用多模态重排序器或联合训练的模型。IBA在E-VQA上比CoRe-MMRAG提高了1.7个百分点,在InfoSeek上提高了1.7个百分点,同时无需任何微调或任务特定训练。
### 4.3 消融研究
我们进行消融研究以验证每个组件的贡献。如表2所示,去除实体识别步骤(即直接进行章节重排序,类似于标准MM-RAG)导致性能显著下降,突出了实体级定位的重要性。使用随机实体而不是MLLM选择的实体进一步降低了性能。这表明MLLM协助的实体选择确实利用了模型的判别能力。
| 配置 | E-VQA | InfoSeek |
|------|-------|----------|
| 完整IBA | 63.2 | 58.4 |
| 无实体识别(直接章节重排序) | 58.1 | 53.5 |
| 随机实体选择 | 52.4 | 48.7 |
| 仅使用一个候选实体 | 61.8 | 56.9 |
### 4.4 效率分析
我们分析了IBA相对于基线的计算效率。由于实体识别减少了需要重排序的章节数量,总推理时间减少了约30%。此外,IBA不需要任何训练,因此与需要微调的方法(如CoRe-MMRAG)相比,在设置成本方面显著更优。具体时间对比见表3。
| 方法 | 重排序步骤时间 (ms) | 总推理时间 (ms) | 是否需要训练 |
|------|---------------------|-----------------|--------------|
| EchoSight | 120 | 200 | 是 |
| ReflectiVA | 110 | 180 | 是 |
| CoRe-MMRAG | 130 | 210 | 是 |
| IBA | 80 | 150 | 否 |
### 4.5 定性分析
我们进一步通过定性示例展示IBA的优势。在E-VQA中,模型面对一张植物图像,问题询问其学名。初始检索返回了多个视觉相似的物种。当MLLM直接命名时(开放式),它输出了“雏菊”,这是错误的。但当提供候选名称列表(如“Lapsana communis”、“Crepis tectorum”、“Bellis perennis”)时,MLLM在识别步骤中正确选择了“Lapsana communis”,随后章节重排序从该实体的Wikipedia页面中提取了支持事实,从而生成正确答案。这清楚地说明了提供候选名称如何激活MLLM的固有知识,从而克服开放式命名困难。
## 5 讨论
### 5.1 “舌尖现象”的解释
我们的观察类似于心理学中的“舌尖现象”(ToT),即个体无法从记忆中直接回忆起某个单词,但当提供多个选项时可以识别正确的一个。在MLLM中,我们推测类似机制在起作用:模型从训练数据中学习了丰富的实体知识,但开放式提示无法可靠地映射到正确的名称。通过提供候选名称,我们将任务从开放式生成转变为受限选择,降低了输出空间,并允许模型利用其视觉-语言关联能力进行推理。这可能是MLLM在使用候选名称时表现更好的原因。未来工作可以进一步探索MLLM知识表征与这种便捷识别现象之间的关系。
### 5.2 局限性
尽管我们的方法在标准化基准上取得了改进,但仍存在一些局限性。首先,它依赖于初始检索的质量;如果真正的实体不在前K个候选页面中,实体识别步骤无法纠正此错误。其次,MLLM在实体识别阶段可能对某些类型的实体(如罕见物种或专门物件)表现不佳,尽管提供候选名称可以缓解这一问题。最后,我们的方法目前仅使用图像进行初始检索,未来可以考虑结合文本描述。
## 6 结论
在本文中,我们重新审视了KB-VQA中MM-RAG方法的工作流程,并确定了实体级定位是主要瓶颈。我们首次报道了MLLM在KB-VQA中的“舌尖现象”,即提供候选实体名称显著提高了实体识别的准确性。基于此,我们提出了IBA,一个无需训练的解耦框架,将实体识别与章节重排序分开。在E-VQA和InfoSeek上的实验验证了方法的有效性,实现了新的最先进结果,同时降低了计算和训练成本。我们希望这项工作能激发未来从工作流角度优化KB-VQA系统的研究。
## 参考文献
[1] Yan and Xie, 2024. EchoSight: Multimodal re-ranking for KB-VQA.
[2] Cocchi et al., 2025. ReflectiVA: Explicit multimodal relevance for VQA.
[3] Tian et al., 2025. CoRe-MMRAG: Joint entity and section re-ranking.
[14] Deng et al., 2025. KB-VQA: A survey.
[16] Marino et al., 2019. OK-VQA: A visual question answering benchmark requiring external knowledge.
[17] Schwenk et al., 2022. A-OKVQA: A benchmark for visual question answering with world knowledge.
[18] Mensink et al., 2023. Encyclopedic-VQA: Towards fine-grained entity grounding.
[19] Chen et al., 2023. InfoSeek: Asking knowledge-based questions from images.
[32] Liu et al., 2023. Visual Instruction Tuning.
[33] Liu et al., 2024. Improved Baselines with Visual Instruction Tuning.
[34] Bai et al., 2025. Qwen-VL: A Versatile Vision-Language Model.
[41] Caron et al., 2024. Open-ended entity naming with MLLMs.
[42] Sun et al., 2024. EVA-CLIP-8B: Scaling vision-language models.
[44] Douze et al., 2025. FAISS: A library for efficient similarity search.
[45] ColBERTv2: Effective and efficient retrieval with late interaction.
[46] LLaMA-2: Open foundation and fine-tuned chat models.相似文章
基于证据的视频问答
本文介绍了基于证据的视频问答(E-VQA),这是一个新任务,要求模型同时输出语义答案和精确的时空证据,如跟踪对象分割掩码序列。作者创建了一个人工验证的基准数据集和一个可扩展的训练数据集,在基线方法上显示出显著改进。
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。
贝叶斯数据重加权提升基于知识的视觉问答中的多模态检索
本文介绍了贝叶斯数据重加权,一种概率框架,自适应地对查询-文档对进行加权,以减轻对比训练中的假阴性问题,从而在多个基于知识的VQA基准上提升多模态检索性能。
Brain-IT-VQA:从大脑信号到答案
Brain-IT-VQA 框架利用 Transformer 架构从 fMRI 信号中解码视觉内容,性能优于此前的方法。作者还引入了 NSD-VQA,这是一个新数据集,具有更丰富的标注,用于评估基于 fMRI 的视觉问答。
VLA 真的了解基础知识吗?视觉-语言-动作模型中常识与世界知识保留的衡量
本文提出 Act2Answer 协议,通过让智能体执行物理动作来回答问题,从而评估视觉-语言-动作模型中知识的保留情况。研究发现,VLA 模型保留了基础知识,但在更丰富的语义类别上存在差距,而 VQA 联合训练有助于改善。