超越视觉相似性:基于知识的视觉问答中的实体对齐检索

Hugging Face Daily Papers 论文

摘要

KBMR是一种基于MLLM的检索器,用于基于知识的视觉问答,它通过语义对齐来提高检索和VQA准确性,相比CLIP基线表现出显著提升。

基于知识的视觉问答(KB-VQA)依赖于检索外部信息来回答涉及长尾实体的查询。然而,现有的检索流程主要采用CLIP风格的双编码器,这些编码器优先考虑表面视觉相似性,而非实体级语义对齐。当语义相同的概念表现出较大视觉差异,或不同实体在视觉上相似时,这种范式往往会失败。为了解决这个问题,我们提出了KBMR,这是第一个专为KB-VQA设计的基于MLLM的嵌入检索器。利用MLLMs的强大自回归能力,KBMR将图像映射到更能保留概念身份的语义空间中。为了应对Wikipedia规模检索中的噪声监督挑战,我们引入了一个基于MLLM的语义判别器,它生成连续的实体一致性权重。这些权重指导了一种新颖的连续语义蒸馏目标,实现了有效的难负样本采样和超越刚性二元标签的软监督。大量实验表明,KBMR显著优于CLIP基线,在检索Recall@1上提高了14.7%,在端到端VQA准确性上提升了9.4%。代码可在https://github.com/realHarryX/KBMR获取。
查看原文
查看缓存全文

缓存时间: 2026/09/03 11:52

论文页面 - 超越视觉相似性:基于知识的视觉问答实体对齐检索

来源: https://huggingface.co/papers/2608.21450

摘要

KBMR使用多模态语言模型基于语义身份(而非表面外观)嵌入图像,通过连续蒸馏和困难负采样提升检索与视觉问答性能。

基于知识的视觉问答(KB-VQA (https://huggingface.co/papers?q=KB-VQA))依赖检索外部信息来回答涉及长尾实体的问题。然而,现有检索流程主要采用CLIP风格的双编码器 (https://huggingface.co/papers?q=CLIP-style%20dual%20encoders),优先考虑表面视觉相似性而非实体级语义对齐。当语义相同的概念呈现显著视觉差异,或不同实体在视觉上相似时,这种范式常常失效。为解决此问题,我们提出KBMR——首个专为KB-VQA (https://huggingface.co/papers?q=KB-VQA)设计的基于MLLM的嵌入检索器 (https://huggingface.co/papers?q=MLLM-based%20embedding%20retriever)。利用MLLM强大的自回归能力 (https://huggingface.co/papers?q=autoregressive%20capabilities),KBMR将图像映射到更能保持概念身份的语义空间。为应对维基百科规模检索中的噪声监督挑战,我们引入基于MLLM的语义判别器 (https://huggingface.co/papers?q=semantic%20discriminator),生成连续实体一致性权重 (https://huggingface.co/papers?q=continuous%20entity-consistency%20weights)。这些权重指导一种新颖的连续语义蒸馏 (https://huggingface.co/papers?q=continuous%20semantic%20distillation)目标,实现有效的困难负采样 (https://huggingface.co/papers?q=hard%20negative%20sampling)及超越僵硬二元标签的软监督。大量实验表明,KBMR显著优于CLIP基线,在检索Recall@1上提升高达14.7%,在端到端VQA准确率上提升9.4%。代码已开源:https://github.com/realHarryX/KBMR。

查看arXiv页面 (https://arxiv.org/abs/2608.21450)查看PDF (https://arxiv.org/pdf/2608.21450)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.21450)

获取本文代理版本:

hf papers read 2608\.21450

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无关联模型

在模型README.md中引用arxiv.org/abs/2608.21450以从此页面关联。

引用本文的数据集0

暂无关联数据集

在数据集README.md中引用arxiv.org/abs/2608.21450以从此页面关联。

引用本文的Spaces0

暂无关联Space

在Space README.md中引用arxiv.org/abs/2608.21450以从此页面关联。

包含本文的合集0

暂无包含本文的合集

将本文添加到合集 (https://huggingface.co/new-collection)以从此页面关联。

相似文章

KARMA: 基于知识图谱的自动化推理实现与对齐

arXiv cs.CL

KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。