超越视觉相似性:基于知识的视觉问答中的实体对齐检索
摘要
KBMR是一种基于MLLM的检索器,用于基于知识的视觉问答,它通过语义对齐来提高检索和VQA准确性,相比CLIP基线表现出显著提升。
查看缓存全文
缓存时间: 2026/09/03 11:52
论文页面 - 超越视觉相似性:基于知识的视觉问答实体对齐检索
来源: https://huggingface.co/papers/2608.21450
摘要
KBMR使用多模态语言模型基于语义身份(而非表面外观)嵌入图像,通过连续蒸馏和困难负采样提升检索与视觉问答性能。
基于知识的视觉问答(KB-VQA (https://huggingface.co/papers?q=KB-VQA))依赖检索外部信息来回答涉及长尾实体的问题。然而,现有检索流程主要采用CLIP风格的双编码器 (https://huggingface.co/papers?q=CLIP-style%20dual%20encoders),优先考虑表面视觉相似性而非实体级语义对齐。当语义相同的概念呈现显著视觉差异,或不同实体在视觉上相似时,这种范式常常失效。为解决此问题,我们提出KBMR——首个专为KB-VQA (https://huggingface.co/papers?q=KB-VQA)设计的基于MLLM的嵌入检索器 (https://huggingface.co/papers?q=MLLM-based%20embedding%20retriever)。利用MLLM强大的自回归能力 (https://huggingface.co/papers?q=autoregressive%20capabilities),KBMR将图像映射到更能保持概念身份的语义空间。为应对维基百科规模检索中的噪声监督挑战,我们引入基于MLLM的语义判别器 (https://huggingface.co/papers?q=semantic%20discriminator),生成连续实体一致性权重 (https://huggingface.co/papers?q=continuous%20entity-consistency%20weights)。这些权重指导一种新颖的连续语义蒸馏 (https://huggingface.co/papers?q=continuous%20semantic%20distillation)目标,实现有效的困难负采样 (https://huggingface.co/papers?q=hard%20negative%20sampling)及超越僵硬二元标签的软监督。大量实验表明,KBMR显著优于CLIP基线,在检索Recall@1上提升高达14.7%,在端到端VQA准确率上提升9.4%。代码已开源:https://github.com/realHarryX/KBMR。
查看arXiv页面 (https://arxiv.org/abs/2608.21450)查看PDF (https://arxiv.org/pdf/2608.21450)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.21450)
获取本文代理版本:
hf papers read 2608\.21450
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无关联模型
在模型README.md中引用arxiv.org/abs/2608.21450以从此页面关联。
引用本文的数据集0
暂无关联数据集
在数据集README.md中引用arxiv.org/abs/2608.21450以从此页面关联。
引用本文的Spaces0
暂无关联Space
在Space README.md中引用arxiv.org/abs/2608.21450以从此页面关联。
包含本文的合集0
暂无包含本文的合集
将本文添加到合集 (https://huggingface.co/new-collection)以从此页面关联。
相似文章
先定位后排序:重新审视基于知识的VQA中的免训练实体识别
本文提出了一种免训练的“先识别后回答”(IBA)框架,用于基于知识的视觉问答(KB-VQA),该框架将实体识别与证据排序解耦,在降低复杂度的同时优于微调的多模态检索增强生成基线。
ProMSA:用于基于知识的视觉问答的渐进式多模态搜索智能体
提出ProMSA,一种用于基于知识的视觉问答的渐进式多模态搜索智能体,它能自适应选择搜索策略并通过序列级强化学习进行优化,在E-VQA和InfoSeek上取得了一致的性能提升。
贝叶斯数据重加权提升基于知识的视觉问答中的多模态检索
本文介绍了贝叶斯数据重加权,一种概率框架,自适应地对查询-文档对进行加权,以减轻对比训练中的假阴性问题,从而在多个基于知识的VQA基准上提升多模态检索性能。
VLA 真的了解基础知识吗?视觉-语言-动作模型中常识与世界知识保留的衡量
本文提出 Act2Answer 协议,通过让智能体执行物理动作来回答问题,从而评估视觉-语言-动作模型中知识的保留情况。研究发现,VLA 模型保留了基础知识,但在更丰富的语义类别上存在差距,而 VQA 联合训练有助于改善。
KARMA: 基于知识图谱的自动化推理实现与对齐
KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。