knowledge-based-vqa

标签

Cards List
#knowledge-based-vqa

层级、汇聚与缩放:多模态大语言模型的自适应证据选择

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出AREA,一种无需训练的推理时方法,自适应分配多模态大语言模型中的证据高亮,提升在基于知识的视觉问答和标准多模态基准测试上的性能。

0 人收藏 0 人点赞
#knowledge-based-vqa

超越视觉相似性:基于知识的视觉问答中的实体对齐检索

Hugging Face Daily Papers ↗ · 2026-08-19 缓存

KBMR是一种基于MLLM的检索器,用于基于知识的视觉问答,它通过语义对齐来提高检索和VQA准确性,相比CLIP基线表现出显著提升。

0 人收藏 0 人点赞
#knowledge-based-vqa

贝叶斯数据重加权提升基于知识的视觉问答中的多模态检索

arXiv cs.LG ↗ · 2026-08-05 缓存

本文介绍了贝叶斯数据重加权,一种概率框架,自适应地对查询-文档对进行加权,以减轻对比训练中的假阴性问题,从而在多个基于知识的VQA基准上提升多模态检索性能。

0 人收藏 0 人点赞
#knowledge-based-vqa

先定位后排序:重新审视基于知识的VQA中的免训练实体识别

arXiv cs.CL ↗ · 2026-06-24 缓存

本文提出了一种免训练的“先识别后回答”(IBA)框架,用于基于知识的视觉问答(KB-VQA),该框架将实体识别与证据排序解耦,在降低复杂度的同时优于微调的多模态检索增强生成基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈