标签
SnapBench引入了一个配对干扰基准测试,用于移动端稳健的即拍即问多模态检索,揭示图像噪声是关键降级因素,并提出一种自适应融合方法以增强模态可靠性。
本文提出了STeReO,一个用于协调异构语音和文本检索器的重排序器,通过改善多模态场景中的证据选择来增强检索增强生成(RAG)系统。
UMER 引入了一个统一的多模态检索框架,通过配对感知判别推理结合嵌入与排序,在 MMEB-V2 基准测试中达到了最先进的性能。
本文提出了UniME-R1,一种用于统一多模态检索的嵌入器-顾问框架,该框架基于检索反馈生成检索中心思维链(RC-CoT),通过从硬负样本中学习来提升检索性能。
本文介绍了贝叶斯数据重加权,一种概率框架,自适应地对查询-文档对进行加权,以减轻对比训练中的假阴性问题,从而在多个基于知识的VQA基准上提升多模态检索性能。
提出了一种用于文档理解中视觉证据归因的语言接口,使用逐字引用替代基于坐标的边界框,在CiteVQA上实现了显著更高的证据召回率和更低的归因幻觉。
提出SERAF,一种用于时间序列预测的多模态检索增强框架,该框架同时利用数值相似性和自生成的文本描述来检索历史模式,从而改善非平稳条件下的预测。在七个真实世界数据集上的实验表明,其效果优于最先进的基线模型。
本文提出了细粒度片段检索(FFR)这一新任务,旨在长对话中定位语义连贯的多模态片段(文本与图像)。作者提出了基于生成的检索模型 F2RVLM(通过强化学习训练)和两阶段检索系统 FFRS,并构建了新的评测数据集 MLDR。
SMART是一个框架,能够解锁单向量模型中的潜在多向量能力,用于多模态检索,通过对比训练和后期交互推理,在降低计算成本的同时提升最先进的性能。