MULTI3IR: 一个多视角多领域多模态信息检索基准
摘要
本文介绍了Multi3IR,一个多视角、多领域、多模态信息检索基准,并提出了SPIN,一种改进检索系统视角覆盖的方法。
查看缓存全文
缓存时间: 2026/09/03 03:51
论文页面 - MULTI3IR:多视角、多领域、多模态信息检索基准测试
来源:https://huggingface.co/papers/2608.30949
摘要
一个新的基准测试和引导方法改善了针对开放式查询在跨领域和模态的多样视角检索覆盖范围。
信息检索(IR)越来越多地针对承认多种视角的开放式查询(https://huggingface.co/papers?q=open-ended%20queries)。然而,现有的IR基准测试主要关注封闭式查询,即使开放式基准测试也大多由支持文档跨越单一主题领域和模态的查询组成。我们引入了Multi^3IR,一个评估检索器在跨领域和模态下如何覆盖开放式查询(https://huggingface.co/papers?q=open-ended%20queries)多面视角的基准测试。它包含104,900个Stack Exchange查询,每个查询都标注了捕获查询隐含观点的视角描述。我们进一步提出了SPIN,一种参数和标签高效的方法,它学习噪声向量(https://huggingface.co/papers?q=noise%20vectors)以引导嵌入向多样但有意义的语义方向发展。实验表明,现有的多模态检索器(https://huggingface.co/papers?q=multimodal%20retrievers)存在单视角偏差(https://huggingface.co/papers?q=single-perspective%20bias),而SPIN在Multi^3IR上显著提高了视角覆盖率(https://huggingface.co/papers?q=perspective%20coverage),并且能很好地泛化到未见过的开放式IR基准测试。数据集和实验代码可在 https://github.com/seokwon99/Multi3IR(https://huggingface.co/papers?q=Multi3IR)获取。
查看arXiv页面(https://arxiv.org/abs/2608.30949)查看PDF(https://arxiv.org/pdf/2608.30949)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.30949)
通过您的代理获取本文:
hf papers read 2608.30949
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无模型链接本文
在模型README.md中引用 arxiv.org/abs/2608.30949 以从此页面链接。
引用本文的数据集0
无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2608.30949 以从此页面链接。
引用本文的空间0
无空间链接本文
在空间README.md中引用 arxiv.org/abs/2608.30949 以从此页面链接。
包含本文的收藏集0
无收藏集包含本文
将本文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
MMed-Bench-IR:一个用于多语言医学信息检索的异构基准
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
通过并行搜索与显式合并扩展检索增强推理
介绍了MultiSearch,一种基于强化学习的框架,该框架在每一步推理中生成多个查询,并显式合并检索到的信息,以提高问答任务中的信噪比和推理准确性。
UMER:通过配对感知判别推理统一嵌入与排序以实现通用多模态检索
UMER 引入了一个统一的多模态检索框架,通过配对感知判别推理结合嵌入与排序,在 MMEB-V2 基准测试中达到了最先进的性能。
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。