MULTI3IR: 一个多视角多领域多模态信息检索基准

Hugging Face Daily Papers 论文

摘要

本文介绍了Multi3IR,一个多视角、多领域、多模态信息检索基准,并提出了SPIN,一种改进检索系统视角覆盖的方法。

信息检索(IR)越来越关注接受多样视角的开放式查询。然而,现有的IR基准主要集中在封闭式查询上,甚至开放式基准也大多由支持文档跨越单一主题领域和模态的查询组成。我们引入了Multi^3IR,这是一个评估检索器如何覆盖跨多样领域和模态的开放式查询的多面视角的基准。它包含104.9K个Stack Exchange查询,每个查询都注有视角描述,捕捉查询的隐含观点。我们进一步提出了SPIN,一种参数和标签高效的方法,学习噪声向量以引导嵌入朝向多样而有意义的语义方向。实验表明,现有的多模态检索器存在单视角偏差,而SPIN在Multi^3IR上显著改进了视角覆盖,并能很好地泛化到未见过的开放式IR基准。数据集和实验代码可在https://github.com/seokwon99/Multi3IR获取。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:51

论文页面 - MULTI3IR:多视角、多领域、多模态信息检索基准测试

来源:https://huggingface.co/papers/2608.30949

摘要

一个新的基准测试和引导方法改善了针对开放式查询在跨领域和模态的多样视角检索覆盖范围。

信息检索(IR)越来越多地针对承认多种视角的开放式查询(https://huggingface.co/papers?q=open-ended%20queries)。然而,现有的IR基准测试主要关注封闭式查询,即使开放式基准测试也大多由支持文档跨越单一主题领域和模态的查询组成。我们引入了Multi^3IR,一个评估检索器在跨领域和模态下如何覆盖开放式查询(https://huggingface.co/papers?q=open-ended%20queries)多面视角的基准测试。它包含104,900个Stack Exchange查询,每个查询都标注了捕获查询隐含观点的视角描述。我们进一步提出了SPIN,一种参数和标签高效的方法,它学习噪声向量(https://huggingface.co/papers?q=noise%20vectors)以引导嵌入向多样但有意义的语义方向发展。实验表明,现有的多模态检索器(https://huggingface.co/papers?q=multimodal%20retrievers)存在单视角偏差(https://huggingface.co/papers?q=single-perspective%20bias),而SPIN在Multi^3IR上显著提高了视角覆盖率(https://huggingface.co/papers?q=perspective%20coverage),并且能很好地泛化到未见过的开放式IR基准测试。数据集和实验代码可在 https://github.com/seokwon99/Multi3IR(https://huggingface.co/papers?q=Multi3IR)获取。

查看arXiv页面(https://arxiv.org/abs/2608.30949)查看PDF(https://arxiv.org/pdf/2608.30949)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.30949)

通过您的代理获取本文:

hf papers read 2608.30949

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无模型链接本文

在模型README.md中引用 arxiv.org/abs/2608.30949 以从此页面链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2608.30949 以从此页面链接。

引用本文的空间0

无空间链接本文

在空间README.md中引用 arxiv.org/abs/2608.30949 以从此页面链接。

包含本文的收藏集0

无收藏集包含本文

将本文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。