MLAIRE: 多语言语言感知信息检索评估协议
摘要
MLAIRE 是一种多语言语言感知信息检索评估协议,它将语义检索准确性与查询语言偏好分离,以更好地评估跨混合语言语料库的检索效用。
查看缓存全文
缓存时间: 2026/05/18 18:27
论文页面 - MLAIRE:多语言语言感知信息检索评估协议
来源:https://huggingface.co/papers/2605.07249
摘要
多语言信息检索评估协议 MLAIRE 将语义检索准确性与查询语言偏好分离,以更好地评估混合语言语料库中的检索实用性。
多语言信息检索 (https://huggingface.co/papers?q=Multilingual%20Information%20Retrieval) 在实际搜索场景中日益重要,用户会在混合语言语料库中发出查询。现有评估主要奖励语言无关的语义相关性,同等对待不同语言的相关段落。然而,检索实用性还取决于检索段落的语言:用户可能更偏好能够阅读和验证的查询语言结果,而查询-段落语言不匹配可能会使检索增强生成 (https://huggingface.co/papers?q=Retrieval-Augmented%20Generation) 系统中的下游依赖和答案验证变得复杂。为了评估这一语言感知维度,我们引入了 MLAIRE,一种多语言语言感知信息检索评估协议,该协议将跨语言语义检索 (https://huggingface.co/papers?q=cross-lingual%20semantic%20retrieval) 与查询语言偏好 (https://huggingface.co/papers?q=query-language%20preference) 分离开来。MLAIRE 构建了包含多种语言平行段落的受控池,从而在存在等价翻译时能够测量语义检索准确性和查询语言偏好 (https://huggingface.co/papers?q=query-language%20preference)。我们提出了语言感知指标 (https://huggingface.co/papers?q=language-aware%20metrics),包括语言偏好率 (https://huggingface.co/papers?q=Language%20Preference%20Rate) (LPR) 和 Lang-nDCG (https://huggingface.co/papers?q=Lang-nDCG),以及一个将语义和查询语言偏好 (https://huggingface.co/papers?q=query-language%20preference) 失败分开的四维分解。评估了 31 个稠密、稀疏和延迟交互检索器 (https://huggingface.co/papers?q=late-interaction%20retrievers) 后,我们表明标准指标掩盖了不同行为:语义强大的检索器可能以非查询语言返回正确内容,而查询语言偏好 (https://huggingface.co/papers?q=query-language%20preference) 更强的检索器可能检索到语义相关性较低的段落。
查看 arXiv 页面 (https://arxiv.org/abs/2605.07249)查看 PDF (https://arxiv.org/pdf/2605.07249)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.07249)
在你的 agent 中获取本文:
hf papers read 2605\.07249
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
请在模型 README.md 中引用 arxiv.org/abs/2605.07249 以从本页链接。
引用本文的数据集0
没有数据集链接本文
请在数据集 README.md 中引用 arxiv.org/abs/2605.07249 以从本页链接。
引用本文的 Spaces0
没有 Space 链接本文
请在 Space README.md 中引用 arxiv.org/abs/2605.07249 以从本页链接。
包含本文的收藏0
没有收藏包含本文
将本文添加到一个收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
所有语言都重要:理解并缓解多语言 RAG 中的语言偏见
研究者发现多语言 RAG 重排器存在系统性英语与查询语言偏见,提出 LAURA——一种面向效用的对齐方法,通过跨语言检索答案关键文档显著提升性能。
MMed-Bench-IR:一个用于多语言医学信息检索的异构基准
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
LAMAR:一种开放的语言感知多语言对齐重排序器
LAMAR 是一种语言感知的多语言交叉编码器重排序器,它利用基于英语锚定的相关性蒸馏和偏好对齐,在保持语义相关性的同时,优先考虑与查询同语言的文档,在多语言基准测试中表现优异。
Libra:面向智能体信息检索的环境训练
本文提出了Libra,一个自我演进的框架,通过在代码仓库中引入可变目录(层次化的Markdown文件,作为可导航索引)来提升LLM智能体的代码定位能力,实现了对数级别的改进以及在不同模型和问题集上的零样本迁移。
MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器
MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。