LAMAR:一种开放的语言感知多语言对齐重排序器

Hugging Face Daily Papers 论文

摘要

LAMAR 是一种语言感知的多语言交叉编码器重排序器,它利用基于英语锚定的相关性蒸馏和偏好对齐,在保持语义相关性的同时,优先考虑与查询同语言的文档,在多语言基准测试中表现优异。

在多语言检索增强生成中,检索器可以检索出多种语言的相关文档,这些文档随后会在答案生成前进行重排序。然而,现有的多语言重排序器在对语义相关的候选项进行排序时,是否会考虑文档语言,目前尚不明确。我们的分析表明,当跨语言存在语义等效的文档时,这些重排序器并不始终优先考虑与查询同语言的文档,尽管文档语言会影响答案生成。我们发布了 LAMAR,这是一种语言感知的多语言交叉编码器,旨在同时考虑语义相关性和语言一致性。LAMAR 首先使用基于英语锚定的相关性蒸馏,建立跨多语言输入的一致性相关性评分,然后应用偏好对齐以实现语言一致性,鼓励与查询同语言的文档在保留语义相关性的同时获得更高排名。在一项旨在评估语言一致性的受控实验中,LAMAR 在所有语言及单独考察的每种语言上均取得了最佳性能。LAMAR 在已建立的多语言重排序基准测试中也保持了竞争力。在实际检索场景中,当对第一阶段检索到的候选文档进行重排序时,LAMAR 在所有报告指标上均取得了最佳结果。这些结果表明,LAMAR 在考虑语言一致性的同时,在通用多语言重排序基准测试上也取得了强劲表现。
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:40

论文页面 - LAMAR:一种开放的语言感知多语言对齐重排器

来源:https://huggingface.co/papers/2607.22042

摘要

在多语言检索增强生成中,检索器可以检索出用多种语言撰写的相关文档,这些文档会在答案生成前进行重排。然而,目前尚不清楚现有的多语言重排器在排序语义相关的候选项时,是否考虑了文档的语言。我们的分析表明,当语义等价的文档跨语言可用时,这些重排器并不会一致地优先选择与查询语言相同的文档,尽管文档语言会影响答案生成。我们发布了 LAMAR,一个语言感知的多语言交叉编码器,它被训练用于同时考虑语义相关性和语言一致性。LAMAR 首先使用英语锚定的相关性蒸馏,在多语言输入间建立一致的相关性评分,然后应用语言一致性的偏好对齐,鼓励与查询语言相同的文档获得更高的排名,同时保留语义相关性。在一项旨在评估语言一致性的受控实验中,LAMAR 在所有语言以及单独考察的每种语言上均取得了最佳性能。LAMAR 在既有的多语言重排基准测试中也保持竞争力。在实际检索场景中,LAMAR 在对第一阶段检索到的候选文档进行重排时,在所有汇报指标上均取得了最佳结果。这些结果表明,LAMAR 兼顾了语言一致性,同时在一股性的多语言重排基准上表现出色。

查看 arXiv 页面 (https://arxiv.org/abs/2607.22042) 查看 PDF (https://arxiv.org/pdf/2607.22042) 项目页面 (https://huggingface.co/nlpai-lab/LAMAR-600m) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22042)

在你的 agent 中获取此论文:

hf papers read 2607.22042

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 1

nlpai-lab/LAMAR-600m 文本排序 • 0.6B • 约1小时前更新 • 127 • 8 (https://huggingface.co/nlpai-lab/LAMAR-600m)

引用此论文的数据集 0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.22042 可在此页面建立链接。

引用此论文的 Space 0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.22042 可在此页面建立链接。

包含此论文的收藏 0

没有收藏包含此论文

添加此论文到一个收藏 (https://huggingface.co/new-collection) 可在此页面建立链接。

相似文章

KaLM-Reranker-V1:快速而非延迟交互的压缩文档重排序

Hugging Face Daily Papers

KaLM-Reranker-V1 是一种快速重排序模型,通过采用编码器-解码器架构,结合 Matryoshka 嵌入池化和交叉注意力机制,将查询与段落计算解耦,在 BEIR 上实现了最先进的重排序性能,并在多语言基准测试中取得了具有竞争力的结果。

LOPA:通过潜在序数原型对齐提升口语评估

arXiv cs.CL

本文介绍了LOPA,一个轻量级口语评估框架,它利用潜在序数原型对齐和语义锚定层路由(基于冻结的Whisper编码器),在不进行LLM微调的情况下,实现了与十亿参数模型相当的性能。