LAMAR:一种开放的语言感知多语言对齐重排序器
摘要
LAMAR 是一种语言感知的多语言交叉编码器重排序器,它利用基于英语锚定的相关性蒸馏和偏好对齐,在保持语义相关性的同时,优先考虑与查询同语言的文档,在多语言基准测试中表现优异。
查看缓存全文
缓存时间: 2026/07/27 05:40
论文页面 - LAMAR:一种开放的语言感知多语言对齐重排器
来源:https://huggingface.co/papers/2607.22042
摘要
在多语言检索增强生成中,检索器可以检索出用多种语言撰写的相关文档,这些文档会在答案生成前进行重排。然而,目前尚不清楚现有的多语言重排器在排序语义相关的候选项时,是否考虑了文档的语言。我们的分析表明,当语义等价的文档跨语言可用时,这些重排器并不会一致地优先选择与查询语言相同的文档,尽管文档语言会影响答案生成。我们发布了 LAMAR,一个语言感知的多语言交叉编码器,它被训练用于同时考虑语义相关性和语言一致性。LAMAR 首先使用英语锚定的相关性蒸馏,在多语言输入间建立一致的相关性评分,然后应用语言一致性的偏好对齐,鼓励与查询语言相同的文档获得更高的排名,同时保留语义相关性。在一项旨在评估语言一致性的受控实验中,LAMAR 在所有语言以及单独考察的每种语言上均取得了最佳性能。LAMAR 在既有的多语言重排基准测试中也保持竞争力。在实际检索场景中,LAMAR 在对第一阶段检索到的候选文档进行重排时,在所有汇报指标上均取得了最佳结果。这些结果表明,LAMAR 兼顾了语言一致性,同时在一股性的多语言重排基准上表现出色。
查看 arXiv 页面 (https://arxiv.org/abs/2607.22042) 查看 PDF (https://arxiv.org/pdf/2607.22042) 项目页面 (https://huggingface.co/nlpai-lab/LAMAR-600m) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22042)
在你的 agent 中获取此论文:
hf papers read 2607.22042
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 1
nlpai-lab/LAMAR-600m 文本排序 • 0.6B • 约1小时前更新 • 127 • 8 (https://huggingface.co/nlpai-lab/LAMAR-600m)
引用此论文的数据集 0
没有数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.22042 可在此页面建立链接。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.22042 可在此页面建立链接。
包含此论文的收藏 0
没有收藏包含此论文
添加此论文到一个收藏 (https://huggingface.co/new-collection) 可在此页面建立链接。
相似文章
所有语言都重要:理解并缓解多语言 RAG 中的语言偏见
研究者发现多语言 RAG 重排器存在系统性英语与查询语言偏见,提出 LAURA——一种面向效用的对齐方法,通过跨语言检索答案关键文档显著提升性能。
KaLM-Reranker-V1:快速而非延迟交互的压缩文档重排序
KaLM-Reranker-V1 是一种快速重排序模型,通过采用编码器-解码器架构,结合 Matryoshka 嵌入池化和交叉注意力机制,将查询与段落计算解耦,在 BEIR 上实现了最先进的重排序性能,并在多语言基准测试中取得了具有竞争力的结果。
通过知识蒸馏将大语言模型转化为高效的交叉编码器以用于RAG重排序
本文提出了一种方法,将LLaMA 3 8B微调为高效的检索增强生成重排序器,利用知识蒸馏和4位量化,在检索指标上比交叉编码器基线提升14-21%,同时降低了推理成本。
LOPA:通过潜在序数原型对齐提升口语评估
本文介绍了LOPA,一个轻量级口语评估框架,它利用潜在序数原型对齐和语义锚定层路由(基于冻结的Whisper编码器),在不进行LLM微调的情况下,实现了与十亿参数模型相当的性能。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。