SemBridge:通过多语言语义桥实现稀疏编码器中的语言迁移
摘要
SemBridge是一种新颖的嵌入初始化方法,利用多语言桥接模型建立源词汇和目标词汇之间的语义对齐,从而提升跨语言稀疏编码器的适配能力和多语言检索性能。
查看缓存全文
缓存时间: 2026/05/26 06:43
论文页面 - SemBridge:通过多语言语义桥接实现稀疏编码器的语言迁移
来源:https://huggingface.co/papers/2605.26002
摘要
SemBridge 通过利用多语言桥接模型建立语义对齐,增强了跨语言稀疏编码器的适配能力,并提升了多语言的检索性能。
稀疏编码器 (https://huggingface.co/papers?q=Sparse%20encoders) 通过在词汇空间中表征词项重要性来实现高精度检索,但其以英语为中心的结构对非英语语言的语言迁移构成了关键障碍。为了克服这一结构性限制,我们提出了 SemBridge,这是一种新颖的嵌入初始化方法,专为稀疏编码器 (https://huggingface.co/papers?q=sparse%20encoders) 的跨语言适配 (https://huggingface.co/papers?q=cross-lingual%20adaptation) 而设计,通过利用多语言桥接模型 (https://huggingface.co/papers?q=multilingual%20bridge%20models) 来实现。SemBridge 使用多语言稠密嵌入作为桥梁,在源词汇表和目标词汇表之间建立语义对齐 (https://huggingface.co/papers?q=semantic%20alignment)。不同于直接依赖所有源语言词项,SemBridge 选择一小批语义相关的源语言词项,并用它们来初始化每个目标语言词项,从而有效过滤语义噪声,并将目标词项重构为核心同义词的精确线性组合。这加速了微调 (https://huggingface.co/papers?q=fine-tuning) 过程中的收敛,并提高了训练效率。跨五种语言和四种稀疏架构的大量实验表明,与现有基线相比,SemBridge 在零样本检索 (https://huggingface.co/papers?q=zero-shot%20retrieval) 中取得了优越性能,并在微调 (https://huggingface.co/papers?q=fine-tuning) 后持续提升了检索性能 (https://huggingface.co/papers?q=retrieval%20performance)。这些结果验证了 SemBridge 作为在不同语言环境中部署高性能稀疏检索系统的实用解决方案。
查看 arXiv 页面 (https://arxiv.org/abs/2605.26002) 查看 PDF (https://arxiv.org/pdf/2605.26002) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.26002)
在您的 Agent 中获取这篇论文:
hf papers read 2605\.26002
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
未找到链接该论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2605.26002,即可从此页面链接该论文。
引用该论文的数据集 0
未找到链接该论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.26002,即可从此页面链接该论文。
引用该论文的 Space 0
未找到链接该论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.26002,即可从此页面链接该论文。
包含该论文的合集 0
未找到包含该论文的合集
将这篇论文添加到合集 (https://huggingface.co/new-collection) 中,即可从此页面链接该论文。
相似文章
为什么先进编码器在稀疏检索上落后?答案及弥合词汇差距的方法
本文指出词汇差距是导致ModernBERT等先进编码器在学习型稀疏检索中表现不佳的根本原因,并提出词汇迁移(VT)这一模型无关框架,将编码器迁移至稀疏友好的词汇表,在BEIR基准测试上取得最优结果。
ParaBridge:弥合语音语言模型中副语言感知与对话行为之间的鸿沟
ParaBridge是一种基于策略的自蒸馏方法,旨在弥合语音语言模型中副语言感知与对话行为之间的差距,在不依赖外部奖励的情况下显著提升安全性和共情能力。
LLMBridge:面向英语端到端指称桥接解析的LLM流水线
LLMBridge 提出了一种基于LLM的端到端指称桥接解析流水线,在三个英语数据集上取得了最先进的性能。该系统将启发式预处理/后处理与LLM自然语言推理相结合。
多语言设计导向的调控:多语言稀疏自编码器与原则性层选择
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。
面向语言集成可靠性审计的多语言句子嵌入
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。