中心性而非各向异性驱动多语言嵌入模型中的跨语言检索不对称性

arXiv cs.CL 论文

摘要

本文研究了多语言嵌入模型中跨语言检索不对称性的成因。作者提出并验证了枢纽中介假说,发现中心性(而非各向异性)是主导原因,并建议使用CSLS替代余弦相似度。

arXiv:2605.26575v1 公告类型:新 摘要:多语言嵌入模型在部署时基于一个假设:跨语言检索是对称的——如果语言A中的查询检索到其在语言B中的翻译,那么反之亦然。然而在实践中,情况并非如此。我们使用一个包含6,518条英语、孟加拉语、印地语和阿拉伯语惯用表达与谚语的平行语料库,通过五个生产级编码器(Gemini、Mistral、OpenAI-L、OpenAI-S、Qwen)进行嵌入,将这种失败形式化为互近邻互惠性的缺失,并检验一个单一的机制性主张:在多语言空间的几何病态中,中心性(而非各向异性、质心偏移或幅度)是主导的因果驱动因素。通过五个预注册实验(预先指定了证伪条件),中心质量在互惠性的联合回归中占据主导地位(主导份额49.5%,是下一个预测因子的1.68倍;偏R²=0.302,而各向异性为0.003),而基于中心性的评分校正(CSLS)弥合了最差与最佳互惠性差距的63.5%,并在模型内产生平均效应量,比精确的中心向量消融大130倍。后一对比揭示了机制:中心性是相似度度量的病态,而非单个中心向量的问题。我们通过证明两者在统计上可分离,解决了著名的各向异性-中心性悖论,并建议用CSLS替代余弦相似度作为多语言嵌入流水线的默认检索度量。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:07

# Hubness, Not Anisotropy, Drives Cross-Lingual Retrieval Asymmetry in Multilingual Embedding Models 来源:https://arxiv.org/html/2605.26575 Adib Sakhawat, Fardeen Sadab, Atik Shahriar, 计算机科学与工程系,伊斯兰科技大学,孟加拉国达卡 \{adibsakhawat, fardeensadab, atikshahriar\}@iut\-dhaka\.edu ###### 摘要 多语言嵌入模型部署时基于一个假设:跨语言检索是对称的——如果语言 A 中的查询检索到其语言 B 中的翻译,反之亦然。但在实践中,这一假设并不成立。本文利用包含6,518条英语、孟加拉语、印地语和阿拉伯语习语及谚语表达的平行语料库,经五个生产级编码器(Gemini、Mistral、OpenAI-L、OpenAI-S、Qwen)嵌入后,将这种失效形式化为互近邻互惠性的缺陷,并检验一个单一的机制性主张:在多语言空间的几何病理中,主导因果驱动因素是**中心性(hubness)**,而非各向异性、质心漂移或向量模长。通过五项预先注册(包含预先指定证伪条件)的实验,中心质量在互惠性的联合回归中占据主导地位(占49.5%的主导份额,是次优预测因子的1.68倍;偏R²=0.302,而各向异性仅为0.003)。同时,中心感知的分数校正(CSLS)弥合了最差到最佳互惠性差距的63.5%,并且产生了比外科手术式中心向量消融大130倍的模型内平均效应量。后者对比精准定位了机制:中心性是一种**相似性度量**的病理,而非单个中心向量的病理。我们通过证明两者在统计上可分离,解决了广为人知的各向异性-中心性悖论,并建议用CSLS替代余弦相似度作为多语言嵌入管道的默认检索度量。 Hubness, Not Anisotropy, Drives Cross-Lingual Retrieval Asymmetry in Multilingual Embedding Models Adib Sakhawat, Fardeen Sadab, Atik Shahriar, 计算机科学与工程系 伊斯兰科技大学,孟加拉国达卡 \{adibsakhawat, fardeensadab, atikshahriar\}@iut\-dhaka\.edu ## 1 引言 多语言嵌入模型(Gemini、Mistral、OpenAI text-embedding-3 系列、Qwen)作为跨语言检索和多语言 RAG 的即插即用组件部署,基于一个几何承诺:不同语言中语义等价的文本应位于共享空间中的彼此附近。然而,不同模型族、文字系统和阈值下,对这些空间的检索显著不对称。图1(https://arxiv.org/html/2605.26575#S1.F1)对比了两种情形:行为良好的空间产生对称的一对一对齐(面板a),而病理性的空间则显示出严重的**中心性**——来自多个源语言的数十个查询坍缩到单个流行的目标向量上(面板b)。 请参阅图注 图 1:跨语言检索中中心性的概念图示:少数目标语言向量成为许多源语言查询的最近邻,导致不对称的检索失败。 越来越多的文献记录了可能解释此类失效的几何病理:各向异性 (Ethayarajh 2019 (https://arxiv.org/html/2605.26575#bib.bib17);Mu等人 (2017 (https://arxiv.org/html/2605.26575#bib.bib18))、中心性 (Radovanović等人 (2010 (https://arxiv.org/html/2605.26575#bib.bib1));Dinu等人 (2014 (https://arxiv.org/html/2605.26575#bib.bib4));Lazaridou等人 (2015 (https://arxiv.org/html/2605.26575#bib.bib5))、质心漂移、模长方差,但它们被报告为一个异质列表,而没有关于哪个是因果性责任的可证伪主张。我们通过一个单一的机制性主张——**中心中介假说**(H₀)来填补这一空白: > 在多语言嵌入空间的几何病理中,中心性是跨语言检索不对称的主导因果驱动因素。在分数层面上抑制中心影响的干预措施,应按照它们所中和的中心质量比例恢复互惠性。 结果变量是**检索互惠性** RR,即互近邻率,这是双向检索和多语言 RAG 实际依赖的指标。我们使用包含6,518条英语、孟加拉语、印地语和阿拉伯语习语及谚语表达的平行语料库(嵌入自五个生产级编码器,共2020个模型×语言对观测)来检验 H₀。 #### 贡献。 我们提供了多语言几何病理的因果分解,其中中心性单独通过优势分析占据了49.5%的解释方差(各向异性的偏R²=0.003);通过实验分离了中心**向量**与中心**分数影响**——外科手术式的前100个中心消融是无效的(Cohen's d≈0.03),而 CSLS (Lample等人 (2018 (https://arxiv.org/html/2605.26575#bib.bib7))) 达到了 d≈2.4,比率为130倍,从而将机制精准定位为分数失真而非中心的物理存在;一个实用建议,即 CSLS 无需重新训练即可弥合最差到最佳互惠性差距的63.5%,并在所有五个编码器上改进 Recall@1;以及各向异性-中心性悖论的解决,因为高各向异性/低中心性(Qwen)和中等各向异性/高中心性(OpenAI-S)模型在两种病理统计分离后的行为完全符合 H₀ 的预测。 ## 2 相关工作 #### 中心性作为一种几何病理。 Radovanović等人 (2010 (https://arxiv.org/html/2605.26575#bib.bib1)) 将中心性引入为维度诅咒的固有结果,表明在高维空间中,小部分点会变得不成比例地成为流行的最近邻。后续工作表明,距离缩放可以显著抑制中心性 (Schnitzer等人 (2012 (https://arxiv.org/html/2605.26575#bib.bib2));Flexer and Schnitzer (2015 (https://arxiv.org/html/2605.26575#bib.bib3)))。 #### 跨语言和零样本设置中的中心性。 Dinu等人 (2014 (https://arxiv.org/html/2605.26575#bib.bib4)) 和 Lazaridou等人 (2015 (https://arxiv.org/html/2605.26575#bib.bib5)) 首次证明,零样本学习(包括跨语言词翻译)中的跨空间映射遭受严重的中心性问题,而中心感知的校正可以提高检索效果。Smith等人 (2017 (https://arxiv.org/html/2605.26575#bib.bib6)) 提出了反向 softmax 作为另一种减轻中心性的检索准则。 #### 跨语言词嵌入与 CSLS。 Lample等人 (2018 (https://arxiv.org/html/2605.26575#bib.bib7)) 引入了跨域相似度局部缩放(CSLS)作为无监督双语词汇归纳的中心感知检索度量。Artetxe等人 (2018 (https://arxiv.org/html/2605.26575#bib.bib8)) 和 Joulin等人 (2018 (https://arxiv.org/html/2605.26575#bib.bib11)) 通过更好的映射或检索对齐目标来解决同一问题。Glavaš等人 (2019 (https://arxiv.org/html/2605.26575#bib.bib9)) 系统化了跨语言词嵌入的评估,而 Glavaš and Vulić (2020 (https://arxiv.org/html/2605.26575#bib.bib10)) 认为主要障碍是非同构性而非中心性——这是一个我们的实验直接回应的替代假说。 #### 多语言句子嵌入。 我们研究的编码器是既定序列的后代:LASER (Artetxe and Schwenk (2019 (https://arxiv.org/html/2605.26575#bib.bib12)))、LaBSE (Feng等人 (2020 (https://arxiv.org/html/2605.26575#bib.bib13)))、Reimers and Gurevych (2020 (https://arxiv.org/html/2605.26575#bib.bib14)) 的蒸馏框架,以及 SBERT/SimCSE (Reimers and Gurevych (2019 (https://arxiv.org/html/2605.26575#bib.bib15));Gao等人 (2021 (https://arxiv.org/html/2605.26575#bib.bib16)))。多语言掩码语言模型如多语言 BERT (Pires等人 (2019 (https://arxiv.org/html/2605.26575#bib.bib19))) 和 XLM-R (Conneau等人 (2020 (https://arxiv.org/html/2605.26575#bib.bib20))) 提供了上游基础。SentEval (Conneau and Kiela (2018 (https://arxiv.org/html/2605.26575#bib.bib21))) 仍然是标准评估工具包,但与几何无关。 #### 嵌入几何与各向异性。 Ethayarajh (2019 (https://arxiv.org/html/2605.26575#bib.bib17)) 记录了上下文化表示中的严重各向异性,Mu等人 (2017 (https://arxiv.org/html/2605.26575#bib.bib18)) 表明简单的几何后处理(均值移除、主成分置零)能带来巨大收益。我们的结果贡献了方差分解:一旦中心性进入模型,各向异性的偏贡献在统计上可忽略不计。 #### 习语层面的评估。 习语和多词表达是翻译的长期压力测试 (Fadaee等人 (2018 (https://arxiv.org/html/2605.26575#bib.bib22));Baziotis等人 (2023 (https://arxiv.org/html/2605.26575#bib.bib23)))。我们将其作为嵌入几何的压力测试,原则是比喻性语言强制对齐必须是纯语义的。 ## 3 设置 #### 语料库。 包含6,518条英语 (En)、孟加拉语 (Bn)、印地语 (Hi) 和阿拉伯语 (Ar) 表达的平行习语数据集。所有表达均为习语或谚语,消除了词汇重叠捷径,强制对齐成为语义性的。该语料库来自一个更大的、正在单独准备的、由专家标注的孟加拉语谚语及其跨语言等价物集合;此处利用的比喻性语言属性与该工作的贡献正交。本文使用的子集以及所有嵌入矩阵和分析产物将在父项目完成后公开发布。 #### 模型。 五个生产级嵌入模型:Gemini(gemini-embedding-001,3072维)、Mistral(mistral-embed-2312,1024维)、OpenAI-L(text-embedding-3-large,3072维)、OpenAI-S(text-embedding-3-small,1536维)和 Qwen(qwen3-embedding-8b,4096维)。所有嵌入均通过 OpenRouter API 网关以其默认推理配置获取,以确保跨提供者一致的请求接口并避免每个供应商的预处理差异。 #### 语言对。 我们评估了 En↔Bn、En↔Hi、En↔Ar 以及 Hi↔Bn(印地-雅利安内部对照)。与5个模型交叉,得到20个(模型,语言对)观测值。 #### 构念。 对于每个(模型,语言对),我们计算下面定义的四个几何量。互惠性,即中心结果变量,统计跨两种语言相互检索的索引分数(方程1 (https://arxiv.org/html/2605.26575#S3.E1)): R = |{i : NN(A_i, B) = i ∧ NN(B_i, A) = i}| / N  (1) 其中 NN(x, Y) = argmax_j sim(x, Y_j)。其余构念为: - • 中心质量 H:由最常被检索的前1%目标向量所捕获的所有最近邻检索的分数。 - • 各向异性 A:每个向量到其语言质心的平均余弦(在两种语言上平均)。 - • 质心漂移 D:1 - cos(̄x_A, ̄x_B)。 - • 控制变量:维度 d 和目标语言的 UTF-8 字节比 b。所有四个构念和互惠性结果的成对原始值列于附录 A (https://arxiv.org/html/2605.26575#A1)。 #### 证伪条件。 在观察任何数据之前预先注册: FC1. 在联合回归中,中心质量 H 必须是 RR 的最大标准化预测因子,并且其主导份额必须超过次优预测因子至少 1.5 倍。 FC2. 对前 k 个中心向量进行消融必须对所有五个模型产生单调非递减的 RR。 FC3. CSLS 必须弥合至少 50% 的最差到最佳互惠性差距(按模型平均)。 如果 FC1 和 FC3 成立,则 H₀ 得到证实。FC2 是一个强检验,正如我们将看到的,它以一种有信息的方式失败。 ## 4 实验 我们报告五个实验(E1–E5),分别针对 H₀ 的不同方面。E1 确定哪种病理在统计上占主导地位;E2 测试外科手术式干预;E3 测试分数层面的干预(最直接的因果检验);E4 解决先前工作中的内部矛盾;E5 询问中心习语是否具有语言指纹。鲁棒性检验 (§4.6 (https://arxiv.org/html/2605.26575#S4.SS6)) 探索替代规格,构念效度元实验 (§5 (https://arxiv.org/html/2605.26575#S5)) 测试内部一致性。 ### 4.1 E1:驱动互惠性的因素是什么? #### 方法。 我们拟合联合回归 R = β₀ + β_H H + β_A A + β_D D + β_d d + β_b b + ε (2),使用标准化预测因子,基于 n=20 个观测值,随后进行 Budescu 优势分析,以分解 R² 在预测因子之间的分配,该分析对预测因子间相关性具有鲁棒性。方程2 (https://arxiv.org/html/2605.26575#S4.E2) 将中心质量、各向异性和质心漂移视为竞争的几何解释,而 d 和 b 控制维度和文字复杂度。 #### 结果。 联合模型解释了互惠性方差的 R²=0.747。表1 (https://arxiv.org/html/2605.26575#S4.T1) 显示中心质量是唯一具有统计显著 β 和实质性偏 R² 的预测因子。如图2 (https://arxiv.org/html/2605.26575#S4.F2) 的视觉强调,中心质量占了近一半(49.5%)的解释方差,清晰地说明了它如何使各向异性和质心漂移等其他几何因子的贡献相形见绌。 表 1:E1:互惠性对几何病理的标准化 OLS 回归(n=20)。Dom.% 是解释 R² 的优势分析份额。电青色标记主导预测因子(中心质量,H₀ 的核心主张);电丁香色标记被证伪的竞争者(各向异性,偏 R²≈0);丁香色标记一个提供信息的零值(质心漂移,同样无效)。 请参阅图注 图 2:实验 1 的优势分析总结。相对于竞争性几何预测因子,中心质量在检索互惠性的解释方差中占最大份额。 中心质量与次优预测因子的主导比率 = 49.5/29.4 = 1.68 倍,超过了预先注册的 1.5 倍阈值。FC1 满足。各向异性——先前工作中讨论最多的病理——在 H 进入模型后偏 R²=0.003 且不显著。这是我们第一个证据,表明先前工作 (Ethayarajh 2019 (https://arxiv.org/html/2605.26575#bib.bib17);Mu等人 (2017 (https://arxiv.org/html/2605.26575#bib.bib18))) 中标记的各向异性-中心性悖论并非矛盾,而是分离:两种病理不是耦合的。 ### 4.2 E2:移除中心向量有帮助吗? #### 方法。 对于每个(模型,语言对),根据源查询对目标侧向量的入度排序,消融前 k 个中心,k∈{0,5,10,25,50,100,250},并重新计算 R(k)。作为对照,使用大小匹配的随机移除重复(5次试验,固定种子)。 #### 结果。 如图3 (https://arxiv.org/html/2605.26575#S4.F3) 鲜明图示,随着 k 的增加,所有模型的互惠性顽固地保持平坦,这一趋势由表2 (https://arxiv.org/html/2605.26575#S4.T2) 中的确切值确认。五个模型中有三个是非单调的:FC2 失败。 请参阅图注 图 3:实验 2 中心向量消融曲线。Recip

相似文章

衡量跨语言理解差距:证据语言如何影响语言模型的理解

arXiv cs.CL

本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

各向异性模态对齐

Hugging Face Daily Papers

本文提出了 AnisoAlign 框架,该框架通过应用各向异性几何校正来解决多模态模型中的模态间隙问题,从而实现有效的非配对模态对齐。