嵌入空间结构不存在理论上的多语言诅咒

arXiv cs.CL 论文

摘要

本文证明嵌入空间结构不存在理论上的多语言诅咒,表明所需的最小维度仅随语言数量呈对数增长,这意味着实证问题源于数据和训练条件。

arXiv:2608.17088v1 Announce Type: new 摘要:多语言自然语言处理的一个核心目标是实现每种语言的高单语性能,并通过多语言模型实现大规模语言覆盖的跨语言对齐。多语言诅咒描述了随着语言覆盖范围的增加,多语言模型性能下降的现象,这对上述目标构成了威胁。本文探讨多语言嵌入空间是否本质上无法在不导致所需容量剧增的情况下实现完美多语言性。我们首先形式化了“完美多语言性”的目标,体现在两个多语言条件中。然后我们证明,实现完美多语言性所需的最小维度仅随语言数量呈对数增长。也就是说,我们表明嵌入空间结构不存在理论上的多语言诅咒。这表明,实证上的多语言诅咒是现实世界数据和训练条件的结果。我们通过一个小型实证研究来支持这一理解。本文首次从理论和内在角度探讨多语言诅咒,对这一现象的科学理解具有启示意义。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:48

# 嵌入空间结构不存在理论意义上的多语言诅咒
来源: https://arxiv.org/html/2608.17088  
Neha Verma, Vilém Zouhar  
单位: 苏黎世联邦理工学院  
\[0.6em\] [email protected]  
Philipp Koehn, David Yarowsky  
\[0.6em\] 约翰霍普金斯大学  
语言与语音处理中心  

###### 摘要  
多语言自然语言处理的核心目标是:通过一个多语言模型,在大规模语言覆盖范围内,实现每种语言的高单语性能以及跨语言对齐。*"多语言诅咒"*描述了随着语言覆盖范围增加,多语言模型性能下降的现象,对上述目标构成威胁。本文探讨多语言嵌入空间是否固有地无法在不显著增加所需容量的前提下,实现完美的多语言性。我们首先将"完美多语言性"目标形式化,体现为两个*多语言性条件*。随后证明,实现完美多语言性所需的最小维度仅随语言数量 \(L\) 对数增长,即 \(\Theta(\log L)\)。换言之,我们证明在嵌入空间结构层面不存在理论意义上的多语言诅咒。这表明经验性的多语言诅咒源于现实世界的数据与训练条件。我们通过小规模实证研究支持了这一观点。本文首次从理论与内在视角审视多语言诅咒,为该现象的科学理解提供了新见解。  
1 实验代码见于 github.com/niyatibafna/curse-of-multilinguality (https://github.com/niyatibafna/curse-of-multilinguality)。  

## 1 引言  
理想的多语言模型应在单语任务上展现高性能,同时在任意语言覆盖范围内实现完美的跨语言结构(即跨语言语义共享)。众所周知的*多语言诅咒*(COM,9),亦有时被称为*负向干扰*(31),描述了当我们在固定容量模型中训练越来越多语言时,观察到的多语言性能下降现象。普遍观点认为,固定容量是固有瓶颈(18),导致每种语言的"空间"减少,表明上述完美多语言性可能无法实现。先前多项工作已从外部任务性能角度证明了该诅咒(9;1),虽有研究探索了缓解策略(35;27),但它仍是一项严峻挑战。由此引出一个根本问题:在容量有限的模型中,是否固有地无法在扩展语言覆盖范围的同时,保持所有语言所需的单语与跨语言性能?  
我们从理论与内在视角审视多语言诅咒。具体而言,我们研究嵌入空间结构的多语言诅咒(COM-EMB),并证明多语言表征可以在不显著增加容量的前提下,容纳更多语言的同时展现内在质量。首先,我们借鉴领域共识(7;19)提出两个*完美多语言*嵌入空间的内在要求,并将其称为*多语言性条件*:(a)空间为每种语言展现高质量的共享单语语义;(b)空间展现跨语言对齐,即跨语言的翻译等价项在空间中彼此"接近"。这对跨语言信息检索等应用至关重要(29;28)。在嵌入空间语境下,"容量"可理解为维度。我们的理论结果显示,编码 \(L\) 种语言的完美多语言空间的最小维度按 \(\Theta(\log L)\) 增长。具体而言,我们假设一个基础 \(D\) 维概念空间,并证明:为满足多语言性条件,容纳 \(L\) 种语言所需的最小额外维度按 \(O(\log L)\) 增长,且任何此类空间的维度至少以 \(\Omega(\log L)\) 增长。该结果表明多语言性并非完全免费:它需要依赖 \(L\) 的额外容量成本。然而,鉴于世界语言数量有限(通常估计约 6700 种),成本的对数依赖性意味着随语言覆盖范围增加,仅需付出很小的多语言税——据证明,为 7000 种语言仅需约 30 个额外维度。因此,我们证明在嵌入空间结构层面不存在理论意义上的多语言诅咒。  
上述发现表明,嵌入空间结构层面的任何经验性多语言诅咒均是现实条件(如数据与计算限制等)的结果。我们通过受控研究刻画经验性 COM-EMB:在不同配置(变化计算约束、采样条件及评估语言集)下,考察基于 Transformer 模型的多语言性条件随语言覆盖范围增加的经验性退化。研究表明,尽管我们确实观察到与普遍认知一致的"诅咒"行为,但该行为依赖于这些配置,并在有利条件下得到缓解。本文为多语言诅咒提供了首个理论与内在基础。通过证明完美内在多语言性在任意语言规模下理论上均可实现,我们为经验多语言空间设定了基准,并推动未来研究探索与弥合差距。  

## 2 背景  
#### 多语言诅咒  
"多语言诅咒"或"负向干扰"现象被理解为:当训练语言数量增加时,固定容量多语言模型性能出现可观察到的退化,通常描述为容量在语言间稀释(1;27)。虽然多语言性在一定程度上有益——尤其通过跨语言迁移提升低资源语言性能,但高资源语言性能通常受损;此外,超过某一临界点后,所有语言性能都会因引入更多训练语言而下降,构成"迁移-稀释"权衡(4;7;18)。31 表明目标语言在总训练数据中的占比是关键因素,且增加模型规模有所帮助,这引出了适应给定语言覆盖范围所需最小模型规模的问题。23 则在语言覆盖范围扩展时,发展了模型与数据规模的经验缩放定律。  
多项研究试图缓解退化现象,包括优化数据采样策略(35;21;15)、架构创新(如混合专家模型)(27),以及优化技术(如梯度疫苗)(36)。上述工作从纯经验视角探索多语言诅咒。据我们所知,我们是首个从理论视角审视多语言诅咒。  
#### 嵌入空间的内在表征  
先前关于多语言诅咒的研究仅通过 XNLI(10)和机器翻译(1)等任务的外部性能间接评估嵌入空间质量。然而,学界对多语言空间结构的研究兴趣广泛,包括评估跨语言重叠与对齐(41;38;30;24;19 等),以及语言信息与语义信息的编码(8;40)。单语与跨语言检索、双语挖掘等任务直接依赖于表征结构(28;13),并启发了我们多语言性条件(第 3 节)与度量(附录 B.1)的形式化。但据我们所知,此前尚无工作试图从嵌入空间结构的内在视角理解多语言诅咒。  

## 3 完美多语言空间的多语言性条件  
本节在给定参考高质量单语概念空间的前提下,形式化完美多语言性所需条件。  
#### 预备知识  
首先定义与论证相关的关键结构。设 \(\mathcal{C}\) 为全局概念集合,\(\mathcal{L}\) 为语言集合。设 \(Z\) 为参考概念空间,其中概念 \(c \in \mathcal{C}\) 嵌入为 \(z_c\),具备高质量语义关系。对于编码 \(L = |\mathcal{L}|\) 种语言的多语言嵌入空间 \(X^L\),设 \(x_{c,\ell}\) 表示概念 \(c \in \mathcal{C}\) 在语言 \(\ell \in \mathcal{L}\) 中的嵌入。设 \(X^L_{\ell} \subset X^L\) 表示语言 \(\ell \in \mathcal{L}\) 的单语子空间。我们用 \(\cos(\cdot,\cdot)\) 表示余弦相似度算子。最后,用 \(\gamma\) 表示参考空间 \(Z\) 的分辨率尺度,即任意两个不同点的最小分离度:存在 \(\gamma < 1\) 使得 \(\forall c,c' \in \mathcal{C}, c \neq c', \cos(z_c, z_{c'}) < \gamma\)。  
#### 单语结构  
完美多语言空间应为每种编码语言编码高质量的共享单语关系。我们以高质量概念空间 \(Z\) 为参考。那么,完美单语结构要求:对于空间 \(X^L\) 中的每种语言 \(\ell\),其单语子空间 \(X^L_{\ell}\) 精确模拟 \(Z\)。  
2 实践中我们并不知晓完美的概念关系。但可将高资源语言(如英语)的单语空间视为参考空间,从而使单语结构条件等价于要求跨语言的单语质量与共享语义对等。单语结构可通过概念对间的相对相似度判断来理解。因此,完美单语结构可理解为:每种语言的单语子空间展现出与参考概念空间相同的相似度排序,从而实现跨语言的高质量共享语义。  
###### 定义 1(单语结构)  
若多语言空间 \(X^L\) 中每个编码单语子空间在相似度排序(\(\sim_R\))上与高质量概念空间 \(Z\) 完全一致,则满足单语结构条件。即 \(\forall \ell \in \mathcal{L}, X^L_{\ell} \sim_R Z\)。  
此条件要求:\(\forall \ell \in \mathcal{L}\) 及 \(c,c',d,d' \in \mathcal{C}\),  
\[\cos(z_c, z_{c'}) \leq \cos(z_d, z_{d'}) \iff \cos(x_{c,\ell}, x_{c',\ell}) \leq \cos(x_{d,\ell}, x_{d',\ell})\]  
图 1:定义 1 的示意图。*Dog=Hund*,*Cat=Katze*,*Bark=Bellen*。概念空间以英语描绘。左侧德语空间展现与概念空间相同的邻域排序,而右侧德语空间则未满足,因为 *Katze(=Cat)* 的最近邻是 *Bellen(=Bark)* 而非 *Hund(=Dog)*。  
#### 跨语言对齐  
完美多语言空间应展现跨语言对齐,即特定概念的语言变体彼此接近,且远离其他概念。文献中区分此概念的"强"与"弱"观点(28;19)。在"强"观点中,要求语言 \(\ell\) 中的概念比任何语言(包括 \(\ell\) 中的其他概念)中的其他概念更接近其在语言 \(\ell'\) 中的翻译等价项;而弱观点仅要求其比任何 \(\ell'\) 语言点更接近。我们采用强观点(其显然蕴含弱观点)。  
###### 定义 2(跨语言对齐)  
若多语言空间 \(X^L\) 中特定语言的概念编码比任何语言中其他概念的编码更接近该概念在其他任何语言中的编码,则满足跨语言对齐条件。即此条件要求:对所有概念 \(c,c' \in \mathcal{C}\)(\(c \neq c'\))及语言 \(\ell,m,n \in \mathcal{L}\),  
\[\cos(x_{c,\ell}, x_{c,m}) > \cos(x_{c,\ell}, x_{c',n})\]  
图 2:定义 2 的示意图(两种语言)。左侧空间中,*Hund(=Dog)* 比任何不同概念词更接近 *Dog*;右侧空间中,不同概念词 *Cat* 却比 *Hund(=Dog)* 更接近 *Dog*。  
#### 非退化性  
多语言空间可将所有概念翻译等价项置于参考高质量单语空间中的同一点,从而平凡地同时满足单语结构与跨语言对齐。但这违背了嵌入空间的常见实际假设——嵌入空间必须能以某种固定分辨率区分任意两个嵌入点(37)。因此,我们要求多语言空间具有分辨率尺度(或最大余弦相似度 \(\gamma_X < 1\)),使得对于任意不同点 \((c,\ell), (d,m) \in \mathcal{C} \times \mathcal{L}\),  
\[\cos(x_{c,\ell}, x_{d,m}) < \gamma_X\]  

## 4 嵌入空间结构的理论多语言诅咒  
### 4.1 多语言诅咒的定义  
COM 在经验空间中被描述为:在固定模型容量下,随着编码语言数量增加,期望属性(通常为某组语言的外部任务性能)出现退化。对于 COM...

相似文章

语言模型难以实现概念整合

arXiv cs.CL

本文研究了大型语言模型中的 compartmentalization(概念隔离)现象,即模型未能跨同一概念的不同表示共享统计强度,导致样本效率和模型容量降低。作者在多语言和多格式场景中验证了这一现象,并表明合成平行数据无法完全解决此问题。

语言作为设计的潜在空间

Lobsters Hottest

本文探讨了人类语言是一种设计的潜在空间,它将推理约束为模式匹配和符号操作,并论证了LLM无法创造新语言来解决现有语言之外的问题。

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。