语言模型中跨语言泛化的体外研究
摘要
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
arXiv:2605.26683v1 公告类型:新
摘要:自然语料中的跨语言迁移难以研究,因为词汇重叠、形态学、数据不平衡和分词相互纠缠。我们引入了一个体外框架,使用两种程序生成的语言,它们共享相同的本体、类型化语法和组合结构,但在表面实现上不同。这使我们能够独立变化词汇距离、少数语言比例、分词器训练策略和词汇表大小,同时在掩码少数语言条件下评估迁移,该条件的词汇形式在训练过程中从未被观察到。在700次受控运行中,我们发现迁移更多地受分词是否保留可复用的跨语言子结构的影响,而非分词器平衡或原始词汇相似性。较小的词汇表通常通过保持单词可分解为共享片段来改善掩码迁移,而较大的词汇表可能将形式转变为语言特定的原子。我们进一步表明,迁移是一个分阶段的过程:语法和类型级别的能力先于掩码词汇泛化。最后,我们尝试通过分词器桥梁来解释这一机制,并表明桥梁强度与掩码可达性密切相关。
查看缓存全文
缓存时间: 2026/05/27 09:09
# 语言模型中跨语言泛化的体外研究
来源:https://arxiv.org/html/2605.26683
###### 摘要
在自然语料中研究语言模型的跨语言迁移十分困难,因为词汇重叠、词法、数据不平衡和分词等因素相互纠缠。我们引入了一个**体外**框架,其中包含两种程序生成的语言,它们共享相同的本体、类型语法和组合结构,但在表面实现上有所不同。这使我们能够独立地改变词汇距离、少数语言比例、分词器训练策略和词汇量,同时评估在掩码少数语言条件下的迁移效果——该条件的词汇形式在训练过程中从未被观察到。通过700次受控实验,我们发现,迁移受制于分词是否保留了可复用的跨语言子结构,而非分词器平衡或纯粹的词汇相似性。较小的词汇量通常通过将单词分解为共享片段来改善掩码迁移,而较大的词汇量可能将形式变为语言特有的原子。我们进一步表明,迁移是一个分阶段出现的过程:语法和类型层面的能力先于掩码词汇泛化。最后,我们尝试通过**分词器桥梁**来解释这一机制,并展示桥梁强度与掩码可达性之间存在强相关性。
## 1 引言
语言模型(LMs)展现出跨语言迁移能力:用一种语言训练可以在另一种语言上提升表现,即使目标语言没有直接监督(Zhao等人,2024(https://arxiv.org/html/2605.26683#bib.bib56);De Souza等人,2024(https://arxiv.org/html/2605.26683#bib.bib50))。然而,这种迁移背后的机制仍不清楚。在本工作中,我们提出一个问题:**在训练过程中,语义语言能力是如何通过表面形式进行迁移的?** 先前的研究表明,多语言模型会发展出语言特有的和共享的与语言无关的表征(Zhao等人,2024(https://arxiv.org/html/2605.26683#bib.bib56);De Souza等人,2024(https://arxiv.org/html/2605.26683#bib.bib50)),但现有证据对于语言相似性和数据组成的作用仍存在分歧(Malkin等人,2022(https://arxiv.org/html/2605.26683#bib.bib30);Limisiewicz等人,2023b(https://arxiv.org/html/2605.26683#bib.bib43)),而分词器反复被证明是表面形式与意义之间的关键接口(Rust等人,2021(https://arxiv.org/html/2605.26683#bib.bib25);Patil等人,2022(https://arxiv.org/html/2605.26683#bib.bib32);Hämmerle等人,2025(https://arxiv.org/html/2605.26683#bib.bib62))。然而,在自然多语言语料中,词汇重叠、词法、文字、领域、语料库规模和分词方式同时变化,这使得难以确定哪些因素使得一种语言中学到的知识在另一种语言中变得有用(Blevins和Zettlemoyer,2022(https://arxiv.org/html/2605.26683#bib.bib28))。
在本工作中,我们**体外**研究跨语言泛化。我们构建了一个框架,用于程序化生成两种语言,\(\mathbf{A}\)和\(\mathbf{B}\),它们共享相同的底层本体、类型语法和组合结构,但在词汇实现上有所不同。这使得我们可以参数化生成过程,包含三个在自然数据中通常相互混淆的因素:语言之间的词汇距离、每种语言训练数据的相对数量,以及子词分词所带来的粒度。我们还进一步定义了一个掩码少数语言条件\(\mathbf{B}^{\dagger}\),通过在训练中从语言\(\mathbf{B}\)中扣留一部分词汇实现。因此,在\(\mathbf{B}^{\dagger}\)上的成功要求模型跨语言迁移共享的组合结构,而不仅仅是记忆少数语言的表面形式。
我们的设置使得在多语言迁移的受控环境中进行研究成为可能,这涉及更广泛的**学习机制**背景(Michaud等人,2023(https://arxiv.org/html/2605.26683#bib.bib44);Liu等人,2025(https://arxiv.org/html/2605.26683#bib.bib65);Allen-Zhu和Li,2025(https://arxiv.org/html/2605.26683#bib.bib38))。具体而言,我们的设置使我们能够测试文献中的以下假设:
1. **\(\mathcal{H}_1\) 分词器影响**:跨语言迁移更多地取决于分词是否保留了语言间的共享子词桥梁,而非分词器平衡本身(Rust等人,2021(https://arxiv.org/html/2605.26683#bib.bib25);Patil等人,2022(https://arxiv.org/html/2605.26683#bib.bib32);Hämmerle等人,2025(https://arxiv.org/html/2605.26683#bib.bib62))。
2. **\(\mathcal{H}_2\) 词汇相似性**:词汇相似的语言将导致更容易的跨语言迁移(Kunchukuttan等人,2018(https://arxiv.org/html/2605.26683#bib.bib15);Gooskens和Swarte,2017(https://arxiv.org/html/2605.26683#bib.bib13);Hernandez等人,2021(https://arxiv.org/html/2605.26683#bib.bib23))。
3. **\(\mathcal{H}_3\) 语言比例**:增加少数语言的数据量应能改善目标语言能力,尽管有证据表明其收益依赖于条件(Malkin等人,2022(https://arxiv.org/html/2605.26683#bib.bib30);Limisiewicz等人,2023b(https://arxiv.org/html/2605.26683#bib.bib43))。
4. **\(\mathcal{H}_4\) 技能级联**:跨语言迁移之前存在一个技能级联:学习多数语言(语法、类型约束)、学习少数语言(语法、类型约束),然后泛化到未见过的概念(Blevins等人,2022(https://arxiv.org/html/2605.26683#bib.bib27);Lubana等人,2025(https://arxiv.org/html/2605.26683#bib.bib53);Wang等人,2024(https://arxiv.org/html/2605.26683#bib.bib54))。
我们尝试通过**分词器桥梁**来形式化跨语言迁移机制。对于每个被掩码的词汇项,我们测量其分词与在相同分词器下观察到的词汇形式的重叠程度。我们发现这种桥梁强度与掩码可达性相关,表明当未见过的目标语言形式通过共享的子词片段与观察到的形式保持连接时,迁移效果会提升。由此得出的观点是,多语言泛化是分词化拓扑的一个属性,语言通过该拓扑呈现给模型。
我们的贡献如下:
1. 我们引入了一个受控的**体外**框架,用于在独立变化的词汇距离、语言比例、分词器策略和词汇量下研究跨语言迁移。
2. 我们定义了一个掩码少数语言条件,以将跨语言泛化与对观察到的目标语言形式的记忆分离开来。
3. 我们表明,较小的词汇量和可复用的子词结构可以改善掩码迁移,而较大的词汇量可能通过将语言隔离为更多语言特有的单元来抑制迁移。
4. 我们提出**分词器桥梁**作为掩码跨语言迁移的一个潜在解释,并展示桥梁强度可以预测掩码可达性。
## 2 相关工作
先前的研究表明,多语言语言模型会发展出语言特有和语言无关的表征(Zhao等人,2024(https://arxiv.org/html/2605.26683#bib.bib56);De Souza等人,2024(https://arxiv.org/html/2605.26683#bib.bib50))。共享内部结构的证据来自探测研究,这些研究识别出重叠或语言特有的神经元(Wendler等人,2024(https://arxiv.org/html/2605.26683#bib.bib55);Zhao等人,2024(https://arxiv.org/html/2605.26683#bib.bib56)),来自合成预训练实验,显示跨不相关表面形式的迁移(Papadimitriou和Jurafsky,2020(https://arxiv.org/html/2605.26683#bib.bib20)),以及来自多语言预训练混合的研究(De Souza等人,2024(https://arxiv.org/html/2605.26683#bib.bib50))。这些发现表明,语言模型可以抽象出表面实现,并捕获跨语言共享的潜在结构。
与此同时,跨语言迁移受到文本进入模型所经过的分词器接口的强烈影响。与人类不同(人类的相互可理解性由词汇、音系和句法介导;Gooskens和Van Heuven,2021(https://arxiv.org/html/2605.26683#bib.bib22);Escudero和Boersma,2004(https://arxiv.org/html/2605.26683#bib.bib9);Gooskens和Swarte,2017(https://arxiv.org/html/2605.26683#bib.bib13)),语言模型在由数据驱动分词器诱导的子词单元上运行。这可能会在语言间引入系统性的不公平,特别是当分词器训练数据由高资源语言主导时(Limisiewicz等人,2023a(https://arxiv.org/html/2605.26683#bib.bib42);Petrov等人,2023(https://arxiv.org/html/2605.26683#bib.bib47);Arnett等人,2026(https://arxiv.org/html/2605.26683#bib.bib58);Hämmerle等人,2025(https://arxiv.org/html/2605.26683#bib.bib62);Patil等人,2022(https://arxiv.org/html/2605.26683#bib.bib32))。因此,先前的工作既探索了分词器层面的干预(Abagyan等人,2025(https://arxiv.org/html/2605.26683#bib.bib57);Jabbar,2023(https://arxiv.org/html/2605.26683#bib.bib41)),也探索了架构层面的替代方案(Xue等人,2022(https://arxiv.org/html/2605.26683#bib.bib37);Ahia等人,2024(https://arxiv.org/html/2605.26683#bib.bib48);Cosma等人,2025(https://arxiv.org/html/2605.26683#bib.bib61))。然而,语言相似性、数据比例和分词之间的相互作用在自然多语言语料中仍然难以分离。
**本工作。**我们在一个受控的合成环境中研究多语言迁移,该环境隔离了语言相似性、训练比例和分词器参数。我们不依赖于自然语言(其中领域、本体和词汇相似性严重混淆),而是在一个共享语义空间上构建程序化语言(Taguchi和Sproat,2026(https://arxiv.org/html/2605.26683#bib.bib69))。建立在Lubana等人(2025(https://arxiv.org/html/2605.26683#bib.bib53))的基础上,我们在带类型约束的**概率上下文相关语法**之上生成受控的词汇实现。我们的评估测试了对训练中未见过的概念实现在多个抽象层次上的泛化能力:单词有效性、语法正确性、约束满足以及掩码概念的词汇可达性。这使我们能够考察多语言迁移何时在训练中出现,以及语义结构如何跨不同的词汇形式进行迁移。更广泛地说,我们的设置遵循了使用形式语法和合成数据来揭示学习动态的研究路线,这些动态在具有众多混淆因素的天然数据中难以识别(Papadimitriou和Jurafsky,2023(https://arxiv.org/html/2605.26683#bib.bib46);Lubana等人,2025(https://arxiv.org/html/2605.26683#bib.bib53);Allen-Zhu和Li,2025(https://arxiv.org/html/2605.26683#bib.bib38);Hu等人,2025(https://arxiv.org/html/2605.26683#bib.bib63);Blevins和Zettlemoyer,2022(https://arxiv.org/html/2605.26683#bib.bib28))。
图1:体外跨语言设置的概述。两种程序生成的语言 \(\mathbf{A}\) 和 \(\mathbf{B}\) 共享相同的底层语法、类型约束以及概念-属性本体,但它们的词汇实现不同。跨语言难度通过词汇距离 \(d\)、少数语言比例 \(\lambda\)、分词器类型和分词器词汇量进行控制。少数语言词汇形式的一个子集被扣留,以定义掩码条件 \(\mathbf{B}^{\dagger}\),从而评估模型是否迁移共享的组合结构而非记忆表面形式。子词分词介导了两种语言之间的重叠。
## 3 体外跨语言设置
### 3.1 设置形式化
我们的目标是隔离跨语言迁移如何依赖于语言之间的词汇相似性、训练语料中的语言比例以及子词分词粒度。在我们的框架中,我们将语言建模为一个结构化的符号系统,由以下部分指定:(i) 一个抽象符号的词汇表,(ii) 这些符号上的类型签名,(iii) 定义句法上合法句子的语法,以及 (iv) 一个将抽象符号映射到表面特定语言词形的实现函数。我们扩展了Lubana等人(2025(https://arxiv.org/html/2605.26683#bib.bib53))的设置,以考虑在类型语法基础上的多语言实现。关于框架实现的更多细节,读者请参考原始工作。因此,我们并不在完整的社会语言学意义上处理语言(Ballard,1980(https://arxiv.org/html/2605.26683#bib.bib4)),而是将其视为一个有限生成系统,具有共享的抽象层和语言特有的实现。
我们研究跨语言泛化,是在一个受控的多语言预训练环境中进行,其中有两种程序生成的语言,分别记作 \(\mathbf{A}\) 和 \(\mathbf{B}\)。为记号方便,我们用 \(\ell \in \{\mathbf{A}, \mathbf{B}\}\) 来索引它们。我们还定义了一个掩码评估条件,记作 \(\mathbf{B}^{\dagger}\),它是从 \(\mathbf{B}\) 中通过在训练过程中扣留一部分少数语言词汇实现而派生出来的。这三种条件共享相同的底层本体和组合规则,但词汇表面实现不同。我们在图1(https://arxiv.org/html/2605.26683#S2.F1)中展示了设置的示意图。
#### 符号系统与语言实现。
一种语言是一个六元组:\(\ell = (\mathcal{V}, \mathcal{T}, \tau, G, \Gamma, \rho_\ell)\),其中:
- \(\mathcal{V}\) 是抽象词汇符号的有限库存;
- \(\mathcal{T}\) 是类型的有限集合;
- \(\tau : \mathcal{V} \to \mathcal{T}\) 为每个符号分配一个类型;
- \(G\) 是定义在 \(\mathcal{V}\) 上的概率语法,用于生成形式良好的符号序列;
- \(\Gamma \subseteq \mathcal{C} \times \mathcal{P}\) 是语义有效的概念-属性对的本体,其中 \(\mathcal{C}, \mathcal{P} \subseteq \mathcal{V}\)。
- \(\rho_\ell : \mathcal{V} \to \Sigma_\ell^*\),一个实现函数,将抽象符号映射为语言 \(\ell\) 中的表面形式,映射到词汇表 \(\Sigma_\ell\)。
特别地,我们将 \(G\) 定义为一个**概率上下文相关语法**(PCSG)(参见附录A(https://arxiv.org/html/2605.26683#A1))。对于本体,令 \(\mathcal{C} = \{c_1, \dots, c_{N_C}\}\) 和 \(\mathcal{P} = \{p_1, \dots, p_{N_P}\}\) 分别为**概念**和**属性**的有限集合。我们假设一个类型化的关系结构 \(\Gamma \subseteq \mathcal{C} \times \mathcal{P}\),其中 \((c, p) \in \Gamma\) 表示属性 \(p\) 对于概念 \(c\) 在语义上是有效的。这定义了所有语言条件共享的本体。直观上,\(\Gamma\) 指定了哪些属性可以描述哪些实体。例如,这编码了诸如 (hiker, climbs) 是有效的,但 (table, eats) 是无效的关系。这将语法与语义以及词汇实现分离开来:\(G\) 决定哪些符号序列在结构上是形式良好的,而 \(\Gamma\) 约束哪些概念-属性组合在语义上是有效的。
#### 符号句子生成。
一个句子的生成分为三个阶段。首先,一个符号模板 \(z = (v_1, \dots, v_n) \in \mathcal{V}^n\) 按照 \(G\) 采样。相似文章
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
跨语言引导的比喻语言生成
本文探讨了多语言大语言模型中内部表示的跨语言迁移,用于比喻语言生成,表明在一种语言中学习到的激活方向可以有效引导其他语言的生成。
迈向真正多语言ASR:将代码切换ASR泛化到未见过的语言对
本文研究了从有限的已见语言对学到的代码切换ASR能力是否可以通过模型合并和域泛化方法泛化到未见过的语言对,结果发现只有有限的迁移。
语言再生:信息局部性对重建影响的探究
本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。
当英语并非最佳教师:跨语言上下文学习中的源语言效应
本文通过七项任务、六种模型及类型多样的语言,实证研究了上下文学习中的跨语言迁移,表明基于微调的预期并不始终适用,并提出了源语言选择的新启发式方法。