为何预训练无法共享跨语言知识
摘要
这篇研究论文探讨了为什么大型语言模型中的预训练无法跨语言转移知识,指出不相交的词元空间是根本障碍,并提出将语言映射到共享词元空间以改善跨语言泛化能力。
arXiv:2609.19291v1 Announce Type: new
Abstract: 大型语言模型(LLMs)在处理和建模多种语言方面取得了显著进展。然而,与人类多语言者不同,它们表现出令人惊讶的有限跨语言知识转移。虽然这一限制已被充分记录,但其在多语言训练期间的起源仍不清楚。我们预训练了360M和7B参数的LLMs,表明较差的跨语言知识泛化在预训练期间出现,并在标准干预下持续存在。为了隔离其原因,我们采用了一种受控的双语预训练设置,使用同一语言的两个副本,共享相同的文本和词元分割,但映射到不相交的词元空间。我们发现,仅不相交的词元就足以诱导知识分区化,即使在同一语言的相同副本之间,从而确立了不相交的词元空间作为跨语言知识泛化的基本障碍。基于这一理解,我们建议通过简单的逐词翻译将语言映射到共享词元空间,并发现这显著改善了跨语言知识泛化,恢复了高达12.6\%的母语学习效率——14$\times$基线。
查看缓存全文
缓存时间: 2026/09/18 08:53
# 为何预训练未能共享跨语言知识 来源:https://arxiv.org/html/2609.19291 CoLab实验室 2026-09-16 # 为何预训练未能共享跨语言知识 Adam Gaber¹†, Uriel Dolev², Elisabeth Fittschen³, Bobby Cheng⁴, Yuval Marton⁵, Leshem Choshen¹·⁶·⁷* ¹魏茨曼科学研究所,²巴伊兰大学,³约翰霍普金斯大学,⁴A*STAR,⁵华盛顿大学,⁶麻省理工学院,⁷MIT-IBM沃森人工智能实验室 大型语言模型(LLMs)在处理和建模多种语言方面取得了显著进展。然而,与人类多语言者不同,它们表现出令人惊讶的有限跨语言知识迁移能力。虽然这种局限性已有充分记录,但其在多语言训练过程中的根源尚不清楚。我们预训练了3.6亿和70亿参数的大型语言模型,并证明了不良的跨语言知识泛化能力在预训练期间就已出现,并在标准干预措施下持续存在。为了隔离其原因,我们采用了一种受控的双语预训练设置:使用同一语言的两个副本,共享相同的文本和分词单元划分,但映射到不相交的标记空间。我们发现,仅不相交的标记就足以诱导知识的区隔化,即使在相同语言的副本之间也是如此,这确立了不相交的标记空间是跨语言知识泛化的根本障碍。基于这一理解,我们建议通过简单的逐词翻译将语言映射到共享标记空间,并发现这显著提升了跨语言知识泛化能力,恢复了高达12.6%的母语学习效率——是基线水平的14倍。 ¹†通讯作者:[[email protected]](mailto:[email protected]) ²通讯作者:[[email protected]](mailto:[email protected]) ³代码已公开:https://github.com/AdamJaber03/torchtitan-mulitlingual 图1:通过逐词翻译(WWT)合并标记空间在跨语言知识泛化方面取得了显著提升。 左图:在3.6亿规模下,不同方法(颜色)用于英语-阿拉伯语预训练的跨语言等价(CLeq)得分,衡量跨语言知识学习效率。 右图:左侧面板显示了3.6亿规模下的英语困惑度;上界是在仅英语一半数据上训练的模型,下界是在两倍英语数据上训练的模型。右侧面板显示70亿规模下的困惑度,界限与3.6亿规模成比例。 ## 1 引言 现代大型语言模型展现出令人印象深刻的多语言能力,然而与人类不同,它们跨语言迁移的知识少得惊人。理解这种局限对于构建真正的多语言模型至关重要。先前的研究记录了较差的跨语言泛化,通过模型容量和样本效率进行表征,并探讨了分词、语言不平衡和激活对齐等因素(Chang et al., 2024b; Schäfer et al., 2024; Howe and Wingate, 2026; Wu and Dredze, 2020; Li et al., 2024b)。近期的研究将这种泛化失败扩展到知识领域(Qi et al., 2023; Ifergan et al., 2025; Goldman et al., 2025),并尝试减轻它(Huang et al., 2023; Diskind et al., 2026; Bandarkar et al., 2026; von Rad et al., 2026a)。然而,这些观察和修复措施都是在完全训练好的模型上进行的,这些模型经历了包括预训练、指令调优和偏好优化在内的一系列训练阶段,因此这种知识泛化失败(我们称之为区隔化)起源于何处仍然是个开放问题。 我们直接在预训练阶段调查区隔化。然而,在此设置下的因果分析因两个因素而复杂化:首先,预训练语料库规模庞大,追踪跨语言的知识暴露情况在计算上难以处理;其次,自然语言在词汇、文字系统、句法、频率分布和语义上同时存在差异,阻碍了受控实验。我们通过两部分方法论来应对这些挑战。首先,为了可靠地追踪知识暴露,我们引入了一个受控的预训练环境,利用虚构知识的注入(§2)。其次,为了剥离语言混淆因素,我们不仅评估自然双语对上的泛化能力,还评估了结构相同、克隆的语言副本上的泛化能力,这些副本除了标记空间外没有任何区别(§5.1)。 利用这个组合框架,我们预训练了3.6亿和70亿参数的模型,以测量和隔离跨语言知识泛化的机制。我们的受控测量揭示,知识区隔化在预训练期间就已出现(§4)。我们进一步发现不相交的标记空间是阻碍跨语言知识泛化机制的根本性障碍,这一现象跨越模型规模而持续存在。无论分词方式如何,表示在模型词汇表不相交区域的两种语言都会阻碍共享(§5)。 基于我们对这一机制的新理解,我们建议采用逐词翻译(WWT)干预措施,以有效地统一词汇不相交语言的标记空间(§6.1)。这一干预措施被证明是有益的,显著提升了跨语言知识泛化能力,同时在通用语言建模困惑度方面也带来了增益(图1)。这一实际成功从机制上验证了我们关于分词在知识泛化中作用的发现(§6.2)。 ## 2 方法:测量知识泛化 ### 2.1 控制知识暴露 - 注入虚构事实 为了测量在一种语言中训练期间接触某个事实是否以及在多大程度上能产生另一种语言中该事实的知识,我们必须知道该事实在每种语言中被观察到的次数。追踪庞大预训练语料库中的事实暴露通常难以处理(Kandpal et al., 2023; Elazar et al., 2024)。我们通过注入基础预训练数据中不存在的新型虚构知识来绕过这个问题,可以精确控制每个事实的接触次数和语言。我们的虚构知识数据集(FKD)包含2048个关于合成实体及相关属性的事实(例如,“Cultramive是一家销售镀银自行车的公司”)。每个事实都扩展为一组每种语言的多样化自然文档,这些文档转述相同的基础知识——用于预训练期间的注入——以及用于评估的保留多项选择题(MCQs)。我们提供了关于FKD的完整细节,包括生成流程和示例,见附录B。 由于先前的工作表明跨语言泛化机制对高频和低频标记的行为可能不同(Schäfer et al., 2024; Feng et al., 2025),我们在一个围绕高频人名构建的虚构人物数据集上复制了我们的主要实验(附录C)。我们通过在单语模型上以不同速率注入实体事实来验证FKD(附录B.5)。在0注入率下,多项选择题的准确率接近随机;在预训练中注入事实转述后,准确率以对数方式增加,在所有语言中达到显著水平;FKD是可学习且可控的。 ### 2.2 评估跨语言知识泛化 – CLeq得分 虽然虚构知识允许我们控制它如何在语言间引入,但我们仍然缺少一个直接的衡量标准,来量化给定的双语模型在语言A和B之间泛化事实知识的能力。为此,我们引入了跨语言等价(CLeq)得分。CLeq B→A 衡量在语言B中接触某个事实对于在语言A中回忆该事实的价值,相对于在语言A本身接触该事实的价值。得分100%表示在语言B中接触与在语言A中接触同样有效,对应于完美的跨语言等价性。得分0%则相反,表示在语言B中接触对在语言A中回忆没有任何益处,对应于两种语言之间完全的知识区隔化。当报告针对在语言A和B上训练的给定双语模型的单一得分时,我们使用双向平均值:CLeq = ½ (CLeq A→B + CLeq B→A)。 关键的是,我们的CLeq定义将跨语言增益相对于母语增益进行了归一化。这使得我们的指标对可能由规模、训练方法或数据质量引起的基准模型能力(原始准确率)差异保持不变;一个能更好学习所有事实的模型会同时提高外语和母语接触的价值,从而保持其比率不变。这将目标语言能力的提升与迁移能力的提升分离开来,而以绝对准确率报告的指标会将两者混为一谈。 #### 估计CLeq得分 控制FKD的暴露允许直接估计模型的CLeq得分。对于FKD中的一个虚构事实f,令N_A(f)和N_B(f)分别表示在预训练期间语言A和B中接触该事实的次数,并令acc_A(f)表示训练后模型在语言A的评估问题上的准确率。我们在所有事实上拟合线性回归(OLS):acc_A(f) = α + β_A N_A(f) + β_B N_B(f) + ε。β_A捕获每次母语接触获得的准确率,β_B捕获每次跨语言接触获得的准确率,得分源自它们的比率:CLeq B→A = 100 × (β_B / β_A)。 这个估计有两个特点值得注意。首先,OLS回归提供了暴露与准确率之间关系的线性近似(§2.1);我们尝试了替代的曲线感知估计器,并发现简单的线性形式更具信息性。其次,采样和评估噪声有时可能将估计值略微拉低至零以下。负值应被解读为显著或绝对的区隔化,而非负迁移。附录D详细讨论了这些主题,并报告了显著性测量,确认我们的主要比较在统计上是稳健的。 ## 3 实验设置 我们的实验遵循一个共同的模板。我们从头预训练双语模型,以不同的跨语言速率注入FKD虚构事实,并根据它们的习得情况估计CLeq得分。我们改变双语设置的孤立方面(架构、分词和干预措施),并比较所得的分数,以推理跨语言知识泛化能力。每个呈现的CLeq结果都需要一个对应其独特条件的完整模型预训练运行。 ### 3.1 模型和数据 我们评估两个规模:一个遵循SmolLM2架构的3.6亿参数模型(Allal et al., 2025),以及一个基于Llama-3(Grattafiori et al., 2024)的70亿参数适配版本。两者都使用词汇量为65,536个标记的BPE分词器。我们在每种语言的7M文档的50/50划分上为每种语言对训练一个分词器,并在匹配的运行中共享它。因此,我们比较困惑度的模型在相同的分词划分下读取文本。模型使用TorchTitan(Liang et al., 2025)训练至接近Chinchilla最优标记预算(Hoffmann et al., 2022)。架构、超参数、调度和硬件的详细信息见附录A。 我们使用FineWeb-edu进行英语预训练(Penedo et al., 2024),使用FineWeb-edu-ar进行阿拉伯语预训练(Alrashed et al., 2024,FineWeb-edu的机器翻译),以及使用FineWeb2-HQ进行俄语预训练(Messmer et al., 2025,原生网络文本而非翻译)。我们的双语实验在两种语言之间平均分配标记预算。由于英语和阿拉伯语语料库是彼此的翻译,我们强制执行严格的文档不重叠划分,以确保模型不会在语言间看到平行文档。 ### 3.2 评估 为了计算CLeq指标,我们将FKD分成16组,每组128个虚构实体事实。16组中的每一组都以统一的N_A和N_B注入其所有虚构事实,这些值选自[0, 20, 100, 1000]与其自身的交叉乘积。这个范围被选择为在事实学习曲线的关键范围内更密集(附录B.5)。事实转述文档以匹配目标接触次数N_A和N_B的每种语言概率随机注入预训练(附录A.5)。我们使用lm-eval-harness(Gao et al., 2024)评估协议以及附带的FKD每语言评估多项选择题(与注入文档分开生成,训练中从未出现)来量化模型在不同语言上的事实习得:acc_A和acc_B。具体来说,我们使用lm-eval-harness中的acc-norm评分来校正选项长度可能存在的差异。 有了这些值,我们根据等式1在所有事实上拟合回归,并将CLeq作为β_A和β_B的比率(§2.2)。我们在附录D中报告了代表性运行的拟合系数。 ## 4 知识区隔化起源于预训练 ### 4.1 区隔化在标准双语预训练中出现 运用上述工具,我们表明当前的预训练实践强烈地将知识区隔化。我们预训练了一个3.6亿参数的英语-阿拉伯语大型语言模型,以受控的跨语言速率注入虚构事实(§2.1)。在获得训练好的双语模型后,我们测量虚构事实的回忆率,并推导出外语接触对知识的相对价值——即CLeq得分(§2.2)。 预训练的英语-阿拉伯语模型显示出极小的知识泛化,CLeq得分为0.9%(图1)。
相似文章
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
LLM预预训练的不稳定性:并非总是有帮助——一项跨多语言的研究
本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。
预训练并行化与失败训练运行笔记(12分钟阅读)
一篇技术深度文章,探讨大型语言模型中预训练运行失败的常见原因,包括专家路由中的因果破坏问题和数值精度错误,并附有Llama 4、Gemini 2 Pro和GPT-4的示例。
从机制上理解大语言模型微调中记忆知识无法泛化的原因
本文形式化了大语言模型微调中的“知道-使用鸿沟”,即模型记忆事实但无法泛化。引入了自修补干预方法,并确定知识回路错位为根本原因,通过简单启发式方法恢复了58-75%的泛化失败。