中间语假设:LLMs 通过潜在与任务无关的特征空间进行翻译
摘要
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。
arXiv:2609.00515v1 Announce Type: new
摘要: 大型语言模型 (LLMs) 最近展示了相较于强大监督基线的改进机器翻译性能。这引发了关于LLMs如何执行跨语言机器翻译的底层机制的问题。受最近可解释性研究的启发——即LLMs使用大规模多语言潜在特征表示进行语言建模——我们提出了中间语假设。该假设认为语言模型通过将源句子读入潜在特征空间进行翻译,并从潜在特征空间读取生成目标句子。我们提供了三方面证据来支持这一假设:(1) 不同语言对之间的BLEU方差在很大程度上可以从特定语言能力预测,无需语言对特定的交互项;(2) 许多模型组件在单语任务和翻译任务中都具有因果影响力;并且 (3) 在单语数据上进行微调可以恢复相对于在对齐文档上微调的大部分翻译改进。这些共同为支持中间语假设提供了收敛证据,并提出了理解和改进如何利用LLMs执行翻译任务的新方法。
查看缓存全文
缓存时间: 2026/09/02 05:53
# 大语言模型通过潜在任务无关特征空间进行翻译 来源:https://arxiv.org/html/2609.00515
## 中间语假说:大语言模型通过潜在任务无关特征空间进行翻译
###### 摘要
大型语言模型(LLMs)最近在机器翻译性能上展现出超越强监督基线的能力。这引发了关于LLM进行语言间翻译所依据机制的问题。受近期可解释性研究发现——即LLM使用大规模多语言潜在特征表示进行语言建模——的启发,我们提出了中间语假说。该假说认为语言模型通过将源句子读取到潜在特征空间中进行翻译,并通过从该特征空间读取来生成目标句子。我们展示了三条支持该假说的证据:(1)不同语言对之间的BLEU分值差异在很大程度上可通过各语言的独立能力来预测,无需引入语言对特定的交互项;(2)许多模型组件在单语任务和翻译任务中均具有因果影响力;(3)相较于在对齐文档上微调,在单语数据上微调能恢复大部分翻译性能提升。这些共同构成了支持中间语假说的汇聚性证据,并为理解和改进如何利用LLM执行翻译任务提供了新思路。
## 1引言
机器翻译长期以来是自然语言处理领域中具有影响力的方向。注意力机制最早被提出用于改进机器翻译性能(Bahdanau等人,2015(https://arxiv.org/html/2609.00515#bib.bib1);Luong等人,2015(https://arxiv.org/html/2609.00515#bib.bib2);Vaswani等人,2017(https://arxiv.org/html/2609.00515#bib.bib3));其结果之一是催生了可在大规模语料上高效训练的语言模型(Devlin等人,2019(https://arxiv.org/html/2609.00515#bib.bib23);Radford等人,2018(https://arxiv.org/html/2609.00515#bib.bib24))。近期,大语言模型(LLMs)在许多自然语言处理领域带来了革命性变化,但在机器翻译(MT)领域的应用相对缓慢。LLM在MT中应用缓慢的一个原因是其关注点集中在资源稀缺语言上,在这些语言上LLM面临重大挑战(Hendy等人,2023(https://arxiv.org/html/2609.00515#bib.bib34);Robinson等人,2023(https://arxiv.org/html/2609.00515#bib.bib44))。由于LLM需要大量训练语料,它们在资源稀缺语言上的有效训练非常困难。然而,它们也具有巨大潜力:即使未在特定语言上进行训练,LLM也可以通过提示来翻译从该语言到其他语言或从其他语言到该语言的文本,即使训练数据中该语言出现极少(Cahyawijaya等人,2024(https://arxiv.org/html/2609.00515#bib.bib25))——例如,通过提供语法书进行提示(Tanzer等人,2024(https://arxiv.org/html/2609.00515#bib.bib22))。此外,它们对高资源语言的表示可能实现跨语言迁移(Conneau等人,2020(https://arxiv.org/html/2609.00515#bib.bib26))。LLM能否实现这一潜力,部分取决于其翻译机制。具体而言,LLM是依赖任务和语言无关的机制进行翻译,还是依赖更专业的翻译机制或语言对特定机制?如果是前者,则意味着改进MT性能有明确途径,且可能无需大量平行语料。近期许多工作提供了机制性证据,支持在语言建模场景中存在大规模多语言表示(Wendler等人,2024(https://arxiv.org/html/2609.00515#bib.bib5);Brinkmann等人,2025(https://arxiv.org/html/2609.00515#bib.bib21);Wu等人,2025(https://arxiv.org/html/2609.00515#bib.bib4))。因此我们假设LLM在很大程度上通过重用单语语言建模的计算机制来执行机器翻译。“推理阶段”假说(Lad等人,2024(https://arxiv.org/html/2609.00515#bib.bib45))认为LLM将前半部分层用于读取输入并组合日益抽象的概念表示。然后,模型的后半部分读取这些概念表示,并利用它们根据先验上下文决定应预测哪个词元。如果语言模型以这种方式执行翻译(我们称之为中间语假说),则翻译不一定需要语言对特定机制;相反,它只需要模型能够从源语言读取抽象特征,并基于这些特征为目标语言生成文本。如果该假说成立,则将得出以下预测:(1)给定语言对(S,T),翻译性能应可仅从S和T的单语能力预测,无需跨语言交互项。(2)应存在任务无关的表示,这些表示对于在机器翻译和单语任务场景中预测正确输出均具有因果相关性。最后,(3)为新语言添加翻译能力应主要需要提升该语言的单语能力——即假设模型已能有效处理语言对中的另一种语言,那么在单语语料上微调应能恢复在平行语料上微调所带来的翻译性能提升的大部分。[1] 注意,我们的主张涉及一个完全训练好的LLM用于执行翻译的机制。我们并未对预训练数据中包含什么内容做出主张;平行预训练数据可能是学习多语言表示所必需的。我们研究了这三个推论,均发现了正面证据。虽然没有单个实验能最终确认中间语假说,但每个实验都提供了支持它的不同类型证据。这些发现可能为接触(主要是单语)文档对于生成更有效翻译模型的价值提供初步解释。
## 2相关工作
#### 大规模多语言特征表示。
我们的工作部分受到以下观察的启发:即使在类型学上不同的语言之间,大型语言模型中的语法概念表示也具有高度的多语言性(Brinkmann等人,2025(https://arxiv.org/html/2609.00515#bib.bib21))。在Wendler等人(2024)(https://arxiv.org/html/2609.00515#bib.bib5);Dumas等人(2025)(https://arxiv.org/html/2609.00515#bib.bib35)中也观察到类似证据。值得注意的是,对语法概念表示进行干预对单语和机器翻译场景中的模型行为均有可预测的影响(Brinkmann等人,2025(https://arxiv.org/html/2609.00515#bib.bib21))。这些发现本身并不确认中间语假说,但确实表明存在与特定任务或语言无关的抽象特征表示。
#### 多语言神经机器翻译中的中间语。
神经机器翻译(NMT)中的一条研究路线旨在通过架构和训练改进来设计中间语以改进跨语言迁移,主要针对编码器-解码器架构(例如XLM-R,Conneau等人,2020(https://arxiv.org/html/2609.00515#bib.bib26);M2M,Fan等人,2020(https://arxiv.org/html/2609.00515#bib.bib48))。先前的方法通过中间语层或网络(Lu等人,2018(https://arxiv.org/html/2609.00515#bib.bib49);Zhu等人,2020(https://arxiv.org/html/2609.00515#bib.bib13)),或天然鼓励语言无关表示的瓶颈层(Vázquez等人,2019(https://arxiv.org/html/2609.00515#bib.bib20);Mao等人,2023(https://arxiv.org/html/2609.00515#bib.bib19))引入显式共享表示。这些研究设定或设计了中间语并通过行为验证,而我们的研究则询问在仅解码器语言模型中,当中间语在自然训练且未设置此类直接激励的情况下涌现时,它是否对MT性能具有因果相关性。我们机制性研究的先驱包括Vázquez等人(2020)(https://arxiv.org/html/2609.00515#bib.bib14),他们研究了具有注意力瓶颈的NMT模型中的句子表示是否是语言无关的。其他人研究了共享或特定语言组件是否根本必需(Escolano等人,2021(https://arxiv.org/html/2609.00515#bib.bib50);Purason和Tättar,2022(https://arxiv.org/html/2609.00515#bib.bib51));这些研究通过控制语言间参数共享程度进行研究,发现完全共享的表示性能不如至少具有一些特定语言组件的表示。因此,在主要使用平行数据的小规模场景中,中间语通常需要通过训练目标来强加,这会损失一些性能。我们研究在当代仅解码器模型(在更大数量的任务和领域通用语言数据上训练)中,这种情况是否仍然成立。
#### 用于机器翻译的大语言模型。
当平行数据有限时,机器翻译很困难(Koehn和Knowles,2017(https://arxiv.org/html/2609.00515#bib.bib36)),而大语言模型并未解决这个问题(Court和Elsner,2024(https://arxiv.org/html/2609.00515#bib.bib37))。一些人希望LLM能够实现跨语言迁移。例如,Tanzer等人(2024)(https://arxiv.org/html/2609.00515#bib.bib22)表明,长上下文LLM在用包含语言描述和翻译示例的语法书提示时,可以翻译以前未见过的低资源语言。然而,Aycock等人(2025)(https://arxiv.org/html/2609.00515#bib.bib18)随后发现,该场景中的大部分改进来自书中的平行示例而非语法解释,这突出了平行数据对翻译的重要性。我们的一个实验提出互补性问题:一旦LLM在预训练期间已经获得了多语言表示,在不添加额外平行数据的情况下,提升其在低资源语言上的单语能力能在多大程度上改善翻译?我们在第5节(https://arxiv.org/html/2609.00515#S5)提供了跨语言迁移的初步证据。
#### 因果中介分析。
我们的一些证据依赖于对特定模型组件因果影响力(Lewis,1973(https://arxiv.org/html/2609.00515#bib.bib41))的估计。这依赖于因果中介分析(Pearl,2001(https://arxiv.org/html/2609.00515#bib.bib40);Vig等人,2020(https://arxiv.org/html/2609.00515#bib.bib42)),这是机制可解释性文献中的常用技术(Finlayson等人,2021(https://arxiv.org/html/2609.00515#bib.bib7);Geiger等人,2021(https://arxiv.org/html/2609.00515#bib.bib8);Heimersheim和Nanda,2024(https://arxiv.org/html/2609.00515#bib.bib12);Marks等人,2025(https://arxiv.org/html/2609.00515#bib.bib39);Mueller等人,2026(https://arxiv.org/html/2609.00515#bib.bib6),等)。虽然本研究的目的不是理解特定模型组件的确切功能作用,但我们希望描述相同的表示是否在多个任务场景和语言对中影响模型的行为。
## 3将翻译性能建模为单语能力的函数
模型翻译能力中有多少可以由其单语语言建模能力解释?如果模型使用中间语进行翻译,那么其翻译能力的大部分应可解释为从输入解析潜在特征并在该语言中生成连贯文本的能力。换句话说,除非模型部署了不涉及通过中间语的独立翻译机制,否则无需语言对特定项来解释翻译性能。为进行研究,我们定义了一个线性模型,用于从单语能力预测翻译性能。我们使用几种单语能力衡量标准。首先,为衡量模型区分语法正确和语法错误句子的能力,我们使用MultiBLiMP(Jumelet等人,2026(https://arxiv.org/html/2609.00515#bib.bib11)),这是BLiMP(Warstadt等人,2020(https://arxiv.org/html/2609.00515#bib.bib9))基准测试的多语言版本。对于给定语言,MultiBLiMP准确率是模型为语法正确的完成形式分配比其非语法正确对应形式更高的完整句子对数概率的最小对比例。我们在每种语言随机选择的200个样本上取平均。由于Llama和Aya在我们分析的许多语言上在该基准测试上达到饱和,我们还计算对数概率差值,即每个最小对的平均log p(语法正确) - log p(非语法正确)。为克服基准测试饱和问题,我们还包括GlobalMMLU(Singh等人,2025(https://arxiv.org/html/2609.00515#bib.bib10))的准确率,这是一个基于MMLU(Hendrycks等人,2021(https://arxiv.org/html/2609.00515#bib.bib33))的多语言多选问答数据集。对于每项任务,我们筛选出在单语数据集和FLORES之间共有的语言(表1(https://arxiv.org/html/2609.00515#S3.T1))[2]。对于翻译,我们有语言对(S,T),其中S是源语言,T是目标语言。翻译能力t_{ST}量化为(S,T)的BLEU分数。为执行翻译,我们使用包含两个来自FLORES随机采样句子的2-shot提示[3]。我们使用sacrebleu(Post,2018(https://arxiv.org/html/2609.00515#bib.bib27))计算BLEU分数。设l是使用MultiBLiMP或GlobalMMLU估计的单语能力。对于每个语言对,我们有l_{S}和l_{T}。然后我们学习系数β_{S}和β_{T}以及偏置项β_{0},以最大化以下函数中BLEU分数t_{ST}的预测准确性:
β_{S}l_{S} + β_{T}l_{T} + β_{0} = t_{ST} (1)
我们还训练了一个几乎相同的双线性模型,但包含一个乘法交互项:
β_{S}l_{S} + β_{T}l_{T} + β_{ST}(l_{S}·l_{T}) + β_{0} = t_{ST} (2)
如果中间语假说成立,那么双线性模型的预测能力不应显著强于线性模型。这将意味着机器翻译性能更适合用单语项解释,而非存在翻译机制(这应该使用特定语言对项)。
表1:单语能力代理指标。N是24种FLORES语言中定义该代理指标的语言数量;↑/↓表示更高单语能力的方向。
#### 单语任务性能预测翻译能力。
在共同的18语言子集上拟合线性模型,单语行为能力代理指标通常是翻译性能的强预测指标。MultiBLiMP相似文章
通用语还是探测器产物?重新思考多语言大语言模型中的潜在语言
本研究比较了用于识别多语言大语言模型中潜在语言的探测技术,发现不同方法产生不一致的结果,表明它们揭示了多语言处理的不同方面,而非单一的内部通用语。
跨语言事实一致性的潜在空间干预:一致性提升而无精度下降
本文提出了一种潜在空间干预方法,用于改善大型语言模型中的跨语言事实一致性,在不损失事实精度的情况下实现更好的对齐。
技能差异:LLM中的技能是否具有语言不变性?
本文通过基于文本游戏的多语言自我对弈,量化了大语言模型在跨语言技能上的不一致性,揭示了不同语言间显著的性能差异,且这种差异可通过改变中间推理语言得到部分缓解。
使用跨语言对齐预测LLMs的多语言分类和翻译性能——英语足够吗?
论文比较了27种跨语言对齐(CLA)分数变体,用于预测LLM在多语言分类和翻译任务上的性能,并提出了一种基于PMI的翻译指标。研究发现,与英语的CLA对翻译质量的预测能力与源语言-目标语言CLA相当或更好,支持了LLMs使用英语作为内部枢轴语言的观点。
推理大语言模型中的隐藏语言一致性现象
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。