当英语并非最佳教师:跨语言上下文学习中的源语言效应
摘要
本文通过七项任务、六种模型及类型多样的语言,实证研究了上下文学习中的跨语言迁移,表明基于微调的预期并不始终适用,并提出了源语言选择的新启发式方法。
arXiv:2606.18033v1 公告类型:新
摘要:在多语言自然语言处理中,跨语言迁移在监督微调背景下已被广泛探索,其中数据可用性和语言相似性等因素在很大程度上决定了迁移质量。随着领域向少样本上下文学习(ICL)转变,通常认为来自微调的见解会原封不动地延续。然而,这一假设尚未经过严格评估,因此如何为跨语言ICL选择源语言的问题仍然悬而未决。我们进行了一项广泛的跨语言ICL迁移实证研究,涵盖七项任务、六种模型和一组类型多样的语言。我们进一步分析了语言混淆——这是跨语言ICL中生成任务的一个关键障碍。我们的结果表明,基于微调的传统预期在ICL机制中并不始终适用,并指出了有效选择源语言的替代启发式方法。
查看缓存全文
缓存时间: 2026/06/17 05:42
# 当英语并非最佳导师:跨语言上下文学习中的源语言效应 来源:https://arxiv.org/html/2606.18033 Fred Philippy¹, Siwen Guo², Jacques Klein¹, Tegawendé F. Bissyandé¹ ¹卢森堡大学 SnT,卢森堡 ²卢森堡科学技术学院,卢森堡 通信作者:[email protected] (https://arxiv.org/html/2606.18033v1/mailto:[email protected]) ###### 摘要 多语言 NLP 中的跨语言迁移已在监督微调场景中得到广泛探索,其中数据可用性和语言相似性等因素在很大程度上决定了迁移质量。随着领域转向少样本上下文学习(ICL),人们通常认为微调中的见解可以直接沿用。然而,这一假设尚未经过严格评估,导致如何为跨语言 ICL 选择源语言的问题悬而未决。我们开展了一项广泛的实证研究,涵盖七个任务、六个模型以及一个类型学多样化的语言集合,深入分析了跨语言 ICL 中的迁移表现。我们还进一步分析了语言混淆问题,这是生成式任务中跨语言 ICL 的一个关键障碍。结果表明,传统微调基础上的预期在 ICL 场景下并不一致适用,并指出了有效选择源语言的替代启发式方法。 当英语并非最佳导师:跨语言上下文学习中的源语言效应 Fred Philippy¹, Siwen Guo², Jacques Klein¹, Tegawendé F. Bissyandé¹ ¹卢森堡大学 SnT,卢森堡 ²卢森堡科学技术学院,卢森堡 通信作者:[email protected] (https://arxiv.org/html/2606.18033v1/mailto:[email protected]) ## 1 引言 大型语言模型(LLM)在各类 NLP 任务上取得了显著性能提升,但其能力在世界各语言之间仍分布不均。核心原因是训练数据可用性的严重不平衡:英语等高资源语言主导了预训练语料库,而许多其他语言则严重缺乏表示。因此,近期针对多语言 LLM 的研究主要聚焦于跨语言迁移,即利用高资源语言的知识来提升低资源语言的性能。以往研究(通常采用监督微调设置)表明,跨语言迁移远非一致:语言相似性、词汇重叠和文字系统等因素显著影响着知识从源语言迁移到目标语言的效果(Pires 等,2019 (https://arxiv.org/html/2606.18033#bib.bib19);Ke 等,2020 (https://arxiv.org/html/2606.18033#bib.bib17);Muller 等,2021 (https://arxiv.org/html/2606.18033#bib.bib16);Philippy 等,2023 (https://arxiv.org/html/2606.18033#bib.bib18))。然而,这些发现主要反映了任务特定微调的时代,即模型在源语言的标注数据上显式训练,然后在不同的目标语言上进行评估。随着大规模指令微调 LLM 的崛起,领域正日益转向完全不需要参数更新的上下文学习方法(Brown 等,2020 (https://arxiv.org/html/2606.18033#bib.bib23))。ICL 与传统微调不同,它允许模型仅通过推理时提供的示例和指令来执行任务。LLM 不再是依靠参数修改,而是根据提示本身,从自然语言演示、任务描述或其他结构化线索中“在上下文中”学习。这一范式在各类任务中表现出惊人的有效性,并且近期研究表明它也能支持跨语言迁移:模型可以使用一种语言的演示来执行另一种语言的任务(Winata 等,2022 (https://arxiv.org/html/2606.18033#bib.bib5);Tu 等,2025 (https://arxiv.org/html/2606.18033#bib.bib7))。然而,与微调设置不同,目前仍不清楚对于给定的目标语言,哪种源语言对 ICL 最有效,以及已知影响微调迁移的因素(例如语言相似性)是否同样适用于这一新范式。在本研究中,我们探讨源语言与目标语言的关系如何塑造 ICL 中的跨语言迁移。通过系统考察类型学、文字系统、基于嵌入的对齐以及资源可用性等因素,我们旨在为如何有效选择用于 ICL 的源语言(尤其是在处理低资源目标语言时)提供更清晰的指导。我们的分析揭示了从微调继承而来的假设在 ICL 中并不总是成立。与基于微调的跨语言迁移中的既定发现相反,我们观察到在仅约 24% 的情况下,目标语言本身是其最有效的源语言;而英语尽管在预训练语料库中占比巨大,却在约 16% 的实验中成为最差的源语言。此外,我们证明语言相似性——被广泛认为是监督微调中跨语言迁移的最强预测因子——在跨语言 ICL 中作用远没有那么大。在针对语言混淆(一种已知会阻碍生成式任务跨语言迁移的现象)的额外实验中,我们同样发现 ICL 期间源语言与目标语言之间存在显著差异。总而言之,我们的发现不仅要求重新思考跨语言 ICL,还指出了一个有希望的方向:LLM 中支持最薄弱的语言,特别是低资源的非拉丁文字语言,实际上可能充当其他语言可以受益的出乎意料的强源语言。 表 1:本研究包含的多语言数据集。这里,n 表示每种语言的测试样本数,|L| 表示每个数据集的完整语言覆盖数,|L*| 表示我们用作源语言和目标语言的子集语言。 ## 2 相关工作 先前研究表明,演示语言的选择和配置对跨语言 ICL 性能有显著影响。早期研究发现跨语言提示通常优于单语言基线,尽管语言邻近性并非总是可靠的预测因素(Winata 等,2022 (https://arxiv.org/html/2606.18033#bib.bib5))。近期工作探索了多样的提示结构,包括混合语言演示(Kim 等,2024 (https://arxiv.org/html/2606.18033#bib.bib3))以及向英语进行语码转换的过渡(Yoo 等,2025 (https://arxiv.org/html/2606.18033#bib.bib1)),这些方法可以在低资源场景下提升推理能力。相反,Tu 等人(2025 (https://arxiv.org/html/2606.18033#bib.bib7))发现仅使用目标语言或单一高资源源语言往往优于混合提示,暗示演示语言内部的一致性可能是有益的。对演示选择的研究进一步凸显了检索质量的重要性。尽管基于对齐的方法(Tanwar 等,2023 (https://arxiv.org/html/2606.18033#bib.bib4))和多语言检索器(Lin 等,2025 (https://arxiv.org/html/2606.18033#bib.bib2))改善了结果,但这些研究通常将源语言限制为英语,或者没有系统性地进行选择(Cahyawijaya 等,2024 (https://arxiv.org/html/2606.18033#bib.bib8))。最后,虽然语言相似性已被提议作为选择预测因子(Kaneko 等,2025 (https://arxiv.org/html/2606.18033#bib.bib20)),但其在当代仅解码器 LLM 中的有效性仍然是一个未解决的问题。 ## 3 方法论 ### 3.1 任务 为了评估跨语言 ICL,我们使用了七个多语言基准测试(表 1 (https://arxiv.org/html/2606.18033#S1.T1))。与以往侧重于英语或仅目标语言演示样本的研究不同,我们评估了所有源-目标语言组合。为了管理评估次数二次方增长,我们选择了 18 种类型学多样化的语言,以最大化基准测试的重叠。我们还进一步将每个基准测试限制为 1,000 个测试实例(如果更小则使用全部)。由于所有基准测试都是完全并行的,使用对齐的测试样本和上下文示例可以确保跨语言对的内容一致性,并将跨语言迁移动态与内容相关的混淆因素隔离开。 ### 3.2 模型 我们使用六个 LLM 进行实验,侧重于相对较小的模型(4B 参数或更少),以保持计算上的可管理性。为了评估模型随机性的鲁棒性,我们使用两个不同的随机种子重复了三个最小模型的所有实验,从而得到不同的演示示例集。然后我们计算两次运行时语言对间性能分数的相关性。所有任务和模型的所有相关性均 ≥0.9,表明高度稳定。基于这一结果,我们对两个较大的模型进行了单次运行,而不影响我们发现的可靠性。具体来说,我们使用了 Llama 3.2 (1B & 3B)、Gemma 3 (1B & 4B)(Team 等,2025 (https://arxiv.org/html/2606.18033#bib.bib22))、Qwen3 (1.7B)(Yang 等,2025 (https://arxiv.org/html/2606.18033#bib.bib21))以及 Phi-4-Mini(Microsoft 等,2025 (https://arxiv.org/html/2606.18033#bib.bib32))。根据 Zhang 等人(2024 (https://arxiv.org/html/2606.18033#bib.bib6))的研究,他们报告在多语言场景中添加超过 2-4 个演示仅能带来微不足道的额外增益,因此我们在所有实验中采用 4-shot 配置¹¹实验使用的提示详见附录 A (https://arxiv.org/html/2606.18033#A1)。 ## 4 结果 图 2 (https://arxiv.org/html/2606.18033#S4.F2) 展示了所有评估语言对的平均迁移性能,显示了在七个任务和六个模型上计算的平均 z 分数²²z 分数是针对每个模型-任务组合分别计算后再取平均。从这些结果中,我们发现了不同的高层次观察: - • 跨目标语言的持久性能差距。正如预期,英语以较大优势领先,其次是西班牙语、意大利语、印度尼西亚语和德语等高资源语言,而斯瓦希里语、泰卢固语和孟加拉语等较低资源语言显示出显著较低的分值。 - • 目标语言并不总是其自身的最佳源语言,这与常见假设相反。事实上,在所有实验中,目标语言仅在约 24% 的情况下是最佳源语言。参考标题 (a) 跨模型。参考标题 (b) 跨任务。 图 1:迁移模式的相关矩阵。皮尔逊相关是在所有语言对的迁移分数上计算的。 - • 模型显示出高度稳定的迁移模式。相似性在模型家族内部以及较大模型之间最强(图 1(a) (https://arxiv.org/html/2606.18033#S4.F1.sf1))。 - • 任务级的迁移相似性处于中等至高水平。具有相关推理或语言结构的任务表现出更一致的迁移模式(图 1(b) (https://arxiv.org/html/2606.18033#S4.F1.sf2))。 更深层次的统计分析(第 4.1 节 (https://arxiv.org/html/2606.18033#S4.SS1)-第 4.4 节 (https://arxiv.org/html/2606.18033#S4.SS4))揭示了几个关键发现: 1. 1. 强目标语言往往是弱源语言(第 4.1 节 (https://arxiv.org/html/2606.18033#S4.SS1))。英语、西班牙语、德语和意大利语作为目标语言表现良好,但却是最弱的源语言之一,而泰语、泰卢固语和孟加拉语则呈现相反的模式。 2. 2. 源语言与目标语言之间的语言相似性并不能预测迁移有效性(第 4.2 节 (https://arxiv.org/html/2606.18033#S4.SS2))。与先前关于基于微调迁移的研究不同,我们在 ICL 设置中没有观察到这种关系。 3. 3. 模型内部的跨语言对齐是迁移成功更强的指示因子(第 4.3 节 (https://arxiv.org/html/2606.18033#S4.SS3))。这种对齐解释的性能方差远多于表面语言属性。 4. 4. 低资源、非拉丁文字的语言是最有效的源语言,而高资源拉丁文字的语言则是最无效的(第 4.4 节 (https://arxiv.org/html/2606.18033#S4.SS4))。虽然文字和资源水平各自具有独立效应,但它们的交互作用放大了这一模式。 参考标题 图 2:跨语言迁移矩阵,显示模型性能在语言对上的平均 z 分数。行代表源语言,列代表目标语言。分数按任务和模型进行归一化。 ### 4.1 提供能力与接收能力之间的相关性 受 Malkin 等人(2022 (https://arxiv.org/html/2606.18033#bib.bib25))和 Dymkiewicz 等人(2025 (https://arxiv.org/html/2606.18033#bib.bib24))方法的启发,我们分析了各语言的提供者与接收者关系。为了计算这些分数,我们遵循 Malkin 等人(2022 (https://arxiv.org/html/2606.18033#bib.bib25))引入的方法:对于每种语言 L,我们将其提供者分数 D(L) 定义为它提供给所有其他目标语言的平均性能(排除 L 是目标的情况)。相反,接收者分数 R(L) 定义为 L 从所有其他源语言接收的平均性能(排除 L 是源的情况)。图 3 (https://arxiv.org/html/2606.18033#S4.F3) 显示提供能力与接收能力呈强烈负相关,我们观察到在所有模型和任务上,源到目标与目标到源迁移之间的皮尔逊相关系数为 -0.932。 参考标题 图 3:提供能力与接收能力的散点图;红线表示拟合它们倒数关系的最佳回归线。 ### 4.2 与语言相似性的相关性 我们考察了微调场景中语言相似性与迁移性能之间已被确认的关系是否也适用于基于提示的方法。使用 URIEL 和 lang2vec 表示(Littell 等,2017 (https://arxiv.org/html/2606.18033#bib.bib26)),我们计算了四种语言相似性类别(句法、遗传、音系和特征),并分别针对每个任务和模型对将其与性能进行相关分析。如图 4 (https://arxiv.org/html/2606.18033#S4.F4) 所示,只有一小部分任务和模型组合在这些特征上表现出低到中等程度的相关性,而且即使这些效应也不一致。对于绝大多数设置,我们未观察到语言相似性与迁移成功之间存在强相关。这些发现表明,与微调模型不同,上下文学习并不系统地依赖于语言邻近性,这凸显了跨语言泛化在两种范式中出现的根本差异。 参考标题 图 4:四个热图展示了源-目标语言对的**语言相似性(句法、遗传、音系和特征)与跨语言迁移性能**之间的相关性。每个热图对应一个 lang2vec 维度,并报告了每个基准测试(列)和模型(行)组合的皮尔逊相关系数。星号 (*) 表示在 p<0.05 水平上统计显著。 ### 4.3 与跨语言对齐的相关性 除了表面层面的语言特征,我们还分析了迁移性能是否与模型中源语言和目标语言内部表示之间的跨语言对齐程度有关。尽管跨语言对齐通常与潜在的语言相似性相关,但它捕获了一个功能
相似文章
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
注意力敏感性不足:细调下注意力层级与行为上下文学习的分离
本文研究了在细调下大型语言模型中注意力层级代理与行为表现之间的分离,揭示了仅凭注意力敏感性来诊断上下文学习能力并不可靠。
因果干预揭示多语言模型中的类型学组织句法机制
本文使用因果干预来研究多语言模型中的句法机制,揭示了基于类型学相似性的分级跨语言迁移。
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。