迈向超越英语中心化开发的大语言模型
摘要
本文证明了大语言模型严重偏向英语,并表明持续预训练在将模型适配到其他语言(尤其是文化理解方面)时,并不比从头训练更具成本优势。
arXiv:2605.15613v1 公告类型:新
摘要:通过分析开放权重大语言模型(LLMs)生成的序列,我们证明了大语言模型严重偏向英语。尽管持续预训练常被用于将大语言模型适配到目标语言,我们表明它并不比从头训练更具成本优势,即使在提高目标语言的文化理解方面也是如此。这些发现表明,未来的大语言模型开发中,针对每种语言的专门投资可能变得越来越重要,而不是主要依赖英语中心化资源的扩展。
查看缓存全文
缓存时间: 2026/05/18 06:33
# 迈向超越英语中心化的大语言模型开发
来源:https://arxiv.org/html/2605.15613
###### 摘要
通过对开源大语言模型(LLM)生成的序列进行分析,我们证明LLM存在严重的英语偏见。尽管持续预训练被广泛用于将LLM适配到目标语言,但我们表明,即使在提升目标语言的文化理解方面,持续预训练也并不比从头训练更具成本优势。这些发现表明,未来的LLM开发可能需要越来越重视按语言进行专门投入,而不是主要依赖英语中心化资源的扩展。
迈向超越英语中心化的大语言模型开发
Sho Takase Ukyo HondaCyberAgent\{honda_ukyo, takase_sho\}@cyberagent.co.jp
## 1 引言
自大语言模型(LLM)表现卓越的初始报告发布以来Brown et al. (2020) (https://arxiv.org/html/2605.15613#bib.bib2),众多团队相继推出了包括Llama、Qwen和Gemma系列在内的LLMTouvron et al. (2023a) (https://arxiv.org/html/2605.15613#bib.bib33); Bai et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib1); Team et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib31)。似乎每天都有新的LLM在性能提升方面被报道。然而,由于现有LLM大多以英语为中心,且主要基准数据集也以英语为主,涉及其他语言的讨论相对较少。
事实上,一些研究表明,它们在训练LLM时使用的数据集中,很大一部分是英语文本Touvron et al. (2023b) (https://arxiv.org/html/2605.15613#bib.bib34); Bai et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib1)。例如,Llama 2的预训练语料库中约90%是英文文档。由于大规模网络爬取语料库CommonCrawl中仅有约40%的英文文档111https://commoncrawl.github.io/cc-crawl-statistics/plots/languages,它们的预训练数据相比于网页的自然语言分布严重偏向英语。在本文中,我们基于每个LLM生成的序列来估计其训练数据的语言分布,并证明即使被设计为多语言模型,LLM也强烈偏向英语(图1 (https://arxiv.org/html/2605.15613#S2.F1))。
为了高效获得在特定语言上表现优异的LLM,先前的研究采用了持续预训练Fujii et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib6)。我们分析了这种持续预训练模型,并表明对于开发专门用于某种语言的LLM,持续预训练并不比从头训练更具成本优势。我们证明持续预训练可以提升目标语言的性能,但这种提升与其所增加的额外计算成本是相称的。特别是,我们证明与特定语言相关的文化理解性能与该语言的训练成本的对数尺度成正比,而非总训练成本(图2 (https://arxiv.org/html/2605.15613#S3.F2))。这些结果证实,对于此类文化理解任务,持续预训练的效率与从头训练相当。基于这些发现,我们讨论了LLM开发的未来方向。
## 2 LLM的语言分布
请参考标题 图1:根据随机生成序列估计的每个LLM的预训练数据语言分布。该图聚焦于CommonCrawl中排名前10的语言。表1:每个LLM在MGSM测试集上的6-shot性能。我们从HuggingFace Hub获取模型名称。虽然一些团队在技术报告中公布了其LLM的构建过程Touvron et al. (2023b) (https://arxiv.org/html/2605.15613#bib.bib34); Yang et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib39); Team et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib30),但这些报告并未透露其预训练数据集的详细统计信息。在本文中,我们基于每个LLM生成的序列与其训练数据强烈相关的假设来估计预训练数据集的语言分布。事实上,先前的研究已经表明,我们可以从LLM中提取训练数据Carlini et al. (2021) (https://arxiv.org/html/2605.15613#bib.bib3); Nasr et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib23); Xu et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib37)。
### 分布估计
我们让每个LLM从BOS token开始生成100,000个序列,每个序列包含1,000个token。然后使用fastText识别每个序列的语言Joulin et al. (2016) (https://arxiv.org/html/2605.15613#bib.bib13); Grave et al. (2018) (https://arxiv.org/html/2605.15613#bib.bib8)。最后,我们将生成序列的语言分布视为预训练数据语言分布的估计值。为了评估此过程的可靠性,我们计算了Llama 2的已报告语言分布与我们的估计值之间的Kendall秩相关系数Kendall (1938) (https://arxiv.org/html/2605.15613#bib.bib15),Llama 2是少数披露其预训练语料库语言分布的研究之一。结果,我们得到了Llama 2 7B和13B分别为0.77和0.80的系数。因为这些值显著较高,我们认为我们的估计方法是合理的222我们还调查了LLM-jp和OLMo,它们未披露语言分布,但公开了其预训练语料库。附录A (https://arxiv.org/html/2605.15613#A1)提供了更多细节。.
### 分布比较
图1 (https://arxiv.org/html/2605.15613#S2.F1)展示了广泛使用的开源权重LLM和CommonCrawl的估计语言分布。对于CommonCrawl,我们采样了100,000个包含超过1,000个字符的文档,并使用fastText识别其语言,以便与LLM进行公平比较。对于LLM,我们重点关注每个团队从头训练的预训练模型。附录C (https://arxiv.org/html/2605.15613#A3)提供了分布的详细信息。
图1 (https://arxiv.org/html/2605.15613#S2.F1)显示,预训练数据集中英语的比例远高于CommonCrawl语料库。换句话说,图1 (https://arxiv.org/html/2605.15613#S2.F1)中的LLM强烈偏向英语。因此,尽管这些LLM在英语上取得了良好的性能,但在其他语言上可能无法达到足够质量。实际上,当在语言无关的基准数据集(如数学问题求解)上跨语言评估时,这些LLM相对于英语的性能显著下降。表1 (https://arxiv.org/html/2605.15613#S2.T1)展示了每个LLM在多语言小学数学(MGSM)数据集上的few-shot性能Shi et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib27),该数据集包含从英语翻译成多种语言的数学问题。我们按照先前研究的设置,将shot数量设为6Shi et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib27)。例如,如表1 (https://arxiv.org/html/2605.15613#S2.T1)所示,俄语上的性能比英语低约10个百分点,尽管俄语是CommonCrawl中第二常见的语言。
## 3 持续预训练的有效性和效率
为了将LLM适配到目标语言,先前的研究已对目标语言应用了持续预训练Yang et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib40); Pires et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib24); Zhao et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib42); Cui et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib5); Fujii et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib6)。这些研究报告称,持续预训练可以在计算成本远低于从头训练的情况下,在目标语言上产生强大的LLM。在本节中,我们重新评估持续预训练在语言无关基准数据集和需要目标语言文化理解才能回答问题的基准数据集上的性能。
表2:在语言无关基准和日语文化理解基准上的性能。MGSM使用6-shot,MMLU ProX使用5-shot,NIILCQA和JMMLU使用4-shot,JAQKET使用zero-shot。### 模型
我们重点关注适配日语的持续预训练模型,因为有多种可用的模型。具体来说,我们评估了从Llama-3.1-8B-Instruct训练得到的Llama-3.1-Swallow-8B-Instruct-v0.5Grattafiori et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib7),从Qwen2.5-32B训练得到的Qwen2.5-bakeneko-32B-InstructYang et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib39),以及从Qwen2.5-32B-Instruct训练得到的ABEJA-Qwen2.5-32B-Japanese-v1.0和ELYZA-Shortcut-1.0-Qwen-32BYang et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib39)。这些模型在持续预训练后进行了指令微调。
### 数据集
对于语言无关的基准任务,我们关注数学问题和大型多语言语言理解(MMLU)数据集。我们使用MGSM的日语部分Shi et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib27)和MMLU ProX的日语部分Xuan et al. (2025) (https://arxiv.org/html/2605.15613#bib.bib38),它们分别是从英语小学数学题Cobbe et al. (2021) (https://arxiv.org/html/2605.15613#bib.bib4)和MMLU ProWang et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib36)翻译而来。我们还报告了这些数据集的英语部分作为参考。此外,我们使用NIILC问答数据集(NIILCQA)Sekine (2003) (https://arxiv.org/html/2605.15613#bib.bib25)、JMMLU中与日本文化相关的子集Yin et al. (2024) (https://arxiv.org/html/2605.15613#bib.bib41)以及JAQKET333github.com/kumapo/JAQKET-dataset (https://github.com/kumapo/JAQKET-dataset)作为评估日本文化理解的基准数据集。对于语言无关基准,我们使用LM Evaluation Harness444github.com/EleutherAI/lm-evaluation-harness (https://github.com/EleutherAI/lm-evaluation-harness);对于日语文化理解基准,我们使用FlexEval555github.com/sbintuitions/flexeval/ (https://github.com/sbintuitions/flexeval/)。
请参考标题 图2:各训练成本下的平均基准分数。(b)中的垂直箭头表示通过持续预训练从基础模型获得的性能提升。
### 结果1:有效性
表2 (https://arxiv.org/html/2605.15613#S3.T2)展示了每个LLM在语言无关基准和日语文化理解基准上的结果。该表还报告了预训练数据包含大量日语文本的LLM的性能,作为参考。对于语言无关基准,Llama-3.1-Swallow-8B-Instruct-v0.5在其基础模型基础上提升了日语部分的性能。Qwen2.5-bakeneko-32B-Instruct也提升了性能。因此,在目标语言上进行持续预训练可以提升语言无关基准的性能。然而,如ABEJA-Qwen2.5-32B-Japanese-v1.0和ELYZA-Shortcut-1.0-Qwen-32B的结果所示,持续预训练也可能降低目标语言的性能。因此,在适配强模型时,仔细设计适当的训练策略非常重要。此外,对于日语文化理解基准,除了Qwen2.5-bakeneko-32B-Instruct之外的所有模型都在其基础模型基础上提升了性能。
### 结果2:效率
表2 (https://arxiv.org/html/2605.15613#S3.T2)表明持续预训练大多能提升目标语言的性能。但是,持续预训练的效率如何?换句话说,与从头预训练相比,持续预训练每单位计算成本能否带来更大的性能提升?为了研究这一问题,我们展示了性能与计算成本之间的关系。具体来说,我们计算了语言无关基准和日本文化基准的日语部分的平均分数。然后,我们考察这些平均分数、总计算成本以及用于日语文本训练的计算成本之间的关系。我们使用参数大小与消耗token数量的乘积作为计算成本的度量。为了计算日语训练数据量,我们使用第2节 (https://arxiv.org/html/2605.15613#S2)中获得的估计比例。
图2 (https://arxiv.org/html/2605.15613#S3.F2)展示了性能与训练成本之间的关系。为了构建此图,我们额外评估了Qwen2.5、Sarashina2.2和LLM-jp-3.1的不同参数大小模型。我们还基于这些点绘制了回归线。如图2 (https://arxiv.org/html/2605.15613#S3.F2)(a)所示,语言无关基准的日语部分分数随着总训练成本的对数尺度线性提升。这一结果表明,使用目标语言进行持续预训练对语言无关基准在目标语言上的性能没有显著影响。
另一方面,图2 (https://arxiv.org/html/2605.15613#S3.F2)(b)显示,就总训练成本而言,持续预训练模型在日语文化理解基准上取得了显著提升。基于该图,仅考虑总训练成本时,持续预训练似乎是一种极具成本效益的方法。相比之下,当我们专门关注用于日语训练的成本时,图2 (https://arxiv.org/html/2605.15613#S3.F2)(c)表明性能提升与日语训练成本的对数尺度成正比。因此,通过持续预训练获得的收益仅仅来自分配给日语的额外训练成本。换句话说,持续预训练的成本-性能趋势大致遵循与目标语言从头训练相同的缩放规律。
## 4 讨论
基于第2节 (https://arxiv.org/html/2605.15613#S2)和第3节 (https://arxiv.org/html/2605.15613#S3)的发现,在近期英语中心化的LLM开发下,语言无关基准的性能很可能继续提升,因为这种性能主要取决于总训练成本。此外,先前的研究表明,通过引导模型以主导语言(即英语)进行思考,而不是显式学习每种语言,LLM可以提升语言无关基准的性能Shi et al. (2023) (https://arxiv.org/html/2605.15613#bib.bib27)。因此,如果目标仅仅是提升语言无关基准的性能,那么在LLM训练中包含大量非英语数据的动力有限。因此,LLM在其他语言的文化理解方面往往表现较弱...(原文此处可能未完成,我们保留原样)相似文章
当英语改写本地知识:大语言模型中的全球叙事主导
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
CulturALL:评测大模型多语言多文化能力的实景基准
CulturALL 发布含 2,610 条样本、覆盖 14 种语言和 51 个地区的实景基准,用于检验大模型在真实文化场景下的表现;目前最佳模型仅得 44.48%,提升空间巨大。
为什么不能训练LLMs用一种优化的AI语言而非英语来思考?
一个推测性的讨论,质疑为什么LLMs没有被训练使用优化的内部语言而非自然语言来思考,以及这是否能提高效率。
将LLM性别偏见锚定于人类基线:一项跨语言审计
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。