MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据

arXiv cs.CL 论文

摘要

本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。

arXiv:2607.00890v1 公告类型:新 摘要:开放的网络规模预训练语料库仍主要集中在英语上,限制了多语言大语言模型的发展。我们推出MultiSynt/MT,这是一个开放的综合平行语料库,包含约4.8万亿目标语言标记,覆盖36种欧洲语言,通过使用Tower+和OPUS-MT/HPLT-MT系统翻译1000亿高质量Nemotron-CC标记生成。对于许多中低资源的欧洲语言,这是目前最大的公开可用预训练资源。在广泛的多语言基准测试套件中,基于MultiSynt/MT训练的参考大语言模型达到了原生数据基线HPLT 2.0的最终分数,使用的预训练标记减少了约72%,并且在匹配的1000亿标记训练预算下,相对性能提升了约15%。我们的分析还识别出评估盲点:标准的多项选择基准无法捕捉翻译质量的差异,而一种对流畅度敏感的大语言模型作为评委的评估方法在训练后的大语言模型上清晰恢复了这些差异(MultiSynt本身没有流畅度缺陷),并且挪威语的习语和文化相关任务仍然更适合使用原生数据。我们发布该语料库,包括来自多个系统的行对齐翻译,以支持对多语言预训练数据和评估的受控研究。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:39

# 万亿级、36种语言的多平行预训练翻译数据集

来源:https://arxiv.org/html/2607.00890

Maximilian Idahl¹,², Jörg Tiedemann³, Sampo Pyysalo⁴, David Salinas⁵,⁶, Tomasz Galica⁴, Shenbin Qian⁷, Tudor Nicolae Mateiu⁸, Zihao Li³, Anna Lokrantz⁹, Fedor Vitiugin⁴, André Martins¹⁰,¹¹,¹², Jenna Kanerva⁴, Filip Ginter⁴, Matthias Lindemann¹⁰, Tim Isbister⁹, Birger Moëll⁹, Jonas Lindh⁹, Jan Hajič¹³, Jenia Jitsev¹⁴,¹⁵,¹⁶,¹⁷, Andrey Kutuzov⁷, Stephan Oepen⁷, Gema Ramírez-Sánchez⁸  
¹ellamind ²莱布尼茨汉诺威大学 ³赫尔辛基大学 ⁴图尔库大学 ⁵蒂宾根ELLIS研究所 ⁶Prior Labs ⁷奥斯陆大学 ⁸Prompsit Language Engineering ⁹AI Sweden ¹⁰电信研究所 ¹¹高等技术学院 ¹²TransPerfect ¹³查理大学 ¹⁴Ontocord ¹⁵LAION ¹⁶Open-Ψ (Open-Sci) Collective ¹⁷于利希超级计算中心 (JSC), 于利希研究中心 (FZJ)

###### 摘要

开放的网络规模预训练语料主要集中于英语,限制了多语言大语言模型的发展。我们推出了 MultiSynt/MT,这是一个开放的合成平行语料库,包含约4.8万亿目标语言标记,涵盖36种语言,通过使用 Tower+ 和 OPUS-MT/HPLT-MT 系统翻译1000亿个高质量 Nemotron-CC 标记生成。对于许多中低资源欧洲语言,这是目前公开可用的最大预训练资源。在一个广泛的多语言基准套件上,基于 MultiSynt/MT 训练的参考LLM达到了原生数据基线 HPLT 2.0 的最终分数,但使用的预训练标记减少了约72%;在匹配的100B标记训练预算下,相对提升了约15%。我们的分析还发现了评估盲点:标准的多项选择基准无法捕捉翻译质量差异,而基于流畅性的 LLM-as-judge 评估在训练的LLM上能清晰恢复这种差异(MultiSynt本身并无流畅性缺陷);例如,挪威语中涉及习语和文化背景的任务,仍然更依赖原生数据。我们发布了该语料库,包括来自多个系统的行对齐翻译,以支持多语言预训练数据和评估的受控研究。

MultiSynt/MT: 万亿级、36种语言的多平行预训练翻译数据集

Maximilian Idahl¹,², Jörg Tiedemann³, Sampo Pyysalo⁴, David Salinas⁵,⁶, Tomasz Galica⁴, Shenbin Qian⁷, Tudor Nicolae Mateiu⁸, Zihao Li³, Anna Lokrantz⁹, Fedor Vitiugin⁴, André Martins¹⁰,¹¹,¹², Jenna Kanerva⁴, Filip Ginter⁴, Matthias Lindemann¹⁰, Tim Isbister⁹, Birger Moëll⁹, Jonas Lindh⁹, Jan Hajič¹³, Jenia Jitsev¹⁴,¹⁵,¹⁶,¹⁷, Andrey Kutuzov⁷, Stephan Oepen⁷, Gema Ramírez-Sánchez⁸  
¹ellamind ²莱布尼茨汉诺威大学 ³赫尔辛基大学 ⁴图尔库大学 ⁵蒂宾根ELLIS研究所 ⁶Prior Labs ⁷奥斯陆大学 ⁸Prompsit Language Engineering ⁹AI Sweden ¹⁰电信研究所 ¹¹高等技术学院 ¹²TransPerfect ¹³查理大学 ¹⁴Ontocord ¹⁵LAION ¹⁶Open-Ψ (Open-Sci) Collective ¹⁷于利希超级计算中心 (JSC), 于利希研究中心 (FZJ)

## 1 引言

公开可用的大规模预训练数据主要存在于英语(Penedo等人,2024 (https://arxiv.org/html/2607.00890#bib.bib22);Su等人,2025 (https://arxiv.org/html/2607.00890#bib.bib18)),大多数其他语言缺乏数量或质量(详见第2节 (https://arxiv.org/html/2607.00890#S2))。这一不足促使人们越来越关注使用机器翻译来大规模生成多语言预训练数据,但这一做法也引发了合理担忧:翻译文本可能带有被称为“翻译腔”的风格痕迹,并继承源语言的文化参照框架,源语言中的名称、地点、习语和文化背景知识在翻译后仍以英语为锚点(Gellerstam, 1986 (https://arxiv.org/html/2607.00890#bib.bib2);Riley等人,2020 (https://arxiv.org/html/2607.00890#bib.bib83))。我们通过引入 MultiSynt/MT 来解决这一资源限制问题。这是一个开放的多语言合成平行语料库,包含约4.8万亿目标语言标记,覆盖36种语言,通过使用开放翻译模型(包括 Tower+ 9B 和 72B(Rei等人,2026 (https://arxiv.org/html/2607.00890#bib.bib4))以及 OPUS-MT(Tiedemann等人,2024 (https://arxiv.org/html/2607.00890#bib.bib90)))翻译来自 Nemotron-CC 的100B标记高质量网络数据样本生成。对于许多欧洲低资源和中资源语言,MultiSynt/MT 是迄今为止公开可用的最大预训练语料库,在最低资源语言中,其规模比最大的可比原生资源(HPLT 3.0; Oepen等人,2025 (https://arxiv.org/html/2607.00890#bib.bib21))高出一个数量级以上(图1 (https://arxiv.org/html/2607.00890#S1.F1))。对于部分语言,我们发布了来自多个系统的行对齐平行翻译,支持在匹配源数据条件下进行受控比较,该语料库在宽松的开放许可下发布。

参见图注
图1: MultiSynt/MT 和 HPLT 3.0 中每种语言的标记数量(对数尺度,Gemma-3分词,24种语言代表性子集)。MultiSynt/MT 在24种语言中有19种规模更大,对于最低资源语言,规模甚至高出几个数量级(例如 mlt 182×, gle 153×, nno 79×);HPLT 3.0 仅在 deu 和 spa 上更大(5–6×)。每组上方的数值给出了 MultiSynt/MT 与 HPLT 3.0 的标记比率。完整统计见附录D (https://arxiv.org/html/2607.00890#A4)。

参见图注
图2: HPLT 2.0(原生)与 MultiSynt/MT (OPUS-MT) 在多语言基准套件上的比较,平均5种语言(dan, nld, ita, por, swe)。MultiSynt/MT 在大约28B训练标记时达到 HPLT 2.0 的终点,并在100B标记时持续改进。每种语言/基准的详细结果作为补充数据提供。

与语料库一同,我们呈现了一个平衡的实证描述,既报告了基于 MultiSynt/MT 训练的参考LLM 在哪些方面优于原生多语言基线,也报告了哪些方面表现不足,并提醒注意那些掩盖这些差异的评估实践。在标准的多语言基座模型基准上,使用 MultiSynt/MT 预训练的参考LLM 达到了原生数据基线(HPLT 2.0¹¹¹我们的预训练实验在较新的 HPLT 3.0 版本可用之前就已开始,因此在第4节 (https://arxiv.org/html/2607.00890#S4)全文中使用 HPLT 2.0 作为原生基线。虽然3.0版本更大,但两者的分布非常相似(Oepen等人,2025 (https://arxiv.org/html/2607.00890#bib.bib21));另见图6 (https://arxiv.org/html/2607.00890#S5.F6)。)的最终分数,使用的训练标记减少了约72%;在匹配的100B标记训练预算下,相对提升了约15%(第4节 (https://arxiv.org/html/2607.00890#S4))。在训练的LLM上进行的基于流畅性的 LLM-as-judge 评估,清晰恢复了标准多项选择基准无法区分的 MT 系统质量排名,暴露了标准评估的盲点,而非 MultiSynt 的流畅性缺陷(第5.1节 (https://arxiv.org/html/2607.00890#S5.SS1));互补的嵌入空间诊断发现,标准基准项目在最近邻中往往有更多 MultiSynt/MT 而非 HPLT 2.0 文档(第5.2节 (https://arxiv.org/html/2607.00890#S5.SS2))。在针对习语和文化背景知识的挪威语任务上,使用原生数据训练的模型在整个训练过程中始终优于翻译数据模型;而在挪威语常识推理任务上,翻译数据缩小了差距并最终超过原生基线;这直接证明了翻译文本并非在所有现象上都能替代原生语料库(第5.3节 (https://arxiv.org/html/2607.00890#S5.SS3))。

## 2 相关工作

#### 多语言预训练语料库。
开放的多语言预训练语料库已从过滤的 Common Crawl 流水线(CCNet, mC4, OSCAR, ROOTS)发展为更大、过滤更好的资源,包括 MADLAD-400, CulturaX, Glot500, HPLT, FineWeb2 和 EMMA 式适配(Wenzek等人,2020 (https://arxiv.org/html/2607.00890#bib.bib100); Conneau等人,2020 (https://arxiv.org/html/2607.00890#bib.bib36); Xue等人,2021 (https://arxiv.org/html/2607.00890#bib.bib102); Abadji等人,2022 (https://arxiv.org/html/2607.00890#bib.bib24); Laurençon等人,2022 (https://arxiv.org/html/2607.00890#bib.bib65); BigScience Workshop, 2022 (https://arxiv.org/html/2607.00890#bib.bib86); Kudugunta等人,2023 (https://arxiv.org/html/2607.00890#bib.bib63); Nguyen等人,2024 (https://arxiv.org/html/2607.00890#bib.bib75); ImaniGooghari等人,2023 (https://arxiv.org/html/2607.00890#bib.bib56); de Gibert等人,2024 (https://arxiv.org/html/2607.00890#bib.bib38); Burchell等人,2025 (https://arxiv.org/html/2607.00890#bib.bib20); Penedo等人,2025 (https://arxiv.org/html/2607.00890#bib.bib80); Ji等人,2024a (https://arxiv.org/html/2607.00890#bib.bib58)),但低资源语言在数量和质量的失衡依然存在(Kreutzer等人,2022 (https://arxiv.org/html/2607.00890#bib.bib62))。MultiSynt/MT 旨在补充这些语料库,针对语言分布中的这一部分;我们使用 HPLT(Oepen等人,2025 (https://arxiv.org/html/2607.00890#bib.bib21)),这是在我们规模下最强、公开可用的原生多语言基线,作为主要比较对象。

#### 高质量英语源数据。
基于翻译的语料库继承了其源数据的质量分布:最近的参考基线工作表明,Nemotron-CC HQ(Su等人,2025 (https://arxiv.org/html/2607.00890#bib.bib18))在多种模型和标记规模下产生了最强的下游表现,领先于已建立的英语语料库,包括 C4、The Pile、RefinedWeb、FineWeb-Edu 和 DataComp-LM(Raffel等人,2020 (https://arxiv.org/html/2607.00890#bib.bib82); Gao等人,2021 (https://arxiv.org/html/2607.00890#bib.bib48); Penedo等人,2023 (https://arxiv.org/html/2607.00890#bib.bib79), 2024 (https://arxiv.org/html/2607.00890#bib.bib22); Li等人,2024a (https://arxiv.org/html/2607.00890#bib.bib68); Nezhurina等人,2025 (https://arxiv.org/html/2607.00890#bib.bib19)),这促使我们将其用作 MultiSynt/MT 的源数据分布。

#### 用于语言模型预训练的翻译语料库。
针对巴斯克语、印度语言、阿拉伯语、印尼语和泰米尔语的研究一致发现,机器翻译的预训练数据在标准 NLU 任务上可与原生数据匹敌,但在文化细微任务上表现不佳(Urbizu等人,2023 (https://arxiv.org/html/2607.00890#bib.bib92); Doshi等人,2024 (https://arxiv.org/html/2607.00890#bib.bib41); Boughorbel等人,2024 (https://arxiv.org/html/2607.00890#bib.bib29); Velasco and Roque, 2025 (https://arxiv.org/html/2607.00890#bib.bib94))。在规模上最接近的是 TransWeb-Edu / CuatroLLM 及其扩展 TransWebLLM,将 FineWeb-Edu 中多达1.7T标记翻译成九种语言(Wang等人,2024a (https://arxiv.org/html/2607.00890#bib.bib98), 2025 (https://arxiv.org/html/2607.00890#bib.bib97));同时期的 FineTranslations 则反向操作,将500多种非英语语言翻译成英语(Penedo等人,2026 (https://arxiv.org/html/2607.00890#bib.bib81))。另一条并行路线将翻译本身视为明确的预训练目标,而非语料构建机制(Ji等人,2024b (https://arxiv.org/html/2607.00890#bib.bib57); Li等人,2024b (https://arxiv.org/html/2607.00890#bib.bib67); Ji等人,2025 (https://arxiv.org/html/2607.00890#bib.bib59); Li等人,2025 (https://arxiv.org/html/2607.00890#bib.bib69));我们则采用标准的下一个标记语言模型,在翻译后的目标语言文档上进行训练。MultiSynt/MT 在三个方面扩展了这一路线:覆盖36种语言,约4.8T目标语言标记;使用 Nemotron-CC HQ 而非 FineWeb-Edu 作为源数据;提供来自多个开放 MT 系统(Tower 家族中专门用于翻译的LLM(Alves等人,2024 (https://arxiv.org/html/2607.00890#bib.bib5); Rei等人,2026 (https://arxiv.org/html/2607.00890#bib.bib4))和经典 NMT 系统(Tiedemann, 2012 (https://arxiv.org/html/2607.00890#bib.bib15); Tiedemann等人,2024 (https://arxiv.org/html/2607.00890#bib.bib90); Junczys-Dowmunt等人,2018 (https://arxiv.org/html/2607.00890#bib.bib17))的行对齐输出,支持在匹配源数据条件下进行受控比较。

#### 翻译腔、文化背景与原生撰写的评估。
翻译文本与原生撰写的文本存在系统性差异(Koppel and Ordan, 2011 (https://arxiv.org/html/2607.00890#bib.bib61); Volansky等人,2015 (https://arxiv.org/html/2607.00890#bib.bib96); Vanmassenhove等人,2021 (https://arxiv.org/html/2607.00890#bib.bib93); Bizzoni等人,2020 (https://arxiv.org/html/2607.00890#bib.bib28)),并影响跨语言基准的解释(Graham等人,2019 (https://arxiv.org/html/2607.00890#bib.bib50); Freitag等人,2020 (https://arxiv.org/html/2607.00890#bib.bib47); Artetxe等人,2020 (https://arxiv.org/html/2607.00890#bib.bib25); Riley等人,2020 (https://arxiv.org/html/2607.00890#bib.bib83), 2021 (https://arxiv.org/html/2607.00890#bib.bib84)),而多语言模型本身通常缺乏目标语言社区的文化和习语知识(Hershcovich等人,2022 (https://arxiv.org/html/2607.00890#bib.bib54); Naous等人,2024 (https://arxiv.org/html/2607.00890#bib.bib74); Liu等人,2024 (https://arxiv.org/html/2607.00890#bib.bib72); Pawar等人,2025 (https://arxiv.org/html/2607.00890#bib.bib78); Yao等人,2024b (https://arxiv.org/html/2607.00890#bib.bib103); Etxaniz等人,2024 (https://arxiv.org/html/2607.00890#bib.bib45))。多语言评估本身也常源自翻译(Belebele, MMLU-ProX, XNLI, XTREME)(Conneau等人,2018 (https://arxiv.org/html/2607.00890#bib.bib35); Hu等人,2020 (https://arxiv.org/html/2607.00890#bib.bib55); Bandarkar等人,2024 (https://arxiv.org/html/2607.00890#bib.bib26); Xuan等人,2025 (https://arxiv.org/html/2607.00890#bib.bib101));原生撰写的替代方案,如 TyDi QA、Global MMLU 和 NorEval,是重要的补充(Clark等人,2020 (https://arxiv.org/html/2607.00890#bib.bib33); Singh等人,2025 (https://arxiv.org/html/2607.00890#bib.bib89); Mikhailov等人,2025 (https://arxiv.org/html/2607.00890#bib.bib10); Romanou等人,2025 (https://arxiv.org/html/2607.00890#bib.bib85); Wu等人,2025 (https://arxiv.org/html/2607.00890#bib.bib32)),而 LLM-as-a-judge 协议(Zheng等人,2023 (https://arxiv.org/html/2607.00890#bib.bib105); Liu等人,2023 (https://arxiv.org/html/2607.00890#bib.bib71); Verga等人,2024 (https://arxiv.org/html/2607.00890#bib.bib95); Gu等人,2026 (https://arxiv.org/html/2607.00890#bib.bib52))提供了对流畅性敏感的补充,我们将在第5节 (https://arxiv.org/html/2607.00890#S5)中加以利用。

## 3 构建 MultiSynt/MT

### 3.1 源数据:高质量英语网络文本

我们从 Nemotron-CC 的*实际高质量*(actual high-quality)子集(Su等人,2025 (https://arxiv.org/html/2607.00890#bib.bib18))进行翻译,该子集包含从其集成质量分类器获得最高分数的非合成 Common Crawl 文档。最近的参考基线工作(Nezhurina等人,2025 (https://arxiv.org/html/2607.00890#bib.bib19))发现,在多个模型和标记规模下,Nemotron-CC HQ 在已建立的开放英语预训练语料库中产生了最强的平均下游表现。我们从中均匀随机抽取大约1.55亿个文档(约1000亿英语标记),规模设定为使每种语言的翻译输出处于同一数量级,并且不应用任何主题、长度或质量过滤。

相似文章

tencent/Hy-MT2-7B

Hugging Face Models Trending

腾讯开源了Hy-MT2系列快速思考的多语言翻译模型(1.8B、7B、30B-A3B),支持33种语言,同时提供了用于设备端部署的极端量化方法以及一个新的指令遵循基准IFMTBench。

@FeitengLi: Hy-MT2 新的开源多语言翻译模型 能力可以跟顶尖大模型匹配、支持 33 种语言之间的互译,而且具备灵活的 Instruct 能力,实现了 2-bit 量化不足 500MB 的空间占用 可以很好的跑在端侧 https://modelsc…

X AI KOLs Timeline

Hy-MT2 is a new open-source multilingual translation model from Tencent Hy that supports 33 languages, offers flexible instruction capabilities, and achieves 2-bit quantization under 500MB for on-device deployment.

ForMaT:视觉引导的多语言PDF翻译数据集

arXiv cs.CL

本文介绍了ForMaT,一个包含15个语言对、3,956个PDF文件的平行语料库,专为视觉引导的多语言翻译而设计,保留了布局元数据,用于对布局感知的机器翻译系统进行基准测试。