墨尔本大学WMT 2026 CreoleMT提交:一种针对低资源太平洋克里奥尔语机器翻译的领域平衡方法
摘要
墨尔本大学提交了一个针对低资源太平洋克里奥尔语(如Tok Pisin、Bislama和Solomon Pijin)的领域平衡机器翻译模型,在WMT 2026 CreoleMT共享任务中,以超过3个chrF++点的优势超越了开放基线模型。
查看缓存全文
缓存时间: 2026/09/15 08:37
# 墨尔本大学 WMT 2026 克里奥尔语MT提交方案:面向低资源太平洋克里奥尔语机器翻译的领域平衡方法 来源:https://arxiv.org/html/2609.13615 ###### 摘要 针对WMT26克里奥尔语翻译共享任务,我们专注于太平洋克里奥尔语——托克皮钦语、比斯拉马语和所罗门皮钦语——的机器翻译(MT)模型,特别关注其在广泛领域的性能表现。在基于大量领域不均衡数据进行预训练后,我们继续在多样化的领域平衡数据混合集上进行微调。我们采用了多种数据收集与准备技术,包括大语言模型辅助的重新拼写与对齐、回译以及从Gemini蒸馏训练数据中原本缺失领域的数据。在Bouquet测试集以及由口语转录文本构成的新测试集上进行的评估表明,使用人工原创参考译文时,我们的模型在所有翻译方向上均以3个以上的chrF++分数超越了开源基线模型。展望未来,我们计划为所罗门皮钦语和比斯拉马语开发人工翻译的测试集,并将我们最优模型蒸馏成更小但保持广泛领域覆盖能力的版本。 ## 1引言 在本届第二次专注于克里奥尔语机器翻译的WMT共享任务(Robinson等人,2026)中,我们聚焦于三种主要的太平洋克里奥尔语:托克皮钦语(tpi,巴布亚新几内亚)、比斯拉马语(bis,瓦努阿图)和所罗门皮钦语(pis,所罗门群岛)。它们具有共同特征:在各自国家作为通用语广泛使用于日常交流(Eberhard等人,2025);它们都属于美拉尼西亚皮钦语家族的英语基础接触语言(Tryon和Charpentier, 2004);对于托克皮钦语和比斯拉马语,它们还是各自国家的官方语言(Smith和Siegel, 2013;Meyerhoff, 2013)。 这些语言的使用者总计超过1000万人(Eberhard等人,2025)。然而,它们在机器翻译领域的覆盖相对有限:谷歌翻译和NLLB仅支持托克皮钦语(NLLB Team等人,2022),而比斯拉马语或所罗门皮钦语尚无面向消费者的模型部署。覆盖广泛领域(例如超越宗教和新闻)的测试集也很有限,除了近期将托克皮钦语加入Bouquet测试集之外(Andrews等人,2025)。 作为本次共享任务的一部分,我们致力于训练一个单一模型以支持这三种语言,并实现广泛的领域覆盖。为此,我们整理了一个训练集,其中包含来自宗教网站的平行数据混合,以及教育领域和非正式领域的合成数据。我们主要依赖Bouquet托克皮钦语作为测试集,并加入了由太平洋克里奥尔语项目(Passmore等人,2025)提供的、涵盖所有三种语言口语转录文本的内部测试集。 我们提供了以下贡献: - 一个针对每个翻译方向的单一联合模型,覆盖所有三种语言。我们先在我们收集的广泛但偏向宗教领域的数据并集上进行预训练,然后在一个较小但领域平衡的混合数据集上继续训练。在Bouquet测试集和留出的口语转录测试集上,使用人工原创参考译文时,该模型在所有方向上至少以3个chrF++分数超越了每一个开源模型基线。 - 证明了蒸馏强大的闭源模型是覆盖某些爬取数据所缺乏领域的廉价方法,并且收益会早期饱和:最初的1.5k个英语→托克皮钦语配对带来+1.54 chrF++的提升,而剩余的14.5k个仅增加+1.20。 - 使用针对所有三种语言的新颖留出口语转录文本进行评估,表明该领域的性能在其他测试集中代表性不足,并且仅向训练混合数据中添加几千行该领域的数据就能显著提升其性能,同时不会影响其他测试集上的表现。 - 我们相信以下三个发现可推广至本任务之外:拼写规范化带来巨大的chrF++增益,但对终端用户而言可能不如数字显示的那么重要;在一个克里奥尔语中添加的领域能力可以传递给其邻近语言;联合训练有助于两个资源最少的语言,同时保持资源最丰富的语言性能不变。 ## 2相关工作 ##### 克里奥尔语机器翻译(Creole MT)。 尽管社区需求常常不同于那些简单翻译现有英语资源的工作所假设的,但克里奥尔语在自然语言处理(NLP)领域长期处于服务不足的状态(Lent等人,2022b)。近期的工作已开始缩小这一差距:CreoleVal汇集了涵盖28种克里奥尔语的多任务基准测试(Lent等人,2024),而Kreyòl-MT则收集了迄今为止横跨41种克里奥尔语的最大平行语料库,发现一个类型多样的模型可以超越特定类型的模型(Robinson等人,2024)。首次专注于克里奥尔语机器翻译的WMT共享任务(Robinson等人,2025)将这些线索整合到了统一的评估中,本次任务是其第二届。过去的发现包括:从英语进行的迁移效果弱于语言之间表面相似性所暗示的(Lent等人,2022a);可用数据以宗教文本为主,这些文本在迁移到日常语言时效果不佳,而即使几百句领域内句子也能显著提升翻译质量(Rowe等人,2025)。这一点适用于我们所针对的太平洋克里奥尔语,其中托克皮钦语是唯一拥有广泛领域测试集的语言。 ##### 跨领域低资源机器翻译。 神经机器翻译质量在其训练领域之外会急剧下降,有时会产生流畅但不充分的输出(Koehn和Knowles, 2017)。对于低资源语言,这一问题尤为突出,因为仅有的少量平行数据集中在少数几个领域(如宗教和新闻),这促使人们努力构建其他领域的语料库(Merx等人,2025)。神经机器翻译的领域适应(Chu和Wang, 2018)通过以数据为中心的方法(如选择或合成领域内数据)和以模型为中心的方法(如持续微调)来解决这个问题。一个常见的流程是首先在所有可用的、大部分为领域外的数据上进行训练,然后在领域内数据和回译数据上进行微调(Imankulova等人,2019)。回译目标侧单语文本(Sennrich等人,2016)和从海量多语言模型(NLLB Team等人,2022)迁移是扩展覆盖范围的标准杠杆。我们将这些方法结合起来:我们从海量多语言模型出发,在所有收集的数据上进行训练,然后在一个领域再平衡的混合数据集上继续微调,该混合数据集加入了回译的新闻和合成的教育与非正式文本,以抵消宗教数据的偏向。 ## 3数据 ### 3.1收集 #### 3.1.1测试集 我们在三个留出集上进行评估,旨在超越主流克里奥尔语语料库所覆盖的宗教和新闻领域。 ##### Bouquet (每种语言854个句子)(Andrews等人,2025)是一个广泛领域的基准测试,涵盖日常对话、操作指南、叙述、社交媒体帖子等。它覆盖了托克皮钦语,但不包括我们目标的另外两种语言,因此我们使用大语言模型(LLM)(第3.2节)为它们构建了银标准参考译文。 ##### FLORES-200 (2,009个句子,仅限托克皮钦语)(NLLB Team等人,2022)是标准的多语言基准测试:包含通用百科全书和新闻文本,带有高质量的人工翻译,用作第二个独立的托克皮钦语参考点。 ##### 口语转录文本 (每种语言300个句子)(Passmore等人,2025)是来自太平洋克里奥尔语项目的转录和翻译语音数据,这是一种其他集合中不存在的口语语体,最初是克里奥尔语到英语的转换。我们为测试留出了每种语言300行数据,其余部分并入训练集(托克皮钦语10.0k,比斯拉马语4.5k,所罗门皮钦语1.6k)。 ##### 数据去污染。 部分CreoleMT共享任务评估集与我们训练数据中的公共文本重叠。过滤前,大部分英语评估句子已出现在我们的数据中(托克皮钦语75%,比斯拉马语95%,所罗门皮钦语99%),托克皮钦语克里奥尔语侧也有66%重叠(所罗门皮钦语和比斯拉马语克里奥尔语侧则少得多,分别为3%和8%)。我们从每个训练语料库中删除了任何与评估源(任一侧)共享句子的配对,经过积极的规范化处理后;之后没有评估句子残留于我们的训练文件中。 #### 3.1.2训练数据 表1(https://arxiv.org/html/2609.13615#S3.T1)给出了按来源统计的数量。数据分为三类。 ##### 爬取平行数据。 英语↔克里奥尔语配对,经过整合、句子对齐和去重(按语言),然后去污染;这构成了训练语料库:托克皮钦语472.7k对,所罗门皮钦语42.5k对,比斯拉马语80.8k对。领域上严重偏向宗教,主要是JW300和圣经,其中比斯拉马语还包括35.1k句回译的瓦努阿图新闻。经文级别的经文通过标准经文ID连接,因此这些配对是精确的,无需对齐。 ##### 单语回译数据。 仅包含克里奥尔语文本,通过机器翻译回译成英语(使用Gemma-4-31B或Gemini),以添加口语和新闻语体:托克皮钦语新闻(34.0k句)和网页文本(FineWeb-2, 18.9k);瓦努阿图新闻和政府页面(FineWeb-2, 2.5k文档, 35.2k对)用于比斯拉马语;以及所罗门皮钦语新闻(33篇文档)。不过,大部分FineWeb-2数据在我们最终最优模型训练混合中并未使用,因为发现它们损害翻译质量(倾向于英语直译)。 ##### 合成(蒸馏)数据。 6.0k个英语到托克皮钦语的配对,由强大的闭源模型(Gemini 3.5 Flash)生成,均匀采样自三个日常领域(叙述、操作指南、社交帖子),以提供爬取数据所缺乏的口语语体。图1(https://arxiv.org/html/2609.13615#S5.F1)衡量了其扩展效果。 ##### 使用方式。 我们为每个方向训练一个联合的托克皮钦语+所罗门皮钦语+比斯拉马语模型。每个模型首先在上述数据的广泛去污染并集(596k对:472.7k托克皮钦语,42.5k所罗门皮钦语,80.8k比斯拉马语)上进行预训练,然后在一个较小但领域内匹配的混合数据上继续训练:两个方向都使用经文和合成数据,另外加上托克皮钦语高质量混合数据(正向翻译)或留出的口语转录文本(反向翻译)。表2(https://arxiv.org/html/2609.13615#S4.T2)和表3(https://arxiv.org/html/2609.13615#S4.T3)给出了完整的训练流程和各阶段评分。 表1:训练数据混合情况,以句子数量计。在英语→克里奥尔语方向下,jw.org、Watchtower、回译新闻和示例行构成了托克皮钦语高质量混合数据。 ### 3.2数据准备 三个清理步骤,每个仅在特定语言需要时应用,并作为单因素消融实验进行衡量(表4(https://arxiv.org/html/2609.13615#S4.T4))。 ##### 借词重新拼写(所罗门皮钦语)。 爬取的皮钦语数据几乎全部来自jw.org,英语借词的拼写方式与英语相同(如 "first", "change"),而日常和测试用皮钦语使用本地拼写(如 "fas", "senis")。我们使用Gemma-4-31B,并借助皮钦语词典的指导,将训练目标文本重新拼写为本地惯例:仅改变拼写,词汇和含义保持不变。这是我们发现的最有效的单一操作(+7.7 chrF++)。 ##### 对齐。 使用大语言模型对齐器(Gemini)从并行文档中提取平行句子。另外,我们将托克皮钦语语料库通过Gemma-4-31B评判器(使用vLLM),该评判器为每个配对打分并删除明显未对齐的句子(评判了490.8k对,保留463.8k对)。经文级别的圣经和摩尔门经文本使用经文ID连接。 ##### 银标准测试集(所罗门皮钦语、比斯拉马语)。 这两种语言都没有Bouquet测试集,因此我们使用Gemini从英语源文本、托克皮钦语参考译文、双语词典条目(SIL Webonary,皮钦语3.0k条;比斯拉马语4.3k条)以及每种语言20个精选示例句子生成银标准参考译文。由于反向翻译的源文本是模型生成的,我们在结果表中标记了这些单元格,并且不将其视为金标准。 ## 4模型 表2:托克皮钦语结果,在Bouquet(854个真人翻译行)、FLORES-200(2,009行)和留出的口语转录文本(300行)上的chrF++分数。**粗体**标记每列中的最佳分数以及所有在最佳分数1个chrF++以内的分数(我们的噪声基线);\*行是我们提交的系统。在所有数据上进行的预训练对正向翻译方向几乎没有影响,但持续的微调和Gemini蒸馏使我们在除FLORES外的所有地方都达到了Gemini 3.5 Flash(最强基线)的水平。表3(https://arxiv.org/html/2609.13615#S4.T3)报告了所罗门皮钦语和比斯拉马语的相同系统和阶段。 ##### 基线系统。 我们与已经覆盖我们三种语言中至少一种的开源多语言系统进行比较:NLLB-200-3.3B(仅tpi,NLLB Team等人,2022)、MADLAD-400-3B(仅bis/pis,Kudugunta等人,2023)、Kreyòl-MT(仅tpi,Robinson等人,2024)和CreoleM2M(全部3种语言,Lent等人,2024)。我们还报告了Gemma-4-31B的零样本性能,以及作为闭源前沿模型的Gemini 3.5 Flash。在小到可以在单个GPU上微调的系统中,NLLB-3.3B在托克皮钦语上是最强的基础模型,在Bouquet测试集和口语转录文本上(两个方向,除了托克皮钦语→英语转录文本,它比Kreyòl-MT低1个chrF++)均优于其他模型;Gemma-4-31B在零样本时具有竞争力,但太大无法在单GPU上微调。因此我们选择NLLB-3.3B进行微调。 ##### 联合多语言微调。 我们将所罗门皮钦语和比斯拉马语目标词添加到NLLB中(从托克皮钦语词初始化),并使用第3.2节(https://arxiv.org/html/2609.13615#S3.SS2)中的干净数据,在所有三种语言上微调一个联合模型,每个方向一个。我们还为NLLB分词器中缺失的标点符号(例如花引号、长破折号)添加了新词符。将相关语言一起训练,在两种少数语言上优于每种语言单独微调(表4(https://arxiv.org/html/2609.13615#S4.T4))。 ##### 在多样化混合数据上持续微调。 在上述联合预训练之后,我们在一个更小但领域更多样化的混合数据上继续微调。表2(https://arxiv.org/html/2609.13615#S4.T2)和表3(https://arxiv.org/html/2609.13615#S4.T3)报告了各阶段的阶梯式结果。 ##### 有限的Gemini蒸馏。 因为Gemini 3.5 Flash在托克皮钦语零样本上表现良好,并且我们发现爬取数据的领域多样性非常有限,我们针对社交媒体文本(TweetEval, Barbieri等人,2020)、操作指南文章……
相似文章
面向东北印度低资源藏缅语Kokborok的高质量机器翻译
研究者开发KokborokMT,一款面向低资源语言Kokborok的神经机器翻译系统,通过在36k句对平行语料上微调NLLB-200,在en→trp方向取得17.30 BLEU分,trp→en方向达38.56。
低资源Tangkhul-英语神经机器翻译
介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。
MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据
本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。
用Toki Pona检验Word2Vec的极限
本文研究了Word2Vec能否为仅含约130个词汇的人造语言Toki Pona生成有意义的语义嵌入,使用了一个包含140万句子的语料库,并考察了非Toki Pona标记对嵌入质量的影响。
Embedding Initialization for Unseen Low-resource Languages in Multilingual NMT: A Case Study on Limbum-English Translation
This paper presents an embedding initialization method for adding unseen low-resource languages to multilingual NMT models, evaluated on Limbum-English translation. The averaged multi-language embedding matches the best single proxy and drastically outperforms zero-shot and from-scratch baselines.