突厥语族语言机器翻译的跨语言迁移

arXiv cs.CL 论文

摘要

本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。

arXiv:2607.29355v1 公告类型:新 摘要:跨语言迁移是低资源机器翻译的核心,但其在密切相关的语系中的行为尚未得到充分表征。我们利用成对迁移矩阵研究了五种突厥语族语言——土耳其语、阿塞拜疆语、乌兹别克语、哈萨克语和吉尔吉斯语——之间的迁移。在此设置中,每个模型使用一个迁移源进行微调,并在不同的迁移目标上进行评估,而翻译目标保持不变。在mT5实验中,我们发现迁移在密切相关的突厥语对之间最强,尤其是土耳其语-阿塞拜疆语和哈萨克语-吉尔吉斯语。我们还表明,迁移方向很重要,并且相同的迁移源-迁移目标对在翻译目标变化时可能表现不同。拉丁化在几种文字不匹配的设置中提高了BLEU和chrF分数,但其效果在不同指标上并不一致。额外分析表明,迁移源在不同数据集和模型设置中基本保持稳定。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:36

# 突厥语族语言机器翻译中的跨语言迁移
来源:https://arxiv.org/abs/2607.29355
查看 PDF (https://arxiv.org/pdf/2607.29355)

> 摘要:跨语言迁移对低资源机器翻译至关重要,但其在关系密切的语族内部的行为尚未得到充分刻画。我们使用成对迁移矩阵研究了五种突厥语族语言之间的迁移:土耳其语、阿塞拜疆语、乌兹别克语、哈萨克语和吉尔吉斯语。在这种设置下,每个模型使用一个迁移源进行微调,并在不同的迁移目标上进行评估,而翻译目标保持不变。在 mT5 实验中,我们发现迁移在关系密切的突厥语族语言对之间效果最强,尤其是土耳其语-阿塞拜疆语和哈萨克语-吉尔吉斯语。我们还表明,迁移方向会影响结果,并且相同的迁移源-迁移目标对在翻译目标改变时可能表现不同。拉丁化在若干文字不匹配的设置中提高了 BLEU 和 chrF 分数,但其效果并非在所有指标上一致。额外分析显示,迁移源在不同数据集和模型设置下大多保持稳定。

## 提交历史

来自:Cagri Toraman [查看邮箱 (https://arxiv.org/show-email/db19ed5f/2607.29355)] **[v1]** Fri, 31 Jul 2026 12:42:17 UTC (650 KB)

相似文章

跨语言同形词的标记化

arXiv cs.CL

本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。

LLMs中的多语言去学习:迁移、动力学与可逆性

arXiv cs.CL

本文通过将TOFU基准扩展到五种语言,研究了LLMs中的多语言去学习。研究发现,去学习迁移因文字和语言家族而异,主要作用于后几层解码层,并且单个引导方向可以恢复跨语言被抑制的大部分知识。

MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据

arXiv cs.CL

本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。