CoPiT:面向传统蒙古文双文低资源语言的认知枢轴翻译

arXiv cs.CL 论文

摘要

本文提出 CoPiT,一种基于认知动机的枢轴翻译流水线,用于双文蒙古语。该流水线通过资源更丰富的西里尔蒙古文进行中转翻译,从而改善从低资源传统蒙古文到目标语言的翻译质量,取得了显著的 BLEU 和 COMET 提升,并发布了一个新的多文种平行数据集。

arXiv:2607.05849v1 公告类型:新 摘要:低资源语言对机器翻译而言仍具挑战,蒙古语便是一个典型案例。作为一种双文语言,蒙古语同时使用西里尔文和传统蒙古文书写,两者在数据可用性上存在严重不平衡。西里尔文相对资源丰富,而传统蒙古文则数据极度稀缺且正字法存在歧义,导致直接翻译性能大幅下降。我们提出 CoPiT,一种基于认知动机的枢轴翻译流水线,通过利用这种内部资源层次结构,将翻译路由至西里尔文。该流水线在翻译前显式地解决传统蒙古文中因文字引起的歧义,从而实现更稳定、更准确的意义传递。在多种骨干模型和目标语言上,CoPiT 始终优于直接翻译,实现了显著的绝对 BLEU 提升以及持续的 1.5-1.6 倍 COMET 增益。这些增益使得强大的开源模型在可比评估设置下能够匹配甚至超越 GPT-4.1。除推理时的改进外,CoPiT 还能直接从传统蒙古文文本构建合成平行数据,缓解真实低资源场景下的数据稀缺问题。我们发布了一个新的多文种平行数据集,涵盖蒙古语的两种文字以及英语、韩语和俄语。所有数据集和代码均已公开,访问地址为 https://anonymous.4open.science/r/anonymous_project-76C7。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:41

# CoPiT:面向双文字低资源传统蒙古文的认知枢轴翻译

来源:https://arxiv.org/html/2607.05849
Burte Bayarsaikhan††Equal contribution.1Serynn Kim11footnotemark:12Buru Chang††Corresponding author.11韩国大学2韩国外国语大学\{burtebay,buru\_chang\}@korea\.ac\.kr serynn@hufs\.ac\.kr

###### 摘要

低资源语言对机器翻译仍然构成挑战,蒙古文就是一个典型代表。作为一种双文字语言,蒙古文使用西里尔字母和传统蒙古文两种文字书写,这两种文字在数据可用性上存在严重的不平衡。虽然西里尔蒙古文的资源相对丰富,但传统蒙古文的数据极其稀少且正字法存在歧义,导致直接翻译的性能显著下降。我们提出了CoPiT,这是一种认知驱动的、基于枢轴的翻译流水线,它利用这种内部资源层级结构,通过西里尔蒙古文进行路由翻译。该流水线在翻译前明确解决传统蒙古文中由文字引起的歧义,从而实现更稳定、更准确的意义传递。在多个骨干模型和目标语言上,CoPiT consistently outperforms direct translation,实现了显著的绝对BLEU提升,以及持续的1.5–1.6× COMET增益。这些增益使得强大的开源模型能够在可比较的评估设置下匹配或超越GPT-4.1。除了推理时的改进,CoPiT还能够直接从传统蒙古文文本构建合成平行数据,缓解现实低资源场景中的数据稀缺问题。我们发布了一个新的多文字平行数据集,涵盖了蒙古文的两种文字以及英语、韩语和俄语。所有数据集和代码已公开发布在https://anonymous.4open.science/r/anonymous_project-76C7。

# CoPiT:面向双文字低资源传统蒙古文的认知枢轴翻译

Burte Bayarsaikhan††Equal contribution.1Serynn Kim11footnotemark:12Buru Chang††Corresponding author.11韩国大学2韩国外国语大学\{burtebay,buru\_chang\}@korea\.ac\.kr serynn@hufs\.ac\.kr

## 1 引言

大型语言模型(LLMs)已从主要为单语言系统演变为通过大规模多语言预训练实现的多语言系统。尽管取得了这些进展,但LLMs在低资源语言上的表现仍然不佳,这主要是由于训练数据有限和语言资源稀疏。这一限制在机器翻译中尤为明显,机器翻译严重依赖于大型平行语料库,而这些语料库对于低资源语言通常不可用(Raja and Vats, 2025 (https://arxiv.org/html/2607.05849#bib.bib1))。

参见图注图1:蒙古文双文字现象。相同的内容可以用传统蒙古文(左)书写,具有多种表面形式和有限的资源,以及资源相对较好的西里尔蒙古文(右)书写。这些挑战在蒙古文中尤为突出,蒙古文是一种具有独特双文字特征的低资源语言,因为它使用西里尔字母和传统蒙古文两种文字书写(见图1 (https://arxiv.org/html/2607.05849#S1.F1))。西里尔蒙古文是现代主要形式,基本上是音位性的,在声音表示上具有高度一致性。相比之下,传统蒙古文是一种古老的书写系统,垂直书写,其字母形式根据位置语境而变化。许多语音和形态上的区别在文字中没有明确编码,因此一个单一的书写形式可能对应多种可能的解释。这种内在的歧义使得传统蒙古文在结构上与其西里尔对应物不同。例如,Gemini-3-Pro-Preview API 会将传统蒙古文书写的标记为有害内容,如附录 A.1 (https://arxiv.org/html/2607.05849#A1.SS1) 所示。

除了这些结构差异外,两种蒙古文文字还与显著不同的语言和计算资源水平相关联。西里尔蒙古文自通过国家语言政策制度化采用以来,一直是现代蒙古社会的主导书写系统。因此,绝大多数文本数据和语言技术都是为西里尔蒙古文开发的。相比之下,传统蒙古文虽然代表同一种语言,但通过旨在推广传统书写实践的政策驱动努力被重新引入官方使用111《蒙古语言法》于2015年2月12日通过,自2025年1月1日起生效的修正案规定,国家和地方政府事务均需同时使用西里尔蒙古文和传统蒙古文;官方文本见 https://legalinfo.mn/mn/detail/10932。由于这种延迟复兴,传统蒙古文的资源仍然严重匮乏,导致单一低资源语言内部出现层级化的资源不平衡。这种不平衡导致当前的NLP系统在两种文字之间表现出显著的性能不对称,即传统蒙古文上的性能较差。

为了解决这一差距,我们引入了一种新颖的流水线 CoPiT(Cognitive Pivot Translation),用于将传统蒙古文书写的内容翻译成其他语言。我们的流水线受到流利的蒙古语读者实际处理传统蒙古文方式的启发(Altangerel and Togtokh, 2024 (https://arxiv.org/html/2607.05849#bib.bib2))。由于西里尔蒙古文在现代使用中占主导地位,许多母语者并不以纯粹直接的方式阅读传统蒙古文。相反,他们隐式地将传统蒙古文形式映射到其西里尔对应物,并通过这种熟悉的表示来理解它们,从而以语音学上知情的方式解决文字相关的歧义。因此,我们采用西里尔蒙古文作为中间表示。虽然它仍然是低资源语言,但它比传统蒙古文提供了更音位透明且相对资源更丰富的表示,因此更有效地符合人类阅读策略和当前LLMs的优势。

具体来说,我们将机器翻译任务分解为两个连续的阶段:(1)从传统蒙古文到西里尔蒙古文的转换,然后是(2)从西里尔蒙古文到目标语言的翻译。这种设计将传统蒙古文的文字特定挑战与下游语义翻译隔离开来,同时利用了西里尔蒙古文相对更大(尽管仍然有限)的资源。

传统蒙古文到西里尔蒙古文的转换进一步分解为三个语言学上合理的步骤,这些步骤与流利的蒙古语读者使用的消歧过程一致:元音和谐恢复、拉丁辅助归一化和西里尔归一化。这些步骤共同将欠指定的传统蒙古文转换为音系上指定的西里尔表示,从而促进后续翻译为目标语言。这种对文字级别歧义的明确解决使得 CoPiT 能够在不需要大规模平行语料库的情况下翻译传统蒙古文。相反,它只需要少量数据来学习文字转换。

在基于参考、无参考和人工评估中,CoPiT consistently improves Traditional Mongolian translation into English, Korean, and Russian. 这些改进在专有和开源骨干模型中都是稳健的,微调后的开源 CoPiT 模型达到了或超过了 GPT-4.1 的直接翻译性能。除了推理时的翻译,CoPiT 还可以用于从真实的传统蒙古文来源构建合成平行数据,产生了与英语、韩语和俄语对齐的 8,034 个句子对。实验表明,这些合成数据使得目标语言→传统蒙古文的翻译成为可能,同时改进了传统蒙古文→目标语言的翻译,展示了 CoPiT 在现实低资源约束下的更广泛用途。

参见图注图2:CoPiT 的概述,一种通过西里尔蒙古文翻译传统蒙古文的流水线。我们的贡献如下:

- •我们提出了 CoPiT,一种认知驱动的多阶段流水线,通过西里尔枢轴解决文字引起的歧义,从而翻译传统蒙古文文本。
- •我们发布了一个多文字平行语料库,将传统蒙古文和西里尔蒙古文与英语、韩语和俄语对齐,填补了双文字低资源机器翻译的资源空白。
- •我们表明,CoPiT 在各种骨干模型和目标语言上 consistently outperforms direct translation,微调后的开源模型达到或超过了 GPT-4.1 的直接翻译性能。
- •我们表明,CoPiT 生成的合成数据能够实现双向翻译,同时改进了目标语言→传统蒙古文和传统蒙古文→目标语言两个方向。

## 2 相关工作

### 2.1 低资源语言处理

以往关于低资源语言处理的工作大致可以分为三个研究方向。数据驱动的方法旨在通过网络挖掘(Schwenk et al., 2021a (https://arxiv.org/html/2607.05849#bib.bib5), b (https://arxiv.org/html/2607.05849#bib.bib6))、回译(Sennrich et al., 2016 (https://arxiv.org/html/2607.05849#bib.bib7); Edunov et al., 2018 (https://arxiv.org/html/2607.05849#bib.bib8))或 LLM 生成的合成语料库(de Gibert et al., 2025 (https://arxiv.org/html/2607.05849#bib.bib9); Waldendorf et al., 2025 (https://arxiv.org/html/2607.05849#bib.bib10))来扩展平行数据。模型驱动的方法利用多语言预训练模型(Conneau et al., 2020 (https://arxiv.org/html/2607.05849#bib.bib11); Xue et al., 2021 (https://arxiv.org/html/2607.05849#bib.bib12)),但对于具有不同或多种书写系统的语言,其共享表示假设常常失效(Liu et al., 2024 (https://arxiv.org/html/2607.05849#bib.bib13))。语言学动机的方法则融入诸如音译(Ma et al., 2025 (https://arxiv.org/html/2607.05849#bib.bib14))或形态感知分词(Chaudhary et al., 2018 (https://arxiv.org/html/2607.05849#bib.bib15); Nzeyimana, 2024 (https://arxiv.org/html/2607.05849#bib.bib16))等显式知识。虽然这些方法在减少表面变异性方面有效,但并未显式建模由双文字现象引起的文字级别歧义。

我们的工作处于语言学动机建模和数据驱动增强的交汇点,因为所提出的枢轴不仅解决了文字级别歧义,而且还能够为低资源翻译创建合成平行数据。

### 2.2 蒙古语言处理

以往关于蒙古语言处理的工作大致可以根据它们处理的文字分组:西里尔蒙古文、传统蒙古文以及两者之间的转换。大多数研究集中于西里尔蒙古文,包括基准测试构建(Zhang et al., 2024 (https://arxiv.org/html/2607.05849#bib.bib17); Tumur-Ochir et al., (https://arxiv.org/html/2607.05849#bib.bib18))和语言模型预训练(Na et al., 2024b (https://arxiv.org/html/2607.05849#bib.bib19))。这些工作通常假设输入文本使用单一标准化文字书写,不考虑双文字现象带来的挑战。针对传统蒙古文的研究主要集中在经典的 NLP 任务上,如形态分析(Liu et al., 2020 (https://arxiv.org/html/2607.05849#bib.bib20); Zhang et al., 2025 (https://arxiv.org/html/2607.05849#bib.bib21)),与下游应用或基于 LLM 的框架联系有限。同时处理两种文字的工作主要将问题框定为文字转换。早期方法依赖基于规则的方法(Li and Sarina, 2011 (https://arxiv.org/html/2607.05849#bib.bib22)),随后是结合语言规则与神经模型的混合系统(Na et al., 2023 (https://arxiv.org/html/2607.05849#bib.bib23), 2024a (https://arxiv.org/html/2607.05849#bib.bib24))、编码器-解码器架构(Na et al., 2022 (https://arxiv.org/html/2607.05849#bib.bib25))以及更近期的神经机器翻译公式(Dulamragchaa et al., 2024 (https://arxiv.org/html/2607.05849#bib.bib26))。

在这项工作中,我们将文字转换视为一个结构化的推理步骤,该步骤解决文字级别歧义并产生意义一致的中间表示,从而在双文字低资源条件下实现更准确的从传统蒙古文的翻译。

## 3 CoPiT:认知枢轴翻译

### 3.1 概述

我们的任务是将传统蒙古文书写的文本翻译成目标语言。这对当前的LLMs来说具有挑战性,因为蒙古文是一种双文字低资源语言,且文字间资源严重不平衡。传统蒙古文资源极其匮乏且正字法存在歧义,导致与西里尔蒙古文相比性能显著下降,使得直接翻译变得困难。

为了应对这一挑战,我们提出了 CoPiT,一种针对传统蒙古文文本的翻译流水线。如图2 (https://arxiv.org/html/2607.05849#S1.F2) 所示,CoPiT 的认知动机来源于流利的蒙古语读者处理传统蒙古文的方式:他们并非直接解读,而是隐式地将其映射到西里尔蒙古文以解决文字引起的歧义。CoPiT 包含两个阶段:(1)传统蒙古文到西里尔蒙古文的枢轴转换,包括形态切分、多步文字消歧和句子级别的自我反思;(2)从消歧后的西里尔表示到目标语言的翻译。更多细节,包括提示设计,请参见附录 A.11 (https://arxiv.org/html/2607.05849#A1.SS11)。

### 3.2 传统蒙古文到西里尔蒙古文的枢轴转换

**形态切分**。

参见图注图3:传统蒙古文句子中基于空格的切分与形态切分的比较。如图3 (https://arxiv.org/html/2607.05849#S3.F3) 所示,传统蒙古文经常在后缀前插入空格,而不是将其附加到词干上,这种惯例使得表面空格成为不可靠的真形态边界指标(Janhunen, 2012 (https://arxiv.org/html/2607.05849#bib.bib28))。因此,形态切分需要区分真正的词汇边界和后缀附着。

该过程从简单的基于空格的拆分开始以获取候选词元,然后通过字典引导的方式合并词干和后缀。使用一个精选的后缀字典来识别应该与前一个词元组合以形成单个形态切分的后缀。这些后缀编码了必要的语法信息,如格和动词范畴。这一步产生了后续文字消歧步骤所需的形态上连贯的切分。

**多步文字消歧**。切分产生了良好的形态单位,但文字本身固有的歧义可能仍然存在于切分级别。我们通过图4 (https://arxiv.org/html/2607.05849#S3.F4) 所示的结构化多步文字消歧过程来解决这个问题。该过程使用 LLM 实现,并逐步融入显式的音系和正字法约束。

相似文章

面向多语言推理的跨语言在线策略自蒸馏

Hugging Face Daily Papers

本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。

低资源Tangkhul-英语神经机器翻译

arXiv cs.CL

介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。

CroCo:基于自生成的跨语言对比偏好调优

arXiv cs.CL

本文介绍了CroCo,一种基于自生成响应的跨语言对比偏好调优方法,表明在英语偏好上训练的奖励模型能够有效对其他语言的响应进行排序,在无需特定语言标注的情况下,提升模型在14种语言上的性能。

CopT: 用于通用与智能体推理的连续空间对比在线思考

Hugging Face Daily Papers

CopT为大型语言模型引入了一种对比性在线思考框架,首先生成草稿答案,然后通过对比验证和动态思考来提高准确性并减少token消耗。在数学、代码和智能体推理任务上,准确率最高提升23%,token使用量最多降低57%。