基于语法书的低资源机器翻译合成数据生成的析因研究

arXiv cs.CL 论文

摘要

本文介绍了一个流程,该流程使用大型语言模型从语法书中提取语法规则、示例句子和词汇表,以生成合成平行语料库,用于微调机器翻译模型,在三种低资源语言上实现了高达+8.8的ChrF++增益。

arXiv:2607.22376v1 公告类型:新 摘要:大多数濒危语言缺乏机器翻译所需的平行数据,尽管存在描述性语法书。我们引入了一个流程,使用大型语言模型从语法书中提取语法规则、示例句子和词汇表,并生成用于微调的合成平行语料库——而不是像先前工作那样在推理时将语法内容注入提示中。在三种类型多样的低资源语言——Kalamang(巴布亚语)、Tuatschin(罗曼语)和Mandan(苏族语)上验证,我们表明,在75%的Kalamang配置和59%的Tuatschin配置中,微调合成数据优于种子数据基线,最佳ChrF++增益分别为+8.8、+5.3和+3.3。通过系统性的析因研究,跨越96种配置,变化目标词性、检索粒度和样本量,我们确定了哪些因素组合驱动增益以及它们在何处失效。我们的结果表明,静态语言文档可以重新用于机器翻译微调,为严重资源不足的语言提供了一条通往翻译工具的实用路径。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:41

# 基于语法书的低资源机器翻译合成数据生成的因子研究  
来源:https://arxiv.org/html/2607.22376  
Varun Ghat Ravikumar¹,Sina Ahmadi²,Lena Jäger²,Rico Sennrich²  
1 苏黎世大学信息学系  
2 苏黎世大学计算语言学系  
{varunghat.ravikumar, sina.ahmadi, lenaann.jaeger, rico.sennrich}@uzh.ch  

###### 摘要  
大多数濒危语言缺乏机器翻译所需的平行数据,尽管存在描述性语法书。我们提出了一种流程,利用大语言模型从语法书中提取语法规则、例句和词典,并生成用于微调的合成平行语料——而不是像先前工作那样在推理时将语法内容注入提示中。我们在三种类型多样的低资源语言——Kalamang(巴布亚语)、Tuatschin(罗曼语族)和Mandan(苏语系)上进行了验证。结果表明,在75%的Kalamang配置和59%的Tuatschin配置中,基于合成数据的微调优于种子数据基线,最佳情况下的ChrF++增益分别为+8.8、+5.3和+3.3。通过系统性的因子研究(涵盖96种配置,分别变化目标词性、检索粒度和样本量),我们确定了哪些因子组合能带来提升,以及哪些情况下提升失效。我们的结果表明,静态的语言学文档可被重新用于机器翻译微调,为严重资源不足的语言构建翻译工具提供了一条实用路径。  

![[未标注图片]](https://arxiv.org/html/2607.22376v1/images/github-logo.png)  
varunghat/GrammarMT (https://github.com/varunghat/GrammarMT)  

## 1 引言  
全球7000多种语言中近一半处于濒危状态,如果保护工作不加速,许多语言可能在本世纪内消失(UNESCO, 2022 (https://arxiv.org/html/2607.22376#bib.bib1))。虽然高资源语言受益于大规模的单语和平行语料,但大多数濒危和少数民族语言缺乏这些基本训练数据(Haddow et al., 2022 (https://arxiv.org/html/2607.22376#bib.bib2))。尽管数字存在有限,许多濒危语言却拥有通过语言田野调查编写的描述性语法书(Nordhoff and Hammarström, 2011 (https://arxiv.org/html/2607.22376#bib.bib85)),然而这些数据在自然语言处理(NLP)中尚未得到充分利用。  

参考图注  
图1:方法概述。第一阶段提取语言信息(平行句、词典、规则)。第二阶段展示组合实验配置。第三阶段通过规则引导的词汇替换生成合成变体(以Tuatschin为例)。  

语法书记录了语法规则、平行句示例和词典,提供了关于形态、句法和词汇的结构化描述(Leech, 2015 (https://arxiv.org/html/2607.22376#bib.bib5))。Tanzer et al. (2024 (https://arxiv.org/html/2607.22376#bib.bib6)) 表明,用语法书内容提示LLM能改善零样本基线下的翻译质量。然而,Aycock et al. (2025 (https://arxiv.org/html/2607.22376#bib.bib17)) 观察到,LLM主要从嵌入的平行句中学习,而非原始语法描述。相比之下,Zhang et al. (2025 (https://arxiv.org/html/2607.22376#bib.bib21)) 表明,当语法规则被手动编码为结构化表示时,确实能提升翻译质量和规则检索。尽管人们对利用语法书和大语言模型(LLM)的推理能力来支持低资源NLP越来越感兴趣(Hus and Anastasopoulos, 2024b (https://arxiv.org/html/2607.22376#bib.bib81); Spencer and Kongborrirak, 2025 (https://arxiv.org/html/2607.22376#bib.bib80) 等),但叙事性描述与编码规则之间的区别尚未得到深入研究。这促使我们提出核心问题:**语法书的结构化内容能否被计算化利用,并借助明确的语法指令生成新句子?**  

我们引入了一个半自动化的框架,用于从语法书中生成合成数据,仅需极少的人工监督:每种语言约~200行标注数据用于训练句子分类器。自动化这一过程是必要的,因为手动规则编码需要专业语言学家投入精力,无法扩展到存在现有语法的数千种语言。我们的流程如图1所示,从非结构化PDF文本中提取平行句、词表和语法规则。然后,这些组件被用于生成合成平行语料:在提取的句子模板中替换单词,同时应用检索到的语法规则以保持形态和句法正确性。我们通过微调Gemini-2.5-flash,并在来自三种类型多样且严重低资源语言(Kalamang(黏着型,巴布亚语)、Tuatschin(分析型,罗曼语族)、Mandan(多式综合型,苏语系))的保留测试集上测量翻译性能,来评估生成的语料。我们选择Gemini-2.5-flash是因为其微调API可用且推理成本低。通过消融研究,我们分析了检索粒度(规则级 vs. 段落级)、目标词性和生成数量对翻译质量的影响。  

## 2 相关工作  
机器翻译(MT)性能依赖于大规模平行语料库。对于低资源语言,诸如NLLB(NLLB Team et al., 2022 (https://arxiv.org/html/2607.22376#bib.bib28))等大规模多语言模型利用高资源语言的跨语言迁移,但对于预训练数据中缺失的语言,性能显著下降(Ahmadi et al., 2025 (https://arxiv.org/html/2607.22376#bib.bib82))。回译(Sennrich et al., 2016 (https://arxiv.org/html/2607.22376#bib.bib44))从单语目标文本生成合成源句子,但需要初始翻译模型具备足够质量,而对于极端低资源语言,这往往不可用。  

Frontull and Moser (2024 (https://arxiv.org/html/2607.22376#bib.bib64)) 发现,将神经模型与显式基于规则的约束相结合,有助于在平行数据稀缺时保持结构完整性,这促使我们在流程中使用语法规则。  

另一条研究路线探索了利用描述性语法书来支持缺乏网络数据的语言的翻译。Tanzer et al. (2024 (https://arxiv.org/html/2607.22376#bib.bib6)) 表明,当用整本语法书提示LLM时,LLM能够进行翻译,尽管Aycock et al. (2025 (https://arxiv.org/html/2607.22376#bib.bib17)) 发现模型主要从嵌入的平行示例中学习,而非描述。Hus and Anastasopoulos (2024a (https://arxiv.org/html/2607.22376#bib.bib7)) 在16种语言中证实了这一发现,观察到语法书提示仅带来微小的提升,但由于注入大量token上下文,计算成本高昂。  

其他工作采用结构化检索来降低上下文注入成本(Guo et al., 2024 (https://arxiv.org/html/2607.22376#bib.bib9); Zebaze et al., 2025 (https://arxiv.org/html/2607.22376#bib.bib10)),而Zhang et al. (2024 (https://arxiv.org/html/2607.22376#bib.bib18)) 串联使用形态分析器和词典,但需要预先存在这些工具,而低资源语言通常缺乏这些工具。最近,Zhang et al. (2025 (https://arxiv.org/html/2607.22376#bib.bib21)) 将语法规则转换为可执行代码来指导翻译,取得了不错的结果,但依赖手动专家标注。  

作为直接翻译的补充,合成数据生成提供了一种替代的数据增强策略。先前工作探索了通过语言模型评分的词汇替换(Fadaee et al., 2017 (https://arxiv.org/html/2607.22376#bib.bib84))、学习联合源-目标概率(Ding et al., 2020 (https://arxiv.org/html/2607.22376#bib.bib54)),以及将形态特征与词典条目结合(Alam et al., 2024 (https://arxiv.org/html/2607.22376#bib.bib83))。Anikina et al. (2025 (https://arxiv.org/html/2607.22376#bib.bib12)) 发现,将目标语言示例与LLM修订相结合,能将与黄金标准数据的差距缩小至5%以内。在语法引导方面,Lucas et al. (2024 (https://arxiv.org/html/2607.22376#bib.bib19)) 手动构建形式语法来为瓜拉尼语生成平行语料,展示了语言约束的价值,但需要专家投入。相反,de Gibert et al. (2025 (https://arxiv.org/html/2607.22376#bib.bib13)) 在没有语法约束的情况下生成了大规模合成语料,达到了规模但缺乏形态精度。  

当前方法面临一个瓶颈:它们要么以高计算成本将整本语法书注入上下文窗口,但对语法内容的利用有限(Aycock et al., 2025 (https://arxiv.org/html/2607.22376#bib.bib17)),要么依赖手动专家标注语法规则(Zhang et al., 2025 (https://arxiv.org/html/2607.22376#bib.bib21))。此外,检索增强方法(Guo et al., 2024 (https://arxiv.org/html/2607.22376#bib.bib9); Zebaze et al., 2025 (https://arxiv.org/html/2607.22376#bib.bib10))在推理时运行,并未解决微调模型的训练数据稀缺问题。现有的生成训练数据的增强方法依赖单语LM概率(Fadaee et al., 2017 (https://arxiv.org/html/2607.22376#bib.bib84))或无约束的LLM生成(de Gibert et al., 2025 (https://arxiv.org/html/2607.22376#bib.bib13))。目前没有方法能够在最少人工干预下自动解析语法书,专门为机器翻译模型创建合成训练数据。我们的工作填补了这一空白。  

## 3 方法  
### 3.1 语言信息提取  
描述性语法书包含格式各异的平行句示例。典型的示例在视觉上由一个或多个源语-注释行对组成,其中每个源语行紧跟其逐词素注释,最后以英语翻译结尾。每个示例中的源语-注释行对数量随句子长度变化,且这些组件并不总是有视觉分界。我们通过两步流程提取这些三元素组:  

- • 首先将PDF文本转换为逐行文本,按垂直坐标从上到下排序。一个句子可能跨越多行;此阶段在原始行上操作,而非语言单位。  
- • 然后,针对每种语言,在约200行手动标注示例上微调一个BERT¹分类器(bert-base-multilingual-cased)(Devlin et al., 2019 (https://arxiv.org/html/2607.22376#bib.bib68)),以识别源语行、注释行和翻译行²。  

连续具有相同标签的行被合并,以重建完整的源语句子、注释和翻译。我们应用基于规则的后期校正,利用期望的三元素组结构来修复偶尔的分类错误。分类器将每个候选行及其前后各3行的上下文窗口作为输入。输入特征包括文本上下文和几何属性(边界框坐标、行宽、宽高比)。提取后,我们使用spaCy(en_core_web_sm)(Honnibal et al., 2020 (https://arxiv.org/html/2607.22376#bib.bib69)) 解析英语翻译,以获得形态句法元数据(例如时态、数、词性标签)。  

#### 章节和词典提取。  
为了隔离语法内容,我们实现了一种启发式算法,基于字体大小统计检测章节标题,将前三个不同的尺寸识别为层级结构。非语法章节(例如“致谢”、“社区历史”)通过基于嵌入的语义相似度进行过滤:我们使用all-MiniLM-L6-v2句子嵌入(Sentence-Transformers Team, 2025 (https://arxiv.org/html/2607.22376#bib.bib59))计算章节标题与目标类别(例如“形态学”、“句法学”)之间的余弦相似度。我们只保留相似度得分高于所有候选章节中位数得分的章节。此外,通过基于嵌入的关键词搜索(“词表”、“词典”)识别出的词汇表章节中,半自动提取词表。我们去除重复条目,并使用spaCy标注词性标签。  

| 语言 | 平行句 | 形态句 | 词表 | 词典条目 | 句子规则 | TTR | 句长(词) | 句长(字符) |
|---|---|---|---|---|---|---|---|---|
| Kalamang | 2,558 | 761 | 399 | 0 | 36 | 6.3 | 4.5 |
| Tuatschin | 1,788 | 981 | 144 | 0 | 24 | 11.6 | 3.8 |
| Mandan | 459 | 92 | 151 | 9 | 0.64 | 4.0 | 7.0 |

表1:提取的信息和语料统计,包括类型-词符比(TTR),长度以词和字符计。Mandan的高TTR(0.64)和词长(7.0)反映了其多式综合形态。  

#### 规则提取与编码。  
为了将叙事性语法描述转换为编码规则,我们使用Gemini-2.5-flash(Google DeepMind, 2023 (https://arxiv.org/html/2607.22376#bib.bib58))进行两阶段提取。首先,超过500词的章节通过检测句子嵌入相似度的主题转移进行语义切块。我们设置此阈值以平衡切块连贯性与规则提取的充分上下文。然后提示Gemini提取符合UniMorph标注模式(Batsuren et al., 2022 (https://arxiv.org/html/2607.22376#bib.bib53))的规则。每条规则是一个结构化的YAML对象,包含:目标词性、词缀类型(例如后缀、附着语素)、UniMorph特征-值对(例如CASE:ACC)和上下文依赖(例如“适用于以辅音结尾的词干”)。其次,对提取的规则进行去重,并转换为确定性的伪代码函数(ApplyRule(STEM, POS)),以确保在合成过程中无歧义地应用。此编码步骤将同一规则的多个描述整合为单一规范表示。此阶段的结果总结于表1。  

### 3.2 合成语料构建  
基于提取的信息,我们通过受约束的词汇替换合成生成句子,考虑如图2所示的三个因素:  

**目标词性(4种)**  
**检索粒度(2级)**  
**样本量k,k(4级)**  

提取的平行句(约400句)  
按目标词性筛选可替换词  
名词 动词 形容词 副词  
规则级 段落级 规则级 段落级 规则级 段落级 规则级 段落级  
k∈{5,10,15,20} k∈{5,10,15,20}  
每组合的句子数  
4×2×4=32种配置/语言  
×3种语言 = 96个实验  

图2:实验设计。种子语料按目标词性过滤,选择包含该类别可替换词的句子。每个子集在检索粒度和样本量k上变化。所有32种配置均独立评估每种语言。  

#### 因子1:词性(POS)。  
对于每个平行句,我们识别一个属于开放式词类(即名词、动词、形容词或副词)的可替换实词,使用贪心字符串匹配与词典进行匹配,并通过与spaCy解析的英语注释对齐来消除歧义。没有词典匹配的句子将从该词性配置中排除。然后,我们从匹配目标词性的词典子集中检索替换词,按all-Mi

相似文章

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。