使用渐进微调序列到序列Transformer的上下文泰米尔语拼写和语法纠正

arXiv cs.CL 论文

摘要

本文提出了一种端到端的序列到序列方法,用于上下文泰米尔语拼写和语法纠正,使用在合成数据上渐进微调的mT5和mBART模型,在诊断集上实现了69.3%的精确匹配准确率。

arXiv:2609.03273v1 公告类型:新 摘要:泰米尔语拼写和语法纠正具有挑战性,因为泰米尔语是一种黏着性低资源语言,具有丰富的动词形态、词边界的复杂sandhi(语音转换)规则,以及由247个不同字母组成的文字。先前的工作针对词级表面错误,采用基于规则的方法、统计n-gram模型、最小编辑距离或带有Transformer重排序器的混合流水线;这些方法无法可靠地处理上下文错误——主谓一致、时态一致性或跨词sandhi——这些需要句子级的理解。我们提出了一种端到端的序列到序列公式,并在最多657,720个噪声-干净泰米尔语句子对的合成语料库上微调了mT5-small和mBART-50,涵盖十个错误类别。两个骨干网络遵循相同的四阶段渐进调度,每个阶段针对一个弱点:表面噪声(v2)、上下文语法(v3)、单站点sandhi(v4)和多站点跨词sandhi(v5)。在验证与所有训练数据不相交的1,000句平衡诊断集上,我们最好的模型mBART-50 v5达到了69.3%的top-1精确匹配准确率,其中sandhi为87.5%,主谓一致为43.5%。该调度产生了这些收益:一旦引入上下文对,主谓一致准确率从1.0%上升到52.5%,而sandhi一旦引入多站点sandhi对,从0%上升到87.5%。我们还量化了本研究文献中未报告的精确率-召回率权衡:sandhi的召回率以恒定方式在身份准确率中付出代价。最后,Tamil-LLaMA-7B-Instruct在零样本下达到19.0%,在三个示例下达到24.7%,相比之下复制基线为20.0%,这表明泰米尔语适配的指令模型在没有任务特定监督的情况下,无法转移到专门的句子级纠正。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:57

# 基于渐进式微调序列到序列Transformer的泰米尔语上下文拼写与语法纠正
来源:https://arxiv.org/html/2609.03273

[扩展名 = .otf,正文字体 = *-常规,粗体字体 = *-粗体,斜体字体 = *-斜体,粗斜体字体 = *-粗斜体]

Karthikeyan A  
附属机构:国家技术学院,蒂鲁吉拉帕利  
附属机构:电子邮件:[[email protected]](mailto:[email protected])

Jaya Nirmala S  
附属机构:国家技术学院,蒂鲁吉拉帕利  
附属机构:电子邮件:[[email protected]](mailto:[email protected])

Sangeetha Sivanesan  
附属机构:国家技术学院,蒂鲁吉拉帕利  
附属机构:电子邮件:[[email protected]](mailto:[email protected])

Pranav Kumar  
附属机构:国家技术学院,蒂鲁吉拉帕利  
附属机构:电子邮件:[[email protected]](mailto:[email protected])

Bharat Jude Johnson  
附属机构:国家技术学院,蒂鲁吉拉帕利  
附属机构:电子邮件:[[email protected]](mailto:[email protected])

Vishnu Ram  
附属机构:国家技术学院,蒂鲁吉拉帕利  
附属机构:电子邮件:[[email protected]](mailto:[email protected])

###### 摘要
泰米尔语的拼写和语法纠正具有挑战性,因为它是一种黏着性低资源语言,具有丰富的动词形态变化、词边界处复杂的连音(语音转换)规则,以及由247个不同字母组成的文字系统。先前的工作针对词级表面错误,采用基于规则的方法、统计n-gram模型、最小编辑距离或带有Transformer重排序器的混合流程;这些方法无法可靠地处理上下文错误——如主谓一致、时态一致性或跨词连音——这些需要句子级的理解。我们提出了一种端到端的序列到序列建模方法,并在包含多达657,720个泰米尔语嘈杂-干净句对(涵盖十类错误)的合成语料库上对mT5-small和mBART-50进行了微调。两个骨干模型遵循相同的四阶段渐进式训练计划,每个阶段针对一个弱点:表面噪声(v2)、上下文语法(v3)、单点连音(v4)和多点跨词连音(v5)。在一个经验证与所有训练数据不相交的1000句平衡诊断集上,我们最好的模型mBART-50 v5达到了69.3%的top-1精确匹配准确率,其中连音准确率为87.5%,主谓一致准确率为43.5%。这种训练计划正是产生这些改进的原因:一旦引入上下文句对,主谓一致准确率从1.0%上升到52.5%;一旦引入多点连音句对,连音准确率从0%上升到87.5%。我们还量化了本文献此前未报告的精度-召回率权衡:连音召回率的提高是以身份准确率的单调下降为代价的。最后,Tamil-LLaMA-7B-Instruct在零样本下达到19.0%,在提供三个示例后达到24.7%,而复制基线为20.0%,这表明一个适配泰米尔语的指令模型在没有任务特定监督的情况下,无法迁移到专门的句子级纠正任务。

## 1 引言
泰米尔语是世界上最古老的古典语言之一,拥有超过7500万使用者,其文学传统跨越两千多年。它使用12个元音(*uyir ezhuthukal*)、18个辅音(*mei ezhuthukal*)和216个复合字符(*uyirmei ezhuthukal*)——总共247个不同的字母。其黏着形态将时态、人称、性别、数和敬语信息打包在单个动词词尾中,这意味着拼写和语法的正确性深度交织且依赖于上下文。虽然英语和印地语的拼写纠正已被广泛研究,但泰米尔语受到的关注相对有限。在英语中,错误大多在表面层面,可以通过在大型数据集上训练的编辑距离模型纠正。在泰米尔语中,错误远不止字符级别的错误。泰米尔语单词 பழம்(“水果”)和 பலம்(“力量”)只相差一个字母,但含义完全不同。泰米尔语还遵循严格的连音规则:短语 அதை கொண்டு வா(“带来那个”)应写作 அதைக் கொண்டு வா,其中插入了辅音 க்,这是因为*vallinam*触发的转换。泰米尔语的黏着特性和低资源环境共同使得泰米尔语拼写纠正比高资源语言困难得多。现有的泰米尔语拼写纠正方法在三个维度上存在困难。首先,它们通常只处理有限的错误类型(通常是表面层面的语音替换),而忽略了上下文错误。其次,它们通常生成一个候选词排序列表,而不是单个纠正结果,这不适用于实时应用。第三,近期结合Transformer重排序和统计检索的混合工作,仅将Transformer用作评分函数,未利用其生成能力。这些方法中没有一种能可靠地处理句子级的主谓一致、时态一致性或跨词连音问题。为应对这些挑战,本工作:1. 提出一种端到端的序列到序列建模方法,微调mT5-small和mBART-50以直接将嘈杂的泰米尔语句子映射到干净句子,而不是将Transformer用作候选重排序器;2. 对两个骨干模型应用相同的四阶段渐进式计划(v2→v5),将课程学习的贡献与架构的贡献区分开;3. 开发一个噪声生成流程,在十类错误上生成657,720个训练句对,包括从语料库挖掘的一致性错误和多点跨词连音违规,每个阶段按70/20/10的比例划分;4. 在一个经验证与训练数据不相交的1000句平衡诊断集上进行评估,报告top-1精确匹配准确率,而非先前上下文无关工作中使用的top-k准确率;5. 在提示选择下,与Tamil-LLaMA(Balachandran, 2023 (https://arxiv.org/html/2609.03273#bib.bib1))进行受控比较,并与一个设定性能下限的简单复制基线进行比较。

图1(https://arxiv.org/html/2609.03273#S1.F1)展示了整体概况:数据集构建、渐进式微调和单次推理。

[图1说明:总体系统架构。(a) 干净的泰米尔语维基百科文本经过三个生成器,注入表面、上下文和连音错误。(b) 一个骨干模型在四个阶段中进行微调,每个阶段从上一个检查点恢复,并添加一个新的错误类别加上一个重放样本以防止灾难性遗忘;v4和v5都从v3恢复。(c) 在推理时,一个句子通过一次前向传播得到纠正。]

泰米尔语维基百科(≈1700万词) → 清洗、去重、长度过滤(3-50词) → 120万干净泰米尔语句子 → 三个生成器:上下文错误生成器(575,000对,10种上下文类型)、表面噪声生成器(500,000对,5种表面类型)、连音违规生成器(30k单点,40k多点) → (a) 数据集构建

预训练骨干模型 mT5-small / mBART-50 → 阶段1 (v2) 表面噪声 → 阶段2 (v3) 上下文语法 → 阶段3 (v4) 单点连音 → 阶段4 (v5) 多点连音 → 最终检查点 mBART-50 v5
(训练数据:500k表面 + 575k上下文 + 82.7k增强;30k连音 + 30k重放;40k多点 + 20k重放;从v3恢复) → (b) 渐进式微调

嘈杂泰米尔语句子 → Unicode规范化 (NFC, 标点) → SentencePiece分词器 (ta_IN语言标签) → 编码器 (12层) → 解码器 (beam=4, no-repeat 3) → 纠正后的泰米尔语句子 → (c) 单次推理

## 2 相关工作

#### 基于规则和统计的方法。
Parthasarathi等人 (2003)(https://arxiv.org/html/2609.03273#bib.bib10)提出了一种基于形态分析和语言规则的拼写检查器;该工作未报告定量评估,而基于规则的系统普遍难以扩展到多样化的错误模式或未见过的单词。Solthiruthi(Elanjelian等人,2004(https://arxiv.org/html/2609.03273#bib.bib4))和Vaani(Rajaraman,2014(https://arxiv.org/html/2609.03273#bib.bib12))是同一类别中公开可用的工具。Segar和Sarveswaran (2015)(https://arxiv.org/html/2609.03273#bib.bib16)提出了一种基于二元组的上下文拼写检查器,达到89.13%的准确率;其两词上下文窗口是主要限制,因为泰米尔语语法依赖经常跨越两个以上的词。Sakuntharaj和Mahesan (2016)(https://arxiv.org/html/2609.03273#bib.bib13)引入了一种混合树状n-gram方法,报告在非词错误上准确率为91%,而Sakuntharaj和Mahesan (2018)(https://arxiv.org/html/2609.03273#bib.bib14)在每个词单独有效的强假设下报告了98%的真词错误准确率。Kumar等人 (2020)(https://arxiv.org/html/2609.03273#bib.bib7)使用最小编辑距离进行泰米尔语纠正。

#### 深度学习和混合方法。
Etoori等人 (2018)(https://arxiv.org/html/2609.03273#bib.bib5)引入了用于印地语和泰卢固语拼写纠正的序列到序列深度学习模型,通过生成合成训练对来克服低资源限制;他们没有将该方法扩展到泰米尔语,也没有建模泰米尔语特有的现象,如连音。Sampath和Shanmugavel (2023)(https://arxiv.org/html/2609.03273#bib.bib15)结合了编辑距离、Soundex匹配、基于规则的纠正和LSTM评分组件,达到了95.67%的准确率。更新的混合方法集成了MED、n-gram概率、FastText(Bojanowski等人,2017(https://arxiv.org/html/2609.03273#bib.bib2))嵌入和预训练Transformer重排序器;虽然对排序表面级候选词有效,但此类方法不生成纠正结果,无法修正候选生成器未提出的语法错误。Sharma和Bhattacharyya (2025)(https://arxiv.org/html/2609.03273#bib.bib17)在低资源环境下探索了密切相关的印地语语法纠正问题,比较了直接噪声注入、往返翻译和神经错误生成——证明了合成数据策略是应对缺乏标注印度语GEC语料库的标准答案。泰米尔语特定的神经工作包括DDSpell(Uthayamoorthy等人,2019(https://arxiv.org/html/2609.03273#bib.bib21))、一个上下文感知的僧伽罗语-泰米尔语纠正环境(Sithamparanathan和Uthayasanker,2019(https://arxiv.org/html/2609.03273#bib.bib19))和一个RoBERTa拼写检查器(Rajalakshmi等人,2023(https://arxiv.org/html/2609.03273#bib.bib11)),所有这些都评判预先列举的候选词,而不是生成纠正后的句子。

#### 用于序列到序列纠正的多语言Transformer。
Xue等人 (2021)(https://arxiv.org/html/2609.03273#bib.bib22)介绍了mT5,一个在包括泰米尔语在内的101种语言上使用mC4语料库预训练的多语言文本到文本Transformer。Liu等人 (2020)(https://arxiv.org/html/2609.03273#bib.bib8)和Tang等人 (2020)(https://arxiv.org/html/2609.03273#bib.bib20)开发了mBART及其50语言扩展,两者都使用概念上接近拼写纠正的去噪序列到序列目标进行预训练。Elango和Pati (2023)(https://arxiv.org/html/2609.03273#bib.bib3)微调了一个多语言T5用于泰米尔语错误纠正,Yazhmozhi VM等人 (2026)(https://arxiv.org/html/2609.03273#bib.bib24)在单个错误类别上比较了mBART、mT5和NLLB(NLLB Team等人,2024(https://arxiv.org/html/2609.03273#bib.bib9));据我们所知,没有一项将这些骨干模型应用于跨越表面、一致性和跨词连音错误的完整分类法的单一句子级模型。

#### Mayangoli特定纠正。
与我们设置最接近的是TamilMayangoliSpell(Yazhmozhi VM等人,2026(https://arxiv.org/html/2609.03273#bib.bib24)),它同样在合成泰米尔语对上微调多语言序列到序列模型,并使用mT5报告了93.50%的精确匹配。它针对单一类别——语音相似字形之间的Mayangoli混淆(ல/ள/ழ,ர/ற,ந/ன/ண),对应于我们仅有的语音类别——替换被限制为词典内有效词,并明确排除连音、Kuril–Nedil和非词错误。它在与训练使用的相同诱导分布的10%分割上进行评估,每句一个错误且没有无编辑项。其流程、数据和模型已公开发布,我们的工作尚未达到这一点。

#### 适配泰米尔语的大型语言模型。
Tamil-LLaMA(Balachandran,2023(https://arxiv.org/html/2609.03273#bib.bib1))通过添加16K泰米尔语词元扩展了LLaMA-2-7B,在泰米尔语文本上进行持续预训练并应用指令微调。其在专注的拼写纠正任务上的性能此前未被测量。与先前的泰米尔语特定工作相比,我们的方法(i)使用端到端序列到序列生成,而非检索加排序,(ii)涵盖十类错误,包括一致性和跨词连音,而非单一混淆类别,(iii)在经验证与训练数据不相交的平衡集上报告top-1准确率,包含一个200项的身份切片和一个设定性能下限的复制基线,以及(iv)直接与一个适配泰米尔语的LLM进行比较。

## 3 数据集创建
大规模标注泰米尔语错误语料库的短缺是深度学习方法应用于泰米尔语拼写纠正的核心障碍。现有资源未能捕捉用户实际错误的多样性,特别是上下文现象。因此,我们通过向干净的泰米尔语文本注入受控噪声来构建合成数据集。本工作中的所有训练和评估对在此意义上都是合成的;没有公开可用的真实标注泰米尔语拼写错误语料库。

### 3.1 语料库
我们使用泰米尔语维基百科数据集(Gaurav和Wikipedia Contributors,2019(https://arxiv.org/html/2609.03273#bib.bib6))作为干净泰米尔语文本的来源,包含约1700万词。预处理流程移除非泰米尔字符、英文单词、XML标签、括号内容和标点符号。在去重和长度过滤(每句3到50词)后,我们获得约120万个干净的泰米尔语句子,这构成了噪声生成的基础。百科全书式的散文在语域、句子长度和词汇上与拼写检查器最常用的即时消息、搜索和学生写作环境不同,因此训练语料库和诊断集都继承了维基百科的领域偏差。泰米尔语维基百科内容在CC BY-SA 4.0许可下使用,与其用于研究目的的意图一致。

表1:基础50万对表面噪声数据集中的表面级错误类别。
表2:75,000对上下文增强集中的上下文错误类别。

### 3.2 错误类别
我们的错误分类法包含十个类别,旨在覆盖泰米尔语作者通常产生的错误范围。这些类别分为两组:无需句子上下文即可检测的表面级错误,以及需要理解周围单词的上下文错误。表1(https://arxiv.org/html/2609.03273#S3.T1)列出了基础500,000对数据集中使用的表面类型;表2(https://arxiv.org/html/2609.03273#S3.T2)列出了在75,000对增强集中引入的上下文类别。连音违规在结构上是独特的,因为它们在词边界处起作用,并通过为v4和v5分别生成的专门数据集(第3.4节(https://arxiv.org/html/2609.03

相似文章

基于图的噪声ASR音素错误纠正

arXiv cs.CL

提出G-SPIN,一个轻量级框架,结合音素图建模与上下文语言理解来纠正ASR错误。使用GNN生成音素合理的候选词元,MLM进行局部评分,LLM进行最终重新排序,所有操作均在推理时进行。

分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

arXiv cs.CL

本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。