MudawanSn:用于机器翻译的沃洛夫语-阿拉伯语高质量平行语料库
摘要
本文介绍了MudawanSn,一个用于沃洛夫语-阿拉伯语机器翻译的高质量平行语料库,并展示了在该语料库上进行微调可以显著提高两个语言方向的翻译质量。
arXiv:2609.17539v1 公告类型:新
摘要:我们介绍MudawanSn,一个包含1,271个句子对齐对的黄金标准资源,这些对是从沃洛夫语手工翻译为现代标准阿拉伯语(MSA)。源文本取自MasakhaNER语料库,涵盖塞内加尔新闻话语中的政治、社会、宗教和体育。尽管FLORES-200和NTREX等多语言资源包含沃洛夫语和阿拉伯语,但没有公开可用的平行语料库专门针对沃洛夫语-现代标准阿拉伯语语言对。我们描述了语料库构建协议、句子对齐过程和质量控制工作流程。我们对四个跨越三个架构族的机器翻译系统进行了基准测试:NLLB-200 (600M)、mT5-base和两个AfriNLLB变体,表明在MudawanSn上进行微调可以显著提高两个翻译方向的性能。表现最佳的模型AfriNLLB-12在沃洛夫语到阿拉伯语的翻译中达到了7.76 BLEU和30.72 chrF++,在阿拉伯语到沃洛夫语的翻译中达到了8.75 BLEU和33.08 chrF++。该语料库根据CC BY-NC许可证发布,可在Hugging Face和GitHub上公开获取。
查看缓存全文
缓存时间: 2026/09/17 08:45
# MudawanSn:用于机器翻译的黄金标准沃洛夫语-阿拉伯语平行语料库 来源:https://arxiv.org/html/2609.17539 蒂埃尔诺·迪奥普 教授 塞内加尔国民教育部 thiernodiop0@gmail\.com ###### 摘要 我们推出了 MudawanSn,一个黄金标准资源,包含 1,271 个手动从沃洛夫语翻译为现代标准阿拉伯语(MSA)的句子对齐平行对。源文本选自 MasakhaNER 语料库(Adelaniet al., 2022b (https://arxiv.org/html/2609.17539#bib.bib1)),涵盖塞内加尔新闻论述中的政治、社会、宗教和体育等领域。尽管像 FLORES-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))和 NTREX(Federmannet al., 2022 (https://arxiv.org/html/2609.17539#bib.bib34))这样的多语言资源同时包含沃洛夫语和阿拉伯语翻译,但据我们所知,此前尚无公开可用的、专门针对沃洛夫语-现代标准阿拉伯语语言对设计的平行语料库。我们描述了语料库的构建协议、句子对齐流程以及质量控制工作流程。我们对四个跨越三种架构族的机器翻译系统进行了基准测试:NLLB-200(600M)、mT5-base 以及两个 AfriNLLB 变体,结果显示,在 MudawanSn 上进行微调在两个翻译方向上都带来了显著的改进。性能最佳的模型 AfriNLLB-12 在沃洛夫语到阿拉伯语翻译中取得了 7.76 BLEU 和 30.72 chrF++,在阿拉伯语到沃洛夫语翻译中取得了 8.75 BLEU 和 33.08 chrF++。该语料库在 CC BY-NC 许可下发布,并在 Hugging Face 和 GitHub 上公开提供。 MudawanSn:用于机器翻译的黄金标准沃洛夫语-阿拉伯语平行语料库 穆罕默德·姆巴耶 NLP 工程师 GalsenAI 实验室 mouhamed\.mbaye@galsen\.ai 蒂埃尔诺·迪奥普 教授 塞内加尔国民教育部 thiernodiop0@gmail\.com ## 1 引言 沃洛夫语是塞内加尔、冈比亚和毛里塔尼亚约一千万使用者日常交流的主要语言,在多语环境中与各自国家的官方语言并存(Robert, 2024 (https://arxiv.org/html/2609.17539#bib.bib8))。尽管使用者群体庞大,沃洛夫语在自然语言处理研究中的代表性仍然严重不足。现有的少数平行资源几乎都将沃洛夫语与法语配对,反映了塞内加尔的殖民和行政背景,但完全忽略了其他文化上相关的语言对。 沃洛夫语-现代标准阿拉伯语(MSA)语言对就是这样一个例子。塞内加尔是一个以穆斯林为主的国家,通过古兰经教育拥有悠久的阿拉伯语识字传统,这催生了沃洛夫阿语(Wolofal)——一种基于阿拉伯语的阿贾米文字系统,用于书写沃洛夫语(Ngom, 2017 (https://arxiv.org/html/2609.17539#bib.bib10))。尽管有这些历史和文化联系,沃洛夫语-MSA 语言对的现代 NLP 资源仍然稀缺。虽然像 FLORES-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))、NTREX(Federmannet al., 2022 (https://arxiv.org/html/2609.17539#bib.bib34))和 FineTranslations(Penedoet al., 2026 (https://arxiv.org/html/2609.17539#bib.bib11))这样的多语言资源包含沃洛夫语和阿拉伯语,但它们并非专门为该语言对设计的、经过人工整理的平行语料库。据我们所知,此前从未为沃洛夫语-MSA 机器翻译开发过公开可用的、人工翻译的、黄金标准平行语料库。因此,像 NLLB-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))这样的多语言系统在技术上支持这两种语言,但我们的基准测试结果表明,它们在该语言对上的零样本翻译质量仍然非常有限。 为了弥合这一差距,我们推出了 MudawanSn,一个公开可用的沃洛夫语-阿拉伯语平行语料库。该数据集包含 1,271 个手动从沃洛夫语翻译为现代标准阿拉伯语(MSA)的句子对齐对,源自 MasakhaNER 语料库(Adelaniet al., 2022b (https://arxiv.org/html/2609.17539#bib.bib1))中的塞内加尔新闻文章。我们的主要贡献如下: - • 发布 MudawanSn,一个公开可用的黄金标准沃洛夫语-MSA 平行语料库,包含 1,271 个手动翻译并经过句子对齐的平行对,随附完整的文档和可复现资源。 - • 提供一个详细且可复现的构建黄金标准平行语料库的协议,适用于此前资源匮乏的语言对。该协议涵盖句子提取与翻译、多语言源对齐、使用 LASER3(Heffernanet al., 2022 (https://arxiv.org/html/2609.17539#bib.bib18))进行跨语言语义验证,以及严格的质量控制流程。 - • 对四种机器翻译架构进行基准测试:NLLB-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))、mT5-base(Xueet al., 2021 (https://arxiv.org/html/2609.17539#bib.bib30))以及两个 AfriNLLB 变体(Moslemet al., 2026 (https://arxiv.org/html/2609.17539#bib.bib29)),结果表明,微调在两个方向上都显著提升了翻译质量,其中 AfriNLLB-12 总体性能最佳(第 4 节 (https://arxiv.org/html/2609.17539#S4))。 ## 2 相关工作 数据论文的贡献最好通过将其置于现有语言资源的背景下来理解。因此,我们回顾(i)涉及沃洛夫语的平行语料库,(ii)同时包含沃洛夫语和阿拉伯语的多语言资源,以及(iii)MudawanSn 所解决的具体空白。表 1(https://arxiv.org/html/2609.17539#S2.T1)总结了本节讨论的主要资源。 表 1:与沃洛夫语-现代标准阿拉伯语机器翻译相关的现有资源比较。“Pub.?”表示无限制的公开可用性;“Transl.”指定翻译是人工生成还是机器生成。 ### 2.1 涉及沃洛夫语的平行语料库 在过去几年中,沃洛夫语在 NLP 领域受到了越来越多的关注,导致发布了若干平行和多语言资源。然而,这些资源主要将沃洛夫语与法语或英语配对,或者将其作为大规模多语言集合中的一种语言。表 1(https://arxiv.org/html/2609.17539#S2.T1)总结了下面讨论的主要资源。 #### 法语-沃洛夫语。 早期的沃洛夫语机器翻译工作几乎完全集中在法语上。SENCORPUS(Ngueret al., 2020 (https://arxiv.org/html/2609.17539#bib.bib31))是最早为神经机器翻译开发的法语-沃洛夫语平行语料库之一,涵盖教育、宗教、立法和社会等多个领域。MAFAND-MT(Adelaniet al., 2022a (https://arxiv.org/html/2609.17539#bib.bib33))随后推出了一个公开可用的、手动翻译的沃洛夫语子集,包含从四个塞内加尔新闻渠道收集的 6,366 个句子对。最近,Mbaye 等人(Mbayeet al., 2023 (https://arxiv.org/html/2609.17539#bib.bib39))发布了一个规模更大的法语-沃洛夫语语料库,包含 123,000 个句子对,用于神经机器翻译实验。然而,与 MAFAND-MT 不同的是,SENCORPUS 和 Mbaye 等人的语料库仍未向研究界开放,限制了可复现性和下游重用。 #### 英语-沃洛夫语。 沃洛夫语也出现在多语言评估基准中。FLORES-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))提供专业翻译的评估集,涵盖 200 种语言,包括沃洛夫语和现代标准阿拉伯语;而 NTREX-128(Federmannet al., 2022 (https://arxiv.org/html/2609.17539#bib.bib34))包含 128 种语言的专业翻译新闻测试集。这些基准旨在评估而非模型训练,因此不提供用于开发机器翻译系统的大规模平行语料库。 #### 大规模多语言资源。 近期的多语言计划进一步扩展了沃洛夫语的覆盖范围。NLLB-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))、MADLAD-400(Kuduguntaet al., 2023 (https://arxiv.org/html/2609.17539#bib.bib35))、SMOL(Caswellet al., 2025 (https://arxiv.org/html/2609.17539#bib.bib37))和 FineTranslations(Penedoet al., 2026 (https://arxiv.org/html/2609.17539#bib.bib11))都将沃洛夫语纳入数百种语言之中。这些资源主要针对广泛的多语言覆盖和大规模模型预训练,而非为特定语言对开发高质量的平行语料库。特别是,FineTranslations 主要依赖自动生成的翻译,而非人工整理的双语数据。 #### 缺失的部分。 尽管取得了这些重要进展,公开可用的沃洛夫语平行资源仍然主要集中在法语或英语上,无论是直接配对还是通过多语言集合。据我们所知,此前从未公开发布过专门为沃洛夫语-现代标准阿拉伯语语言对开发的、人工翻译的、黄金标准平行语料库。MudawanSn 通过提供这样的资源以及可复现的构建协议和机器翻译基准来填补这一空白。 ### 2.2 涉及阿拉伯语和非洲语言的平行语料库 虽然阿拉伯语在多语言机器翻译基准中被广泛代表,但专门针对阿拉伯语与撒哈拉以南非洲语言配对的平行资源,与以英语或法语为中心的资源(Adelaniet al., 2022a (https://arxiv.org/html/2609.17539#bib.bib33); NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))相比仍然相对稀少。最大的多语言集合,包括 OPUS(Tiedemann, 2012 (https://arxiv.org/html/2609.17539#bib.bib41))、NLLB-200(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5))和 MADLAD-400(Kuduguntaet al., 2023 (https://arxiv.org/html/2609.17539#bib.bib35)),都将阿拉伯语与众多非洲语言一同包含在内。然而,许多非洲-阿拉伯语言对是通过多语言迁移或枢轴翻译来支持的,而非专门的双语平行语料库(NLLB Team, 2024 (https://arxiv.org/html/2609.17539#bib.bib5); Kuduguntaet al., 2023 (https://arxiv.org/html/2609.17539#bib.bib35))。 其次,最近针对阿拉伯语的、以非洲为重点的机器翻译项目,包括正在进行的 AfriNLLB 倡议(Moslemet al., 2026 (https://arxiv.org/html/2609.17539#bib.bib29)),大规模地解决了资源稀缺问题,但尚未提供针对特定非洲-阿拉伯语言对的、经过整理的、句子对齐的、黄金标准语料库。这仍然是一个重要的限制,因为多语言迁移和低资源语言对之间的零样本翻译通常表现不佳,不如在直接平行数据上微调的系统(Fanet al., 2021 (https://arxiv.org/html/2609.17539#bib.bib42); Adelaniet al., 2022a (https://arxiv.org/html/2609.17539#bib.bib33))。这一限制也在我们的实验中(第 4 节 (https://arxiv.org/html/2609.17539#S4))得到体现,多语言模型在微调 MudawanSn 之前表现出非常弱的零样本性能。最近的塞内加尔 NLP 综述(Mbayeet al., 2026 (https://arxiv.org/html/2609.17539#bib.bib36))同样指出,缺乏公开可用的沃洛夫语-阿拉伯语资源是未来研究的一个重要空白。 ### 2.3 我们贡献的定位 我们的语料库解决了上述两个交叉空白。据我们所知,这是第一个公开可用的、人工整理的、直接将沃洛夫语与现代标准阿拉伯语在新闻领域进行句子级别配对的平行资源。 MudawanSn 与以前的资源在三个方面有所不同。首先,它是*黄金标准*的:每个句子对都是经过人工翻译和人工验证的,这与大规模多语言集合中通过网络挖掘或枢轴翻译得到的阿拉伯-非洲数据形成对比。其次,它是*新闻领域且具有文化背景*的:源文本来自 MAFAND-MT 涵盖的四个塞内加尔新闻渠道,将语料库锚定在沃洛夫语使用者社区直接相关的语域和内容领域中。第三,它是*完全可溯源的*:通过第 3 节(https://arxiv.org/html/2609.17539#S3)描述的匹配程序,每个句子对都可以追溯到其上游来源,支持那些希望控制源语域或领域的下游研究。 ## 3 语料库构建与质量控制 为一个没有先前双语资源的语言对构建高质量的平行语料库,需要一个确保翻译保真度和对齐正确性的多阶段流程。因此,我们设计并执行了一个端到端的流程,用于清理、丰富、对齐和语义验证手动翻译的句子对,最终得到一个经过验证的黄金标准资源。图 1(https://arxiv.org/html/2609.17539#S3.F1)概述了整个流程。 ### 3.1 源数据与来源 沃洛夫语源句选自 MasakhaNER 语料库(Adelaniet al., 2022b (https://arxiv.org/html/2609.17539#bib.bib1)),该语料库聚合了来自四个主要塞内加尔在线新闻机构的文章:Seneweb、Jotna News、YerimPost 和 SocialNetLink。这些文本代表了当代书面沃洛夫语,涵盖了塞内加尔公共论述中政治、社会、宗教和体育等不同主题领域。 我们选择 MasakhaNER 作为来源有三个科学原因。首先,这些文本由母语为塞内加尔语的作者撰写,确保了真实、自然的沃洛夫语新闻语域。其次,该语料库在 CC BY-NC 4.0 许可下发布,允许在兼容条款下重新分发衍生的翻译资源。第三,这些句子已经过高质量的分割和基本预处理,为跨语言对齐提供了干净的基础。从这些源文本中,选择了 1,271 个句子子集进入翻译流程。 ### 3.2 人工翻译 语料库的阿拉伯语部分由一位沃洛夫语母语且具备现代标准阿拉伯语(MSA)高级能力的双语者直接从沃洛夫语源文翻译而来。翻译遵循混合的字面-语义策略:只要能产生语法正确、地道的阿拉伯语句子,就优先采用字面翻译;而当字面翻译会导致不地道或歧义的阿拉伯语时,则采用基于语义(基于意义)的翻译。 为确保最高准确性,翻译者依赖单语阿拉伯语词典 Almaany(https://www.almaany.com/)来核实词义和语域,并在翻译复杂的文化或习语概念时咨询了沃洛夫语和阿拉伯语母语使用者。翻译过程中未使用任何商业机器翻译系统,避免了对下游机器翻译评估产生任何循环偏差。 ### 3.3 清理与规范化 我们设计并执行了一个统一的预处理流程来清理原始双语文本。我们对沃洛夫语和阿拉伯语文本都应用了 Unicode 规范化形式 C(NFC),以解决分解变音符号和复合字符问题。我们通过程序去除了非标准空格(例如不间断空格),并将多个空格序列合并为一个标准空格。标点符号被标准化,任何残留的格式伪影也被移除,以确保得到干净、统一的文本表示。 ### 3.4 多语言源匹配与丰富 为了丰富我们的语料库并使未来的多向翻译研究成为可能,我们设计了一个定制的三阶段匹配流程,将我们的沃洛夫语句子与更大的 galsenai/french-wolof-translation(https://huggingface.co/datasets/galsenai/french-wolof-translation)语料库进行配对,以实现三方匹配。
相似文章
连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准
本文提出了一个阿拉伯语-俄语科学翻译的基准,包括一个包含27,000个句对的混合平行语料库,以及使用LoRA微调的多语言模型(mT5、NLLB、Qwen)。最佳模型达到了BLEU分数23.15,该工作旨在降低阿拉伯语和俄语研究人员之间科学知识交流的语言障碍。
我构建了一个从零开始的开源机器翻译管道和平行语料库,用于突尼斯达里加语(阿拉伯字母转写)的早期基线,并正在将其发展为一个精心策划的社区语料库 [P]
一位18岁的突尼斯学生介绍了一个开源机器翻译管道和平行语料库,用于以阿拉伯字母转写书写的突尼斯达里加语,该管道从零开始构建,使用了小型1560万参数的Transformer,诚实基线BLEU为3.89,并呼吁贡献者以道德方式扩展语料库。
提升科学论述:科学领域的机器翻译
本文介绍了针对西班牙语-英语、法语-英语和葡萄牙语-英语的科学机器翻译平行语料库和单语语料库的开发,涉及四个领域:癌症研究、能源研究、神经科学和交通运输。这些语料库用于微调神经机器翻译系统,以解决科学文本中专业词汇和句法带来的挑战。
BOUTEF:北非假新闻的多语言语料库——语言作为武器
本文介绍了BOUTEF,一个用于研究阿尔及利亚和突尼斯假新闻的大规模多语言语料库,涵盖阿拉伯方言、Arabizi、法语、英语及语码转换。该语料库包含对语言策略和互动动态的实证分析。
用于米佐语自动语音识别的语音语料库:Whisper 和 SraVaani 1.0 的形态感知评估微调
本研究通过微调Whisper和SraVaani 1.0模型,开发了一个用于米佐语(一种低资源语言)的自动语音识别系统,其中Whisper-large-v3实现了7.22%的形态感知词错误率。