豪萨语和丰贝语文本与语音资源综述:可用性、质量及NLP发展的差距

arXiv cs.CL 论文

摘要

本综述对两种西非语言——豪萨语和丰贝语的公开文本与语音资源进行了编目,评估了其在NLP开发中的可用性、质量和差距,并提供了针对特定任务的建议。

arXiv:2605.22828v1 公告类型:新 摘要:本综述全面编目了两种西非语言的公开文本与语音资源:豪萨语(一种亚非语系语言,约有8000万至1亿使用者)和丰贝语(一种尼日尔-刚果语系语言,在贝宁约有200万人使用)。这两种语言代表了资源可用性谱系中的对比案例。我们探讨的问题是:\textit{豪萨语和丰贝语的公开NLP资源现状如何?还存在哪些差距?}通过系统性地搜索学术数据库、数据平台和网络资源,我们编目了平行语料库、单语文本集合、语音数据集、预训练模型和评估基准。对于每种资源,我们记录了其规模、领域覆盖范围、格式、许可协议和可访问性。我们的发现表明,豪萨语在新闻、百科全书和教育领域拥有更广泛的文本资源多样性。丰贝语虽然文本资源较为有限,但近期已成为学术语音数据收集项目的重点。这两种语言在Masakhane的命名实体识别和词性标注基准中均有体现。我们提供了针对特定任务的建议,并确定了优先填补的差距,包括领域多样的丰贝语文本和专门的豪萨语语音语料库。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:54

# 豪萨语和丰贝语文本与语音资源综述:可用性、质量及自然语言处理发展中的差距
来源:https://arxiv.org/html/2605.22828

###### 摘要

本文系统调查了两种西非语言——豪萨语(亚非语系,约 80–100 M 使用者)和丰贝语(尼日尔-刚果语系,约 2 M 使用者,贝宁)——的公开文本与语音资源,这两种语言代表资源可用性光谱上的两个对比点。通过系统检索学术库、数据平台和网络来源,我们整理了平行语料、单语文本、语音数据集、预训练模型和基准测试,并记录了每种资源的大小、领域、格式、许可和可访问性。豪萨语受益于新闻、百科和教育领域广泛的文本多样性,而丰贝语则通过有针对性的语音数据采集项目吸引了关注,尽管其文本覆盖有限。豪萨语广泛出现在涵盖情感、情绪和推理任务的评估基准中,而丰贝语在基准中的存在则极为有限;两种语言在命名实体识别(MasakhaNER 2.0)、词性标注(MasakhaPOS)和机器翻译评估(FLORES-200, MAFAND-MT)上均有共同覆盖。我们提供了针对特定任务的资源建议,并识别了优先缺口,包括领域多样的丰贝语文本语料库和多说话人豪萨语自动语音识别数据。

## I. 引言

自然语言处理(NLP)技术已成为数字服务的重要基础设施,然而对大多数非洲语言的使用者来说,这些技术仍难以获取。一位为贝宁国语丰贝语构建机器翻译系统的研究者,必须独立搜索 Hugging Face1、Zenodo2、GitHub 和学术文献,却没有任何综合指南说明存在哪些资源及其特征。

这种分散性带来了实际后果:研究者重复发现工作,做出次优的资源选择,或因为察觉到数据稀缺而放弃项目。一份全面的综述提供了整合的起点,识别了数据采集项目的缺口,并建立了可用于衡量未来进展的文档。

以往的综述以非洲大陆规模考察了非洲语言资源[10,12],提供了宝贵的概览,但不可避免地牺牲了深度以换取广度。本综述针对两种西非语言——豪萨语(亚非语系,约 80–100 M 使用者)和丰贝语(尼日尔-刚果/格贝语系,约 2 M 使用者)——填补了这一空白。通过考察处于资源光谱不同位置的语言,我们为针对其他低资源语言的类似努力提供了一个模板。

整理低资源语言资源面临特定挑战:资源分散在异构平台上,元数据标准各不相同,文档质量从详细的学术论文到完全没有描述不等。评估资源是否适合任务通常需要母语者专业知识,例如判断丰贝语语料库是否使用一致的变音符[10]。

我们的综述整理了两种语言的文本语料库、平行语料库、语音数据集、预训练模型和基准测试。我们记录了资源特征,包括大小、领域、格式和许可,并提供了针对特定任务的建议。附带的在线门户3提供了所有整理资源的直接链接。

### I-A 研究问题

本综述旨在回答以下核心研究问题:

> 豪萨语和丰贝语当前公开可用的文本与语音资源处于何种状态,NLP 发展还面临哪些空白?

我们探讨两个子问题:

1. 豪萨语和丰贝语有哪些公开可用的文本、语音和平行语料库?
2. 当前资源覆盖中存在哪些空白,哪些策略可以解决这些问题?

### I-B 贡献总结

- •  豪萨语和丰贝语公开可用的文本、语音和平行资源的综合目录,记录了大小、领域、格式和许可(第四至第五部分)。
- •  一个在线文档门户(https://fongbe-hausa-nlp-resources.vercel.app/),提供所有整理资源的直接链接及每项资源的摘要,便于高效发现和访问资源。
- •  识别资源缺口、伦理考虑以及针对特定任务的资源选择建议(第五至第六部分)。

本文其余部分安排如下:第二部分回顾相关综述。第三部分描述我们的方法。第四部分整理资源。第五部分讨论质量考量、局限性和资源机会。第六部分提供建议,第七部分得出结论。

## II. 相关工作

### II-A 非洲语言资源综述

#### II-A1 大陆层面的综述与倡议

自 2019 年以来,非洲语言技术研究显著加速,主要得益于社区倡议。Masakhane 项目针对 30 多种非洲语言建立了参与式机器翻译方法,通过分布式社区标注创建了平行数据集[10]。这一倡议展示了协作创建资源的潜力,同时凸显了持续存在的语言数据稀缺挑战。

然而,Masakhane 专注于机器翻译,因此并未记录资源选择所需的关键元数据:数据集的词/句大小、许可条款(CC-BY 与 CC-BY-NC 与自定义)、文件格式(JSON、TSV、纯文本)、领域覆盖(新闻、宗教、对话)或预处理要求。这一文档缺口迫使研究者必须逐一下载并检查每个数据集,才能确定其是否适合自身任务。

此外,其大陆范围必然限制对任何单一语言的覆盖深度。我们的综述补充了 Masakhane、FLORES-200 和 MAFAND-MT 等现有努力,通过更聚焦的视角审视两种特定语言,提供跨所有资源类型的详尽语言级文档,而非广泛的跨语言覆盖。

Naira 等人发表了对非洲语言和方言 NLP 方法的全面回顾,考察了数据稀缺、方言变异和社区驱动解决方案[16]。他们强调非标准正字法和有限的数字存在是反复出现的障碍,这些挑战尤其与丰贝语相关。例如,丰贝语使用声调变音符(如 è, é, ê),这些变音符在数字资源中表示不一致:一些语料库保留完整变音符,而另一些则完全省略,导致合并数据集时出现兼容性问题。

Siminyu 等人记录了 AI4D 非洲语言项目,这是一个结构化倡议,结合了众包数据集收集、标注语料库创建和自然语言处理(NLP)共享任务挑战,以解决非洲语言数字资源严重短缺的问题[11]。Orife 等人考察了机器翻译挑战,包括数据稀缺和宗教文本主导[12]。尽管这些综述提供了宝贵的大陆视角,但每篇覆盖 30–50 种语言,每种语言最多分配几段内容。我们的综述通过为两种语言提供详尽文档来区分:整理每个公开可用的资源,附带详细元数据——这正是构建 NLP 系统所需的细节水平。

MasakhaNER 2.0 基准引入了以非洲为中心的迁移学习,用于跨 20 种语言的命名实体识别,包括豪萨语和丰贝语[1]。类似地,MasakhaPOS 为类型多样的非洲语言建立了词性标注基准[2]。这些基准代表了标准化评估的关键基础设施。

#### II-A2 语言特定研究

大陆综述提供广度,而语言特定研究提供互补的深度。一篇针对 Afaan Oromo 的情感分析资源综述展示了针对单一低资源语言进行聚焦文档的价值[17]。此类单语言综述揭示了更广泛概览必然会忽略的资源缺口。我们的综述遵循这一传统,为两种语言提供详细文档,从而实现资源开发模式的比较分析。

### II-B 低资源 NLP 综述

#### II-B1 全球方法论综述

更广泛的低资源 NLP 文献提供了方法论背景。Hedderich 等人提出了低资源场景下方法的全面分类法,将策略分为迁移学习、数据增强、远程监督和跨语言方法等类别[13]。这些技术对豪萨语和丰贝语具有直接适用性:例如,当仅有几百条标注句子时,来自多语言模型(如 mBERT)的跨语言迁移可以引导命名实体识别(NER)系统,正如 MasakhaNER 的结果所示,该结果表明,在 1,000 条丰贝语句子上微调 XLM-R 可在 MasakhaNER NER 测试集上达到 71.2 F1 分数,该基准专为非洲语言 NER 评估设计,实体类型包括 PER、LOC、ORG 和 DATE。这一性能与拥有 10 倍训练数据的中等资源欧洲语言相当,展示了针对低资源非洲语言的迁移学习效果[1]。

Joshi 等人提出了一个理解资源差异的框架,根据可用资源将语言从第 0 级(“落后语言”)到第 5 级(“赢家”)进行分类[14]。在此分类下,豪萨语因其国际媒体存在而处于中等级别(3–4),而丰贝语尽管在贝宁具有国语地位,却更接近最低级别(0–1)。

#### II-B2 在非洲语言中的应用

多语言微调和跨语言迁移已展现出对非洲语言的潜力,如 AfriBERTa[3] 和 AfroXLMR[19] 所示。然而,针对豪萨语和丰贝语系统评估这些方法仍然有限,主要原因有两个:(1)大多数多语言研究报告的是跨语言家族的聚合指标,而非每种语言的结果,因此难以评估在个别语言上的表现;(2)丰贝语在情感、情绪和推理基准(AfriSenti, BRIGHTER, BLEnD, Global PIQA, Fikira)中的缺失,使其无法在这些任务上与其他非洲语言进行直接比较。全球综述中记录的许多技术,如数据增强和合成数据生成,尚未在这些语言上进行广泛测试。

### II-C 现有综述的空白

#### II-C1 范围、深度和模态的局限

现有综述存在以下局限性。大陆综述广泛覆盖 20–40 种语言,但无法提供构建特定低资源语言语言模型所需的详细语言级清单。语言特定研究聚焦于单语言或特定任务;虽然对该任务有价值,但无法帮助需要构建完整 NLP 流程(涵盖分词、语言建模、NER 和下游应用)的研究者,因为每个环节需要不同的资源。大多数综述侧重于文本资源和机器翻译,语音资源得到的系统关注较少。本综述通过将语音资源与文本资源一同整理来填补这一缺口,包括 61 小时的 FFSTC2 丰贝语语料库和 BibleTTS 豪萨语。领域覆盖、正字法变异和数据溯源等质量考量极少被深入考察。

本综述的定位:本综述通过在单个数据集层面提供文档来填补这些缺口:对于每项资源,我们记录确切的词/句计数(例如,莱比锡豪萨语维基百科的“47,384 句,935,915 个词元”)、文件格式(JSON、TSV、纯文本)、许可条款(CC-BY-4.0、CC-BY-NC-4.0、自定义限制)、下载 URL 和领域覆盖(新闻、宗教、对话、教育)。这种粒度使研究者无需下载和检查每个数据集即可做出明智决策。我们整理了两种类型不同的西非语言的资源,它们处于资源光谱的不同位置:豪萨语(亚非语系,中等资源)和丰贝语(尼日尔-刚果语系,极低资源)。我们整理了跨所有主要模态(文本、语音和平行语料库)的资源,并包括预训练模型和评估基准。这种双语言、多模态的方法能够进行比较分析,为从事任一语言的研究者提供实际效用,并展示了如果资源被构建出来可以实现的功能——对比极低资源与中等资源场景(豪萨语与丰贝语)的状况。

## III. 方法论

我们进行了一项综述,以应对低资源非洲语言特有的挑战:资源分散、元数据不一致、文档从详细论文到没有描述不等、需要母语者专业知识,以及快速演变的格局。

### III-A 搜索策略

文献:ACL Anthology8(ACL、EMNLP、NAACL、LREC、Interspeech、AfricaNLP、MRL 研讨会)。

网络资源:从已知起点通过引用追踪:

- • 豪萨语:BBC Hausa, VOA Hausa, DW Hausa, Leadership Newspaper, ha.wikipedia.org
- • 丰贝语:jw.org/fon, beninlangues.com, fongbebenin.com

### III-B 纳入标准

初始池:(1)来自存储库搜索的所有结果,使用以下术语:“Hausa”、“Fongbe”、“Fon”、“hau”(ISO 639-3)、“fon”(ISO 639-3)、“Nigerian languages”、“Benin languages”、“West African NLP” 和 “African language corpus”——每个平台都使用所有术语进行全面覆盖;(2)AfricaNLP 研讨会论文(2020–2024)中引用的所有数据集——这些英语论文作为元数据源,描述豪萨语/丰贝语数据集,提供访问链接和数据集特征;我们提取数据集引用和 URL 以整理它们描述的实际语言资源;(3)Lanfrica 中豪萨语和丰贝语的所有条目;(4)第一作者(一位母语为丰贝语的研究者,对两种语言均有研究经验)通过从已知起点的引用追踪识别的网络来源。

资源被纳入的条件是:包含豪萨语/丰贝语作为主要内容或重要多语言覆盖(例如,MasakhaNER 的 20 种语言包括完整标注);可用于研究使用。

资源根据 README 文件或论文中提供的可用文档进行纳入。

相似文章

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

@wsl8297: GitHub 上有一份把「语音语言模型(SpeechLM)」研究脉络梳理得很清楚的资源库:Awesome-SpeechLM-Survey。 它把分类框架、代表模型、训练数据集到评测基准一站式整理成“知识地图”,查资料、补背景、找对标都很省…

X AI KOLs Timeline

GitHub 上的 Awesome-SpeechLM-Survey 仓库系统整理了语音语言模型的研究脉络,包括分类框架、代表模型、训练数据集和评测基准,是了解该领域的知识地图。