Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统
摘要
本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。
arXiv:2606.26003v1 公告类型:新
摘要:自动语音和语言技术仍然严重偏向于高资源语言,限制了它们在阿尔及利亚方言等方言和低资源环境中的适用性。这种语言还面临额外挑战,包括缺乏标准化正字法、频繁与法语进行语码转换,以及标注语音资源稀缺。本文解决了为阿尔及利亚方言构建完整语音对话系统的问题。我们提出了一种模块化流水线,在统一架构中集成了自动语音识别、自然语言理解、检索增强生成和文本到语音合成。本工作是我们先前关于阿尔及利亚方言对话系统Bechiri和Lanasri [2026]的延续,将其从基于文本的对话建模扩展到完整的基于语音的交互。我们为电信领域的ASR、NLU和TTS构建了专用数据集,并为每个组件微调了预训练模型。ASR系统基于Whisper的适配构建,而NLU模块结合了基于Transformer的嵌入和面向任务的对话框架。一个神经TTS系统在新收集的方言语料库上训练,以实现语音响应的生成。实验结果显示所有组件均表现出色,包括ASR的低词错误率、NLU的高意图分类和实体识别分数,以及稳定的语音合成质量。所提出的系统为阿尔及利亚方言的端到端对话建模提供了可复现的基线。
查看缓存全文
缓存时间: 2026/06/25 05:13
# DZIRI VoiceBOT:面向阿尔及利亚方言的端到端低资源语音对话系统 来源:https://arxiv.org/html/2606.26003 Dihia LANASRI, Fairouz TAKI, Asma KEMMOUM (https://orcid.org/0000-0002-3794-844X) ATM Mobilis, Saad Dahlab Blida 1 University Algiers, Algeria [email protected] , [email protected], [email protected] ###### 摘要 自动语音和语言技术仍严重偏向高资源语言,限制了其在方言和低资源环境(如阿尔及利亚方言)中的适用性。该语言面临额外挑战,包括缺乏标准化正字法、频繁的法语代码切换以及标注语音资源的稀缺。 本文解决了为阿尔及利亚方言构建完整语音到语音对话系统的问题。我们提出了一个模块化流水线,将自动语音识别、自然语言理解、检索增强生成和文本到语音合成集成在统一的架构中。 本工作是我们先前关于阿尔及利亚方言对话系统研究的延续Bechiri and Lanasri (2026 (https://arxiv.org/html/2606.26003#bib.bib1)),将其从基于文本的对话建模扩展到完整的基于语音的交互。 我们为电信领域构建了专用的ASR、NLU和TTS数据集,并对每个组件的预训练模型进行了微调。ASR系统基于Whisper适配构建,而NLU模块结合了基于Transformer的嵌入和面向任务的对话框架。我们训练了一个基于新收集的方言语料库的神经TTS系统,以生成语音响应。 实验结果表明,所有组件均表现强劲,包括ASR的低词错误率、NLU的高意图分类和实体识别分数,以及稳定的语音合成质量。所提出的系统为阿尔及利亚方言的端到端对话建模提供了可复现的基线。 *关键词*自然语言处理⋅语音机器人⋅阿尔及利亚方言⋅语音转文本⋅文本转语音⋅ASR⋅TTS⋅RAG ## 1 引言 语音和语言处理的最新进展使得能够在多种领域处理口语交互的对话系统得到广泛部署。现代流水线通常将自动语音识别(ASR)、自然语言理解(NLU)、对话管理和文本到语音(TTS)合成集成到统一系统中,以实现自然的人机通信。尽管取得了这些进展,这些系统的性能和可用性仍高度依赖于大规模标注数据集和标准化语言资源的可用性。 这种对数据丰富性的依赖导致了一个基本限制:语音技术主要针对高资源语言(如英语)和少数广泛使用的语言进行了优化。相比之下,世界上大量的语言和方言在学术研究和工业应用中仍未被充分代表。这些低资源和方言环境的特点是语料库有限或不存在、语言变异性高、缺乏标准化正字法,所有这些都严重阻碍了鲁棒语音系统的开发。 阿尔及利亚方言(Darija)尤为突出地体现了这些挑战。它是阿尔及利亚广泛使用的口语方言,估计有超过4500万人在日常交流中使用。然而,它缺乏形式标准化,且不被商业语音技术支持。阿尔及利亚方言表现出显著的语音和词汇变异性、频繁的法语代码切换以及多种书写惯例,包括阿拉伯文字和拉丁文字(Arabizi)。这些特性使得声学建模和语言理解比标准化语言环境复杂得多。因此,用户经常被迫使用现代标准阿拉伯语或法语与现有系统交互,这不符合自然口语使用习惯,并显著降低了可访问性和采用率。 虽然多语言和跨语言模型最近改善了低资源场景下的性能,但它们仍难以捕捉方言语音的全部复杂性,尤其是在面向任务和特定领域的环境中。与此同时,大多数现有的阿尔及利亚方言对话系统仅限于基于文本的交互Boulesnane et al. (2022 (https://arxiv.org/html/2606.26003#bib.bib12))。尽管这些系统表明在阿尔及利亚方言中实现面向任务的对话是可行的,但它们并未解决实际语音应用中所需的完整语音处理流水线,其中语音输入和语音输出都是必需的。 在这种背景下,将对话系统从纯文本交互扩展到完整的语音到语音流水线,成为实际部署的必要步骤。此类系统必须共同处理噪声大且高度可变的语音输入,在代码切换条件下执行鲁棒的语义解释,并在缺乏标准化语音和语言资源的声音中生成自然的语音响应。这些挑战的结合使阿尔及利亚方言成为端到端口语对话AI中最具挑战性的场景之一。 本工作基于先前关于阿尔及利亚方言对话建模的研究Bechiri and Lanasri (2026 (https://arxiv.org/html/2606.26003#bib.bib1)),该研究引入了一个面向任务的基于文本的阿尔及利亚方言聊天机器人。虽然该系统证明了在该方言中进行结构化对话建模的可行性,但它仍局限于文本交互,并未包含语音处理能力。本工作通过引入一个完整的语音到语音对话框架,将ASR、NLU、检索增强生成(RAG)和TTS集成到一个专为阿尔及利亚方言设计的统一架构中,从而扩展了该研究方向。 为支持该系统,我们构建并整理了新的数据集,涵盖特定领域中的语音识别、意图分类、实体提取和语音合成。我们对预训练模型进行适配和微调,以应对方言变异性、代码切换和低资源约束。最终系统实现了阿尔及利亚方言的端到端口语交互,弥合了低资源语言研究原型与可部署对话代理之间的差距。 所提出的系统在端到端语音流水线的所有组件上进行了评估。首先,我们为电信领域构建了一个专用的阿尔及利亚方言语音语料库(2.68小时,4,103条标注话语,14位说话人,70个意图),以及一个包含15,891个样本(涵盖80个意图和28个实体)的补充NLU数据集。其次,基于Whisper-medium微调的ASR模型实现了13.74%的词错误率,这是该领域阿尔及利亚方言ASR的首个报告基准。 对于自然语言理解,一个结合DziriBERT的混合Rasa架构实现了98.4%的意图分类准确率和93.9%的实体级F1分数,优于先前在类似面向任务环境中报道的方言阿拉伯语结果。此外,引入了一个条件检索增强生成模块来处理开放领域查询,实现了78.5/100的综合性能分数,同时保持了完全的技术可靠性。 对于语音合成,我们构建了一个专用的阿尔及利亚方言TTS语料库(50.7分钟,单说话人),并对两个架构(结合LoRA适配的XTTS-v2和基于VITS的模型)进行微调,建立了首个针对该方言在电信上下文中微调的TTS系统。 通过解决语言和系统层面的挑战,本工作有助于将基于语音的人工智能扩展到至今在学术文献和工业部署中仍基本未得到支持的方言环境。 本文的其余部分组织如下:第2节回顾了阿拉伯语和阿尔及利亚方言背景下语音机器人的相关工作,第3节介绍了已开发的详细方法,第4节详细说明了进行的实验和获得的结果,第5节进行了详细讨论和分析,第6节总结全文。 ## 2 相关工作 语音和语言技术的快速发展使得能够支持人机之间自然口语交互的高级语音代理得以出现。这些系统现在广泛应用于客户服务、虚拟助手和对话AI平台。然而,它们的成功主要依赖于大规模标注数据的可用性,这使得它们严重偏向高资源语言。因此,阿拉伯语方言,特别是北非变体如阿尔及利亚方言,在学术研究和工业应用中仍被严重忽视。 为了定位我们的工作,我们回顾了与端到端对话系统相关的三个主要研究方向:阿拉伯语方言的自动语音识别(ASR)、自然语言理解(NLU)和文本到语音(TTS)。 ### 2.1 阿拉伯语方言的自动语音识别 早期的阿拉伯语ASR系统依赖于混合隐马尔可夫模型(HMM)架构结合加权有限状态转换器(WFST),如ALASR系统Menacer et al. (2017 (https://arxiv.org/html/2606.26003#bib.bib2))所示,该系统基于现代标准阿拉伯语(MSA)广播数据训练。虽然此类系统在受控环境中取得了合理的性能,但由于词汇和语音变异性,它们难以泛化到方言语音。 最近的研究转向端到端神经架构和从大型预训练模型进行迁移学习。例如,Özyilmaz et al. (2025 (https://arxiv.org/html/2606.26003#bib.bib3))研究了跨多个阿拉伯语方言的Whisper微调,表明方言池化训练可以达到与方言特定模型相当的性能。类似地,AlBlooki et al. (2025 (https://arxiv.org/html/2606.26003#bib.bib4))评估了预训练模型在低资源阿拉伯语方言上的表现,发现基于MMS的系统在适配后表现强劲,而Wav2Vec2表现出更好的零样本泛化能力。 针对阿尔及利亚方言,最近的研究探索了参数高效适配技术。Nasri (2024)提出了一种基于Whisper的模型,在有限的声音语料库上使用LoRA适配器进行微调,证明了轻量级适配策略在低资源ASR中的有效性。早期关于ALGASD语料库的工作介绍了一个经典的基于HMM的基线系统Selouani and Boudraa (2010 (https://arxiv.org/html/2606.26003#bib.bib6)),随后通过神经方法(如Wav2Vec2微调)进行了扩展,尽管训练数据有限,但仍实现了词错误率的显著降低Haboussi et al. (2025 (https://arxiv.org/html/2606.26003#bib.bib7))。 多语言和多任务学习方法也被提出来缓解数据稀缺。Menacer and Smaïli (2021 (https://arxiv.org/html/2606.26003#bib.bib8))证明了将阿尔及利亚方言、MSA和法语数据结合在联合训练框架中显著提高了识别性能,突显了跨语言迁移在低资源环境中的重要性。 总体而言,现有的阿尔及利亚方言ASR系统要么规模有限,要么专注于孤立的声学建模,而没有集成到下游对话系统中。 阿尔及利亚语音的一个关键挑战是阿拉伯语、法语和Arabizi之间普遍存在的代码切换,这显著降低了基于单语数据训练的标准ASR和NLU系统的性能。 ### 2.2 阿拉伯语方言的自然语言理解 阿拉伯语的自然语言理解(NLU)受益于基于Transformer的语言模型。AraBERTAntoun et al. (2020 (https://arxiv.org/html/2606.26003#bib.bib11))在标准阿拉伯语NLP任务上建立了强劲的性能,而MARBERTAbdul-Mageed et al. (2021 (https://arxiv.org/html/2606.26003#bib.bib10))通过在社交媒体数据上进行大规模预训练,将该能力扩展到方言阿拉伯语。 对于阿尔及利亚方言,DziriBERTAbdaoui et al. (2021 (https://arxiv.org/html/2606.26003#bib.bib58))引入了第一个专门在方言阿尔及利亚文本上预训练的Transformer模型,在多个分类和序列标注任务上达到了最先进的性能。基于该模型,DziriBOTBechiri and Lanasri (2026 (https://arxiv.org/html/2606.26003#bib.bib1))提出了一个面向任务的阿尔及利亚方言电信领域对话系统,集成了意图分类、实体提取和基于规则的对话管理(使用Rasa框架)。 然而,现有的NLU系统仍然主要是基于文本的,并假设输入文本干净,这使得它们在现实世界中与语音识别组件集成时容易受到错误传播的影响。 ### 2.3 阿拉伯语方言的文本到语音 神经文本到语音系统显著提高了语音合成质量,特别是采用VITS等架构和大规模多语言模型。MMS-TTS111https://huggingface.co/facebook/mms-tts引入了一个涵盖1000多种语言的大规模多语音框架,包括MSA,但方言专业化程度有限。 为了改善方言覆盖,衍生系统如vits-ar尝试微调基于MMS的模型用于阿拉伯语方言。类似地,Habibi-TTSChen et al. (2026 (https://arxiv.org/html/2606.26003#bib.bib9))引入了一个统一的阿拉伯语方言TTS框架,包括阿尔及利亚阿拉伯语,展示了在多语言环境中的有前景结果。 社区驱动的努力也探索了马格里布方言。例如,Dialect TTSv0.1-500M专注于摩洛哥方言,使用基于LoRA的大型TTS骨干适配。虽然对摩洛哥阿拉伯语有效,但这些模型不能很好地泛化到阿尔及利亚语音和词汇结构。其他开源系统如Arabic-Speechsynthesis仍然主要基于MSA数据训练,并未明确解决方言变异性或代码切换。 总体而言,阿拉伯语方言的TTS系统仍然分散且资源不足,对阿尔及利亚方言的覆盖有限。 ### 2.4 讨论与研究空白 尽管在ASR、NLU和TTS方面取得了显著进展,但现有工作在很大程度上仍然是模块化和任务特定的。每个组件都独立进行了优化,但缺乏集成口语对话流水线所有阶段的统一系统。 阿拉伯语方言的ASR系统仍然对有限数据敏感,并且通常孤立地进行评估。NLU模型在基于文本的输入上表现强劲,但没有考虑语音识别引入的转录噪声。TTS系统虽然日益自然,但很少集成到端到端对话系统中,限制了在现实对话场景中的评估。 这种碎片化在低资源环境(如阿尔及利亚方言)中变得尤为关键,因为数据稀缺会加剧组件之间的错误传播。据我们所知,之前没有工作联合解决ASR、NLU、
相似文章
面向低资源口语方言的线性语义分割
本文引入了一个针对低资源阿拉伯语方言的语义分割基准,并提出了一种模型,该模型在会话式语音上的性能优于标准基线模型。
面向低资源阿尔及利亚方言的端到端混合谣言检测框架
本文提出了一种面向低资源阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架,通过结合Transformer嵌入和经典分类器,达到了0.84的F1分数。
基于说话人日志引导的Qwen-ASR多语言双人对话语音自适应
本文介绍了为MLC-SLM 2026挑战赛设计的系统,该系统结合了说话人日志与微调后的Qwen-ASR,采用监督式全参数微调、合成语音上的LoRA以及GRPO强化学习,在最终评测集上实现了17.97的tcpMER。
@alamin_ai_: 天哪,伙计们,这太难以置信了 请听一下黎凡特阿拉伯语和英语之间的无缝代码切换,提高了7…
在黎凡特阿拉伯语语音合成和英语代码切换方面取得了重大突破,使用单张RTX 3060在一晚上实现了76%的提升。
从词汇到AI:面向低资源语言专业对话系统的结构化数据流水线
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。