基于迁移学习与数据增强的低资源汉语方言辨识

arXiv cs.CL 论文

摘要

本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。

arXiv:2606.18597v1 公告类型:新论文 摘要:由于标注资源稀缺,汉语方言辨识是一项具有挑战性的自然语言处理任务。本文开发了一种新颖的基于迁移学习与数据增强的汉语方言辨识框架(CDDTLDA),以克服资源短缺的问题。具体而言,我们首先使用一个较大的汉语方言语料库训练源端自动语音识别(ASR)模型。然后,采用一种简单但有效的数据增强方法(即速度、音高和噪声扰动)来增强目标端的低资源汉语方言,并基于之前的源端ASR模型微调另一个目标端ASR模型。同时,利用自注意力机制捕捉源端与目标端ASR模型之间潜在的共同语义特征。最后,提取目标端ASR模型中的隐层语义表示进行汉语方言辨识。广泛的实验结果表明,我们的模型在两个基准汉语方言语料库上显著优于最先进的方法。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:45

# 基于迁移学习与数据增强的低资源中文方言辨识
来源:https://arxiv.org/abs/2606.18597
查看PDF (https://arxiv.org/pdf/2606.18597)

> 摘要:中文方言辨识是一项具有挑战性的自然语言处理任务,主要由于标注资源稀缺。本文提出了一种新颖的中文方言辨识框架——基于迁移学习与数据增强的中文方言辨识(CDDTLDA),以克服资源匮乏问题。具体而言,我们首先利用一个相对较大的中文方言语料库训练源端自动语音识别(ASR)模型。接着,采用一种简单但有效的数据增强方法(即速度、音高和噪声干扰)来扩充目标端的低资源中文方言,并基于之前的源端ASR模型微调另一个目标ASR模型。同时,通过使用自注意力机制,可以捕捉源端与目标端ASR模型之间潜在的共同语义特征。最后,提取目标ASR模型中的隐藏语义表示进行中文方言辨识。大量实验结果表明,我们的模型在两个基准中文方言语料库上显著优于现有最先进方法。

## 提交历史

来自:范旭 [查看邮件 (https://arxiv.org/show-email/21108fd4/2606.18597)] **\[v1\]** 2026年6月17日星期三 01:46:41 UTC (993 KB)

相似文章

面向中国方言的语音驱动端到端语言辨识

arXiv cs.CL

本文研究了用于中国方言细粒度辨识的语音驱动特征,采用了一种端到端模型,通过卷积神经网络结合基于MFCC的特征与词级嵌入,性能优于文本驱动方法。

语音识别中的Convex低资源口音鲁棒语言检测

Hugging Face Daily Papers

本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。

利用双语微调与语言识别改进低资源ASR:一项跨语言评估

arXiv cs.CL

本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。