PiDA: 基于语音信息的数据增强方法以实现鲁棒的越南语语音翻译
摘要
本文提出PiDA,一种基于语音信息的越南语语音翻译数据增强方法,通过使用语音词嵌入生成类似ASR的破坏来提高鲁棒性,在噪声输出上获得高达+2.04 BLEU的提升。
arXiv:2606.12911v1 公告类型:新
摘要:级联语音翻译(ST)系统在自动语音识别(ASR)输出错误转录时会遭受错误传播。我们首次对越南语ST的ASR错误进行了系统分类,根据语音原因对替代错误进行分类,并使用线性混合效应模型量化其对下游神经机器翻译(NMT)性能的影响。我们确认大多数ASR替代错误源于语音混淆而非随机噪声,并且这些语音错误显著降低了ST质量。基于这一发现,我们提出了基于语音信息的数据增强(PiDA),该方法通过使用语音词嵌入将单词替换为语音相似的替代词来生成类似于ASR的破坏。在PiDA增强版本的FLEURS越南语-英语数据集上进行微调,可以改善有错误的ASR输出的翻译(在标准微调基础上最高提升+2.04 BLEU),同时略微提高干净文本的性能。
查看缓存全文
缓存时间: 2026/06/12 08:51
# PiDA:面向鲁棒越南语语音翻译的语音信息数据增强 来源:https://arxiv.org/abs/2606.12911 查看 PDF (https://arxiv.org/pdf/2606.12911) > 摘要:级联语音翻译(ST)系统在自动语音识别(ASR)输出错误转录时会出现错误传播。我们首次对越南语ST中的ASR错误进行了系统分类,根据语音原因对替换错误进行分类,并使用线性混合效应模型量化了它们对下游神经机器翻译(NMT)性能的影响。我们证实,大多数ASR替换错误源于语音混淆而非随机噪声,并且这些语音错误显著降低了ST质量。受此发现启发,我们提出了语音信息数据增强(PiDA),该方法通过使用语音词嵌入生成语音相似替代词来产生类似ASR的损坏。在PiDA增强版FLEURS越南语-英语上进行微调,可以改善对错误ASR输出的翻译(比标准微调最多提升+2.04 BLEU),同时略微提升干净文本的性能。 ## 提交历史 来自:Giang Son Nguyen [查看邮件](https://arxiv.org/show-email/15cfb280/2606.12911) **\[v1\]**2026年6月11日星期四 05:09:59 UTC(39 KB)
相似文章
越南语音中方言变化的语音建模
本文提出了一种方言感知的语音框架,用于建模越南语自动语音识别(ASR)中的语音变化,将音节分解为结构化组件,并将其映射到特定方言的国际音标(IPA)表示。该方法在UIT-ViMD多方言数据集上,以更少的参数且无需外部预训练,匹配了预训练基线的性能。
BamiBERT: 一种新的基于BERT的越南语语言模型
BamiBERT 是一种新的基于BERT的越南语预训练语言模型,它解决了PhoBERT的局限性,支持更长的上下文,无需分词即可运行,并在多个越南语基准上取得了最先进的结果。
利用多模态特征融合联合改进印度语言中的方言识别与语音识别
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
LLM对越南方言的鲁棒性如何?
本文介绍了VialectBench,这是一个评估LLM在六种越南方言群体和四项任务上鲁棒性的基准,发现平均性能下降2.82%,且没有模型完全不受方言影响。
基于迁移学习与数据增强的低资源汉语方言辨识
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。