迈向真正多语言ASR:将代码切换ASR泛化到未见过的语言对

Hugging Face Daily Papers 论文

摘要

本文研究了从有限的已见语言对学到的代码切换ASR能力是否可以通过模型合并和域泛化方法泛化到未见过的语言对,结果发现只有有限的迁移。

自动语音识别(ASR)已成为人机交互的关键技术。然而,代码切换ASR(CS-ASR)仍然特别具有挑战性,因为不同语言对的多语言CS语音资源严重匮乏。现有方法主要通过合成CS语音生成或在有限的双语数据集上进行特定语言对的微调来提升CS-ASR性能。然而,这些方法面临着固有的可扩展性限制,因为对CS的支持需要针对不同语言对单独开发,而语言对的数量随着支持的语言数量呈组合增长。本文研究了从有限已见语言对中学到的CS能力是否可以通过模型合并和域泛化方法泛化到未见过的语言对。我们的实验表明,合并的双语CS-ASR模型对未见过的语言对表现出适度的泛化能力,表明双语CS能力在语言对之间的迁移有限。
查看原文
查看缓存全文

缓存时间: 2026/06/05 06:06

论文页面 - 迈向真正的多语言ASR:将代码切换ASR泛化到未见过的语言对

Source: https://huggingface.co/papers/2606.05846

摘要

尽管尝试了模型合并和领域泛化技术,代码切换自动语音识别模型在未见过的语言对上仍表现出有限的泛化能力。

自动语音识别(Automatic Speech Recognition, ASR)已成为人机交互的关键技术。然而,代码切换ASR(CS-ASR)由于不同语言对之间多语言CS语音资源的严重匮乏,仍然极具挑战性。现有方法主要通过合成CS语音生成(synthetic CS speech generation, https://huggingface.co/papers?q=synthetic%20CS%20speech%20generation)或针对特定语言对的微调(pair-specific fine-tuning, https://huggingface.co/papers?q=pair-specific%20fine-tuning)在有限的双语数据集上改进CS-ASR性能。然而,这些方法面临固有的扩展性限制,因为对CS的支持必须针对每个语言对分别开发,而语言对的数量随着所支持语言的数量呈组合增长。在本工作中,我们探讨了从有限的一组已见过语言对中学到的CS能力,是否能够通过模型合并(model merging, https://huggingface.co/papers?q=model%20merging)和领域泛化(domain generalization, https://huggingface.co/papers?q=domain%20generalization)方法泛化到未见过的语言对。我们的实验表明,合并后的双语CS-ASR模型对未见过的语言对具有适度的泛化能力,这表明双语CS能力在语言对之间的迁移有限。

查看arXiv页面 (https://arxiv.org/abs/2606.05846)查看PDF (https://arxiv.org/pdf/2606.05846)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2606.05846)

在你的智能代理中获取此论文:

hf papers read 2606\.05846

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.05846,即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.05846,即可从此页面链接。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.05846,即可从此页面链接。

包含此论文的收藏集1

相似文章

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。