迈向真正多语言ASR:将代码切换ASR泛化到未见过的语言对
摘要
本文研究了从有限的已见语言对学到的代码切换ASR能力是否可以通过模型合并和域泛化方法泛化到未见过的语言对,结果发现只有有限的迁移。
查看缓存全文
缓存时间: 2026/06/05 06:06
论文页面 - 迈向真正的多语言ASR:将代码切换ASR泛化到未见过的语言对
Source: https://huggingface.co/papers/2606.05846
摘要
尽管尝试了模型合并和领域泛化技术,代码切换自动语音识别模型在未见过的语言对上仍表现出有限的泛化能力。
自动语音识别(Automatic Speech Recognition, ASR)已成为人机交互的关键技术。然而,代码切换ASR(CS-ASR)由于不同语言对之间多语言CS语音资源的严重匮乏,仍然极具挑战性。现有方法主要通过合成CS语音生成(synthetic CS speech generation, https://huggingface.co/papers?q=synthetic%20CS%20speech%20generation)或针对特定语言对的微调(pair-specific fine-tuning, https://huggingface.co/papers?q=pair-specific%20fine-tuning)在有限的双语数据集上改进CS-ASR性能。然而,这些方法面临固有的扩展性限制,因为对CS的支持必须针对每个语言对分别开发,而语言对的数量随着所支持语言的数量呈组合增长。在本工作中,我们探讨了从有限的一组已见过语言对中学到的CS能力,是否能够通过模型合并(model merging, https://huggingface.co/papers?q=model%20merging)和领域泛化(domain generalization, https://huggingface.co/papers?q=domain%20generalization)方法泛化到未见过的语言对。我们的实验表明,合并后的双语CS-ASR模型对未见过的语言对具有适度的泛化能力,这表明双语CS能力在语言对之间的迁移有限。
查看arXiv页面 (https://arxiv.org/abs/2606.05846)查看PDF (https://arxiv.org/pdf/2606.05846)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2606.05846)
在你的智能代理中获取此论文:
hf papers read 2606\.05846
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.05846,即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.05846,即可从此页面链接。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.05846,即可从此页面链接。
包含此论文的收藏集1
相似文章
面向数据高效的代码切换ASR的强化学习
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
使用滚动缓冲区和单语模型的实时多语言ASR [P]
一种基于路由的实时多语言ASR方法,使用较小的单语模型并配备回滚机制来处理语言切换,在跨语句代码切换上实现了约13%的词错误率,并将系统开源。
通过渐进式代码切换实现高效的多语言推理迁移
本文提出渐进式代码切换(PCS),这是一种结合课程学习的强化学习方法,逐步增加LLM中的代码切换比例,从而实现多语言推理能力的高效迁移。
用于鲁棒代码切换语音识别的基于LLM生成的近失对比训练
提出了一种POI感知的对比训练框架,利用LLM生成的近失假设来增强ASR在代码切换区域的鲁棒性,在两个基准测试上实现了一致的错误率降低。
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。