使用滚动缓冲区和单语模型的实时多语言ASR [P]
摘要
一种基于路由的实时多语言ASR方法,使用较小的单语模型并配备回滚机制来处理语言切换,在跨语句代码切换上实现了约13%的词错误率,并将系统开源。
我在Gladia的研究中构建了一种基于路由的轻量级实时多语言ASR方法。核心问题在于,能够准确处理对话中语言切换的多语言模型通常体积过大,无法在大多数本地硬件上运行,且准确率较低。因此,我们没有依赖单一的庞大多语言模型,而是将音频路由到多个更小、更专业的单语模型(每个约1亿参数)之间。* **Zipformer**用于低延迟流式转录 * **Silero VAD**用于检测语音边界 * **SpeechBrain**用于语言识别。该方法无需等待语言检测即可立即开始转录。一个协调器会缓冲音频、监控语言的置信度,当检测到语言切换超过阈值时,它会回滚到上一个语音边界,并使用正确的模型重新转录。用户可能会短暂看到错误的文本,但系统会快速自我修正。[回滚管线概览](https://preview.redd.it/qu5jir6i0p4h1.png?width=2641&format=png&auto=webp&s=f59447cc3afa32cc3bdc77ec3f1c01139643840a) 在跨语句代码切换基准测试中,该方法达到了约13%的词错误率,优于我测试的所有其他系统,包括云API。已知的局限性是语句内切换(如句子中间的西英混合语等),词错误率会降至约41%,但依然优于开源替代方案,且模型尺寸小得多。开源仓库包含使用说明和详细的基准测试结果:[https://github.com/gladiaio/realtime-multilingual-asr-router](https://github.com/gladiaio/realtime-multilingual-asr-router) 欢迎提出意见。专业提示:仅启用你预期的语言不仅能让系统更轻量,还能提升语言识别的准确率,特别是对于口音较重的语音。
相似文章
面向数据高效的代码切换ASR的强化学习
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
迈向真正多语言ASR:将代码切换ASR泛化到未见过的语言对
本文研究了从有限的已见语言对学到的代码切换ASR能力是否可以通过模型合并和域泛化方法泛化到未见过的语言对,结果发现只有有限的迁移。
商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语
本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。
用于鲁棒代码切换语音识别的基于LLM生成的近失对比训练
提出了一种POI感知的对比训练框架,利用LLM生成的近失假设来增强ASR在代码切换区域的鲁棒性,在两个基准测试上实现了一致的错误率降低。
基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒
本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。