使用滚动缓冲区和单语模型的实时多语言ASR [P]

Reddit r/MachineLearning 论文

摘要

一种基于路由的实时多语言ASR方法,使用较小的单语模型并配备回滚机制来处理语言切换,在跨语句代码切换上实现了约13%的词错误率,并将系统开源。

我在Gladia的研究中构建了一种基于路由的轻量级实时多语言ASR方法。核心问题在于,能够准确处理对话中语言切换的多语言模型通常体积过大,无法在大多数本地硬件上运行,且准确率较低。因此,我们没有依赖单一的庞大多语言模型,而是将音频路由到多个更小、更专业的单语模型(每个约1亿参数)之间。* **Zipformer**用于低延迟流式转录 * **Silero VAD**用于检测语音边界 * **SpeechBrain**用于语言识别。该方法无需等待语言检测即可立即开始转录。一个协调器会缓冲音频、监控语言的置信度,当检测到语言切换超过阈值时,它会回滚到上一个语音边界,并使用正确的模型重新转录。用户可能会短暂看到错误的文本,但系统会快速自我修正。[回滚管线概览](https://preview.redd.it/qu5jir6i0p4h1.png?width=2641&format=png&auto=webp&s=f59447cc3afa32cc3bdc77ec3f1c01139643840a) 在跨语句代码切换基准测试中,该方法达到了约13%的词错误率,优于我测试的所有其他系统,包括云API。已知的局限性是语句内切换(如句子中间的西英混合语等),词错误率会降至约41%,但依然优于开源替代方案,且模型尺寸小得多。开源仓库包含使用说明和详细的基准测试结果:[https://github.com/gladiaio/realtime-multilingual-asr-router](https://github.com/gladiaio/realtime-multilingual-asr-router) 欢迎提出意见。专业提示:仅启用你预期的语言不仅能让系统更轻量,还能提升语言识别的准确率,特别是对于口音较重的语音。
查看原文

相似文章

商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语

arXiv cs.CL

本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。