我在大量真实世界数据上评估了顶级STT模型
摘要
对领先STT模型在1000多个嘈杂真实世界片段上的评估显示,大多数在嘈杂环境中表现不佳,其中DG Nova表现最佳。应用噪声消除显著提高了准确性。
我在1000多个嘈杂真实世界片段上评估了领先的STT模型,发现几乎所有的模型在嘈杂/公共环境中表现都很差。它们会拾取主说话人周围的声音并一并转录。在我评估的提供商中,我发现DG Nova是最好的。有趣的是,当你在STT的同时应用噪声消除/声音隔离时,数据会显著改善。感兴趣的读者,我已经分享了结果。
相似文章
房间混响和低信噪比对STT准确性的影响远大于模型大小
房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。
嘈杂环境中的语音代理
一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。
语音代理的最佳STT API?我会先测试延迟再测试准确性
作者认为,对于实时语音代理,STT延迟和实时行为比原始转录准确性更为关键,并提出了不同的评估记分卡。
图自监督学习对现实世界噪声的鲁棒性:基于文本驱动生物医学图的案例研究
本文介绍了 NATD-GSSL 框架,用于评估图自监督学习在含噪声的文本驱动生物医学图上的鲁棒性。研究表明,尽管存在现实世界的噪声,某些 GNN 架构和 pretext tasks(辅助任务)仍能保持性能,为在不完美数据集上进行无监督学习提供了实用指导。
转录儿童语音:ASR性能与获取可靠的正字法转写
这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。