我在大量真实世界数据上评估了顶级STT模型

Reddit r/AI_Agents 新闻

摘要

对领先STT模型在1000多个嘈杂真实世界片段上的评估显示,大多数在嘈杂环境中表现不佳,其中DG Nova表现最佳。应用噪声消除显著提高了准确性。

我在1000多个嘈杂真实世界片段上评估了领先的STT模型,发现几乎所有的模型在嘈杂/公共环境中表现都很差。它们会拾取主说话人周围的声音并一并转录。在我评估的提供商中,我发现DG Nova是最好的。有趣的是,当你在STT的同时应用噪声消除/声音隔离时,数据会显著改善。感兴趣的读者,我已经分享了结果。
查看原文

相似文章

嘈杂环境中的语音代理

Reddit r/AI_Agents

一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。

转录儿童语音:ASR性能与获取可靠的正字法转写

arXiv cs.CL

这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。