@svpino:在将音频发送到语音转文本模型之前降低噪声会带来巨大改进。语音隔离是…
摘要
Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。
查看缓存全文
缓存时间: 2026/09/24 22:30
在将音频送入语音识别模型前进行降噪处理,效果会非常显著。
语音隔离是您接下来需要重点关注的核心技术。
Krisp 刚刚发布了一项开放基准测试与数据集,用于评估语音隔离对语音识别准确率的影响。
结果令人震撼:
在265段真实录音与11种语音识别配置的测试中,错误率整体降低了73%。
该对比基于原始录音与语音隔离处理版本之间的差异。
以下是语音隔离后的具体效果:
• 整体单词错误率:从23.24%降至6.24% • 工作场所录音:从31.84%降至6.30% • 呼叫中心录音:从23.83%降至6.86%
如果您已部署语音识别系统,可以使用自己的音频复现实验,验证语音隔离技术的实际效果。
实验链接:https://partner.krisp.ai/svpino-x-bm
感谢Krisp团队与我合作完成这篇分享。
语音隔离语音识别基准测试 | Krisp
来源:https://krisp.ai/benchmarks/voice-isolation-benchmark/?utm_source=svpino&utm_medium=twitter&utm_campaign=vi_benchmark_2026&utm_content=benchmark 页面加载需要JavaScript支持。 正在解压…
相似文章
房间混响和低信噪比对STT准确性的影响远大于模型大小
房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。
嘈杂环境中的语音代理
一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。
@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
@svpino:我为两家不同的公司构建了两个语音管道。它们看起来都是这样的:音频 → STT → 清理转录 → ……
Santiago 指出了传统 STT 管道在丢失语调和情感方面的局限性,然后介绍了 Modulate 公司的 Velma,这是一个原生语音 AI 模型,通过分析原始音频来捕捉意图、情感及其他声学信号,通过 API 获取,其成本比基于 LLM 的方法便宜 10 倍。
通过声学掩蔽量化辅音对单词可懂度的贡献
本文介绍了一种可扩展的方法,利用声学掩蔽和ASR模型来测量辅音对单词可懂度的贡献,并在四种语言中通过音素频率和功能负载进行了验证。