房间混响和低信噪比对STT准确性的影响远大于模型大小
摘要
房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。
在许多STT讨论中,当转录失败时,人们会立即归咎于模型架构,假设解决方案是升级从Whisper-medium到Large-v3,或者调高Temperature设置。几乎没有人检查Mel频谱图,看声学掩蔽实际上对输入音频做了什么。我用手机MEMS麦克风进行了一次快速声学测试,麦克风放置在距离2.5米外的一张靠近窗户的木桌上。我朗读了一个包含清擦音和短语“do not approve”的控制句。通过小扬声器回放时,人耳会自然地插补缺失的声音。但检查STFT(短时傅里叶变换)帧后,发现两个物理问题:来自窗户交通的低频隆隆声(200Hz到500Hz)压缩了动态范围,抬高了噪声基底。房间混响(硬桌面的$T_{60}$反射)产生了梳状滤波,削弱了区分清辅音(如/s/或/t/)所需的高频能量(4kHz到8kHz)。当直接在本地Whisper-large-v3实例上运行未经预处理的原始音频时,缺失的频谱能量导致令牌解码错误。然而,通过vomo ai处理同一文件后,输出明显更干净。其云端流水线包含自适应谱减法和前端DSP滤波,在将帧送入解码器之前清理低频噪声基底,成功恢复了被掩蔽的音素。通过前端音频增强修复输入信噪比,比仅仅更换模型后端能更大幅度地降低WER(词错误率)。有效的STT既依赖于底层模型架构,也同样依赖于预处理声学处理。
相似文章
我在大量真实世界数据上评估了顶级STT模型
对领先STT模型在1000多个嘈杂真实世界片段上的评估显示,大多数在嘈杂环境中表现不佳,其中DG Nova表现最佳。应用噪声消除显著提高了准确性。
@svpino:在将音频发送到语音转文本模型之前降低噪声会带来巨大改进。语音隔离是…
Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。
@FeitengLi: 其实这些问题都能很好的解决了 1. 扔掉 whisper,换 ASR 模型,Qwen3-ASR 就很不错幻觉很少、也有一些别的ASR选择,whisper 幻觉多也要求 30s片段,Qwen3-ASR 塞更长的音频识别越准确,最大支持 20…
推荐使用Qwen3-ASR替代Whisper以减少幻觉,使用LattifAI工具进行精确的音文本对齐和字幕生成,并介绍自己的OmniVAD-Kit项目用于语音活动检测。
使基础ASR模型适应构音障碍语音:一项案例研究
本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。
嘈杂环境中的语音代理
一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。