房间混响和低信噪比对STT准确性的影响远大于模型大小

Reddit r/ArtificialInteligence 新闻

摘要

房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。

在许多STT讨论中,当转录失败时,人们会立即归咎于模型架构,假设解决方案是升级从Whisper-medium到Large-v3,或者调高Temperature设置。几乎没有人检查Mel频谱图,看声学掩蔽实际上对输入音频做了什么。我用手机MEMS麦克风进行了一次快速声学测试,麦克风放置在距离2.5米外的一张靠近窗户的木桌上。我朗读了一个包含清擦音和短语“do not approve”的控制句。通过小扬声器回放时,人耳会自然地插补缺失的声音。但检查STFT(短时傅里叶变换)帧后,发现两个物理问题:来自窗户交通的低频隆隆声(200Hz到500Hz)压缩了动态范围,抬高了噪声基底。房间混响(硬桌面的$T_{60}$反射)产生了梳状滤波,削弱了区分清辅音(如/s/或/t/)所需的高频能量(4kHz到8kHz)。当直接在本地Whisper-large-v3实例上运行未经预处理的原始音频时,缺失的频谱能量导致令牌解码错误。然而,通过vomo ai处理同一文件后,输出明显更干净。其云端流水线包含自适应谱减法和前端DSP滤波,在将帧送入解码器之前清理低频噪声基底,成功恢复了被掩蔽的音素。通过前端音频增强修复输入信噪比,比仅仅更换模型后端能更大幅度地降低WER(词错误率)。有效的STT既依赖于底层模型架构,也同样依赖于预处理声学处理。
查看原文

相似文章

使基础ASR模型适应构音障碍语音:一项案例研究

arXiv cs.CL

本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。

嘈杂环境中的语音代理

Reddit r/AI_Agents

一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。