嘈杂环境中的语音代理
摘要
一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。
我从一年多前就开始从事语音代理方面的工作。但在某些环境中,它们总是出问题——噪声、周围人说话等等。我寻找过解决方案,甚至在几个子版块(subreddits)上提问,但都没找到好用的。作为一家语音公司,我们决定解决这个问题。我们训练了一个模型,它能识别主要说话者并消除所有其他声音。经过数月的探索、数据获取和多次模型迭代,我们构建出的东西现在正在超越行业基准——在领先的ASR模型上实现了50%更低的词错误率(WER)。由于我经常关注并从本群学习,只是想分享一下这段经历。:)
相似文章
我在大量真实世界数据上评估了顶级STT模型
对领先STT模型在1000多个嘈杂真实世界片段上的评估显示,大多数在嘈杂环境中表现不佳,其中DG Nova表现最佳。应用噪声消除显著提高了准确性。
@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…
南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。
语音助手能处理双语客户吗?前沿ASR在代码切换语音上的基准测试
ServiceNow AI 发布了一个基准测试和数据集,用于评估自动语音识别(ASR)在跨四种语言对(西班牙语-英语、法语-英语、加拿大法语-英语、德语-英语)的企业HR和IT场景中的代码切换语音上的表现,发现当前前沿ASR模型在代码切换方面仍存在困难,导致错误率较高。
房间混响和低信噪比对STT准确性的影响远大于模型大小
房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。
我的语音助手本来很智能,直到一个电话号码被转录错误。
本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。