总词错误率(WER)在语音代理生产环境中毫无用处
摘要
文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。
我们的ASR显示95%的准确率,所以没人质疑它,但后来有人实际检查了客户朗读IFSC代码的通话,发现大约一半至少错了一个字符。一个二十词句子中的一个错误单词仍然有意义,但银行代码中的一个错误字符就毫无价值了。在8kHz电话音频中,印度口音的说话者,M和N听起来一样,S和F,B和D和P。数字更糟,因为双五、五十五和五五意思相同,但模型将它们视为三种不同的输入。不常见的姓氏基本上是随机的,保单号码一旦字母和数字混合就有同样的问题,而我们一半的通话者在句子中途切换印地语和英语,所以模型会只选一种语言,破坏其余部分,而这正是他们朗读重要信息的时候。问题在于,我们几个月来一直向包括催收团队在内的所有人报告一个WER数字,这隐藏了他们关心的所有重要信息。一个错误的IFSC意味着支付失败,一个错误的名字意味着合规问题,而聚合数字没有告诉我们这些。现在我们分别跟踪每个字段,是的,数字很难看,但至少当催收团队说机器人又弄错了账号时,我们可以在数据中看到。我们正在研究受限解码和验证流程,但不确定这是否只是修补模型问题。
相似文章
我的语音助手本来很智能,直到一个电话号码被转录错误。
本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。
VoiceCodeBench: 评估自动语音识别中的精确结构化令牌恢复
VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。
超越WER:带口音对话式ASR中的实体和不流畅性召回率
本文提出一个用于带口音对话式ASR的三阶段流水线,以提高实体和不流畅性的召回率,实现80-85%的实体召回率,并且用更少的参数优于基线系统。
语音AI在生产中表现不佳,实际让你付出什么代价?
一位从业者回顾了在呼叫中心使用语音AI的经历,详细说明了解决方案在生产中表现不佳时的隐性成本,并希望从有类似实际经验的人那里获得诚实的反馈。
推出 Real World VoiceEQ:衡量语音AI的拟人化质量
Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。