总词错误率(WER)在语音代理生产环境中毫无用处

Reddit r/AI_Agents 新闻

摘要

文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。

我们的ASR显示95%的准确率,所以没人质疑它,但后来有人实际检查了客户朗读IFSC代码的通话,发现大约一半至少错了一个字符。一个二十词句子中的一个错误单词仍然有意义,但银行代码中的一个错误字符就毫无价值了。在8kHz电话音频中,印度口音的说话者,M和N听起来一样,S和F,B和D和P。数字更糟,因为双五、五十五和五五意思相同,但模型将它们视为三种不同的输入。不常见的姓氏基本上是随机的,保单号码一旦字母和数字混合就有同样的问题,而我们一半的通话者在句子中途切换印地语和英语,所以模型会只选一种语言,破坏其余部分,而这正是他们朗读重要信息的时候。问题在于,我们几个月来一直向包括催收团队在内的所有人报告一个WER数字,这隐藏了他们关心的所有重要信息。一个错误的IFSC意味着支付失败,一个错误的名字意味着合规问题,而聚合数字没有告诉我们这些。现在我们分别跟踪每个字段,是的,数字很难看,但至少当催收团队说机器人又弄错了账号时,我们可以在数据中看到。我们正在研究受限解码和验证流程,但不确定这是否只是修补模型问题。
查看原文

相似文章

我的语音助手本来很智能,直到一个电话号码被转录错误。

Reddit r/AI_Agents

本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。