我分析了10000通语音AI电话,其中40%存在类似问题
摘要
对10,000通语音AI电话的分析揭示了关键失败点:STT错误率、前8秒混乱、中断处理、长时间静默、工具调用延迟、LLM故障以及转接失败——为代理构建者提供了实用见解。
部署语音AI最重要的部分就是弄清楚第56通电话上发生了什么。我们在构建开源语音AI平台(dograh)时也遇到了类似的问题!所以和其他人一样,我做了一个实验,通过聆听并使用LLM系统来分析失败点!!LLM相关的问题可以忽略不计!
STT / 词错误率 ~38% - 实际电话环境运行在8 kHz - 这很糟糕
前8秒混乱 ~34% - 人们会突然插话,一旦他们意识到这是AI代理,他们的行为就会改变 :)
中断处理 ~28% - 把填充词(比如“嗯”)当作中断,最重要的是之后会丢失上下文
长时间静默 ~22% - 在访问知识库或工具时出现静默,然后用户感到困惑
工具调用延迟 ~19% - 管理API延迟是最困难的部分,但总有办法……
LLM故障模式 ~15% - 幻觉、指令漂移,懂的都懂
转接失败 ~11% - 没有清晰的人工转接路径
通过在各个组织部署语音代理,我们学到了很多,正在想办法解决这些问题……各位代理构建者,你们在如何解决这些问题?
相似文章
从零搭建 AI 语音智能体:真正耗费我们时间的环节
作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。
在生产语音AI栈中我们反复看到的五个可观测性缺口
讨论了生产语音AI栈中五个常见的可观测性缺口,包括基础设施故障与对话失败混合、缺乏VAD可见性、采样不足、自动生成的评估噪音大以及评估层级错误。
目前AI语音代理面临的最大问题是什么?
讨论AI语音代理在真实客户交互中面临的主要挑战,如口音处理、延迟和集成,并邀请企业分享经验。
我的语音助手本来很智能,直到一个电话号码被转录错误。
本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。
我从构建一个处理了5万次通话的外呼语音智能体中学到了什么
作者分享了构建一个处理了5万次通话的外呼语音智能体的关键经验,强调成功在于调度和合规等周边系统,而非AI模型本身。