我分析了10000通语音AI电话,其中40%存在类似问题

Reddit r/AI_Agents 新闻

摘要

对10,000通语音AI电话的分析揭示了关键失败点:STT错误率、前8秒混乱、中断处理、长时间静默、工具调用延迟、LLM故障以及转接失败——为代理构建者提供了实用见解。

部署语音AI最重要的部分就是弄清楚第56通电话上发生了什么。我们在构建开源语音AI平台(dograh)时也遇到了类似的问题!所以和其他人一样,我做了一个实验,通过聆听并使用LLM系统来分析失败点!!LLM相关的问题可以忽略不计! STT / 词错误率 ~38% - 实际电话环境运行在8 kHz - 这很糟糕 前8秒混乱 ~34% - 人们会突然插话,一旦他们意识到这是AI代理,他们的行为就会改变 :) 中断处理 ~28% - 把填充词(比如“嗯”)当作中断,最重要的是之后会丢失上下文 长时间静默 ~22% - 在访问知识库或工具时出现静默,然后用户感到困惑 工具调用延迟 ~19% - 管理API延迟是最困难的部分,但总有办法…… LLM故障模式 ~15% - 幻觉、指令漂移,懂的都懂 转接失败 ~11% - 没有清晰的人工转接路径 通过在各个组织部署语音代理,我们学到了很多,正在想办法解决这些问题……各位代理构建者,你们在如何解决这些问题?
查看原文

相似文章

从零搭建 AI 语音智能体:真正耗费我们时间的环节

Reddit r/artificial

作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。

我的语音助手本来很智能,直到一个电话号码被转录错误。

Reddit r/AI_Agents

本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。