我花了两个月为AI语音智能体构建可观测性,因为调试它们快把我逼疯了
摘要
开发者构建了VoiceOBS,一款AI语音智能体的可观测性工具,提供延迟分解、情感分析、幻觉检测等功能,并与Vapi集成。
我一直在Vapi上构建语音智能体,但总是遇到同样的问题:通话出了问题,客户挂断,我却完全不知道原因。是延迟问题吗?LLM产生幻觉了吗?函数调用超时了吗?现有的可观测性工具(如Helicone、Langfuse)只显示提示词和响应,它们是针对文本而非语音构建的。它们无法看到真正破坏语音智能体的那些因素。所以我构建了VoiceOBS。你可以将你的Vapi(正在集成Retell)账户通过webhook连接,然后每次通话都会自动分析:
* 延迟分解:STT / LLM / TTS,包含p50和p95
* 每次通话的情感、意图和CSAT预估(由Claude分析)
* 幻觉标记
* 完整的可搜索转录
* 结束原因分解,以便了解通话*实际*结束的原因
设置大约需要60秒:注册,创建集成,将webhook URL粘贴到Vapi,发起一次通话,它就会显示分析结果。Beta期间免费(每月100次通话,无需信用卡)。我真正想要的是诚实的反馈——哪些地方令人困惑,缺少什么,什么会让你真正使用它。很高兴回答任何问题。谢谢。
相似文章
从零搭建 AI 语音智能体:真正耗费我们时间的环节
作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。
OpenObserve 的 AI 可观测性
OpenObserve 推出了一个 AI 原生的开源可观测性平台,旨在追踪 AI 代理和大型语言模型 (LLMs),为开发者提供关于性能、成本和质量的详细洞察。
被Vapi坑后,我自建了语音AI平台。撰写了我寻找平台过程中学到的所有经验。
作者分享因不满Vapi而自建语音AI平台的经验教训,揭示了隐藏成本、实际延迟问题和白标的缺陷,并为评估平台的代理机构业主提供免费指南。
构建AI智能体最难的部分不是编写代码,而是调试那个让你想把笔记本电脑扔出窗外的幻觉循环。
一位AI开发者分享了在构建语音智能体和自动化工作流时常见的调试陷阱,强调了记录错误和在真实环境中测试等实用策略。
你用什么进行可观测性?
一位开发者讨论了AI代理缺乏合适的可观测性工具,对现有解决方案如Opik表示失望,并希望有一个支持OpenTelemetry的服务,用于分析代理会话和故障模式。