构建像人类一样轮流说话的语音AI代理——没人提醒你的陷阱
摘要
本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。
花了数月时间构建实时语音AI代理——1对1角色以及多个代理运行社交推理游戏的多代理设置。
让我付出真实时间和金钱的教训:
轮流发言就是整个游戏。一旦人类说话立即停止,等待真正的静默,简短轮流回复。独白会毁掉一切。
"getUserMedia succeeded" ≠ 音频在流动。操作系统静音会让音轨保持静默,VAD永远不会触发,代理卡在"监听"状态。测量RMS,不要相信权限。
静音麦克风音轨并不会停止服务器端Realtime API的计费。VAD在模型服务器上运行。你必须在会话更新中关闭轮次检测才能真正暂停。
永远不要将代理自己的TTS反馈回STT。回声和自我监听循环是致命的。还要过滤敲击声、呼吸声、手机反馈音。
角色应随房间变化。在1对1中活跃,在群组中大多安静——仅在静默或被邀请时介入。
对于多代理编排,不要让模型自由运行。一个拥有轮次控制权的外部编排器优于代理自行决定。
对我来说仍很棘手:移动设备上的插话和误中断过滤。你是怎么处理的?
相似文章
从零搭建 AI 语音智能体:真正耗费我们时间的环节
作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。
构建一个能打真实电话的AI代理(包含等待音乐、IVR、愤怒的人类)——截至目前我学到的经验
作者构建了callitdone.today,一个能拨打真实电话、导航IVR菜单、等待通话并与人交谈的AI语音代理,分享了关键的技术挑战和经验教训。
构建AI智能体最难的部分不是编写代码,而是调试那个让你想把笔记本电脑扔出窗外的幻觉循环。
一位AI开发者分享了在构建语音智能体和自动化工作流时常见的调试陷阱,强调了记录错误和在真实环境中测试等实用策略。
我的多智能体语音游戏中,轮流发言是可以解决的。但给智能体共享且准确的记忆才是真正的挑战——我大约完成了80%
一位开发者描述了构建一个多智能体语音社交推理游戏的过程,通过一个中央指挥解决了轮流发言问题,但在共享记忆以及在将对话历史压缩为结构化状态时保留社交潜台词方面遇到了困难。
我构建语音代理三年了。以下是让它们听起来像真人的提示习惯。
本文分享了让语音AI代理听起来更像人类的关键提示习惯,包括大声朗读提示、明确使用填充词、展示示例而非说明、处理特殊字符,以及允许代理说不知道。