构建像人类一样轮流说话的语音AI代理——没人提醒你的陷阱

Reddit r/AI_Agents 工具

摘要

本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。

花了数月时间构建实时语音AI代理——1对1角色以及多个代理运行社交推理游戏的多代理设置。 让我付出真实时间和金钱的教训: 轮流发言就是整个游戏。一旦人类说话立即停止,等待真正的静默,简短轮流回复。独白会毁掉一切。 "getUserMedia succeeded" ≠ 音频在流动。操作系统静音会让音轨保持静默,VAD永远不会触发,代理卡在"监听"状态。测量RMS,不要相信权限。 静音麦克风音轨并不会停止服务器端Realtime API的计费。VAD在模型服务器上运行。你必须在会话更新中关闭轮次检测才能真正暂停。 永远不要将代理自己的TTS反馈回STT。回声和自我监听循环是致命的。还要过滤敲击声、呼吸声、手机反馈音。 角色应随房间变化。在1对1中活跃,在群组中大多安静——仅在静默或被邀请时介入。 对于多代理编排,不要让模型自由运行。一个拥有轮次控制权的外部编排器优于代理自行决定。 对我来说仍很棘手:移动设备上的插话和误中断过滤。你是怎么处理的?
查看原文

相似文章

从零搭建 AI 语音智能体:真正耗费我们时间的环节

Reddit r/artificial

作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。