开源了一个面向生产环境的语音助手全栈启动模板(Web端和电话端共用一个worker)
摘要
开源了一个基于LiveKit、FastAPI和React的全栈生产级语音助手启动模板,通过单一代码路径同时处理Web和电话端,可使用Docker Compose一键部署。
大多数语音助手教程都止步于"这是一个能回话的脚本。" 从演示到生产环境之间的差距在于围绕它的一切:生成房间令牌、真正的客户端、电话集成、部署、测试。我一直在重建这些,所以我将其打包成一个开源启动模板(MIT许可)。它是一个基于LiveKit的语音助手,分为三个部分:语音工作器(STT→LLM→TTS,带有语音端点检测)、一个FastAPI令牌服务器,以及一个带有实时转录和文本聊天的React客户端。我最满意的部分是:Web和SIP(电话)呼叫通过同一个参与者分支访问同一个助手,因此你不需要为"在浏览器中对话"和"拨打号码"维护两条代码路径。你可以通过添加功能工具或将任务移交来扩展助手,并且提供商是可切换的。Docker Compose用一个命令运行整个技术栈。对于那些已经部署过语音助手的人:从演示到生产环境之间的差距在哪里最让你头疼?我希望这个启动模板能覆盖真正的痛点,而不仅仅是顺风顺水的情况。
相似文章
livekit/agents
LiveKit Agents 是一个用于构建实时、多模态语音智能体的开源框架,这些智能体能够看、听和理解,并具备灵活的 STT/LLM/TTS 集成、任务调度、电话支持、MCP 兼容性以及内置测试框架。
@AISuperDomain: 实时语音 Agent 正在从“演示玩具”走向真正可用,而 LiveKit Agents 可能是目前最完整的开源框架之一。 它不只是把 STT、LLM 和 TTS 串起来,还直接提供: • WebRTC 实时音视频 • 电话呼入与呼出 • …
LiveKit Agents 是一个开源的实时语音 Agent 框架,支持 WebRTC、电话集成、语义轮次检测、MCP 工具调用和多 Agent 交接,帮助开发者快速构建 AI 客服、电话机器人等实时语音应用。
OpenAI推出GPT-Live-1用于全双工语音代理(阅读时间2分钟)
OpenAI已推出GPT-Live-1,这是一款用于API的全双工语音模型,为开发者提供自然的双向语音对话能力,降低延迟并改善语音代理中的轮次交替。
学习构建语音代理的结构化路径:从首次STT通话到生产部署
一份精选的开源学习路径,用于构建语音代理,涵盖从STT到生产部署,包含190+资源和一份5周计划。
从零搭建 AI 语音智能体:真正耗费我们时间的环节
作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。