学习构建语音代理的结构化路径:从首次STT通话到生产部署
摘要
一份精选的开源学习路径,用于构建语音代理,涵盖从STT到生产部署,包含190+资源和一份5周计划。
语音是较难入门的代理模态之一,因为相关知识分散在众多厂商中,而失败模式(如延迟、话轮转换)直到给你造成麻烦才会显现。我维护了一个精选的学习路径,试图解决这个问题,免费且开源(MIT)。它按照实际工作的顺序排列:
- Foundations:从STT到LLM再到TTS的管道,以及你永远与之抗争的延迟预算
- Frameworks:选择一个(用于开源的LiveKit Agents或Pipecat)并部署一个hello-world
- Components:替换STT、TTS、LLM、VAD和话轮检测,以了解每一层的作用
- Telephony:通过SIP连接一个真实电话号码
- Evaluation and production:使其足够安全以发布,包括现在适用的FCC和EU AI Act法规
190+资源,每个都按级别标记,商业来源已标注。最后还有一份5周计划。
对于已经部署过语音代理的开发者:这个路径没有让你准备好应对哪些坑?我希望生产部分能减少意外。
相似文章
语音代理,通俗解释:STT+TTS 与 4 个可在浏览器中对话的演示代理 + 使用 RAG 和工具构建你自己的
一份使用语音转文字和文字转语音技术揭秘语音代理的指南,包含四个基于浏览器的演示代理以及使用RAG和工具的构建说明。
@svpino: 一步一步的视频教程,从零开始构建语音代理。我使用 Claude Code 来做这个,因为手写代码……
一个逐步视频教程,使用 Claude Code 和 AssemblyAI 的新 Voice Agent API 从零开始构建语音代理。
开源了一个面向生产环境的语音助手全栈启动模板(Web端和电话端共用一个worker)
开源了一个基于LiveKit、FastAPI和React的全栈生产级语音助手启动模板,通过单一代码路径同时处理Web和电话端,可使用Docker Compose一键部署。
在生产环境中运行语音代理8个月:出过的问题、修复方法以及我使用的系统提示
一位从业者分享了为一家律师事务所运行语音代理8个月的经验,详细说明了延迟、轮流发言和通话后工作流程等挑战,并提供了一个可用的系统提示。
构建像人类一样轮流说话的语音AI代理——没人提醒你的陷阱
本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。