livekit/agents
摘要
LiveKit Agents 是一个用于构建实时、多模态语音智能体的开源框架,这些智能体能够看、听和理解,并具备灵活的 STT/LLM/TTS 集成、任务调度、电话支持、MCP 兼容性以及内置测试框架。
查看缓存全文
缓存时间: 2026/08/03 13:30
🎙️ 入门智能体
一个针对语音对话优化的入门智能体。
代码
🔄 多人按键说话
通过按键说话(push-to-talk)响应房间内的多位用户。
代码
🎵 背景音频
用于提升真实感的环境氛围声和思考音效。
代码
🛠️ 动态工具创建
动态创建函数工具。
代码
☎️ 外呼智能体
发起外呼电话的智能体。
代码
📋 结构化输出
使用LLM的结构化输出来引导TTS的语气。
代码
🔌 MCP支持
使用来自MCP服务器的工具。
代码
💬 纯文本智能体
完全跳过语音,将相同的代码用于纯文本集成。
代码
📝 多人转录器
生成房间内所有用户的转录文本。
代码
🎥 视频虚拟形象
使用Tavus、Bithuman、LemonSlice等添加AI虚拟形象。
代码
🍽️ 餐厅订餐与预约
一个处理餐厅来电的完整智能体示例。
代码
👁️ Gemini Live视觉
一个具有视觉能力的Gemini Live智能体的完整示例(包括iOS应用)。
代码
相似文章
@AISuperDomain: 实时语音 Agent 正在从“演示玩具”走向真正可用,而 LiveKit Agents 可能是目前最完整的开源框架之一。 它不只是把 STT、LLM 和 TTS 串起来,还直接提供: • WebRTC 实时音视频 • 电话呼入与呼出 • …
LiveKit Agents 是一个开源的实时语音 Agent 框架,支持 WebRTC、电话集成、语义轮次检测、MCP 工具调用和多 Agent 交接,帮助开发者快速构建 AI 客服、电话机器人等实时语音应用。
@DanKornas: 实时语音智能体需要的不仅仅是 LLM 调用——它们还需要传输、语音组件、通话处理以及部署路径。
TEN 是一个用于构建实时多模态对话式 AI 智能体的框架,提供可配置的 STT、LLM 和 TTS 组件、可视化设计器,以及包括自托管和拆分部署在内的部署选项。
@DanKornas:构建实时语音智能体需要协调音频流、轮次检测、中断、模型调用和媒体路由…
VideoSDK AI Agents 是一个开源 Python 框架,用于构建生产可用的实时语音和多模态 AI 智能体,这些智能体可以以参与者身份加入 VideoSDK 房间,支持统一 Pipeline 配置和多种执行模式。
Speakeasy 推出 Kit
Speakeasy 推出 Kit,一款编程智能体运行时,将终端客户端、Agent Client Protocol 服务器、A2A 端点和子智能体编排器整合为单一静态二进制文件,旨在实现更快、更低成本的 AI 编程工作流。
@mylifcc: 语音 Agent 正在爆发,生产里却大多还是黑盒。 昨天(7月21日)LangSmith 正式上线了 Python 端语音 tracing 支持,覆盖目前最主流的 4 个框架: Pipecat LiveKit OpenAI Realtim…
LangSmith 正式上线 Python 端语音 tracing 支持,覆盖 Pipecat、LiveKit、OpenAI Realtime 和 Gemini Live 四个主流框架,将语音对话纳入与文本 Agent 同一套可观测、可评估的工作流,解决了语音 Agent 可调试性差的痛点。