@DanKornas: 实时语音智能体需要的不仅仅是 LLM 调用——它们还需要传输、语音组件、通话处理以及部署路径。
摘要
TEN 是一个用于构建实时多模态对话式 AI 智能体的框架,提供可配置的 STT、LLM 和 TTS 组件、可视化设计器,以及包括自托管和拆分部署在内的部署选项。
查看缓存全文
缓存时间: 2026/07/31 10:52
实时语音智能体不仅仅需要 LLM 调用——它们还需要传输、语音组件、轮次处理以及一条部署路径。
TEN 是一个面向开发者的实时多模态对话式 AI 框架,专为构建语音和交互式智能体应用而设计。
它通过基于扩展的 STT、LLM 和 TTS 组件、可视化 TMAN Designer 以及可运行的示例,帮助您组装和定制智能体。
主要特性: • 实时语音助手 – 同时支持 RTC 和 WebSocket 连接。 • 可配置的智能体组件 – 在 TMAN Designer 或 property.json 中编辑 STT、LLM 和 TTS 属性。 • 实用示例 – 探索说话人分离、转写、SIP 通话、唇形同步虚拟形象以及提示驱动的涂鸦。 • 自托管路径 – 将示例构建为 Docker 镜像并运行。 • 拆分部署选项 – 将后端托管在容器平台上,将前端托管在 Vercel 或 Netlify 上。
根框架使用 Apache 2.0 许可并附带附加限制;packages/ 中的组件在 Apache 2.0 许可下发布。
链接见回复中。
相似文章
@DanKornas:构建实时语音智能体需要协调音频流、轮次检测、中断、模型调用和媒体路由…
VideoSDK AI Agents 是一个开源 Python 框架,用于构建生产可用的实时语音和多模态 AI 智能体,这些智能体可以以参与者身份加入 VideoSDK 房间,支持统一 Pipeline 配置和多种执行模式。
livekit/agents
LiveKit Agents 是一个用于构建实时、多模态语音智能体的开源框架,这些智能体能够看、听和理解,并具备灵活的 STT/LLM/TTS 集成、任务调度、电话支持、MCP 兼容性以及内置测试框架。
@AISuperDomain: 实时语音 Agent 正在从“演示玩具”走向真正可用,而 LiveKit Agents 可能是目前最完整的开源框架之一。 它不只是把 STT、LLM 和 TTS 串起来,还直接提供: • WebRTC 实时音视频 • 电话呼入与呼出 • …
LiveKit Agents 是一个开源的实时语音 Agent 框架,支持 WebRTC、电话集成、语义轮次检测、MCP 工具调用和多 Agent 交接,帮助开发者快速构建 AI 客服、电话机器人等实时语音应用。
你的语音助手响应慢可能不是因为大语言模型。
一位开发者驳斥了常见的观点,即LLM延迟是语音助手响应慢的主要原因,并解释说,延迟往往源于更早的阶段,如音频捕获、语音活动检测(VAD)和语音转文字(STT)。他建议记录特定的延迟指标,并测试不同的STT/TTS提供商和编排框架来诊断问题。
从零搭建 AI 语音智能体:真正耗费我们时间的环节
作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。