@DanKornas: 实时语音智能体需要的不仅仅是 LLM 调用——它们还需要传输、语音组件、通话处理以及部署路径。

X AI KOLs Timeline 工具

摘要

TEN 是一个用于构建实时多模态对话式 AI 智能体的框架,提供可配置的 STT、LLM 和 TTS 组件、可视化设计器,以及包括自托管和拆分部署在内的部署选项。

实时语音智能体需要的不仅仅是 LLM 调用——它们还需要传输、语音组件、通话处理以及部署路径。 TEN 是一个用于构建实时多模态对话式 AI 的框架,面向构建语音和交互式智能体应用的开发者。 它通过基于扩展的 STT、LLM 和 TTS 组件、可视化 TMAN Designer 以及可运行示例,帮助您组装和定制智能体。 主要特性: • 实时语音助手 – 同时支持 RTC 和 WebSocket 连接。 • 可配置的智能体组件 – 在 TMAN Designer 或 property.json 中编辑 STT、LLM 和 TTS 属性。 • 实用示例 – 探索说话人分离、转写、SIP 通话、唇形同步虚拟形象和提示驱动的涂鸦。 • 自托管路径 – 将示例构建并运行为 Docker 镜像。 • 拆分部署选项 – 将后端托管在容器平台上,将前端托管在 Vercel 或 Netlify 上。 根框架使用 Apache 2.0 并附加限制;packages/ 下的组件以 Apache 2.0 许可证发布。 回复中有链接
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:52

实时语音智能体不仅仅需要 LLM 调用——它们还需要传输、语音组件、轮次处理以及一条部署路径。

TEN 是一个面向开发者的实时多模态对话式 AI 框架,专为构建语音和交互式智能体应用而设计。

它通过基于扩展的 STT、LLM 和 TTS 组件、可视化 TMAN Designer 以及可运行的示例,帮助您组装和定制智能体。

主要特性: • 实时语音助手 – 同时支持 RTC 和 WebSocket 连接。 • 可配置的智能体组件 – 在 TMAN Designer 或 property.json 中编辑 STT、LLM 和 TTS 属性。 • 实用示例 – 探索说话人分离、转写、SIP 通话、唇形同步虚拟形象以及提示驱动的涂鸦。 • 自托管路径 – 将示例构建为 Docker 镜像并运行。 • 拆分部署选项 – 将后端托管在容器平台上,将前端托管在 Vercel 或 Netlify 上。

根框架使用 Apache 2.0 许可并附带附加限制;packages/ 中的组件在 Apache 2.0 许可下发布。

链接见回复中。

相似文章

livekit/agents

GitHub Trending (daily)

LiveKit Agents 是一个用于构建实时、多模态语音智能体的开源框架,这些智能体能够看、听和理解,并具备灵活的 STT/LLM/TTS 集成、任务调度、电话支持、MCP 兼容性以及内置测试框架。

@AISuperDomain: 实时语音 Agent 正在从“演示玩具”走向真正可用,而 LiveKit Agents 可能是目前最完整的开源框架之一。 它不只是把 STT、LLM 和 TTS 串起来,还直接提供: • WebRTC 实时音视频 • 电话呼入与呼出 • …

X AI KOLs Timeline

LiveKit Agents 是一个开源的实时语音 Agent 框架,支持 WebRTC、电话集成、语义轮次检测、MCP 工具调用和多 Agent 交接,帮助开发者快速构建 AI 客服、电话机器人等实时语音应用。

你的语音助手响应慢可能不是因为大语言模型。

Reddit r/AI_Agents

一位开发者驳斥了常见的观点,即LLM延迟是语音助手响应慢的主要原因,并解释说,延迟往往源于更早的阶段,如音频捕获、语音活动检测(VAD)和语音转文字(STT)。他建议记录特定的延迟指标,并测试不同的STT/TTS提供商和编排框架来诊断问题。

从零搭建 AI 语音智能体:真正耗费我们时间的环节

Reddit r/artificial

作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。