标签
NVIDIA 宣布推出 Magpie 多语言 TTS,这是一个开放权重的文本转语音模型,支持 12 种语言,可通过 NVIDIA NIM 进行低延迟部署,用于构建生产级语音代理。
讨论语音代理在转录为文本时如何丢失语调、犹豫和说话人身份等副语言信号,并质疑这些特征是否以及如何在下游被捕获和使用。
一位开发者询问人们在生产环境的语音智能体中使用哪些 STT API,比较了 Deepgram、AssemblyAI 和 Smallest AI Pulse,并指出了常见的故障点,如端点检测、延迟和打断。
LiveKit Agents 是一个开源的实时语音 Agent 框架,支持 WebRTC、电话集成、语义轮次检测、MCP 工具调用和多 Agent 交接,帮助开发者快速构建 AI 客服、电话机器人等实时语音应用。
Google Devs分享如何使用Google ADK、Gemini Live和LangSmith构建具有完整交互可追溯性的语音助手,包括工具调用和令牌成本。
本文讨论了在语音代理中分离概率性语言理解与确定性工具执行的挑战,建议在触发结构化操作之前对条件性短语进行置信度检查,正如使用Vomo AI所实现的那样。
Encore AI 已筹集3000万美元,用于开发通过分析通话录音和文字记录来从客户互动中学习的AI语音代理。
深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。
本文探讨了扩展语音代理时面临的挑战,指出问题会出现在不同层面,并找出了通常最先限制性能的瓶颈。
LangChain 推出面向语音框架(Pipecat、LiveKit、OpenAI Realtime、Gemini Live)的 LangSmith 追踪功能,支持完整音频监控、STT/TTS 延迟跟踪、中断检测和 VAD 分析,且仅需极少量代码。
一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。
Cars24 利用 OpenAI 技术构建了由 AI 驱动的语音和聊天代理,每月处理超过一百万分钟的对话,自动化了购买、销售和融资汽车的完整客户旅程。
文章指出了语音助手的一个结构性缺陷:它们无法检测到在多个对话回合中过度承诺的情况,并描述构建了一个确定性检查器,能在不依赖LLM评估的情况下标记矛盾。
本文评估了Gemini模型作为音频裁判对全双工语音代理对话进行评分的可靠性,发现Gemini 2.5 Flash在多数维度上与人类评分者一致性较强,但模型替换需要重新验证。
Eric Schmidt建议创办一家自主型AI公司,以利用构建者供不应求的市场,并建议构建和销售AI语音代理,每月收费1万美元。
本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。
一份使用语音转文字和文字转语音技术揭秘语音代理的指南,包含四个基于浏览器的演示代理以及使用RAG和工具的构建说明。