标签
文章讨论了AI语音代理向客户做出承诺的风险,例如安排回电或退款,这可能会给其他团队带来意外工作,并凸显自动化中的伦理问题。
文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。
文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。
网易有道开源了Confucius4-R2T2,这是一款用于语音代理的流式ASR模型,它逐步处理语音并仅输出已提交的文本,以防止状态损坏。
Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking,用于生产级语音代理,以及其他 AI 新闻,包括监管纠纷、安全担忧以及一篇关于模型工具链的斯坦福-麻省理工学院论文。
一位AI开发者分享了在构建语音智能体和自动化工作流时常见的调试陷阱,强调了记录错误和在真实环境中测试等实用策略。
Google 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是一组先进的AI模型,专为实时推理和语音代理设计,在各项基准测试中均取得了最高分。
本文介绍了τ-Elicitation,一个用于评估语音代理中多轮实体提取的基准,指出了策略选择和错误恢复是关键瓶颈。
来自@alexandr_wang的一条推文分享了用户的通知,称@Muse现在可以使用语音代理拨打电话,质疑其现有功能并安排了一次通话。
这篇文章讨论了语音代理中内存检索的关键挑战,强调了测量每轮 P99 延迟、使用预取以及预算内存令牌以减少延迟并改善用户体验的必要性。
论文介绍了Duplex Cue,一个评估全双工语音代理轮内适应的框架,通过比较人类和模型对重叠语音的反应。
OpenAI已推出GPT-Live-1,这是一款用于API的全双工语音模型,为开发者提供自然的双向语音对话能力,降低延迟并改善语音代理中的轮次交替。
作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。
文章比较了GLM-5.3与GPT-5.5等AI模型在基准测试中的性能指标,强调了成本效益并质疑基准测试的效度,同时探讨高效的方法论评估方式。
本文介绍了DuplexSpeechBench-IFEval,一个用于评估全双工语音代理中隐式指令遵循的基准测试,包含1,038个测试用例,涵盖八个角色和五种协议,以评估实时语音系统对显式行为与角色隐含行为的遵循程度。
Hugging Face的一位工程师正在招聘构建语音代理的职位,邀请熟悉其演示和代码的候选人申请。
这项研究测试了实时语音AI模型在语音中识别情绪线索的能力,发现尽管它们能检测到痛苦或讽刺等情绪,但这些信息并不能可靠地影响决策,突显了当前系统在情感智能方面的差距。
ElevenLabs MCP 在 Claude 中允许用户在聊天系统中创建和管理语音代理,将 ElevenLabs 的语音技术与 Claude 的 AI 能力集成。
LangChain 正在举办一场网络研讨会,内容是如何从执行、结果和体验三个方面评估语音智能体,涵盖工具使用、任务完成、延迟、中断以及对话摩擦等。