voice-agents

标签

Cards List
#voice-agents

AI代理能否向客户许下承诺?

Reddit r/AI_Agents ↗ · 昨天

文章讨论了AI语音代理向客户做出承诺的风险,例如安排回电或退款,这可能会给其他团队带来意外工作,并凸显自动化中的伦理问题。

0 人收藏 0 人点赞
#voice-agents

总词错误率(WER)在语音代理生产环境中毫无用处

Reddit r/AI_Agents ↗ · 4天前

文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。

0 人收藏 0 人点赞
#voice-agents

稳定性与速度:为语音智能体时代重新思考ASR

Reddit r/artificial ↗ · 2026-09-18

文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。

0 人收藏 0 人点赞
#voice-agents

@rohanpaul_ai:语音代理应逐步处理语音,但仅对已提交的文本采取行动,因为快速转录如果修改文本……

X AI KOLs Following ↗ · 2026-09-16 缓存

网易有道开源了Confucius4-R2T2,这是一款用于语音代理的流式ASR模型,它逐步处理语音并仅输出已提交的文本,以防止状态损坏。

0 人收藏 0 人点赞
#voice-agents

@rohanpaul_ai: 今天我的新闻通讯最新一期已发布。 https://rohan-paul.com/p/google-releases-gemini-38-live-for… Google Rel…

X AI KOLs Following ↗ · 2026-09-16 缓存

Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking,用于生产级语音代理,以及其他 AI 新闻,包括监管纠纷、安全担忧以及一篇关于模型工具链的斯坦福-麻省理工学院论文。

0 人收藏 0 人点赞
#voice-agents

构建AI智能体最难的部分不是编写代码,而是调试那个让你想把笔记本电脑扔出窗外的幻觉循环。

Reddit r/AI_Agents ↗ · 2026-09-15

一位AI开发者分享了在构建语音智能体和自动化工作流时常见的调试陷阱,强调了记录错误和在真实环境中测试等实用策略。

0 人收藏 0 人点赞
#voice-agents

推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

Google DeepMind Blog ↗ · 2026-09-15 缓存

Google 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是一组先进的AI模型,专为实时推理和语音代理设计,在各项基准测试中均取得了最高分。

0 人收藏 0 人点赞
#voice-agents

τ-Elicitation:评估语音代理中多轮实体提取的基准

arXiv cs.AI ↗ · 2026-09-15 缓存

本文介绍了τ-Elicitation,一个用于评估语音代理中多轮实体提取的基准,指出了策略选择和错误恢复是关键瓶颈。

0 人收藏 0 人点赞
#voice-agents

@alexandr_wang: 我们有劲爆内容要发布!

X AI KOLs Timeline ↗ · 2026-09-15 缓存

来自@alexandr_wang的一条推文分享了用户的通知,称@Muse现在可以使用语音代理拨打电话,质疑其现有功能并安排了一次通话。

0 人收藏 0 人点赞
#voice-agents

P50 内存检索的 15 毫秒对语音代理毫无作用

Reddit r/AI_Agents ↗ · 2026-09-14

这篇文章讨论了语音代理中内存检索的关键挑战,强调了测量每轮 P99 延迟、使用预取以及预算内存令牌以减少延迟并改善用户体验的必要性。

0 人收藏 0 人点赞
#voice-agents

继续、适应或让步:全双工代理中对重叠语音的轮内适应

arXiv cs.CL ↗ · 2026-09-14 缓存

论文介绍了Duplex Cue,一个评估全双工语音代理轮内适应的框架,通过比较人类和模型对重叠语音的反应。

0 人收藏 0 人点赞
#voice-agents

OpenAI推出GPT-Live-1用于全双工语音代理(阅读时间2分钟)

TLDR AI ↗ · 2026-09-11 缓存

OpenAI已推出GPT-Live-1,这是一款用于API的全双工语音模型,为开发者提供自然的双向语音对话能力,降低延迟并改善语音代理中的轮次交替。

0 人收藏 0 人点赞
#voice-agents

从零搭建 AI 语音智能体:真正耗费我们时间的环节

Reddit r/artificial ↗ · 2026-09-06

作者分享了构建生产级电话 AI 语音智能体的复盘,揭示大部分工程时间被电话基础设施、话轮检测、可观测性和故障处理所消耗,而非核心 LLM 行为。他们建议从一开始就使用 Vapi、Retell 或 Dasha 等托管平台,将工程精力集中在业务逻辑上。

0 人收藏 0 人点赞
#voice-agents

GLM得分高于GPT,但如何验证基准测试的有效性?

Reddit r/ArtificialInteligence ↗ · 2026-09-04

文章比较了GLM-5.3与GPT-5.5等AI模型在基准测试中的性能指标,强调了成本效益并质疑基准测试的效度,同时探讨高效的方法论评估方式。

0 人收藏 0 人点赞
#voice-agents

DuplexSpeechBench-IFEval: 评估全双工语音代理中的隐式指令遵循

arXiv cs.AI ↗ · 2026-09-04 缓存

本文介绍了DuplexSpeechBench-IFEval,一个用于评估全双工语音代理中隐式指令遵循的基准测试,包含1,038个测试用例,涵盖八个角色和五种协议,以评估实时语音系统对显式行为与角色隐含行为的遵循程度。

0 人收藏 0 人点赞
#voice-agents

@andimarafioti: 我正在寻找一位工程师来与我在Hugging Face一起构建语音代理。如果你喜欢我发布的演示,...

X AI KOLs Timeline ↗ · 2026-09-02 缓存

Hugging Face的一位工程师正在招聘构建语音代理的职位,邀请熟悉其演示和代码的候选人申请。

0 人收藏 0 人点赞
#voice-agents

实时语音AI能听到情绪——但它真的会用吗?

Reddit r/ArtificialInteligence ↗ · 2026-08-25

这项研究测试了实时语音AI模型在语音中识别情绪线索的能力,发现尽管它们能检测到痛苦或讽刺等情绪,但这些信息并不能可靠地影响决策,突显了当前系统在情感智能方面的差距。

0 人收藏 0 人点赞
#voice-agents

语音代理的最大延迟未必来自模型

Reddit r/ArtificialInteligence ↗ · 2026-08-22

语音代理常面临延迟问题,主要并非源于模型,而是端点检测等组件;优化VAD和采用合适的基准测试可有效降低轮次延迟。

0 人收藏 0 人点赞
#voice-agents

Claude 中的 ElevenLabs MCP

Product Hunt ↗ · 2026-08-17

ElevenLabs MCP 在 Claude 中允许用户在聊天系统中创建和管理语音代理,将 ElevenLabs 的语音技术与 Claude 的 AI 能力集成。

0 人收藏 0 人点赞
#voice-agents

@LangChain:已经在构建语音智能体?加入我们即将举办的网络研讨会,了解如何从执行、结果等方面评估它们……

X AI KOLs Following ↗ · 2026-08-11

LangChain 正在举办一场网络研讨会,内容是如何从执行、结果和体验三个方面评估语音智能体,涵盖工具使用、任务完成、延迟、中断以及对话摩擦等。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈