vad

标签

Cards List
#vad

我测量了AI语音代理回复前的停顿时间,在xAI的实时引擎上,其下限约为1.3秒

Reddit r/AI_Agents · 5天前

作者测量了xAI实时语音引擎的响应延迟,发现下限约为1.3秒,并通过在提示中编写开场白来解决固定首条消息的问题。

0 人收藏 0 人点赞
#vad

语音代理的最大延迟未必来自模型

Reddit r/ArtificialInteligence · 2026-08-22

语音代理常面临延迟问题,主要并非源于模型,而是端点检测等组件;优化VAD和采用合适的基准测试可有效降低轮次延迟。

0 人收藏 0 人点赞
#vad

@LangChain:追踪中的完整音频、STT/TTS 延迟、中断 + VAD,仅需几行代码即可设置

X AI KOLs Timeline · 2026-07-21 缓存

LangChain 推出面向语音框架(Pipecat、LiveKit、OpenAI Realtime、Gemini Live)的 LangSmith 追踪功能,支持完整音频监控、STT/TTS 延迟跟踪、中断检测和 VAD 分析,且仅需极少量代码。

0 人收藏 0 人点赞
#vad

构建像人类一样轮流说话的语音AI代理——没人提醒你的陷阱

Reddit r/AI_Agents · 2026-06-20

本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。

0 人收藏 0 人点赞
#vad

@FeitengLi: 其实这些问题都能很好的解决了 1. 扔掉 whisper,换 ASR 模型,Qwen3-ASR 就很不错幻觉很少、也有一些别的ASR选择,whisper 幻觉多也要求 30s片段,Qwen3-ASR 塞更长的音频识别越准确,最大支持 20…

X AI KOLs Timeline · 2026-05-15 缓存

推荐使用Qwen3-ASR替代Whisper以减少幻觉,使用LattifAI工具进行精确的音文本对齐和字幕生成,并介绍自己的OmniVAD-Kit项目用于语音活动检测。

0 人收藏 0 人点赞
#vad

为服务型企业运行生产级语音代理6个月:延迟计算远比演示所暗示的复杂。

Reddit r/ArtificialInteligence · 2026-05-15

在为服务型企业运行语音AI代理6个月后,作者揭示了现实世界中的延迟是双峰的(中位数约800ms,p95约2.4s),而p95决定了用户的感知。诸如VAD误触发、长提示词下函数调用退化、以及TTS质量等问题比LLM的选择更重要,而多语言支持则增加了显著的成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈