@svpino:为什么这么多AI电话智能体在你打断它们之前听起来很聪明?即使这些智能体给出合理……
摘要
Deepgram发布了Flux TTS,一种流式、对话原生的文本转语音模型,能跨对话轮次保留语气、节奏和上下文,处理打断,并实现低至80ms的延迟,让语音AI感觉更自然。
查看缓存全文
缓存时间: 2026/08/12 20:31
为什么这么多由 AI 驱动的语音代理在被打断之前听起来都很聪明?
即使这些代理给出了合理的回答,你挂断电话后仍然会觉得,跟你说话的是一个一次只读一句话的机器。
我们至今还没有打造出真正像人的语音代理。
问题在于,传统的文本转语音(TTS)把代理生成的每一行都当作一个独立的任务来处理。
TTS 模型不会保留上一句话的语气、节奏或上下文。
这就是为什么语音 AI 仍然如此生硬的原因。
Deepgram 刚刚发布了 Flux TTS 来解决这个问题:
Flux TTS 是一个流式、面向对话的原生语音模型,目标只有一个:在代理轮次之间保留上下文,让你的对话保持响应及时、连贯一致,并且听起来自然。
据我目前了解,它有 3 大亮点:
-
Flux TTS 能记住对话内容,并在不同轮次之间延续语气、节奏和上下文。
-
它支持实时流式输出,延迟最低可达 80ms。
-
它能处理打断情况,并能在您插话后自然地恢复。
如果你正在构建语音代理,不妨看看 Flux TTS,帮助你的代理在整个对话过程中保持上下文,并以更自然的方式回应:
https://fandf.co/3TDgnXW
感谢 @DeepgramAI 团队与我在本篇内容上的合作。
Deepgram Flux TTS:具备对话感知能力的文本转语音
来源:https://deepgram.com/product/text-to-speech/flux?utm_source=fnf&utm_medium=x&utm_campaign=august&utm_term=svaldarrama&utm_content=flux-tts 现已推出
Flux TTS。继续对话。
专为实时对话而构建的文本转语音。Flux TTS 读取的是整个对话,而不仅仅是当前这一行,从第一句回应到最后一句,全程保持上下文。
点击任意语音。开始一段对话。
免费注册(https://console.deepgram.com/signup)查看文档(https://developers.deepgram.com/docs/flux-tts/overview)
深受语音 AI 领域一流团队信赖。
Flux 架构
Flux 架构Flux STTLLMFlux TTS今天,Flux STT 和 Flux TTS 以集成式技术栈的形式运行在单条连接上,由 Deepgram 协调聆听与说话之间的时机。
一次通话 · 0:51 · Haley悬停任意一行,点击即可试听
热情的问候第 1 行,共 6 行 · 00:00
探索 Flux 语音(https://talk.deepgram.com/)
一个月的免费对话
截至 2026 年 9 月 12 日,开发者可以免费使用 Flux TTS,全球最多支持 45 个并发流式连接(EU/AU 地区为 5 个)。2026 年 9 月 13 日起按标准价格计费。
听起来就是自然
Flux TTS 天然富有表现力。它会根据对话的上下文,输出恰当节奏、重音和情绪。无需提示工程、SSML 或风格标签。
-
#1Deepgram Flux TTS73.4%
-
#2Cartesia Sonic 3.572.0%
-
#3Google Gemini 2.5 Flash62.4%
-
#4Rime Arcana61.4%
-
#5ElevenLabs Eleven v361.2%
-
#6Inworld TTS-1.5 MAX57.9%
-
#7ElevenLabs Eleven Flash v2.552.6%
-
#8Inworld TTS-250.5%
-
#9xAI Grok TTS49.5%
-
#10OpenAI GPT Realtime49.4%
-
#11OpenAI GPT-4o mini TTS33.5%
-
#12AWS Polly Generative22.4%
-
#1Deepgram Flux TTS77.5%
-
#2Cartesia Sonic 3.577.0%
-
#3Google Gemini 2.5 Flash75.1%
-
#4ElevenLabs Eleven Flash v2.570.1%
-
#5ElevenLabs Eleven v368.9%
-
#6Inworld TTS-1.5 MAX63.9%
-
#7Rime Arcana63.5%
-
#8OpenAI GPT Realtime58.8%
-
#9Inworld TTS-250.9%
-
#10OpenAI GPT-4o mini TTS48.8%
-
#11xAI Grok TTS46.4%
-
#12AWS Polly Generative24.0%
检测到插入打断
来电者
等等——那是付款之前的事吗?
代理
是的,截至今天早上。需要我调出完整账单吗?
SpeechStarted{speech_id:“dg_sp_a1b2c3d4e5f6”}
audio
audio
audio
INTERRUPT
SpeechInterrupted{ speech_id:“dg_sp_a1b2c3d4e5f6”, text_spoken:“您的余额为 $2,847”, text_remaining:“as of this morning.”// ✕ 未播放 }
Configure{speed:1.05}
SpeechStarted{speech_id:“dg_sp_b2c3d4e5f6a1”}
audio
audio
SpeechMetadata{speech_id:“dg_sp_b2c3d4e5f6a1”}
在你的对话场景中工作
Flux TTS 可以无缝接入你现有的语音代理技术栈,并部署在数据必须驻留的任何位置——云端、VPC 或本地环境。
你的语音代理技术栈
VapiVapi
PipecatPipecat
LivekitLivekit
jambonzJambonz
CloudflareCloudflare
MicFlux TTSspeak.v2 · wss /v2/speak
cloud托管云
VPC你的 VPC
Prem本地部署
9.8%
困难提示词上的词错误率
- 药品名
- 追踪号码
- IVR 菜单
- 金额
- 技术字符串
- 字母数字
越低越好。Flux TTS(Haley)。
能力对比能力Flux TTSElevenLabsCartesiaInworldRime跨轮次上下文✓XX✓◒无需标记(上下文感知表达)✓XX◒X打断反馈(插入打断时的 text_spoken)✓XX??服务端刷新✓◒◒??对结构化内容的生产级准确度✓X???对话原生 WebSocket 协议✓✓✓◒✓自行托管 / 本地部署✓◒✓◒◒包含 HIPAA + SOC 2✓◒✓✓◒企业级并发✓◒◒?◒
为语音 AI 交付团队而生
了解各公司如何借助 Flux TTS 构建更快速、更自然的语音体验。
常见问题
对语音代理来说,最好的文本转语音是什么?
Flux TTS 与 ElevenLabs 相比如何?
Flux TTS 与 Cartesia 相比如何?
Flux TTS 是 Rime 或 Inworld 的替代方案吗?
Flux TTS 如何处理打断?
Flux TTS 如何在不同轮次之间保持一致性?
Flux TTS 的延迟是多少?
Flux TTS 支持 SSML 或风格标签吗?
如何从其他提供商迁移到 Flux TTS?
我可以自行托管或在本地部署 Flux TTS 吗?
Flux TTS 支持哪些语言?
Flux TTS 与 Aura-2 有何不同?Aura-2 会被弃用吗?
如何开始使用 Flux TTS?
Flux TTS 符合 HIPAA 要求吗?
继续对话
使用 Flux TTS 构建你的下一个语音代理,体验整个对话过程中的不同之处。只需将模型参数改为flux-\{voice\}-en即可切换。
相似文章
VoiceChat-TTS:用于交互代理的低延迟连续语音合成模型
VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。
@rohanpaul_ai:语音代理应逐步处理语音,但仅对已提交的文本采取行动,因为快速转录如果修改文本……
网易有道开源了Confucius4-R2T2,这是一款用于语音代理的流式ASR模型,它逐步处理语音并仅输出已提交的文本,以防止状态损坏。
AI语音代理的实际工作原理
关于AI语音代理五层架构的详细解释,包括语音转文字、大语言模型(LLM)、文字转语音、编排器和电话通信,所有层均在500毫秒延迟约束下运行,以保持自然的对话流畅度。
@LangChain: 在真实对话中,决定何时开口与决定说什么需要几乎同等的脑力。语音代理…
Sierra Platform 的语音代理方法将思考、倾听和说话并行化,以模拟人类对话,正如 Max Agency 播客中所讨论的。
我每天开车45分钟去上班,却无法与我的AI代理对话,所以我开发了一款iOS应用,可以在免提情况下与AI代理交谈——内置完整的TTS和STT功能
一位开发者构建了ClawVibe,一款用于免提语音交互的iOS应用,配备设备端语音识别和TTS,实现低延迟。