面向语音代理构建者的TTS精选列表 — 聚焦于流式延迟和流中取消

Reddit r/ArtificialInteligence 工具

摘要

一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/21 14:46

mahimairaja/tts 来源:https://github.com/mahimairaja/tts 一条精选的、面向开发者的文本转语音路径,围绕一个决定所有其他决策的核心问题组织:用于智能体的实时流式合成 vs. 用于媒体的高保真离线合成。 Awesome (https://awesome.re) 许可证:MIT Stars (https://github.com/mahimairaja/tts/stargazers) 最后一次提交 (https://github.com/mahimairaja/tts/commits/main) 资源 欢迎提交 PR 文本转语音被分成两个领域,却共享同一个名称。一个是实时合成,以首字节时间和毫秒级延迟为评判标准,语音智能体必须在呼叫者察觉到停顿之前开始说话。另一个是离线合成,以自然度和表现力范围为评判标准,有声书或配音可以随意消耗计算资源。一个模型在一个领域获胜,就会在另一个领域失败,而 TTS 构建中几乎所有的错误都可以追溯到选择了针对错误一侧调整的工具。 这份列表的组织方式使得这一分界处处可见。提供商、模型和基准测试各自带有实时或离线的倾向,而对智能体构建者最重要的那些部分——流式传输、取消和编解码器——恰恰是其他领域解释得最差的部分。学习资源标记为**🟢 入门**、🟡 中级或**🔴 高级**。优先选择免费官方文档和供应商中立的指南;如果作者有商业利益,会标注出来。 — ## 如何使用这份列表 如果你是合成新手,请从头到尾阅读。推荐路径: 1. 基础概念:理解前端、声学模型和声码器的划分,以及流式传输如何改变这三者。 2. 选择一侧:根据你的用例决定实时还是离线,然后从对应列中选择提供商或开源模型。 3. 流式传输:如果你在构建智能体,这是最重要的部分。首字节延迟、取消、分块。 4. 表现力与克隆:在基本流式传输流畅后,控制情感、风格和说话人身份。 5. 评估:学会衡量你自己的流量,因为供应商的基准测试是为了美化供应商而调整的。 — ## 范围 在范围内。 将文本转换为波形的所有内容:前端(文本标准化、字素到音素、韵律预测)、声学模型、神经声码器和音频编解码器、流式传输和取消、语音克隆和语音设计、表现力和多语言控制,以及任何严肃部署现在所需的评估和伦理。 不在范围内。 语音转文本、语音活动检测、话轮检测和端点检测、传输(WebRTC)和电话(SIP)都属于管线,而非合成。如果 TTS 决策依赖于其中某一个,本列表只提供足够做出该决策的解释,不再深入。话轮检测是最明显的例子:在插入时取消合成属于 TTS 关注点,位于第 4 节,但判断插入是否发生属于话轮控制关注点,不在本列表范围内。 边界情况及其处理方式。 语音克隆和语音转换被视为核心 TTS 并包含在内,范围限定在合成而非说话人验证。水印和克隆伦理保留,因为在 2026 年,它们与发布合成语音密不可分。音乐和通用音频生成不在范围内。 纳入标准。 如果一个资源在过去 12 个月内活跃、对工作中的开发者可访问,并且要么是供应商中立,要么在由商业方撰写时明确标注,则获得一席之地。如果一个提供商今天可以接受文本并返回音频(无需候补名单),则获得一行。 — ## 目录 📖 展开 17 个部分 1. 基础概念 2. 商业提供商 3. 开源和开放权重模型 4. 流式传输和低延迟合成 5. 语音克隆和语音设计 6. 表现力与可控合成 7. 多语言和语码切换 TTS 8. 架构与 TTS 工作原理 9. 里程碑式与现代论文 10. 数据集 11. 评估与基准测试 12. 音频编解码器和声码器 13. 水印与检测 14. 伦理、同意与监管 15. 教程与入门仓库 16. 工具、游乐场和实用程序 17. 博客、社区与活动 — ## 🧭 1. 基础概念 经典神经 TTS 是一个三阶段管线:文本前端(标准化、字素到音素、韵律预测)输入声学模型,该模型预测梅尔频谱图,然后由神经声码器将其转换为波形。 核心设计选择是实时与离线:流式传输和端到端架构压缩或重新排序这些阶段,以便在几百毫秒内为语音智能体输出音频,而离线合成则保持各阶段分离以最大化自然度。 从这里开始构建心智模型,然后再比较模型或提供商。 8 个资源 ### TTS 工作原理入门 - 🟢 Hugging Face 音频课程,TTS 单元 (https://huggingface.co/learn/audio-course):免费动手课程,其文本转语音单元讲解了数据集、声学模型加声码器的划分,以及使用 Transformers 进行微调,面向刚接触语音合成的开发者。 - 🟢 文本转语音模型工作原理:理论与实践 (it-jim) (https://www.it-jim.com/blog/how-text-to-speech-models-work-theory-and-practice/):供应商中立文章,将文本分析、声学模型和声码器阶段映射到 VITS 和 Tortoise 的具体 Python 运行,适合将抽象管线与代码联系起来。 - 🟡 使用 Tacotron2 的文本转语音 (Torchaudio 教程) (https://docs.pytorch.org/audio/stable/tutorials/tacotron2_pipeline_tutorial.html):官方可运行教程,组装文本处理器、Tacotron2 声学模型和可替换的声码器(WaveRNN、Griffin-Lim 或 WaveGlow),让你看到每个管线阶段作为独立张量。 ### 前端问题:标准化与 G2P - 🟡 espeak-ng (https://github.com/espeak-ng/espeak-ng):开源音素器,支持超过 100 种语言,作为许多现代 TTS 栈的字素到音素后端,因此理解其 IPA 输出是调试发音的前提。 - 🔴 英语 TTS 合成的统一前端框架 (arXiv) (https://arxiv.org/abs/2305.10666):论文将前端形式化为文本标准化、韵律预测和 G2P 在一个框架内,有助于理解为什么前端被视为与声学建模不同的问题。 ### 延迟与自然度及流式传输 - 🟡 文本转语音技术完整指南 (Picovoice) (https://picovoice.ai/blog/complete-guide-to-text-to-speech/):概述,阐述了质量、延迟和成本之间的权衡,以及设备上流式合成的位置,但推广了作者自己的设备上引擎,请注意商业作者。 - 🔴 交错语音文本语言模型实现简单流式 TTS (arXiv) (https://arxiv.org/abs/2412.16102):论文关于交错文本和语音标记,使得单个模型可以在完整输入可用之前开始说话,说明了流式架构如何重新排序经典管线以实现低首音频延迟。 ### 参考综述 - 🔴 神经语音合成综述 (arXiv 2106.15561) (https://arxiv.org/abs/2106.15561):Tan 等人的全面综述,对文本分析、声学模型和声码器以及快速、稳健和表现力 TTS 进行了分类,是该领域术语和架构系列的最佳单一地图。 ## 🏢 2. 商业提供商 这里的每个提供商今天都可以普遍使用:发送文本,返回音频,无需候补名单。对构建者来说重要的划分是架构上的:专为轮次对话构建的提供商现在首音频时间大约在 40 毫秒到 200 毫秒之间,而媒体和配音提供商则牺牲该延迟以换取表现力范围和长格式控制。 从第一组中选择用于语音智能体,从第二组中选择用于旁白、配音和制作内容。 | 提供商 | 倾向 | 最佳用途 | | — | — | — | | ElevenLabs | 两者 | 富有表现力的 Eleven v3 声音、配音以及成熟的智能体栈。 | | Cartesia Sonic 3.5 | 实时 | 最低延迟对话式 TTS(Turbo 40 毫秒,供应商数据)。 | | Deepgram Aura-2 | 实时 | 企业联络中心智能体,支持本地部署选项。 | | OpenAI TTS | 两者 | 通过 OpenAI 栈内的指令实现可引导的交付。 | | Rime | 实时 | 高容量 IVR,具有确定性发音控制。 | | Hume Octave 2 | 两者 | 基于文本语义的 LLM 驱动情感韵律。 | | Inworld TTS | 实时 | 自然语言语音引导,覆盖 200+ 语言。 | | Soniox TTS | 实时 | 低成本的实时合成,与 Soniox STT 配对。 | | LMNT | 实时 | 快速流式传输加上语音克隆,用于智能体和游戏。 | | Neuphonic | 实时 | 以 WebSocket 为先的低延迟 TTS,外加开源设备端 NeuTTS。 | | PlayAI | 两者 | 多说话人对话式合成(PlayDialog)。 | | Amazon Polly | 两者 | AWS 原生的生成式和神经语音,支持流式传输。 | | Google Cloud TTS | 两者 | 在 GCP 上覆盖 50+ 地区的 Chirp 3 HD 声音。 | | Azure Neural TTS | 两者 | 600+ 声音、Dragon HD、SSML 和批量合成。 | | Murf | 离线 | 工作室级画外音,具有风格和节奏控制。 | | WellSaid Labs | 离线 | 面向企业旁白的 API,用于电子学习和企业视频。 | | Speechify | 两者 | 大型声音库和克隆,用于阅读和媒体应用。 | | Resemble AI | 两者 | 语音克隆以及开源 Chatterbox 模型。 | 18 个资源 ### 实时与智能体聚焦 - 🟢 Cartesia Sonic (https://docs.cartesia.ai/build-with-cartesia/tts-models/latest):专为对话构建的状态空间 TTS,当前 Sonic 3.5 模型声称标准首音频时间低于 90 毫秒,Turbo 约 40 毫秒(供应商数据),因此在中断延迟是约束时选择它。 - 🟢 Deepgram Aura-2 文档 (https://developers.deepgram.com/docs/tts-models):企业级 TTS,具有 40+ 针对联络中心调整的声音,以及云、私有云或本地部署,与 Deepgram STT 原生配对,形成单一供应商的智能体栈。 - 🟢 OpenAI TTS (gpt-4o-mini-tts) (https://developers.openai.com/api/docs/guides/text-to-speech):可引导的 TTS,接受自然语言指令以控制语气和表达,如果你的智能体已经在 OpenAI API 上运行,这是阻力最小的路径。 - 🟢 Rime 文档 (https://docs.rime.ai/docs/introduction):低延迟 TTS,面向 IVR 和高容量呼叫,其 Mist v3 模型(TTFA 约 37 毫秒 P50)提供确定性发音,你可以定义一次然后重复使用,因此数字和名称在每个呼叫上读取相同;请注意商业作者。 - 🟡 Hume Octave 2 (https://dev.hume.ai/docs/text-to-speech-tts/overview):基于 LLM 的 TTS,从文本中读取情感和语义意图,并调整音高、速度和强调以匹配,当扁平朗读破坏交互时很有用。 - 🟢 Inworld TTS 文档 (https://docs.inworld.ai/tts/tts):实时 TTS-2 添加了自然语言语音引导,覆盖 200+ 语言和地区,mini 层中位延迟约 120 毫秒(供应商数据)。 - 🟢 Soniox 文本转语音 (https://soniox.com/docs/tts/get-started):低成本实时合成,从最初几个词开始生成,并与 Soniox STT 配对,在预算和匹配的语音转文本模型都重要时,是一个合理的单一供应商选择。 - 🟢 LMNT 文档 (https://docs.lmnt.com/):面向开发者的流式 TTS,具有持久性 WebSocket 合成和基于短样本的快速语音克隆,为对话应用、智能体和游戏打造;请注意商业作者。 - 🟡 Neuphonic TTS 文档 (https://docs.neuphonic.com):以 WebSocket 为先的低延迟 TTS,在生成时流式传输音频,来自同一团队,他们同时发布开源设备端 NeuTTS Air 模型,适合需要边缘或气隙合成的场景;请注意商业作者。 ### 媒体、配音和通用 - 🟢 ElevenLabs 文档 (https://elevenlabs.io/docs):旗舰 Eleven v3 覆盖 70+ 语言,带有内联音频标签用于笑声、犹豫和情感,使其成为有声书、配音和戏剧性画外音的默认选择,同时也服务于智能体。 - 🟢 PlayHT(现 PlayAI)文本转语音文档 (https://docs.play.ht/reference/api-getting-started):PlayDialog 使用先前上下文来塑造韵律和节奏,合成多轮、多说话人对话,适用于播客风格和有脚本的对话内容;请注意商业作者。 - 🟢 Amazon Polly 生成式声音 (https://docs.aws.amazon.com/polly/latest/dg/generative-voices.html):AWS 原生 TTS,其生成引擎支持双向流式传输,并提供跨多个地区的 43 种表现力声音,当你的其余栈在 AWS 上时,这是低摩擦选择。 - 🟢 Google Cloud Chirp 3 HD 声音 (https://docs.cloud.google.com/text-to-speech/docs/chirp3-hd):最新一代 Google 声音,具有速度和停顿控制以及文本流式传输以实现低延迟使用,已在 GCP 上跨 50+ 语言和地区正式可用。 - 🟢 Azure AI 语音 TTS 概述 (https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/text-to-speech):600+ 神经声音覆盖 150 种语言,加上 SSML 和批量合成,Dragon HD 声音统一了预建和生成的声音,适用于企业 Azure 部署。 - 🟢 Murf Gen 2 API 文档 (https://murf.ai/api/docs/text-to-speech-models/gen-2):工作室级 TTS,具有说话风格和节奏控制,覆盖 150+ 声音,专为制作画外音而非实时智能体打造;请注意商业作者。 - 🟢 WellSaid Labs API 文档 (https://docs.wellsaidlabs.com/docs/getting-started):企业级旁白 API,具有大量声音与风格组合以及 SSML,面向电子学习、培训和企业视频,其中一致性优于延迟。 - 🟢 Speechify API 文档 (https://docs.speechify.ai/):单一 API 覆盖大型声音库,支持从短样本克隆、流式传输和 SSML,涵盖阅读助手和一般媒体用途;请注意商业作者。 - 🟡 Resemble AI Chatterbox (https://www.resemble.ai/products/text-to-speech):商业语音克隆平台,其开源 Chatterbox 模型(MIT 许可、23 种语言、零样本克隆)允许你免费原型开发,然后迁移到托管 API 以获得 SLA;请注意商业作者。 ## 🔓 3. 开源和开放权重模型 2026 年的自托管 TTS 跨越两个极端:微小的、CPU 友好的模型,在一秒内流式传输;以及大型 LLM 骨干模型,从几秒参考音频中克隆声音。 最重要的制约因素是权重许可证,而不是音频质量,因为几个顶级开放权重模型附带非商业或限制使用条款,这些条款阻止生产发布。 在构建之前阅读每个模型的许可证说明,因为宽松的代码通常位于限制性许可的检查点旁边。 | 模型 | 许可证 | 最佳用途 | | — | — | — | | Chatterbox (多语言 v3, Turbo) | MIT(代码和权重) | 需要低延迟(供应商)、23 种语言和内置水印的生产级语音智能体。 | | Kokoro 82M | Apache 2.0 | 最便宜的实时 TTS:8200 万参数,在 CPU 上运行快速,8 种语言。 | | Piper | GPL v3 | 完全离线嵌入式设备和树莓派设备。 | | Coqui XTTS v2 (idiap 分支) | Coqui 公共 ML 许可证(非商业权重) | 跨 17 语言的零样本克隆

相似文章

在构建 AI 辅导系统时,延迟比模型选择更重要

Reddit r/AI_Agents

一位从业者认为,在 AI 辅导系统中,语音启动延迟才是关键因素,而非模型的选择。他建议将语音启动延迟控制在 1 秒以内,并强调流式 TTS 是优化效果最显著的手段。文章梳理了从 ASR 到 TTS 再到虚拟形象同步的完整处理链路,并指出延迟叠加最严重的环节。