TontaubeV1 - 本地长篇生成开放语音合成模型发布
摘要
TontaubeV1 是一个开放权重的语音合成模型,专为本地长篇生成发布,支持英语和德语,具备零样本语音克隆功能,并可在 GPU 上实现低延迟推理。
大家好,我是 Tontaube 的联合创始人。我的兄弟和我刚刚发布了 TontaubeV1,一个 2.9B 参数的开放权重语音合成模型,专注于表达性语音、长篇生成和低延迟本地推理。该模型主要针对英语和德语,支持从长达一分钟的参考音频进行零样本语音克隆。一些技术细节:
- 四个独立的自回归模型从粗略的语义结构到声学细节生成编解码流
- 对于较高的码本,模型逐渐变小
- 字符级文本分词
- 对齐文本和音频之间的共享逻辑位置
- 通过滚动上下文窗口实现流式且实际上无界的长篇生成
- 基于 vLLM 的推理,跨请求和声学阶段进行批处理
在预热的 RTX 5090 上,我们测量到:
- 单个文本的 RTF 约为 0.08
- 批处理时 RTF 低至 0.02,或大约 50 倍实时速度
- 流式路径中首个编码音频的延迟约为 200 毫秒
当前版本要求 GPU 至少具有 24 GB 的显存,用于低显存和平衡配置文件,或 32 GB 用于高吞吐量配置文件。目前占用大量显存的原因是 vllm 实现,它允许高并发和低延迟服务。我们计划发布针对较小 GPU 和设备使用的量化版本,以及微调支持。
我们还运行了一个 400 段落的 LLM-as-a-judge 有声书基准测试。在韵律方面,TontaubeV1 得分为 50.1%,对比 ElevenLabs Flash v2.5,并被优先于 Fish Audio S2 Pro、Gradium 和 Cartesia Sonic 3。方法论、注意事项和置信区间在报告中有描述。我们知道人类听测仍然是金标准。我们在发布前无法进行大规模人类研究,但我们计划在未来几天通过 TTS Arena V2 和 Artificial Analysis Text to Speech Arena 用真实听众测试 TontaubeV1。
链接:
- 权重:https://huggingface.co/TontaubeAI/TontaubeV1
- 推理代码:https://github.com/craitech/tontaube
- 技术报告:https://tontaube.ai/papers/tontaube-v1-technical-report.pdf
- 样本/演示:https://tontaube.ai/playground 或先无需登录访问 https://tontaube.ai
我非常感兴趣于独立的安装体验、其他 GPU 上的显存测量以及您发现的任何奇怪故障案例。请让我知道哪里可以帮忙!
相似文章
Audio8/Audio8-TTS-预览版-0.1b
Audio8 TTS Preview 0.1b 是一个紧凑的零样本文本转语音模型,主模型拥有约1.7亿参数,支持语音克隆和多语言。
Audio8/Audio8-TTS-Preview-0.6b
Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。
@vvolhejn: 我们的开源TTS变得更加开源了
Kyutai Labs 已经开源了他们的 Pocket TTS 训练工具集,包括数据流水线、训练方案和评估,允许开发者在GPU上训练文本转语音模型并在CPU上运行。
OpenBMB/VoxCPM
OpenBMB发布VoxCPM2,一个2B参数的无分词器TTS模型,基于超过200万小时的多语言语音数据训练,支持30种语言、语音设计、可控克隆和48kHz输出。
WavTTS: 通过直接原始波形建模实现高质量零样本TTS
WavTTS 提出了首个使用流匹配和扩散变换器的原始波形生成式文本转语音模型,其性能可与潜在空间扩散模型相媲美,同时避免了压缩表示导致的信息损失。