dots.tts 2B🎙️ 来自RedNote的SOTA文本转语音模型
摘要
RedNote发布了dots.tts,一个2B参数的开源文本转语音模型,支持零样本语音克隆和48kHz合成。
🔗 博客: https://rednote-hilab.github.io/dots.tts-demo/ 🔗 GitHub: https://github.com/rednote-hilab/dots.tts 🔗 技术报告: https://arxiv.org/abs/2608.16894 dots.tts 🎙️ 来自RedNote(小红书)的全新开源TTS ✨ 2B参数(Apache 2.0) ✨ 全连续架构(无编解码令牌) ✨ 48kHz合成 ✨ 零样本语音克隆 ✨ 直接文本转语音(无语音素管道)
相似文章
@AdinaYakup: dots.tts 来自小红书的新TTS模型 2B参数 - Apache 2.0 完全连续架构(无编解码器令牌)48kHz合成…
Dots.tts 是来自小红书(RedNote)的新TTS模型,拥有2B参数,遵循Apache 2.0许可,采用完全连续架构(无编解码器令牌),支持48kHz合成和零样本语音克隆。
dots.tts 技术报告
dots.tts 提出了一个拥有 2B 参数的连续自回归文本转语音 (TTS) 模型,基于多语言数据进行训练,在 Seed-TTS-Eval 等基准测试上取得了最先进的性能,并通过 CFG-aware MeanFlow 蒸馏实现了低延迟流式生成。该模型、代码和检查点均以 Apache 2.0 许可证发布。
@AdinaYakup: 更多参与者加入开源夏季 RedNote 刚刚发布了 dots3-note preview,首个开放权重模型在…
RedNote 已发布 dots3-note preview,这是 dots3 家族中首个开放权重模型,具备 280B 参数和 16B 活跃参数,支持多模态理解(文本、图像、视频、音频),上下文长度为 512K,采用 Apache 2.0 许可证,并具有强大的智能体能力。
Audio8/Audio8-TTS-Preview-0.6b
Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。
kyutai-labs/pocket-tts
Kyutai 发布了 Pocket TTS,这是一个轻量级的文本转语音模型,可高效在 CPU 上运行,拥有 1 亿参数、低延迟和语音克隆功能,支持多种语言。