Tacit-TTS:从自回归解码到掩码预测的免转录高效语音克隆
摘要
Tacit-TTS 将 IndexTTS2 的自回归文本到语义解码替换为掩码非自回归生成,并结合免训练的声学长度估计与 ReFlow 蒸馏,实现了无需参考文本的零样本语音克隆;在时长超过 5 秒的语音上,其生成速度比 IndexTTS2 快 10 倍以上,同时支持跨语言以及非语音(如婴儿咿呀学语、合成乱码)参考音频的克隆。
查看缓存全文
缓存时间: 2026/10/01 20:24
论文页面 - Tacit-TTS:从自回归解码到掩码预测的高效无转录文本语音克隆
来源:https://huggingface.co/papers/2609.38658
摘要
采用自回归语义建模的 TTS 系统展现出了强大的零样本语音克隆性能和丰富的表达变化,但其顺序解码带来了较高的延迟。非自回归的替代方案虽然生成速度更快,但往往依赖更严格的参考条件,例如在推理时需要参考语音的转录文本。我们提出了 Tacit-TTS,一个从 IndexTTS2 蒸馏得到的高效无转录文本零样本语音克隆系统。我们的模型用掩码非自回归生成替代了自回归的文本到语义解码,引入了免训练的声学长度估计,并通过 ReFlow 蒸馏加速了 flow-matching 渲染器。在两个英文和两个中文数据集上,Tacit-TTS 在达到具有竞争力的零样本质量的同时,对于超过 5 秒的语音,生成速度比 IndexTTS2 快 10 倍以上。其无转录文本的条件机制还进一步支持跨语言和非词汇性的参考输入。我们使用来自八种其他语言的参考语音、婴儿咿呀学语以及合成乱码来验证这一能力——在这些场景下,依赖转录文本的系统往往会因 ASR 转录不可靠而性能下降甚至失败。
查看 arXiv 页面 (https://arxiv.org/abs/2609.38658) 查看 PDF (https://arxiv.org/pdf/2609.38658) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.38658)
在你的 agent 中获取此论文:
hf papers read 2609\.38658
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.38658,即可从此页面链接过去。
引用该论文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.38658,即可从此页面链接过去。
引用该论文的 Space0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.38658,即可从此页面链接过去。
收录该论文的合集0
没有合集收录此论文
将此论文加入合集 (https://huggingface.co/new-collection),即可从此页面链接过去。
相似文章
IndexTTS: 一个工业级可控高效的零样本 文本转语音系统
IndexTTS 是一个增强型文本转语音系统,结合了 XTTS 和 Tortoise 模型,采用混合字符-拼音建模和优化的向量量化,在自然度、发音可控性和推理速度上优于现有的开源 TTS 系统。
Open TTS Leaderboard:面向多语言语音合成与语音克隆的可扩展评测
Hugging Face 推出了 Open TTS Leaderboard,这是一个客观、可扩展的多语言 TTS 与语音克隆评测框架,采用基于 ASR 的可懂度指标(WER/CER)、速度指标(RTFx/TTFA)以及 WavLM 说话人相似度指标,将模型评测时间从数周缩短至数小时。
seshat-tts:一款支持语音克隆的本地实时游戏旁白工具
seshat-tts 是一款开源工具,可通过 OCR 或大语言模型提取文本,并使用 pocket-tts 进行本地合成,实现带语音克隆的实时游戏旁白。语音克隆在 RTX 2070 Super 上约需 10 秒,缓存后可在 CPU 上运行。
WavTTS: 通过直接原始波形建模实现高质量零样本TTS
WavTTS 提出了首个使用流匹配和扩散变换器的原始波形生成式文本转语音模型,其性能可与潜在空间扩散模型相媲美,同时避免了压缩表示导致的信息损失。
@LinearUncle: 推荐一家叫模思的中国公司的开源声音克隆仓库: MOSS-TTS 你朗读一段文字,它克隆你的声音,然后就可以用你的声音朗读任意文本,查看帖子详情看我实战如何使用,效果很好,可以以假乱真。 https://github.com/OpenMOS…
MOSS-TTS是模思公司推出的开源声音克隆模型,用户朗读少量文本即可克隆声音,随后可用克隆的声音生成任意语音,效果逼真。