Tacit-TTS:从自回归解码到掩码预测的免转录高效语音克隆

Hugging Face Daily Papers 论文

摘要

Tacit-TTS 将 IndexTTS2 的自回归文本到语义解码替换为掩码非自回归生成,并结合免训练的声学长度估计与 ReFlow 蒸馏,实现了无需参考文本的零样本语音克隆;在时长超过 5 秒的语音上,其生成速度比 IndexTTS2 快 10 倍以上,同时支持跨语言以及非语音(如婴儿咿呀学语、合成乱码)参考音频的克隆。

基于自回归语义建模的 TTS 系统已经展现出强大的零样本语音克隆性能与丰富的表现力变化,但其顺序解码会带来较高的时延。非自回归方案虽然生成速度要快得多,但往往依赖更严格的参考音频条件化方式,例如在推理时需要参考语音的转录文本。我们提出 Tacit-TTS,这是一个从 IndexTTS2 蒸馏得到的高效免转录零样本语音克隆系统。该模型以掩码非自回归生成取代自回归的文本到语义解码,引入免训练的声学长度估计,并通过 ReFlow 蒸馏加速基于流匹配的渲染器。在两个英文数据集和两个中文数据集上,Tacit-TTS 在保持具有竞争力的零样本质量的同时,对于时长超过 5 秒的语音,其生成速度比 IndexTTS2 快 10 倍以上。其免转录的条件化方式进一步支持跨语言和非语音的参考音频。我们使用来自其他八种语言的参考音频、婴儿咿呀学语以及合成乱码来验证这一能力——在这些场景下,依赖转录文本的系统往往会因为 ASR 转录不可靠而性能下降或直接失败。
查看原文
查看缓存全文

缓存时间: 2026/10/01 20:24

论文页面 - Tacit-TTS:从自回归解码到掩码预测的高效无转录文本语音克隆

来源:https://huggingface.co/papers/2609.38658

摘要

采用自回归语义建模的 TTS 系统展现出了强大的零样本语音克隆性能和丰富的表达变化,但其顺序解码带来了较高的延迟。非自回归的替代方案虽然生成速度更快,但往往依赖更严格的参考条件,例如在推理时需要参考语音的转录文本。我们提出了 Tacit-TTS,一个从 IndexTTS2 蒸馏得到的高效无转录文本零样本语音克隆系统。我们的模型用掩码非自回归生成替代了自回归的文本到语义解码,引入了免训练的声学长度估计,并通过 ReFlow 蒸馏加速了 flow-matching 渲染器。在两个英文和两个中文数据集上,Tacit-TTS 在达到具有竞争力的零样本质量的同时,对于超过 5 秒的语音,生成速度比 IndexTTS2 快 10 倍以上。其无转录文本的条件机制还进一步支持跨语言和非词汇性的参考输入。我们使用来自八种其他语言的参考语音、婴儿咿呀学语以及合成乱码来验证这一能力——在这些场景下,依赖转录文本的系统往往会因 ASR 转录不可靠而性能下降甚至失败。

查看 arXiv 页面 (https://arxiv.org/abs/2609.38658) 查看 PDF (https://arxiv.org/pdf/2609.38658) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.38658)

在你的 agent 中获取此论文:

hf papers read 2609\.38658

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.38658,即可从此页面链接过去。

引用该论文的数据集0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.38658,即可从此页面链接过去。

引用该论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.38658,即可从此页面链接过去。

收录该论文的合集0

没有合集收录此论文

将此论文加入合集 (https://huggingface.co/new-collection),即可从此页面链接过去。

相似文章

seshat-tts:一款支持语音克隆的本地实时游戏旁白工具

Reddit r/ArtificialInteligence

seshat-tts 是一款开源工具,可通过 OCR 或大语言模型提取文本,并使用 pocket-tts 进行本地合成,实现带语音克隆的实时游戏旁白。语音克隆在 RTX 2070 Super 上约需 10 秒,缓存后可在 CPU 上运行。