VoiceChat-TTS:用于交互代理的低延迟连续语音合成模型

arXiv cs.CL 论文

摘要

VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。

arXiv:2608.13831v1 宣布类型:交叉 摘要:口语对话是人机交互的自然形式,但大多数语音语言模型仍然局限于轮流操作,缺乏实时适应性,例如用户打断。最近的双工语音到语音和语音到文本模型通过替代多阶段管道来降低延迟,但通常损害语音质量,因为精确的ASR、中断处理和高保真合成必须联合优化。我们提出VoiceChat-TTS,一种用于交互代理的低延迟、连续且可流式传输的文本转语音模型。VoiceChat-TTS 直接由LLM文本令牌流驱动,支持通过控制令牌进行显式中断,并在没有文本输入时产生静音。该模型支持始终开启、响应迅速的语音生成,同时保持模块化和高语音质量,并且支持在语句中途中断而不重置KV缓存。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:05

# VoiceChat-TTS:面向交互式智能体的低延迟连续语音合成模型
来源:https://arxiv.org/html/2608.13831  
Casanova Kim Graterol Fuenmayor Hussain Klimkov Mendelev Desta Neekhara Zelasko Chen Rastorgueva Hu Pasad Yang Alja’fari Roy Badlani Roche Li Chen  

JaehyeonMarianaShehzeenViacheslavValentinMikyasPaarthPiotrChenElenaKeAnkitaXuesongAyaRajarshiRohanJasonJasonZhehuai  

###### 摘要

语音对话是人机交互的一种自然形式,但大多数语音语言模型仍局限于轮流操作模式,缺乏实时适应能力(例如用户插话)。近期的双工语音到语音和语音到文本模型通过替换多阶段流程降低了延迟,但通常会牺牲语音质量,因为精确的语音识别、中断处理和高保真合成需要协同优化。我们提出了VoiceChat-TTS,一种面向交互式智能体的低延迟、连续且支持流式传输的文本到语音模型。该模型由大语言模型文本token流直接驱动,通过控制token支持显式中断,并在没有文本输入时生成静音。该模型在保持模块化和高语音质量的同时,实现了始终在线、响应迅速的语音生成,并支持不重置KV缓存的句子中断。

###### 关键词

语音合成,文本转语音,流式TTS,语音大模型

††地址:NVIDIA公司 ††邮箱:[email protected]

## 1 引言

语音对话是人机交互中一种自然且直观的模态。然而,大多数现有的语音语言模型仍受限于轮流操作模式,缺乏实时适应能力,例如支持用户插话。近期的双工语音到语音[7 (https://arxiv.org/html/2608.13831#bib.bib14), 4 (https://arxiv.org/html/2608.13831#bib.bib15), 18 (https://arxiv.org/html/2608.13831#bib.bib16)]和语音到文本[14 (https://arxiv.org/html/2608.13831#bib.bib21)]模型通过替换依赖独立自动语音识别、语音活动检测和文本到语音组件的传统多阶段流程,实现了低延迟和简化的部署。ASR系统将语音音频转录为文本,VAD检测语音的存在与否以指导下游处理,而TTS则根据文本输入生成波形输出。

虽然端到端双工模型前景广阔,但它们通常表现出语音合成质量的下降。这种下降在很大程度上源于在单一架构中联合优化精确的ASR、鲁棒的中断处理和高质量的语音生成所带来的巨大数据和建模挑战。

先前关于语音到语音模型的工作探索了通过潜在表示将专用语音解码器连接到共享主干网络的架构[3 (https://arxiv.org/html/2608.13831#bib.bib1), 22 (https://arxiv.org/html/2608.13831#bib.bib13)]。尽管这些方法在减少总体交互延迟方面很有效,但它们增加了架构的复杂性,并可能损害传统流程系统的模块化和可调试性。

最近,流式TTS在减少首次音频时间和实现增量语音生成方面取得了显著进展。一个早期的例子是Audio Flamingo 3-Chat[5 (https://arxiv.org/html/2608.13831#bib.bib17)]的流式语音解码器,它旨在通过消费可流式传输的文本输入并逐步生成语音token来实现低延迟的对话语音生成。该设计表明,高质量的神经语音合成可以集成到交互式语音语言系统中,而无需预先获得完整的文本响应。后续的流式TTS系统进一步改进了延迟和对齐。例如,VoXtream[20 (https://arxiv.org/html/2608.13831#bib.bib2)]使用带有单调对齐和有限前瞻的增量仅解码器Transformer将输入的音素映射到声学token,而SpeakStream[1 (https://arxiv.org/html/2608.13831#bib.bib11)]采用仅解码器架构,通过交错文本和语音序列进行训练,以吸收来自大语言模型的流式文本。此外,Qwen3-TTS[6 (https://arxiv.org/html/2608.13831#bib.bib12)]通过直接摄取LLM token来探索用于实时应用的高效文本到语音对齐,在保持高质量合成和表现力的同时实现了极低的首次音频时间。

然而,这些系统主要解决单个响应内的流式生成问题。它们并未原生建模全双工交互式智能体所需的连续、始终在线的行为。在这种情况下,语音解码器必须在整个对话过程中保持活跃,在没有智能体文本时生成静音,并在用户插话时及时停止。VoiceChat-TTS建立在这一系列流式语音解码器(特别是Audio Flamingo 3-Chat语音解码器)的基础上,并扩展了显式静音建模、中断控制token以及用于单轮和多轮对话合成的统一训练公式。

在本文中,我们提出了VoiceChat-TTS,一种专为交互式智能体设计的连续、支持流式传输且低延迟的文本到语音模型。VoiceChat-TTS由大语言模型文本token流直接驱动,通过控制token支持显式中断,并在没有文本输入时生成静音。这种设计在保持模块化和高合成质量的同时,实现了始终在线、响应迅速的语音生成。此外,VoiceChat-TTS与双工交互框架和语音到语音流程系统兼容,并避免了在句子中断时重置KV缓存。

我们工作的主要贡献如下:

- 我们提出了VoiceChat-TTS,一个连续、支持流式传输且低延迟的TTS模型,它直接消费LLM文本token流,并在没有智能体文本时生成静音;
- 我们提出了一种基于可靠控制token的中断机制,可在用户插话中途停止正在进行的语音并将输出转为静音;
- 我们提出了一种统一的训练策略,将高质量的单轮TTS数据与复杂的多轮对话数据相结合,同时最小化两种设置之间的分布不匹配;
- 我们证明VoiceChat-TTS在语音质量方面与强大的离线和流式基线具有竞争力,同时满足交互式智能体的延迟和中断处理要求。

VoiceChat-TTS代码已在NVIDIA NeMo Speech111https://github.com/NVIDIA-NeMo/Speech公开,模型检查点作为NVIDIA-NemotronLabs-VoiceChat-11B222https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B的一部分在Hugging Face上提供。

## 2 VoiceChat-TTS模型

提出的架构直接基于Audio Flamingo 3-Chat[5 (https://arxiv.org/html/2608.13831#bib.bib17)]的流式语音解码器构建,并进行了若干修改以支持全双工交互。Audio Flamingo 3-Chat流式语音解码器是为低延迟对话用例和实时交互而设计的。它依赖于流式输入,允许增量处理文本而无需预先获得完整序列,并通过逐步生成语音token来产生流式输出,以便立即播放。然而,全双工交互施加了额外的操作要求:系统必须处理句子中途的用户中断,并在用户说话时生成静音以支持自然的轮流发言。为了满足这些要求,我们在基础Audio Flamingo 3-Chat流式语音解码器架构之上实施了若干修改。图1 (https://arxiv.org/html/2608.13831#S2.F1)展示了VoiceChat-TTS架构的概览。

(图1:VoiceChat-TTS架构概览。音频编解码器:音频编解码器主干是一个完全由卷积层组成的全因果自编码器,类似于[5 (https://arxiv.org/html/2608.13831#bib.bib17)]中的设计。在我们的工作中,我们训练该编解码器以12.5 Hz的帧率压缩22 kHz波形,使用31码本残差向量量化token。在此配置下,每个生成的音频token帧对应80毫秒的波形片段。该帧率与近期的双工语音到语音模型(如[7 (https://arxiv.org/html/2608.13831#bib.bib14), 4 (https://arxiv.org/html/2608.13831#bib.bib15)])兼容。为了高效的流式编解码器推理,网络仅缓存其感受野内的卷积块输入。

文本分词器:与Audio Flamingo 3-Chat[5 (https://arxiv.org/html/2608.13831#bib.bib17)]不同,我们使用NVIDIA Nemotron Nano 2子词分词器[15 (https://arxiv.org/html/2608.13831#bib.bib3)]并增加序列开始和中断token。在LibriTTS测试集干净子集上,该分词器平均产生4.16 Hz的文本token,相当于大约每三个声学token帧对应一个文本token。在训练期间,文本流被右填充以匹配声学序列的长度,从而在整个交互过程中实现增量处理。BOS token标记每个助手回合的开始,而中断token标记模型应停止说话并转为静音的点。我们还在文本和音频通道之间引入了一个token的延迟,文本流领先于音频流。这提供了有限的语言前瞻性,确保模型在生成相应语音之前至少观察到两个子词token。

字符感知子词编码器:消费LLM子词token的增量文本到语音模型的一个普遍问题是LLM词汇表与TTS训练语料库之间的不匹配;前者产生的许多子词在后者中很少见或不存在。为了缓解这个问题,我们引入了一个字符感知子词编码器。每个输入子词首先被转换为字符序列,然后由一个浅层Transformer编码器处理。我们然后对字符级输出进行平均池化,以获得稳健的字符感知嵌入,这些嵌入可以泛化到未见过的子词。图2 (https://arxiv.org/html/2608.13831#S2.F2)展示了字符感知子词编码器的架构概览。此外,为了提高长词或片段词增量生成过程中的发音准确性,我们引入了一个专门的子词续接token嵌入。这允许模型更连贯地处理和合成多token的语言单元。

(图2:字符感知子词编码器架构概览。高斯混合估计头:为了加速深层RVQ token层次结构的生成,我们将高斯混合头集成到架构中。该头不依赖31步自回归解码流水线,而是迭代地去掩码RVQ token。在每次迭代中,它使用MoG估计预测被掩码RVQ token的连续嵌入向量,随后将向量量化为逐步去掩码的离散token。这种迭代精化是可控的,并且先前结果表明4到8次迭代足以实现高保真声学重建[5 (https://arxiv.org/html/2608.13831#bib.bib17)]。

音频提示调节:Audio Flamingo 3-Chat流式语音解码器不采用显式的说话人参考调节。相反,它在来自同一说话人的拼接话语上进行训练,并学习从先前的声学上下文推断说话人身份。这种方法在生成开始时(当可用的说话人信息很少或没有时)以及在对话设置中(当最近的声学上下文可能被用户说话时的静音主导)可能效果较差。为了提供明确的说话人线索,我们基于3秒参考音频提示来调节VoiceChat-TTS。在训练期间,相应的音频token预填充声学序列的开始,并且该提示区域的损失被掩码,因此模型将提示用作调节上下文而不是学习重建它。在推理期间,相同的3秒提示在合成开始前初始化声学上下文。

边界嵌入与门控融合:由于我们的训练目标针对多轮对话,我们为BOS和中断token引入了可学习的文本嵌入。这些嵌入提供了明确的边界信号,改善了对话轮流发言的流畅性。我们还解决了基础解码器中的一个架构不稳定问题,其中高幅值RVQ嵌入可能导致混合精度溢出并使早期层激活不稳定。我们通过在传入的文本嵌入和声学语音嵌入之间应用门控融合机制来缓解此问题,确保整个网络稳定的数值缩放。

最终的VoiceChat-TTS模型总参数为977M,包括一个基于Gemma 3的778M参数流式TTS模块[19 (https://arxiv.org/html/2608.13831#bib.bib19)]和一个199M参数的编解码器模型。

## 3 实验

为了训练VoiceChat-TTS模型,我们使用了标准单轮文本到语音语料库、合成生成的多轮对话和真实对话数据集的组合。这种多样化的数据混合对于确保稳健的声学质量同时教会模型复杂的交互动态(如轮流发言和中断)至关重要。

### 3.1 单轮数据

为了建立稳健的声学生成基础,我们在单轮训练阶段利用了大规模的标准文本到语音语料库。具体来说,我们使用了来自LibriTTS[24 (https://arxiv.org/html/2608.13831#bib.bib6)]的*train-clean-360*和*train-clean-100*子集、原始HiFiTTS语料库[2 (https://arxiv.org/html/2608.13831#bib.bib8)]、HiFiTTS-2[12 (https://arxiv.org/html/2608.13831#bib.bib24)]扩展的36.7k小时子集以及一个包含两个高保真说话人的专有62小时数据集的约70,159小时英语语音。我们还额外加入了一个源自高质量、公开可用YouTube视频(遵循知识共享许可协议)的32k小时内部数据集。

训练双工模型的一个关键挑战是单轮生成(通常立即开始语音合成)和多轮交互(通常在用户说话时开始长时间的静音)之间的分布偏移。为了缓解这种模态差异,我们对50%的单轮数据应用了有针对性的数据增强策略。我们随机在音频序列开头添加0.5到5.0秒的背景静音,并相应调整文本对齐。这种技术有效地模拟了智能体最初处于聆听状态的多轮对话上下文。通过弥合这一差距,我们防止了模型简单地区分标准TTS任务和双工场景。

### 3.2 多轮数据

合成数据集:为了显式地建模复杂的双工行为,我们开发了一个精选的合成多轮数据集,包含约2.5k小时的语音。数百万个文本对话脚本由开源

相似文章

kyutai-labs/pocket-tts

GitHub Trending (daily)

Kyutai 发布了 Pocket TTS,这是一个轻量级的文本转语音模型,可高效在 CPU 上运行,拥有 1 亿参数、低延迟和语音克隆功能,支持多种语言。