X2Streaming-TTS:基于流式文本与语音状态继承的因果令牌级文本转语音
摘要
X2Streaming-TTS 提出了一种因果令牌级文本转语音框架,用于真正的流式合成,使用因果承诺和语音状态继承来处理不确定的文本前缀,并在低延迟口语对话系统中保持声学连续性。
查看缓存全文
缓存时间: 2026/08/20 10:16
# X2Streaming-TTS:基于语音状态继承的流式文本因果词级语音合成
来源:https://arxiv.org/html/2608.18661
作者:刘泽翰、秦肖恩、施亮、甘仁豪、王浩、王茜
\[0.6em\] X Square Robot\[0.8em\]
*(作者贡献均等。通讯作者为王茜)*
###### 摘要
流式文本转语音(TTS)对于低延迟语音对话系统至关重要,但许多系统等待句子级文本,因此仅实现伪流式处理。真正的词级合成必须在有限上下文内,从不确定的文本前缀生成语音,同时在无界语音流中保持感知连续性。本文提出 X2Streaming-TTS,一个因果 TTS 框架,它消耗异步到达的文本词元并在不访问未来输入的情况下生成语音。为处理不确定前缀,我们引入**因果承诺**机制,通过不确定性感知缓冲保持歧义表达的暂态性,并执行容量自适应、标点感知的分割。为保持声学连续性,我们进一步引入**因果语音状态继承**机制,该机制携带完整的 Code2Wav 状态和选定的 Talker 历史状态跨越片段边界。结合注意力先验约束,该机制在阻止访问未来位置的同时保留了有界声学上下文。实验表明,X2Streaming-TTS 在大多数主观和客观指标上优于现有伪流式模型。进一步分析表明,因果承诺稳定了在线分割并减少了因上下文不足导致的失败,而语音状态继承在不降低自然度或说话人身份的情况下提高了边界连续性。X2Streaming-TTS 由此实现了严格的词级合成,质量可与评估的离线基线相媲美,单个请求的音频首 token 时间(TTFT)中位数为 15.8 毫秒,128 个并发请求下的 TTFT 中位数为 260.8 毫秒。我们的实现已在 https://github.com/X-Square-Robot/X2Streaming-TTS 公开。
## 1 引言
语音一旦播放,便无法修改。当上游语言模型逐词生成文本时,这种不可逆性便成为一个根本性约束,而不仅仅是工程问题:TTS 系统必须仅根据已观测到的文本前缀决定何时发言,而未来的词元无法改变已生成的语音。例如,假设语言模型已生成前缀 "He finished 3"。它随后可能变成 "He finished 3 laps",此时 "3" 读作 "*three*",或者变成 "He finished 3rd",此时读作 "*third*"。虽然两种发音开头相似,但它们在任一单词完成发音前就会产生分歧。一个已经发出 "*three*" 的系统因此无法将其修正为 "*third*"。离线合成不会遇到此决策问题,缓冲整个句子后再合成的系统也不会,因为相关文本在这两种情况下都已固定。在词级流式处理中,离线 TTS 中简单直接的三项要求变得难以同时满足。首先,**发音**:不完整的数字、单位和符号可能在其已发音后被后续到达的字符重新解释。其次,**呼吸空间**:说话者在语言允许的地方停顿,但仅基于标点符号的分割会产生许多短片段,消耗生成预算用于重复停止和重新开始;而固定窗口则通过在与语言结构无关的位置切断来填满预算。第三,**延续性**:从静默生成的片段必须从头重建音高和音色,使得产生的接缝清晰可闻。综上所述,这三个挑战表明,词级流式处理不仅仅是降低首音延迟的问题。更根本地,它要求系统在部分可观察性下做出不可逆的承诺:每个决策产生的输出都无法修改,即使其正确性可能取决于尚未到达的信息。
同步翻译在源句结束前发出目标词 \[20\]\(https://arxiv.org/html/2608.18661#bib.bib21\); \[21\]\(https://arxiv.org/html/2608.18661#bib.bib22\),流式识别显示部分假设 \[14\]\(https://arxiv.org/html/2608.18661#bib.bib23\); \[25\]\(https://arxiv.org/html/2608.18661#bib.bib24\),长视频生成无法重新渲染已产生的帧 \[15\]\(https://arxiv.org/html/2608.18661#bib.bib25\); \[33\]\(https://arxiv.org/html/2608.18661#bib.bib26\)。它们共享一个结构:*何时可以承诺*,以及*如何延续已产生的状态*。我们通过两种互补机制来回答语音合成流式处理中的这两个问题。*因果承诺* 控制直至片段结束(包含结束决策)的处理,而 *因果语音状态继承* 控制跨越片段边界的状态传播。移除任一机制都会导致可观察的缺陷:没有语音状态继承时,片段边界会出现可测量的音高不连续;没有因果承诺时,生成可能耗尽容量,迫使在语言学上不适当的位置进行分割。
图 1 \[https://arxiv.org/html/2608.18661#S1.F1\] 将这些挑战映射到合成流程:左图追溯词级文本释放和音频生成,右图展示了首音延迟、前缀歧义下的不可逆承诺、跨片段不连续性以及解决它们的机制。流式前端确定哪些观测到的文本可以被释放,Talker 将释放的文本转换为离散的声学 token,Code2Wav 将这些 token 解码为波形。因果承诺决定当前片段何时关闭,而因果语音状态继承决定下一个片段继续的状态。
我们的贡献如下:
- 我们引入了一种 **因果承诺** 机制,该机制在数字、单位和符号的发音确定之前保持其暂态性,同时将容量和边界准入表述为一个统一的受约束分割问题。
- 我们引入了一种 **因果语音状态继承** 机制,该机制通过两条独立路径传递完整的波形解码器状态和固定数量的声学状态,使用一个固定的因果先验(为未来位置分配零权重)和一个显式有界的残差。
- 我们开发了一个端到端的因果 TTS 系统,集成了这两种机制,无需访问未来文本即可执行严格的词级合成。实验结果证明其合成质量与评估的离线基线相当。单个请求的音频首 token 时间(TTFT)中位数为 15.8 毫秒,128 个并发请求下为 260.8 毫秒。
**图注**:图 1:左侧:词级到达下的流式处理流程。前端仅释放 TTS 就绪的文本(当无文本就绪时为 PAD;歧义片段如 "He finished 3" 中的 "3" 会保留直到发音解决),Talker 发出声学 token,Code2Wav 流式传输波形以供立即播放。右侧:三个挑战及相应机制——(1) 通过词级而非块级启动来应对首音延迟;(2) 通过不确定性感知缓冲实现不可逆的早期承诺;(3) 通过语音状态继承解决跨片段不连续性。
## 2 相关工作
我们根据合成开始时可用的文本上下文,以及系统如何处理边界选择、声学容量和跨片段状态来组织先前的工作。
##### 完全观测的文本,流式音频输出。
这些方法在完整句子可用后开始合成,并通过自回归声学生成、因果或块感知解码以及流式声码器来降低输出延迟 \[8\]\(https://arxiv.org/html/2608.18661#bib.bib11\); \[10\]\(https://arxiv.org/html/2608.18661#bib.bib5\); \[9\]\(https://arxiv.org/html/2608.18661#bib.bib12\); \[29\]\(https://arxiv.org/html/2608.18661#bib.bib10\); \[18\]\(https://arxiv.org/html/2608.18661#bib.bib19\); \[26\]\(https://arxiv.org/html/2608.18661#bib.bib20\)。它们建立在离散音频编解码器 \[34\]\(https://arxiv.org/html/2608.18661#bib.bib17\); \[6\]\(https://arxiv.org/html/2608.18661#bib.bib18\) 和基于语言模型的零样本 TTS 架构 \[27\]\(https://arxiv.org/html/2608.18661#bib.bib13\); \[35\]\(https://arxiv.org/html/2608.18661#bib.bib14\); \[32\]\(https://arxiv.org/html/2608.18661#bib.bib16\); \[3\]\(https://arxiv.org/html/2608.18661#bib.bib15\) 之上。尽管它们实现了音频生成和播放的并发,但等待完整句子会引入输入侧延迟,并且无法解决不确定文本前缀下的发音或分割问题。
##### 具有有限前瞻的流式文本。
LiveSpeech、SyncSpeech 和 SpeakStream 通过固定前瞻、词元同步解码和文本-语音交错来减少所需上下文 \[5\]\(https://arxiv.org/html/2608.18661#bib.bib4\); \[24\]\(https://arxiv.org/html/2608.18661#bib.bib2\); \[2\]\(https://arxiv.org/html/2608.18661#bib.bib3\)。相关工作还研究了韵律边界和停顿预测 \[4\]\(https://arxiv.org/html/2608.18661#bib.bib33\); \[30\]\(https://arxiv.org/html/2608.18661#bib.bib34\); \[31\]\(https://arxiv.org/html/2608.18661#bib.bib35\)。边界感知的流式生成 \[19\]\(https://arxiv.org/html/2608.18661#bib.bib6\) 使用有限的未来词汇、边界后训练和有界滑动提示,而 MagpieTTS-LF \[13\]\(https://arxiv.org/html/2608.18661#bib.bib7\) 结合了标点感知的块、历史文本、注意力跟踪状态和推理时软先验。这些方法减少了句子级等待,但仍然依赖于未来词元,因此其延迟仍与上游生成速率挂钩,并且它们不满足严格的零前瞻因果性。
##### 无代价的分割。
独立的文本分割器 \[11\]\(https://arxiv.org/html/2608.18661#bib.bib8\) 可以识别语言学上合适的边界,但未考虑声学生成代价。因此,一个合适的边界可能只在声学预算耗尽后才出现。我们使用 SaT-3L(它访问最多 48 个未来子词)仅作为边界质量参考。此外,文本分割并未定义应跨越边界传递的语音状态,因此无法确保跨片段连续性。现有方法因此要么等待完整文本,依赖未来上下文,要么忽略声学容量和跨片段状态;而我们的方法则在严格因果性下,将语言学就绪性与声学代价耦合,并在已承诺的边界间传递有界的语音状态。
## 3 X2Streaming-TTS
零前瞻是可负担的,因为文本信息密集,而语音在时间上是冗余的。我们使用声学-文本扩展比 $\rho$ 来量化这种差异,定义为每个文本词元的自回归声学解码步数。对于一个包含 $n_k$ 个文本词元、需要 $A_k$ 个声学解码步骤的已完成片段 $S_k$,其实际扩展比为 $\rho_k = A_k / n_k$。由于 $\rho_k$ 通常远大于 1,为当前可用文本配音为后续词元到达提供了时间。基于前瞻的方法消耗未来文本,因此需要上游模型等待。相比之下,我们的方法利用声学侧已有的时间。在每个已完成片段后,系统更新在线估计 $\widehat{\rho}_{k}$,将“何时可以发声”的问题转化为一个因果准入测试。令 $\tau$ 表示挂钟时间,令 $N(\tau)$ 表示在时间 $\tau$ 观测到的文本词元数量。令 $y_u$ 表示第 $u$ 个离散声学 token,在时间 $\tau_u$ 生成,令 $h_{k-1}$ 表示从前一片段继承的语音状态。严格因果性要求 $y_u \perp \!\!\! \perp x_{N(\tau_u)+1} \mid x_{1:N(\tau_u)}, y_{1:u-1}, h_{k-1}$。因此,当条件概率 $p(y_u \mid x_{1:N(\tau_u)}, y_{1:u-1}, h_{k-1})$ 满足以下条件时,我们才允许合成:$$\frac{p(y_u \mid x_{1:N(\tau_u)}, y_{1:u-1}, h_{k-1})}{\max_{y'} p(y' \mid x_{1:N(\tau_u)}, y_{1:u-1}, h_{k-1})} \geq \beta_u,$$其中 $\beta_u$ 是一个温度缩放因子。
我们引入一个基于容量的分割阈值。令 $\mathcal{F}_{u} = \{ y' \mid p(y' \mid x_{1:N(\tau_u)}, y_{1:u-1}, h_{k-1}) > 0 \}$ 表示在给定上下文中可能的声学 token 集合。定义归一化熵 $s_u$ 来衡量预测的不确定性:$$s_u = \begin{cases} 1 + \frac{\sum_{j \in \mathcal{A}_u} a_{u,j} \log a_{u,j}}{\log M_u}, & M_u > 1, \\[5.0pt] 1, & M_u = 1. \end{cases} \tag{11}$$因此 $s_u \in [0,1]$,值越大表示注意力越集中。使用有界增益 $g_u = 0.015(0.5 + 0.5 s_u)$,我们将受关注的因果上下文注入为 $\overline{\mathbf{m}}_{u} = \sum_{j \in \mathcal{A}_u} a_{u,j} \mathbf{m}_j, \mathbf{z}_u' = \mathbf{z}_u + g_u \overline{\mathbf{m}}_{u}$。由于 $0.0075 \leq g_u \leq 0.015$,产生的扰动满足 $\|\mathbf{z}_u' - \mathbf{z}_u\| \leq 0.015 \max_{j \in \mathcal{A}_u} \|\mathbf{m}_j\|$,显式地约束了携带上下文的影响。
## 4 实验
表 1:可懂度与长文本鲁棒性(% 错误率;越低越好)。粗体为最佳,下划线为次佳。粒度为声学决策时可用的文本:离线、块或词元。
### 4.1 设置与评估
##### 数据。
分割和连续性评估使用中文 TTS 语料库普通话熟练度子集中的 59 篇保留段落,包含段落内的 954 个源句边界。整体合成质量使用 SEED-TTS-Eval \[1\]\(https://arxiv.org/html/2608.18661#bib.bib9\)(目标说话人评估集)和从 1 倍到 10 倍的长文本外推进行评估。稳定性实验使用持续数百秒的段落,并在 60 个固定的 10 秒窗口上评估每个系统。面向符号的评估涵盖数字、流式歧义和非自然类别,向所有系统提供相同的文本,并从 120 名听众收集主观评分。文本词元以固定速率提供以进行受控评估;已部署的上游语言模型可能表现出可变的词元生成延迟。所有 X2Streaming-TTS 运行都将继承的 Talker 历史固定为 $H=4$。服务延迟在单个 RTX 5090 上使用已部署的 BF16 引擎单独测量。我们测试 1 到 128 个并发请求,每级在 3 轮热身后进行 20 轮测量。
##### 指标。
识别性能使用 Whisper \[22\]\(https://arxiv.org/html/2608.18661#bib.bib30\) 和 Paraformer \[12\]\(https://arxiv.org/html/2608.18661#bib.bib32\) 测量。说话人相似度使用 ECAPA-TDNN \[7\]\(https://arxiv.org/html/2608.18661#bib.bib29\); \[28\]\(https://arxiv.org/html/2608.18661#bib.bib31\) 测量,预测自然度使用 UTMOS \[23\]\(https://arxiv.org/html/2608.18661#bib.bib28\) 测量。为量化片段边界处的不连续性,我们在边界两侧各提取 1000 毫秒的音频,并计算平均音高和平均能量的绝对差值,分别记为 $\Delta F0$ 和 $\Delta E$。PBD 是它们在 min-max 归一化后的平均值。每个估计首先在段落级别聚合,然后在段落上进行 10,000 次自助法引导。
### 4.2 主要结果
表 1 \[https://arxiv.org/html/2608.18661#S4.T1\] 的第一行和最后一行提供了最严格控制的比较。它们使用相同的离线骨干网络和相同的模型权重,仅在输入和决策条件上有所不同。因此,它们的性能差异反映了严格增量词级输入的效果。在 8 个条件中的 3 个中,我们的方法实现了比离线参考更低的识别错误,而在其余 5 个条件中,其最大下降幅度为 0.62 个百分点。这些结果表明,在评估条件下,词级输入引入的可测量可懂度损失很小。在 e相似文章
X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction
This paper introduces X2-Turn, a frame-synchronous dual-head model that jointly performs streaming ASR and turn state prediction on shared representations, improving turn-taking accuracy and latency in spoken dialogue systems.
VoiceChat-TTS:用于交互代理的低延迟连续语音合成模型
VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。
面向语音代理构建者的TTS精选列表 — 聚焦于流式延迟和流中取消
一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。
DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.
基于SpeechLLM的流式语音转文本翻译
提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。