标签
X2Streaming-TTS 提出了一种因果令牌级文本转语音框架,用于真正的流式合成,使用因果承诺和语音状态继承来处理不确定的文本前缀,并在低延迟口语对话系统中保持声学连续性。
VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。
Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。
作者指出流式语音合成中文本归一化被严重低估,并分享了一份厂商基准:用 1000+ 句子、31 个类别(日期、网址、缩写等)测评主流实时 TTS 服务。