构建与评估基于合成语音的固定语音泰语TTS系统
摘要
本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。
查看缓存全文
缓存时间: 2026/09/04 06:01
# 从合成语音构建与评估固定语音泰语TTS系统 来源:https://arxiv.org/html/2609.03502 Potsawee Manakul,Warit Sirichotedumrong,Sittipong Sripaisarnmongkol,Pakorn Nathong,Phatrasek Jirabovonvisut Wayu Research,Paxa Labs,Typhoon ###### 摘要 在低资源环境中部署TTS时,通常需要在以下两种方案中选择:一种是使用推理成本高昂的大型语音克隆模型,另一种是需要特定说话人语料库的紧凑型固定语音系统。我们研究了第三条路径:将大型语音克隆模型用作可编程数据源,把短语音参考(例如15秒)转化为完全基于合成语音训练的紧凑型固定语音学生模型。这种设定使得流程设计变得关键:教师模型的错误会成为训练目标,而过滤失败的生成结果可能降低对困难文本的覆盖。泰语还因其模糊的词汇边界、声调、专名与借词、数字口语化表达以及泰英混合使用等特性带来了额外挑战。我们研究了文本准备、合成生成、质量过滤、拒绝采样以及前端选择如何影响最终的学生模型,并探讨了教师模型仍存在的局限性。我们评估了字符错误率、挑战集关键词准确率、韵律停顿准确率、说话人相似度和语速。最终得到的82M参数模型Wayu-Paxa-TTS-Edge,可在无需参考音频的情况下实现设备端泰语TTS。该模型在泰语挑战集关键词准确率达到68.2%(相当于Gemini 3.1的85.5%),停顿精度达到91.4%,超越了其OmniVoice教师模型(89.9%),并达到Gemini 3.1的94.8%水平。该模型还在三个系统中取得了最低的停顿位置错误率和词内停顿率,泰语和英语的字符错误率分别为3.7%和1.1%。我们开源了该模型及泰语TTS开发的评估框架。 Wayu Research,Paxa Labs 技术报告 ## 1 引言 在低资源环境中部署TTS通常需要在两种方案之间选择:一种是使用参考音频和GPU推理的大型生成式语音克隆模型,另一种是基于授权单说话人语料库训练的紧凑型固定语音TTS系统。现代多语言TTS系统可以从仅几秒钟的参考音频中复现说话人特征(Zhang et al., 2025; Hu et al., 2026; Boson AI, 2026; Zhu et al., 2026)。这些系统依赖于大规模生成式骨干网络,包括自回归语言模型和扩散语言模型,并通常在大规模多语言语音集合上进行训练。其规模提供了广泛的零样本能力,但当应用仅需单一机构特定语音(如交互式语音应答系统或个人品牌创作者)时,这可能过于昂贵。相比之下,VITS和StyleTTS2等TTS架构支持紧凑型固定语音部署(Kim et al., 2021; Li et al., 2023b);我们的学生模型使用了82M参数的Kokoro骨干网络(Hexgrad, 2025)。第二种路径简化了部署,但需要特定说话人语料库。 受现代LLM开发中知识蒸馏的启发(Pipatanakul et al., 2024),我们研究了第三条路径。我们同样使用大型语音克隆模型从短语音参考(例如15秒)生成语音,并训练一个紧凑型固定语音学生模型。 先前的低资源工作使用合成目标语言语音,然后适应数小时的真实目标说话人音频(Joshi and Garera, 2023)。最近的一个泰语特定系统采用了数据密集型路径,构建了带有明确声调和停顿标注的大型语音和文本集合(Geng et al., 2025)。我们的路径不需要短参考以外的任何特定说话人语料库。合成数据在数量上是无限的,但它们的质量和覆盖范围仍然受限于随机教师模型所能生成的内容以及流程所能选择的内容。 泰语因其模糊的词汇边界、声调、不规则的专名和借词、非正式拼写、数字口语化表达以及泰英混合使用而具有挑战性。泰语正字法并未一致地标记词汇边界(Chormai et al., 2020),先前的泰语TTS工作明确建模了声调和停顿位置(Geng et al., 2025)。混合输入增加了另一层歧义:预期的表达方式通常是带泰语口音的英语,而非纯正英语。这些情况暴露了句子级CER所掩盖的错误。一个句子可能CER较低,但错误发音了一个关键表达;转录文本可能正确,但波形中却在一个单词内部或不合理的交界处包含了停顿。 因此,核心问题不在于合成语音能否训练学生模型,而在于流程的哪些组件会影响性能、如何评估它们的影响,以及教师模型的局限性依然存在。我们的流程涵盖文本准备、使用OmniVoice(Zhu et al., 2026)进行合成语音生成、质量过滤、拒绝采样以及训练紧凑型Kokoro学生模型(Hexgrad, 2025)。我们评估了CER、挑战集关键词准确率、韵律停顿准确率、说话人相似度和语速。 我们最终的模型Wayu-Paxa-TTS-Edge是一个82M参数的固定语音泰英TTS系统,支持设备端推理。该模型在泰语上取得了68.2%的挑战集关键词准确率和91.4%的停顿精度,泰语和英语的CER分别为3.7%和1.1%。教师模型分析表明,最佳-K采样揭示了显著的提升空间:在K=118时,精确准确率达到87.9%,比72.8%的教师基线高出15.1个百分点。这一提升表明,改进采样和选择是获得更强训练目标的途径;未解决的项目集中在教师训练语料库中代表性不足的表达上,使得数据覆盖成为下一个挑战。 我们的贡献包括: - 一个端到端的方案,用于将短语音参考转化为质量受控的泰语合成语料库和一个紧凑型固定语音学生模型; - 一个评估框架,将句子级CER、定向发音正确性、停顿位置、说话人相似度和语速分开评估; - 关于停顿过滤、拒绝采样、预训练初始化和前端策略影响的控制证据,包括前端变更无需声学模型重训练所带来的收益; - 通过最佳-K采样进行的教师支持分析,以及一项伊森语适应研究,表明15秒的参考音频可以将语音身份和方言形式转移给固定语音学生模型。 ## 2 从零样本教师到固定语音学生 我们通过图1所示的三阶段流程,将零样本语音克隆教师蒸馏为固定语音学生模型:(1)泰语文本准备和口语化,(2)教师采样和质量过滤,(3)学生训练。给定泰语文本和12个冻结的OmniVoice设计语音参考之一(https://huggingface.co/k2-fsa/OmniVoice)(Zhu et al., 2026),教师模型生成候选话语以供质量过滤器评估。由此产生的语音构成用于训练Kokoro(https://huggingface.co/hexgrad/Kokoro-82M)学生模型的合成语料库(Hexgrad, 2025; Li et al., 2023b)。 图 1:将15秒语音参考蒸馏为固定语音泰语TTS。零样本教师渲染准备好的泰语文本;质量过滤保留合适的候选语音,并触发对合格失败语音的重新渲染,由此产生的语料库训练了一个带有泰英音素前端的Kokoro学生模型。 ### 评估:超越CER的互补证据 合成语音的评分维度包括:句子正确性、困难表达发音、停顿位置、语音身份和语速,从而揭示单一指标可能遗漏的失败情况。 ### 2.1 合成语料库构建 我们分三个阶段构建学生语料库:(1)收集和分割泰语文本,(2)对多语言教师无法可靠解释的文本形式进行口语化,(3)采样和质量过滤候选波形。由此产生的文本-音频对用于训练学生模型。第4.1节评估了这些语料库构建选择。 #### 2.1.1 文本来源 原始文本来自两个来源:(1)WangchanThaiInstruct(Limkonchotiwat et al., 2025),提供广泛的泰语覆盖;(2)基于LLM的关键词合成流程,针对困难表达。在教师推理之前,我们将文本分成句子级块。对于发布的模型,我们添加了来自LibriTTS(Zen et al., 2019)的英文文本。 #### 2.1.2 语音创建 我们分两个阶段创建合成语音。首先,使用OmniVoice Voice Design模式从12个说话人规范生成种子参考。其次,使用OmniVoice克隆模式使用这些冻结的参考渲染语料库文本,为每个声音生成多个话语,同时保持相应的身份。 在克隆之前,我们对多语言教师无法可靠解释的文本形式进行口语化处理。在初步实验中,数字有时用中文朗读,而英文部分则以不同于预期泰式英语口音的口音渲染。因此,LLM口语化器将模糊的数字和嵌入式英文片段重写为面向发音的泰语或“泰式英语”(Tinglish)文本。OmniVoice随后使用冻结的种子参考合成这段准备好的文本,并将候选语音传入过滤阶段。 #### 2.1.3 过滤与拒绝采样 为确保合成的语音质量足以用于学生模型训练,我们使用涵盖发音、停顿位置、语速和时长的质量过滤器评估每个教师生成的候选语音。 **内容正确性** 我们使用基于CTC的泰语ASR模型airesearch/wav2vec2-large-xlsr-53-th(VISTEC-depa AI Research Institute of Thailand, 2023)转录每个候选语音,并在音素空间中比较每个*硬token*与目标。如果任何硬token未能通过精确的音素匹配(包括声调),则拒绝该候选。我们使用CTC验证器,因为Whisper风格的自回归ASR模型(Radford et al., 2023)能够从句子上下文中恢复预期的单词,尽管声学实现不正确,这会在过滤过程中掩盖发音错误。 我们使用确定性规则定义硬token。如果一个token是词汇表外的,或是TLTK词典中的词头但在泰国国家语料库(Aroonmanakun, 2007; Phatthiyaphaibun et al., 2023)中罕见的,则被视为硬token。 **韵律与时长正确性** 一个话语可能通过内容过滤但仍不适合训练。我们根据三个标准拒绝候选:(1)停顿位置违反第3.2节允许的位置,(2)话语级语速超出特定说话人范围(约±10%),(3)硬token时长相对于教师群体异常压缩。 停顿位置失败的语音将从候选池中移除。我们重新渲染剩余的失败语音最多四次,并在没有候选通过时保留最佳结果,以保持文本覆盖。表1报告了过滤过程的最终拒绝率。 表 1:质量过滤拒绝了23.0%的教师候选;停顿位置(11.3%)和发音(10.4%)失败占主导,而语速和时长检查仅剔除了少数候选。 ### 2.2 学生模型 我们使用82M参数的Kokoro/StyleTTS2骨干网络,因为其紧凑的固定语音架构符合我们的部署目标,同时保持了强大的合成质量(Hexgrad, 2025; Li et al., 2023b)。学生模型将音素序列转换为特定固定集合声音的语音,并且在推理时不需要参考音频。我们的调整添加了一个脚本路由的泰英音素前端,并使用第2.1节描述的质量受控合成语料库训练模型。 #### 2.2.1 音素前端 Kokoro不直接处理原始文本。相反,特定语言的前端将文本映射到基于IPA的共享音素词汇表;例如,Kokoro对英语使用Misaki,对中文和日语使用单独的前端(Hexgrad, 2025)。由于原始前端不支持泰语,我们集成了泰语语言工具包(TLTK)(Aroonmanakun, 2024)作为泰语字素到音素组件。大多数泰语音段音素已经可以映射到Kokoro多语言词汇表中的符号。五个泰语声调中的四个同样可以重用现有的轮廓token;只有泰语低声调(เสียงต่ํา)需要额外的词汇条目和一个可学习的嵌入。 我们比较了两种处理嵌入式英语的方法。 **单语前端** 拉丁文片段被转换为面向发音的泰语文字,TLTK将整个输入作为泰语进行音素化。 **双语前端** 拉丁文片段保持不变;泰语和英语片段分别通过TLTK和Misaki路由,并在Kokoro的共享音素词汇表中组合。
相似文章
构建和评估用于电信客户服务的合成孟加拉语音资源
本文介绍了一个用于电信客户服务场景的合成孟加拉语音数据集,包含10,000个音频-文本对,使用OmniVoice语音克隆技术生成,并通过ASR模型评估,实现了较低的单词错误率。
FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines
This paper presents FastThaiG2P, a sub-millisecond Thai grapheme-to-phoneme conversion tool for TTS pipelines, achieving 0.15 ms average latency on a 27k-utterance benchmark. The authors demonstrate it by training a StyleTTS 2 Thai TTS model on a phonemized 20-hour open dataset.
kyutai-labs/pocket-tts
Kyutai 发布了 Pocket TTS,这是一个轻量级的文本转语音模型,可高效在 CPU 上运行,拥有 1 亿参数、低延迟和语音克隆功能,支持多种语言。
迈向基于音系学的多语言TTS评估
本文提出了一种基于分类器的框架,用于审计多语言TTS系统的音系忠实性,以阿萨姆语ATR元音和谐为案例研究。结果显示,Meta的MMS TTS频繁错误生成舌根前伸元音,而这种偏差在人类语音中不存在。
TontaubeV1 - 本地长篇生成开放语音合成模型发布
TontaubeV1 是一个开放权重的语音合成模型,专为本地长篇生成发布,支持英语和德语,具备零样本语音克隆功能,并可在 GPU 上实现低延迟推理。