Qwen3 TTS 被严重低估了——我本地实时跑通后,发现它是目前最有表现力的开源 TTS 之一

Reddit r/LocalLLaMA 模型

摘要

开发者演示如何本地实时运行 Qwen3 TTS,支持流式输出、量化、词级对齐与自定义音色微调,打造高表现力的开源 TTS 流水线。

大家好, 大约一年前,我发布并分享了 Persona Engine 这个 side project:把 ASR→LLM→TTS 整条链路完全本地化,再给一个实时对口型的虚拟形象(类似 VTuber)。当时用 Sesame 做 TTS,效果勉强够用。后来我歇了很长一段时间。 一两周前,我想给项目升个级,顺便看看本地模型进步到哪了,结果 Qwen3 TTS 让我大吃一惊。官方放出的初版其实一般,但我折腾了一阵,搞定了: 1. 稳定流式输出。模型解码器是滑动窗口架构,LLM 一边吐字,TTS 一边读,韵律、音高、语调都能保持一致。 2. 用 llama.cpp 跑起来,C# 环境也能用,顺便做了量化,速度飞起。 3. 原版没有词级时间戳和音素,而之前的 Kokoro(虽然声音更机械)是有的。于是我给 Qwen3 加了 CTC 词级对齐,方便做字幕和嘴型驱动。 搞定这些后,我又自己微调了一个 Qwen3-TTS 音色。官方给的克隆功能挺酷,但对上下文理解差,发音也翻车;而且官方没放母语级女声,我不想再做新 Live2D 模型。最终微调效果惊艳,我会继续迭代。 GitHub 地址:[https://github.com/fagenorn/handcrafted-persona-engine](https://github.com/fagenorn/handcrafted-persona-engine) 去玩吧,搞出啥骚操作记得告诉我!
查看原文

相似文章

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。

Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

Hugging Face Models Trending

阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。

Qwen3-tts.cpp + Compose 桌面 GUI

Reddit r/LocalLLaMA

开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。