Qwen3 TTS 被严重低估了——我本地实时跑通后,发现它是目前最有表现力的开源 TTS 之一
摘要
开发者演示如何本地实时运行 Qwen3 TTS,支持流式输出、量化、词级对齐与自定义音色微调,打造高表现力的开源 TTS 流水线。
大家好,
大约一年前,我发布并分享了 Persona Engine 这个 side project:把 ASR→LLM→TTS 整条链路完全本地化,再给一个实时对口型的虚拟形象(类似 VTuber)。当时用 Sesame 做 TTS,效果勉强够用。后来我歇了很长一段时间。
一两周前,我想给项目升个级,顺便看看本地模型进步到哪了,结果 Qwen3 TTS 让我大吃一惊。官方放出的初版其实一般,但我折腾了一阵,搞定了:
1. 稳定流式输出。模型解码器是滑动窗口架构,LLM 一边吐字,TTS 一边读,韵律、音高、语调都能保持一致。
2. 用 llama.cpp 跑起来,C# 环境也能用,顺便做了量化,速度飞起。
3. 原版没有词级时间戳和音素,而之前的 Kokoro(虽然声音更机械)是有的。于是我给 Qwen3 加了 CTC 词级对齐,方便做字幕和嘴型驱动。
搞定这些后,我又自己微调了一个 Qwen3-TTS 音色。官方给的克隆功能挺酷,但对上下文理解差,发音也翻车;而且官方没放母语级女声,我不想再做新 Live2D 模型。最终微调效果惊艳,我会继续迭代。
GitHub 地址:[https://github.com/fagenorn/handcrafted-persona-engine](https://github.com/fagenorn/handcrafted-persona-engine)
去玩吧,搞出啥骚操作记得告诉我!
相似文章
Qwen3-TTS 技术报告
Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。
Qwen3-tts.cpp + Compose 桌面 GUI
开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。
HN上展示:Nari Qwen3-TTS 和 Qwen3-ASR – 高准确率、低延迟和低成本
Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。
@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。