Qwen3-tts.cpp + Compose 桌面 GUI
摘要
开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。
我改进了我的 qwen3-tts.cpp 实现,使其在我的 RTX 5080 上达到约 5 倍实时速度。它基于 GGML 构建,因此应该可以在任何地方编译运行——不过我只在 Windows 和 Linux 下测试了 CPU 与 CUDA 版本:https://github.com/Danmoreng/qwen3-tts.cpp 此外,我还使用 Kotlin Compose Multiplatform 制作了一个桌面 GUI,同样支持 Windows 和 Linux:https://github.com/Danmoreng/qwen-tts-studio Windows 版本已发布,可直接下载运行。Linux 需要从源码构建。Qwen-TTS-Studio 功能特性:已知最快的 GGML 实现,比 Python 参考实现(0.6B 和 1.7B 模型)快 15 倍;基础模型支持语音克隆;带指令的 customvoice 模型;带指令的 voicedesign 模型;保存说话人嵌入;混合与合并说话人嵌入;流式传输(包括半准确文本高亮);内置从 Hugging Face 下载预转换 GGUF 模型的选项(https://huggingface.co/Serveurperso/Qwen3-TTS-GGUF)
相似文章
Qwen3 TTS 被严重低估了——我本地实时跑通后,发现它是目前最有表现力的开源 TTS 之一
开发者演示如何本地实时运行 Qwen3 TTS,支持流式输出、量化、词级对齐与自定义音色微调,打造高表现力的开源 TTS 流水线。
Qwen3-TTS 技术报告
Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。
我为 Ollama 构建了一个本地实时语音栈:Parakeet STT → Qwen 2.5 7B → Qwen3-TTS
作者使用 Parakeet STT、Qwen 2.5 7B 和 Qwen3-TTS 构建了一个本地实时语音栈,并与 Ollama 集成。
Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。