Qwen3-tts.cpp + Compose 桌面 GUI

Reddit r/LocalLLaMA 工具

摘要

开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。

我改进了我的 qwen3-tts.cpp 实现,使其在我的 RTX 5080 上达到约 5 倍实时速度。它基于 GGML 构建,因此应该可以在任何地方编译运行——不过我只在 Windows 和 Linux 下测试了 CPU 与 CUDA 版本:https://github.com/Danmoreng/qwen3-tts.cpp 此外,我还使用 Kotlin Compose Multiplatform 制作了一个桌面 GUI,同样支持 Windows 和 Linux:https://github.com/Danmoreng/qwen-tts-studio Windows 版本已发布,可直接下载运行。Linux 需要从源码构建。Qwen-TTS-Studio 功能特性:已知最快的 GGML 实现,比 Python 参考实现(0.6B 和 1.7B 模型)快 15 倍;基础模型支持语音克隆;带指令的 customvoice 模型;带指令的 voicedesign 模型;保存说话人嵌入;混合与合并说话人嵌入;流式传输(包括半准确文本高亮);内置从 Hugging Face 下载预转换 GGUF 模型的选项(https://huggingface.co/Serveurperso/Qwen3-TTS-GGUF)
查看原文

相似文章

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。

Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

Hugging Face Models Trending

阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。