Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持
摘要
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
人们可能还记得几个月前的 Qwen3-TTS llama.cpp 演示。那个 PR 曾说它可能不会被合并,因为 llama.cpp 缺少所需的部分图和 API 组件。新的实现在昨天已合并到 master。目前可用的功能:
- GGUF 格式的 Qwen3-TTS-12Hz-1.7B-Base
- 支持 WAV 或 MP3 文件作为说话人参考
- 英语、中文、德语、意大利语、西班牙语、法语、葡萄牙语、俄语、日语和韩语
- 通过 llama-tts 二进制文件进行音频生成
示例:
llama-tts -hf ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF \
-p "Hello, this is running locally." \
--tts-lang en \
--tts-speaker-file speaker.mp3 \
--output out.wav
Qwen 描述 Base 模型可以从大约三秒的参考音频中克隆声音。我还没有看到独立测试显示 llama.cpp 版本在声音相似度或稳定性上是否与原始 PyTorch 实现一致。有趣之处不在于 Qwen3-TTS 能在本地运行——专门的 C++ 实现早已存在。而在于语音克隆现在已成为 llama.cpp 主线的一部分,这应该会让基于该运行时构建的项目更容易添加本地语音输出。
仍有一些重要限制:
- 合并的实现目前使用 llama-tts
- /tts 服务器端点仍是一个草稿 PR
- 它只针对 1.7B Base 模型,不包含 CustomVoice 或 VoiceDesign
- 还没有与 qwen3-tts.cpp 或 audio.cpp 进行适当的比较
- 此次更新包含对现有 llama-tts 二进制的破坏性变更
我希望看到的对比是:使用同一段三秒参考片段和同一段文本,在 CPU、Metal、CUDA 和 ROCm 上进行测试,并测量:
- 实时因子
- 峰值 RAM 和 VRAM
- 声音相似度
- 长文本稳定性
- 首次输出音频的时间
专门的移植版本可能在速度上仍然占优,而 llama.cpp 可能在可移植性和集成性上胜出。有人已经更新并测试了吗?M 系列 Mac 和纯 CPU 的结果尤其有用。
来源:https://github.com/ggml-org/llama.cpp/pull/26254
服务器端点草稿:https://github.com/ggml-org/llama.cpp/pull/26603
相似文章
Qwen3-TTS 技术报告
Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。
@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。
我为 Ollama 构建了一个本地实时语音栈:Parakeet STT → Qwen 2.5 7B → Qwen3-TTS
作者使用 Parakeet STT、Qwen 2.5 7B 和 Qwen3-TTS 构建了一个本地实时语音栈,并与 Ollama 集成。
Qwen3 TTS 被严重低估了——我本地实时跑通后,发现它是目前最有表现力的开源 TTS 之一
开发者演示如何本地实时运行 Qwen3 TTS,支持流式输出、量化、词级对齐与自定义音色微调,打造高表现力的开源 TTS 流水线。
Qwen3-tts.cpp + Compose 桌面 GUI
开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。