Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持

Reddit r/LocalLLaMA 工具

摘要

Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。

人们可能还记得几个月前的 Qwen3-TTS llama.cpp 演示。那个 PR 曾说它可能不会被合并,因为 llama.cpp 缺少所需的部分图和 API 组件。新的实现在昨天已合并到 master。目前可用的功能: - GGUF 格式的 Qwen3-TTS-12Hz-1.7B-Base - 支持 WAV 或 MP3 文件作为说话人参考 - 英语、中文、德语、意大利语、西班牙语、法语、葡萄牙语、俄语、日语和韩语 - 通过 llama-tts 二进制文件进行音频生成 示例: llama-tts -hf ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF \ -p "Hello, this is running locally." \ --tts-lang en \ --tts-speaker-file speaker.mp3 \ --output out.wav Qwen 描述 Base 模型可以从大约三秒的参考音频中克隆声音。我还没有看到独立测试显示 llama.cpp 版本在声音相似度或稳定性上是否与原始 PyTorch 实现一致。有趣之处不在于 Qwen3-TTS 能在本地运行——专门的 C++ 实现早已存在。而在于语音克隆现在已成为 llama.cpp 主线的一部分,这应该会让基于该运行时构建的项目更容易添加本地语音输出。 仍有一些重要限制: - 合并的实现目前使用 llama-tts - /tts 服务器端点仍是一个草稿 PR - 它只针对 1.7B Base 模型,不包含 CustomVoice 或 VoiceDesign - 还没有与 qwen3-tts.cpp 或 audio.cpp 进行适当的比较 - 此次更新包含对现有 llama-tts 二进制的破坏性变更 我希望看到的对比是:使用同一段三秒参考片段和同一段文本,在 CPU、Metal、CUDA 和 ROCm 上进行测试,并测量: - 实时因子 - 峰值 RAM 和 VRAM - 声音相似度 - 长文本稳定性 - 首次输出音频的时间 专门的移植版本可能在速度上仍然占优,而 llama.cpp 可能在可移植性和集成性上胜出。有人已经更新并测试了吗?M 系列 Mac 和纯 CPU 的结果尤其有用。 来源:https://github.com/ggml-org/llama.cpp/pull/26254 服务器端点草稿:https://github.com/ggml-org/llama.cpp/pull/26603
查看原文

相似文章

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。

Qwen3-tts.cpp + Compose 桌面 GUI

Reddit r/LocalLLaMA

开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。