Zyphra/ZONOS2
摘要
ZONOS2 是 Zyphra 推出的一款新型文本转语音模型,基于超过600万小时的多语言语音数据训练,采用混合专家架构,实现高质量语音克隆和低延迟。支持30多种语言,并提供高性能推理服务器。
查看缓存全文
缓存时间: 2026/06/15 09:07
Zyphra/ZONOS2 · Hugging Face 来源:https://huggingface.co/Zyphra/ZONOS2 ZONOS2 标题卡片 Discord(https://discord.gg/gTW9JwST8q) — ZONOS2 是我们最新的文本转语音模型,基于超过 600 万小时的多语言语音数据训练,通过 MoE 架构在低延迟下提供与顶级 TTS 提供商相当甚至超越的表现力和质量。ZONOS2 擅长高保真且自然的语音克隆。推理时,我们使用 nemo TN 标准化的 UTF-8 字节和 ECAPA-TDNN 嵌入,通过 MoE 骨干网络生成 DAC 令牌。推理概览如下图。 ZONOS2 标题卡片 语言支持如下。
| 层级 | 语言 |
|---|---|
| 第1层 | 英语、简体中文、日语 |
| 第2层 | 韩语、俄语、意大利语、葡萄牙语、法语、西班牙语、越南语、德语、希伯来语、荷兰语 |
| 第3层 | 瑞典语、印地语、泰米尔语、泰卢固语、泰语、挪威语、孟加拉语、他加禄语、阿拉伯语、丹麦语、印尼语、波兰语、乌克兰语、罗马尼亚语、芬兰语、匈牙利语、立陶宛语、爱沙尼亚语、斯洛伐克语、克罗地亚语、拉脱维亚语 |
对于本地推理,我们提供了一个构建在 Mini-SGLang(https://github.com/sgl-project/mini-sglang)之上的高性能 TTS 推理服务器。更多详情和语音样本,请查看我们的博客(https://www.zyphra.com/our-work/zonos2)。 我们也在 cloud.zyphra.com/audio-playground(https://cloud.zyphra.com/audio-playground)提供了一个托管版本。 — ## https://huggingface.co/Zyphra/ZONOS2#quick-start 快速开始 > 平台支持:仅限 Linux(x86_64)。需要 NVIDIA GPU,且 CUDA 工具包版本与驱动版本匹配(可通过 nvidia-smi 查看)。 ### https://huggingface.co/Zyphra/ZONOS2#1-installation 1. 安装 需要 uv(https://docs.astral.sh/uv/getting-started/installation/)。 git clone https://github.com/Zyphra/ZONOS2.git cd ZONOS2 uv sync ### https://huggingface.co/Zyphra/ZONOS2#2-launch-the-tts-server 2. 启动 TTS 服务器 uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/ uv run 始终使用项目环境,因此无需激活虚拟环境。服务器默认在 http://localhost:1919 上启动。zonos2 模型会自动检测 TTS 模式。--tts-default-voices-dir 参数用于预填充 Web 界面中的语音克隆说话人;该文件夹会递归扫描说话人音频(.wav、.mp3、.flac、.m4a、.ogg、.opus、.aac、.webm)和已保存的嵌入(.npy、.npz)。启动时会自动选择最新的语音。 ### https://huggingface.co/Zyphra/ZONOS2#3-generate-speech 3. 生成语音 curl: curl -X POST http://localhost:1919/tts/generate \ -H "Content-Type: application/json" \ -d '{"text": "Hello world", "stream": true}' \ --output output.pcm # 转换为 WAV ffmpeg -f f32le -ar 44100 -ac 1 -i output.pcm output.wav Web 界面: 在浏览器中打开 http://localhost:1919/。 ## https://huggingface.co/Zyphra/ZONOS2#python-api-offline-inference Python API(离线推理) 你也可以通过 TTSLLM 直接在 Python 脚本中运行引擎,而无需启动服务器: from minisgl.message import TTSSamplingParams from minisgl.tts import TTSLLM tts = TTSLLM(model_path="Zyphra/ZONOS2") results = tts.generate( ["Hello from the offline Python API.", "Batched prompts work too."], TTSSamplingParams(seed=42), ) for i, result in enumerate(results): print(f"frames={len(result['audio_tokens'])}, eos_frame={result['eos_frame']}") tts.save_audio(result["audio"], f"output_{i}.wav") ## https://huggingface.co/Zyphra/ZONOS2#citation 引用 如果你在学术环境中使用了本模型,请引用如下: @misc{zyphra2025zonos, title = {Zonos V2 Technical Report}, author = {Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge}, year = {2026}, }
相似文章
@ZyphraAI: 今天我们发布 ZONOS2,我们的下一代实时 TTS 模型,具有高保真语音克隆功能。ZONOS2 是最…
Zyphra 发布了 ZONOS2,一个开源的实时 TTS 模型,具有高保真语音克隆功能,采用 Apache 2.0 许可,可在基于 AMD 的 Zyphra Cloud 上使用。
@Gorden_Sun: ZONOS2:开源MoE TTS模型 8B总参数,0.9B激活参数。支持多语言,支持语音克隆,支持中文,中文效果不错。 模型:
Zyphra released ZONOS2, an open-source MoE text-to-speech model trained on over 6 million hours of multilingual speech, supporting voice cloning and high-quality synthesis across many languages.
k2-fsa/OmniVoice
OmniVoice 是一款大规模多语言零样本文本转语音模型,支持超过 600 种语言,基于扩散语言模型架构构建,具备快速推理和语音克隆能力。
OpenBMB/VoxCPM
OpenBMB发布VoxCPM2,一个2B参数的无分词器TTS模型,基于超过200万小时的多语言语音数据训练,支持30种语言、语音设计、可控克隆和48kHz输出。
@tom_doerr: 零样本语音克隆支持30种语言 https://github.com/sunnyxrxrx/X-Voice…
X-Voice 是一个基于流匹配的多语言文本转语音系统,支持跨30种语言的零样本语音克隆,并提供开源代码、模型及演示。