Zyphra/ZONOS2

Hugging Face Models Trending 模型

摘要

ZONOS2 是 Zyphra 推出的一款新型文本转语音模型,基于超过600万小时的多语言语音数据训练,采用混合专家架构,实现高质量语音克隆和低延迟。支持30多种语言,并提供高性能推理服务器。

任务:文本转语音 标签:ZONOS2, 文本转语音, 许可证:apache-2.0, 地区:us
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:07

Zyphra/ZONOS2 · Hugging Face 来源:https://huggingface.co/Zyphra/ZONOS2 ZONOS2 标题卡片 Discord(https://discord.gg/gTW9JwST8q) — ZONOS2 是我们最新的文本转语音模型,基于超过 600 万小时的多语言语音数据训练,通过 MoE 架构在低延迟下提供与顶级 TTS 提供商相当甚至超越的表现力和质量。ZONOS2 擅长高保真且自然的语音克隆。推理时,我们使用 nemo TN 标准化的 UTF-8 字节和 ECAPA-TDNN 嵌入,通过 MoE 骨干网络生成 DAC 令牌。推理概览如下图。 ZONOS2 标题卡片 语言支持如下。

层级语言
第1层英语、简体中文、日语
第2层韩语、俄语、意大利语、葡萄牙语、法语、西班牙语、越南语、德语、希伯来语、荷兰语
第3层瑞典语、印地语、泰米尔语、泰卢固语、泰语、挪威语、孟加拉语、他加禄语、阿拉伯语、丹麦语、印尼语、波兰语、乌克兰语、罗马尼亚语、芬兰语、匈牙利语、立陶宛语、爱沙尼亚语、斯洛伐克语、克罗地亚语、拉脱维亚语

对于本地推理,我们提供了一个构建在 Mini-SGLang(https://github.com/sgl-project/mini-sglang)之上的高性能 TTS 推理服务器。更多详情和语音样本,请查看我们的博客(https://www.zyphra.com/our-work/zonos2)。 我们也在 cloud.zyphra.com/audio-playground(https://cloud.zyphra.com/audio-playground)提供了一个托管版本。 — ## https://huggingface.co/Zyphra/ZONOS2#quick-start 快速开始 > 平台支持:仅限 Linux(x86_64)。需要 NVIDIA GPU,且 CUDA 工具包版本与驱动版本匹配(可通过 nvidia-smi 查看)。 ### https://huggingface.co/Zyphra/ZONOS2#1-installation 1. 安装 需要 uv(https://docs.astral.sh/uv/getting-started/installation/)。 git clone https://github.com/Zyphra/ZONOS2.git cd ZONOS2 uv sync ### https://huggingface.co/Zyphra/ZONOS2#2-launch-the-tts-server 2. 启动 TTS 服务器 uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/ uv run 始终使用项目环境,因此无需激活虚拟环境。服务器默认在 http://localhost:1919 上启动。zonos2 模型会自动检测 TTS 模式。--tts-default-voices-dir 参数用于预填充 Web 界面中的语音克隆说话人;该文件夹会递归扫描说话人音频(.wav.mp3.flac.m4a.ogg.opus.aac.webm)和已保存的嵌入(.npy.npz)。启动时会自动选择最新的语音。 ### https://huggingface.co/Zyphra/ZONOS2#3-generate-speech 3. 生成语音 curl: curl -X POST http://localhost:1919/tts/generate \ -H "Content-Type: application/json" \ -d '{"text": "Hello world", "stream": true}' \ --output output.pcm # 转换为 WAV ffmpeg -f f32le -ar 44100 -ac 1 -i output.pcm output.wav Web 界面: 在浏览器中打开 http://localhost:1919/。 ## https://huggingface.co/Zyphra/ZONOS2#python-api-offline-inference Python API(离线推理) 你也可以通过 TTSLLM 直接在 Python 脚本中运行引擎,而无需启动服务器: from minisgl.message import TTSSamplingParams from minisgl.tts import TTSLLM tts = TTSLLM(model_path="Zyphra/ZONOS2") results = tts.generate( ["Hello from the offline Python API.", "Batched prompts work too."], TTSSamplingParams(seed=42), ) for i, result in enumerate(results): print(f"frames={len(result['audio_tokens'])}, eos_frame={result['eos_frame']}") tts.save_audio(result["audio"], f"output_{i}.wav") ## https://huggingface.co/Zyphra/ZONOS2#citation 引用 如果你在学术环境中使用了本模型,请引用如下: @misc{zyphra2025zonos, title = {Zonos V2 Technical Report}, author = {Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge}, year = {2026}, }

相似文章

k2-fsa/OmniVoice

Hugging Face Models Trending

OmniVoice 是一款大规模多语言零样本文本转语音模型,支持超过 600 种语言,基于扩散语言模型架构构建,具备快速推理和语音克隆能力。

OpenBMB/VoxCPM

GitHub Trending (daily)

OpenBMB发布VoxCPM2,一个2B参数的无分词器TTS模型,基于超过200万小时的多语言语音数据训练,支持30种语言、语音设计、可控克隆和48kHz输出。