Audio8/Audio8-TTS-Preview-0.6b
摘要
Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。
查看缓存全文
缓存时间: 2026/07/30 15:57
Audio8/Audio8-TTS-Preview-0.6b · Hugging Face
来源: https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b Audio8
Audio8 TTS Preview 0.6B:紧凑规模的SOTA级TTS
一个拥有6亿参数的多语言文本转语音模型,支持零样本声音克隆。
GitHub (https://github.com/Audio8-AI/Audio8_TTS) 演示 (https://audio8-ai.github.io/Audio8_TTS/) 许可证 (https://github.com/Audio8-AI/Audio8_TTS/blob/main/LICENSE)
Audio8 TTS Preview 支持多语言语音生成和零样本声音克隆。此仓库包含完整的检查点、其44.1 kHz神经音频编解码器、分词器、处理器以及Hugging Face远程代码。
预览状态: 本版本的覆盖语言范围有限。为获得最佳效果,请使用下面列出的11种推荐语言之一。更广泛的多语言覆盖和中文方言支持将在未来版本中提供。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#supported-languages 支持的语言
粤语 · 中文 · 荷兰语 · 英语 · 法语 · 德语 · 意大利语 · 日语 · 韩语 · 波兰语 · 西班牙语
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#model-details 模型详情
Audio8 TTS 采用受 Fish Audio S2 Pro (https://github.com/fishaudio/fish-speech) 启发的 DualAR 架构。慢速AR变换器预测每帧一个语义token。快速AR变换器在慢速隐藏状态和先前码本条件下预测该帧的编解码器码本。
| 组件 | 配置 |
|---|---|
| 主模型 | 601,159,424 参数(不含编解码器) |
| 慢速AR | 24层,宽度896,14个注意力头,2个KV头 |
| 快速AR | 4层,宽度896,14个注意力头,2个KV头 |
| 声学token | 10个码本,每个码本4096个条目 |
| 编解码器 | 44.1 kHz,每模型帧2048个样本(约21.5帧/秒) |
| 上下文 | 最多2048个打包的文本/音频位置 |
捆绑的编解码器同时处理参考音频编码和波形解码,因此无需额外的编解码器检查点。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#installation 安装
推荐使用 Python 3.10 或更高版本以及支持CUDA的GPU。
pip install "torch>=2.5.0" "torchaudio>=2.5.0" \ "transformers>=4.57.0,<5" "soundfile>=0.12" "safetensors>=0.4"
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#usage 使用
该模型使用自定义的 Transformers 代码。查看此仓库中的文件,然后使用 trust_remote_code=True 加载。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#zero-shot-voice-cloning 零样本声音克隆
参考文本必须与参考音频中的语音内容匹配。
`` import soundfile as sf import torch from transformers import AutoModel, AutoProcessor
model_id = “AutoArk-AI/Audio8-TTS-Preview-0.6b” device = “cuda” if torch.cuda.is_available() else “cpu” dtype = torch.bfloat16 if device == “cuda” else torch.float32
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True) model = AutoModel.from_pretrained( model_id, trust_remote_code=True, dtype=dtype, ).eval().to(device)
inputs = processor( text=[“欢迎使用 Audio8 TTS。”], reference_audio=[“reference.wav”], reference_text=[“参考录音的确切转录文本。”], return_tensors=“pt”, ) inputs = {name: value.to(device) for name, value in inputs.items()}
with torch.inference_mode(): output = model.generate( **inputs, max_new_tokens=1024, temperature=0.8, top_p=0.95, top_k=50, do_sample=True, return_dict_in_generate=True, ) waveforms, waveform_lengths = model.decode_audio(output.codes)
audio = waveforms[0, : int(waveform_lengths[0])].float().cpu().numpy() sf.write(“output.wav”, audio, model.config.codec_sample_rate) ``
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#generation-without-a-reference 无参考生成
当不需要克隆声音时,省略 reference_audio 和 reference_text:
inputs = processor( text=["这段话语不使用参考语音。"], return_tensors="pt", )
关于命令行推理、批处理和监督微调,请参阅 Audio8 TTS 仓库 (https://github.com/Audio8-AI/Audio8_TTS)。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#evaluation 评估
Audio8 TTS Preview 是本次比较中参数最少的模型,仅有 6亿参数。尽管参数数量仅为其他系统的一小部分,但在以下基准测试中,其表现与业界领先的SOTA TTS模型处于同一梯队。特别是,它在 Seed-TTS 上取得了最佳的英文WER和有竞争力的中文CER,同时在 CV3 多语言评估中保持了竞争力。
WER/CER 越低越好;SIM 越高越好。Seed-TTS 的相似度值以百分比显示。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#seed-tts Seed-TTS
| 模型 | 参数 | 英文 WER / SIM | 中文 CER / SIM | 中文难例 CER / SIM |
|---|---|---|---|---|
| Audio8 TTS Preview | 0.6B | 1.506 / 63.2 | 0.950 / 73.1 | 1.510 / 68.7 |
| Fish S2 Pro | 4.6B | 1.607 / 64.6 | 1.038 / 73.8 | 10.149 / 70.1 |
| Higgs Audio v2 | 4.7B | 1.524 / 66.4 | 0.806 / 72.1 | 10.622 / 69.3 |
| CosyVoice3-1.5B | 1.5B | 2.22 / 72.0 | 1.12 / 78.1 | 5.83 / 75.8 |
| MOSS-TTS | 8.5B | 1.85 / 73.4 | 1.20 / 78.8 | - |
| VoxCPM2 | 2.3B | 1.84 / 75.3 | 0.97 / 79.5 | 8.13 / 75.3 |
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#cv3-multilingual-error-rate CV3多语言错误率
| 模型 | 参数 | zh | en | hard-zh | hard-en | ja | ko | de | es | fr | it | ru |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Audio8 TTS Preview | 0.6B | 3.205 | 3.128 | 10.535 | 5.997 | 7.205 | 4.223 | 3.447 | 3.641 | 8.790 | 4.790 | - |
| Fish S2 Pro | 4.6B | 3.600 | 3.493 | 10.588 | 7.349 | 5.139 | 4.111 | 3.605 | 2.972 | 8.600 | 4.229 | 4.702 |
| Higgs Audio v2 | 4.7B | 3.378 | 3.404 | 10.424 | 5.754 | 4.742 | 4.260 | 3.300 | 2.929 | 9.425 | 3.555 | 5.423 |
| CosyVoice3-1.5B | 1.5B | 3.91 | 4.99 | 9.77 | 10.55 | 7.57 | 5.69 | 6.43 | 4.47 | 11.81 | 0.56 | 6.64 |
| VoxCPM2 | 2.3B | 3.65 | 5.00 | 8.55 | 8.48 | 5.96 | 5.69 | 4.77 | 3.80 | 9.85 | 4.25 | 5.21 |
参数数量直接根据发布的权重张量计算。MOSS-TTS 包含 8,489,841,664 个参数。VoxCPM2 的主模型包含 2,290,004,544 个参数;单独的 AudioVAE 不包含在参数比较中。
Fish S2 Pro 被重新评估,因为其官方评估使用了自身的归一化器。Higgs Audio v2 是在本地评估的,因为具体数值不可用。所有其他基准值均来自其官方报告,通过 VoxCPM 仓库 (https://github.com/OpenBMB/VoxCPM) 收集。
不同的归一化器和评估器使得跨项目数值仅为参考比较,而非严格匹配的排名。评估覆盖范围不会将 Preview 检查点支持的语言范围扩展至上述 11 种语言之外。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#limitations-and-responsible-use 限制与责任使用
- 这是一个 Preview 检查点,多语言和方言覆盖范围有限。
- 非常长、有噪声或转录不准确的参考片段可能会降低稳定性和说话人相似度。
- 生成的语音可能被滥用于冒充或虚假信息。克隆声音前需获得同意,并在适当情况下明确披露合成音频。
- 在部署前评估模型的准确性、安全性和法律合规性。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#license-and-acknowledgements 许可证与致谢
代码和模型权重在 Apache License 2.0 (https://github.com/Audio8-AI/Audio8_TTS/blob/main/LICENSE) 下发布。归属详情请参见上游 NOTICE (https://github.com/Audio8-AI/Audio8_TTS/blob/main/NOTICE)。
我们感谢 Fish Audio 团队发布了 Fish Audio S2 Pro 中使用的 DualAR 架构。
相似文章
@SamuelZengML:我们由衷地感到惊讶和感激,看到我们最新的开源模型 Audio8/Audio8-TTS-Preview-0.6b 在……上排名第一
Audio8 的开源 TTS 模型在 Hugging Face 的 TTS 趋势榜上排名第一,总榜排名第十,团队对此表示感谢,并计划继续改进。
Higgs Audio v3 TTS 4B。专为语音聊天打造。支持100种语言和内联控制。
Higgs Audio v3 是一个 4B 参数的 TTS 模型,专为语音聊天应用设计,支持 100 种语言并具备内联控制能力。
OpenMOSS-Team/MOSS-TTS-v1.5 · Hugging Face
MOSS-TTS v1.5是一个更新的开源文本转语音模型,具有改进的多语言合成(支持31种语言)、更稳定的零样本语音克隆以及显式的内联停顿控制。
@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。
@Prince_Canuma: mlx-audio v0.4.3 正式发布!模型、服务器和开发体验全面升级 → 6 个全新 TTS 模型:Higgs Audio v2(声音克隆)…
mlx-audio v0.4.3 发布,新增 6 个 TTS 模型,包括 Higgs Audio v2 和支持 646+ 种语言的 OmniVoice,同时带来并发请求与持续批处理等服务器改进,Voxtral Realtime 4-bit 模式速度提升约 3 倍,并精简了 Apple Silicon 上的依赖项。