Audio8/Audio8-TTS-Preview-0.6b

Hugging Face Models Trending 模型

摘要

Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。

任务:文本转语音 标签:transformers, safetensors, arktts, feature-extraction, audio, text-to-speech, tts, voice-cloning, zero-shot, multilingual, custom_code, yue, zh, nl, en, fr, de, it, ja, ko, pl, es, 许可证:apache-2.0, 地区:us
查看原文
查看缓存全文

缓存时间: 2026/07/30 15:57

Audio8/Audio8-TTS-Preview-0.6b · Hugging Face

来源: https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b Audio8

Audio8 TTS Preview 0.6B:紧凑规模的SOTA级TTS

一个拥有6亿参数的多语言文本转语音模型,支持零样本声音克隆。

GitHub (https://github.com/Audio8-AI/Audio8_TTS) 演示 (https://audio8-ai.github.io/Audio8_TTS/) 许可证 (https://github.com/Audio8-AI/Audio8_TTS/blob/main/LICENSE)

Audio8 TTS Preview 支持多语言语音生成和零样本声音克隆。此仓库包含完整的检查点、其44.1 kHz神经音频编解码器、分词器、处理器以及Hugging Face远程代码。

预览状态: 本版本的覆盖语言范围有限。为获得最佳效果,请使用下面列出的11种推荐语言之一。更广泛的多语言覆盖和中文方言支持将在未来版本中提供。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#supported-languages 支持的语言

粤语 · 中文 · 荷兰语 · 英语 · 法语 · 德语 · 意大利语 · 日语 · 韩语 · 波兰语 · 西班牙语

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#model-details 模型详情

Audio8 TTS 采用受 Fish Audio S2 Pro (https://github.com/fishaudio/fish-speech) 启发的 DualAR 架构。慢速AR变换器预测每帧一个语义token。快速AR变换器在慢速隐藏状态和先前码本条件下预测该帧的编解码器码本。

组件配置
主模型601,159,424 参数(不含编解码器)
慢速AR24层,宽度896,14个注意力头,2个KV头
快速AR4层,宽度896,14个注意力头,2个KV头
声学token10个码本,每个码本4096个条目
编解码器44.1 kHz,每模型帧2048个样本(约21.5帧/秒)
上下文最多2048个打包的文本/音频位置

捆绑的编解码器同时处理参考音频编码和波形解码,因此无需额外的编解码器检查点。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#installation 安装

推荐使用 Python 3.10 或更高版本以及支持CUDA的GPU。

pip install "torch>=2.5.0" "torchaudio>=2.5.0" \ "transformers>=4.57.0,<5" "soundfile>=0.12" "safetensors>=0.4"

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#usage 使用

该模型使用自定义的 Transformers 代码。查看此仓库中的文件,然后使用 trust_remote_code=True 加载。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#zero-shot-voice-cloning 零样本声音克隆

参考文本必须与参考音频中的语音内容匹配。

`` import soundfile as sf import torch from transformers import AutoModel, AutoProcessor

model_id = “AutoArk-AI/Audio8-TTS-Preview-0.6b” device = “cuda” if torch.cuda.is_available() else “cpu” dtype = torch.bfloat16 if device == “cuda” else torch.float32

processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True) model = AutoModel.from_pretrained( model_id, trust_remote_code=True, dtype=dtype, ).eval().to(device)

inputs = processor( text=[“欢迎使用 Audio8 TTS。”], reference_audio=[“reference.wav”], reference_text=[“参考录音的确切转录文本。”], return_tensors=“pt”, ) inputs = {name: value.to(device) for name, value in inputs.items()}

with torch.inference_mode(): output = model.generate( **inputs, max_new_tokens=1024, temperature=0.8, top_p=0.95, top_k=50, do_sample=True, return_dict_in_generate=True, ) waveforms, waveform_lengths = model.decode_audio(output.codes)

audio = waveforms[0, : int(waveform_lengths[0])].float().cpu().numpy() sf.write(“output.wav”, audio, model.config.codec_sample_rate) ``

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#generation-without-a-reference 无参考生成

当不需要克隆声音时,省略 reference_audioreference_text

inputs = processor( text=["这段话语不使用参考语音。"], return_tensors="pt", )

关于命令行推理、批处理和监督微调,请参阅 Audio8 TTS 仓库 (https://github.com/Audio8-AI/Audio8_TTS)。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#evaluation 评估

Audio8 TTS Preview 是本次比较中参数最少的模型,仅有 6亿参数。尽管参数数量仅为其他系统的一小部分,但在以下基准测试中,其表现与业界领先的SOTA TTS模型处于同一梯队。特别是,它在 Seed-TTS 上取得了最佳的英文WER和有竞争力的中文CER,同时在 CV3 多语言评估中保持了竞争力。

WER/CER 越低越好;SIM 越高越好。Seed-TTS 的相似度值以百分比显示。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#seed-tts Seed-TTS

模型参数英文 WER / SIM中文 CER / SIM中文难例 CER / SIM
Audio8 TTS Preview0.6B1.506 / 63.20.950 / 73.11.510 / 68.7
Fish S2 Pro4.6B1.607 / 64.61.038 / 73.810.149 / 70.1
Higgs Audio v24.7B1.524 / 66.40.806 / 72.110.622 / 69.3
CosyVoice3-1.5B1.5B2.22 / 72.01.12 / 78.15.83 / 75.8
MOSS-TTS8.5B1.85 / 73.41.20 / 78.8-
VoxCPM22.3B1.84 / 75.30.97 / 79.58.13 / 75.3

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#cv3-multilingual-error-rate CV3多语言错误率

模型参数zhenhard-zhhard-enjakodeesfritru
Audio8 TTS Preview0.6B3.2053.12810.5355.9977.2054.2233.4473.6418.7904.790-
Fish S2 Pro4.6B3.6003.49310.5887.3495.1394.1113.6052.9728.6004.2294.702
Higgs Audio v24.7B3.3783.40410.4245.7544.7424.2603.3002.9299.4253.5555.423
CosyVoice3-1.5B1.5B3.914.999.7710.557.575.696.434.4711.810.566.64
VoxCPM22.3B3.655.008.558.485.965.694.773.809.854.255.21

参数数量直接根据发布的权重张量计算。MOSS-TTS 包含 8,489,841,664 个参数。VoxCPM2 的主模型包含 2,290,004,544 个参数;单独的 AudioVAE 不包含在参数比较中。

Fish S2 Pro 被重新评估,因为其官方评估使用了自身的归一化器。Higgs Audio v2 是在本地评估的,因为具体数值不可用。所有其他基准值均来自其官方报告,通过 VoxCPM 仓库 (https://github.com/OpenBMB/VoxCPM) 收集。

不同的归一化器和评估器使得跨项目数值仅为参考比较,而非严格匹配的排名。评估覆盖范围不会将 Preview 检查点支持的语言范围扩展至上述 11 种语言之外。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#limitations-and-responsible-use 限制与责任使用

  • 这是一个 Preview 检查点,多语言和方言覆盖范围有限。
  • 非常长、有噪声或转录不准确的参考片段可能会降低稳定性和说话人相似度。
  • 生成的语音可能被滥用于冒充或虚假信息。克隆声音前需获得同意,并在适当情况下明确披露合成音频。
  • 在部署前评估模型的准确性、安全性和法律合规性。

https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b#license-and-acknowledgements 许可证与致谢

代码和模型权重在 Apache License 2.0 (https://github.com/Audio8-AI/Audio8_TTS/blob/main/LICENSE) 下发布。归属详情请参见上游 NOTICE (https://github.com/Audio8-AI/Audio8_TTS/blob/main/NOTICE)。

我们感谢 Fish Audio 团队发布了 Fish Audio S2 Pro 中使用的 DualAR 架构。

相似文章

OpenMOSS-Team/MOSS-TTS-v1.5 · Hugging Face

Reddit r/LocalLLaMA

MOSS-TTS v1.5是一个更新的开源文本转语音模型,具有改进的多语言合成(支持31种语言)、更稳定的零样本语音克隆以及显式的内联停顿控制。