BreezeBlue/Breeze-TTS-2

Hugging Face Models Trending 模型

摘要

Breeze TTS 2 是一个开放权重的实时文本转语音模型,支持语音设计和双语语音,并在 Artificial Analysis TTS 排行榜的开放权重模型中排名第一。

任务: 文本转语音 标签: Transformer, 安全张量, Breeze, 文本生成, 文本转语音, 语音生成, 语音克隆, 语音设计, 语音定向, PyTorch, CUDA, 英语, 中文, 许可证:其他, 端点兼容, 区域:美国
查看原文
查看缓存全文

缓存时间: 2026/08/27 21:15

BreezeBlue/Breeze-TTS-2 · Hugging Face

来源:https://huggingface.co/BreezeBlue/Breeze-TTS-2 BreezeBlue (https://breezeblue.ai/) GitHub (https://github.com/breezeblue-ai/breeze-tts)博客 (https://breezeblue.ai/breeze-tts-2)网站 (https://breezeblue.ai/)Discord (https://discord.com/invite/6H7AgPe9pA)X (https://x.com/BreezeBlueX)

源代码基于 Apache 2.0 许可。Breeze TTS 2 模型权重、衍生模型及自托管输出仅限研究和非商业用途。详见许可证。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%93%B0-news📰 新闻动态

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%93%96-introduction📖 简介

Breeze TTS 2 是一款为实时交互设计的开源文本转语音模型。它在Artificial Analysis TTS排行榜上位列开源模型榜首,同时超越了前沿的专有系统。其开放式自然语言指令跟随能力支持无参考音频的语音设计及有参考引导的语音定向,而超低延迟的流式传输则能实现响应迅速、表现力丰富的交互。

按Artificial Analysis Elo评分排名的文本转语音模型

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%E2%9C%A8-highlights✨ 亮点

  • 🎙️语音克隆—— 使用参考音频及其准确文稿来保留音色、节奏、情感和风格。
  • 🎨语音设计—— 通过自然语言描述创建独特声音,无需参考音频。
  • 🎛️语音引导—— 基于参考音频克隆声音,同时引导语调、情感、节奏和表达方式。
  • 🎭人声事件—— 在文本中直接添加富有表现力的内联事件:英文使用圆括号,如 \(laugh\)、\(cough\)、\(clears throat\) 和 \(sigh\);中文使用方括号,如 \[笑\]、\[咳嗽\]、\[清嗓子\] 和 \[叹气\]。
  • ⚡超低延迟—— 在预热的快速路径上,NVIDIA H100 可实现低于 40 毫秒的首帧音频时间 (TTFA)。
  • 🌊实时流式传输—— 在预热的快速路径上,NVIDIA H100 可达 0.32 的实时率 (RTF),以约 3.1 倍实时速度生成音频。
  • 💾GPU 高效—— 急切推理约使用 7.7 GiB GPU 内存;最低推荐配置为 12 GB GPU。
  • 🌏双语支持—— 单个模型即可生成自然的英文和中文语音。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%9A%80-quick-start🚀 快速开始

https://huggingface.co/BreezeBlue/Breeze-TTS-2#requirements要求

  • Linux 和 Python 3.10 或更高版本
  • 支持 CUDA 的 NVIDIA GPU
  • GPU 内存:急切推理约 7.7 GiB,使用 --fast-all 则约 14.4 GiB;急切推理建议使用 12 GB GPU,快速路径建议使用 24 GB GPU
  • Breeze TTS 2 模型检查点

https://huggingface.co/BreezeBlue/Breeze-TTS-2#installation安装

下载推理代码:

git clone https://github.com/breezeblue-ai/breeze-tts.git cd breeze-tts

安装依赖:

python -m pip install -r requirements.txt

所有必需的模型组件都包含在 Breeze TTS 2 检查点中。

针对测试的 CUDA 环境,构建附带的 Docker 镜像:

bash docker/build.sh

默认镜像适用于 H100/Hopper (sm90)。若使用 A100:

FLASH_ATTN_CUDA_ARCHS=80 bash docker/build.sh

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%8E%99%EF%B8%8F-voice-clone🎙️ 语音克隆

根据干净的参考音频及其准确文稿克隆说话人。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#english英文

python infer.py ../breeze-tts-2 \ --ref-audio reference_en.wav \ --ref-text "This is the exact transcript of the English reference audio." \ --text "(sigh) It is good to hear your voice again after all this time." \ --output outputs/voice_clone_en.wav

https://huggingface.co/BreezeBlue/Breeze-TTS-2#chinese中文

python infer.py ../breeze-tts-2 \ --ref-audio reference_zh.wav \ --ref-text "这是中文参考音频的准确文字稿。" \ --text "[叹气] 没想到过了这么久,你还记得我的声音。" \ --output outputs/voice_clone_zh.wav

参考音频应包含干净、背景噪声极小的语音。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%8E%A8-voice-design🎨 语音设计

无需参考音频,通过自然语言描述创建声音。将指令语言与目标文本匹配。使用 --cfg-scale 4 可增强指令跟随效果。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#english-1英文

python infer.py ../breeze-tts-2 \ --text "(sigh) Welcome aboard. Your journey begins now." \ --instruction "A warm, thoughtful young woman with a clear voice and a calm, reflective delivery." \ --cfg-scale 4 \ --output outputs/voice_design_en.wav

https://huggingface.co/BreezeBlue/Breeze-TTS-2#chinese-1中文

python infer.py ../breeze-tts-2 \ --text "[笑] 欢迎来到今晚的故事时间,让我们一起开始吧。" \ --instruction "一位温柔自信的年轻女性,声音清晰,语气亲切,表达轻快而富有感染力。" \ --cfg-scale 4 \ --output outputs/voice_design_zh.wav

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%8E%9B%EF%B8%8F-voice-direction🎛️ 语音引导

保持参考说话人的身份,同时引导其语调、情感、节奏和表达方式。使用 --cfg-scale 4 可增强指令跟随效果。

python infer.py ../breeze-tts-2 \ --ref-audio reference.wav \ --ref-text "This is the exact transcript of the reference audio." \ --text "(clears throat) We need to discuss what happened last night." \ --instruction "Speak slowly with a restrained, serious tone." \ --cfg-scale 4 \ --output outputs/voice_direction.wav

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%F0%9F%8C%90-streaming-api🌐 流式 API

启动单并发流式 API。它使用相同的 PyTorch 运行时,默认为急切执行:

`` python -m breeze_infer.api ../breeze-tts-2 –host 0.0.0.0 –port 7860


发送包含参考音频和 CFG 4 的语音引导请求:

``
curl -X POST http://127.0.0.1:7860/v1/audio/speech \
  -F "cfg_scale=4" \
  -F "[email protected]" \
  -F "ref_text=This is the exact transcript of the reference audio." \
  -F "text=(clears throat) We need to discuss what happened last night." \
  -F "instruction=Speak slowly with a restrained, serious tone." \
  -F "seed=42" \
  --output voice_direction.pcm

响应为流式单声道 24 kHz 有符号 16 位小端 PCM。使用 --fast-all 启动 API 可启用快速路径。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#%E2%9A%A1-fast-inference-options⚡ 快速推理选项

CLI 和 API 默认使用急切流式传输并跳过图预热。在可接受额外冷启动时间的情况下,传递 --fast-all 可为每个推理阶段启用最佳配置。每个阶段也可独立控制:

阶段快速参数禁用时启用时文本编码器--[no-]fast-text-encoder原生急切前向传播由 CFG 形状和文本长度桶选择的静态 CUDA 图骨干预填充--[no-]fast-backbone-prefill原生急切预填充由 CFG 形状和提示长度桶选择的 CUDA 图骨干解码--[no-]fast-backbone-decode原生急切令牌步进支持高速缓存的图,由 CFG 形状选择深度解码器--[no-]fast-depth-decoder原生急切深度循环具有 CFG 形状 CUDA 图的全图编译编解码器--[no-]fast-codec急切流式解码支持 CFG 形状的单请求流式 CUDA 图(单帧块)

单独的阶段标志用于性能分析和调试。

https://huggingface.co/BreezeBlue/Breeze-TTS-2#license-and-responsible-use许可证和负责任使用

源代码基于Apache License, Version 2.0许可。模型权重、检查点、适配器、衍生模型及自托管输出则受BreezeBlue Research and Non-Commercial License单独约束。Apache License 不授予商业使用模型的权利。

商业使用需获得 RESONIA, INC. 的书面授权。托管的 BreezeBlue 服务受其适用服务条款约束。有关商业许可,请联系 [email protected]。

您有责任遵守适用法律,并获得输入、参考音频、声音和输出所需的所有权利和同意。禁止未经授权的声音克隆、冒充、欺诈及其他非法或有害用途。

代码和模型材料按“原样”提供,在法律允许的最大范围内不附带任何保证或责任。第三方组件仍受其各自许可的约束。

相似文章

OpenBMB/VoxCPM

GitHub Trending (daily)

OpenBMB发布VoxCPM2,一个2B参数的无分词器TTS模型,基于超过200万小时的多语言语音数据训练,支持30种语言、语音设计、可控克隆和48kHz输出。