FireRedAudio 和 FireRedTTS3 由 FireRedTeam 开发 - Huggingface
摘要
FireRedAudio 和 FireRedTTS3 是统一音频理解与生成的AI模型,提供ASR、TTS、语音克隆、编辑和多语言支持,并具有竞争力的基准测试结果。
FireRedAudio:一个用于理解与生成的通用音频语言模型,采用解耦连续表示
HuggingFace : https://huggingface.co/FireRedTeam/FireRedAudio
GitHub : https://github.com/FireRedTeam/FireRedAudio
Demo : https://fireredteam.github.io/demos/fireredaudio/
概述
FireRedAudio 是一个基于共享的9B参数大型语言模型构建的通用音频语言模型,采用解耦连续表示:Audio Encoder 处理理解,而 RedAE 路径处理生成。单个模型支持ASR、音频理解、零样本TTS、指令TTS、语义/声学语音编辑,以及对长达一小时录音的精确时间对齐。
亮点 ✨
🧩 专用表示,共享主干 — Audio Encoder 路径用于理解,RedAE-Patch 路径用于语音生成。它们的表示保持解耦,但共享相同语言和推理主干。据我们所知,这是统一音频语言模型中首个公开披露的此类设计。
📊 单个模型,完整音频栈 — FireRedAudio 涵盖ASR、广泛和细粒度的音频理解、零样本TTS、指令TTS和自由形式语音编辑,在MMAU、MMSU、Seed-TTS-Eval、InstructTTSEval和Ming-Freeform-Audio-Edit中取得具有竞争力或领先的结果。
🎙️ 使用自然语言创建和编辑语音 — 从参考片段克隆语音,从描述设计语音,或通过单一连续潜在生成路径编辑说话内容和方式。
⏱️ 从分钟到小时级录音 — 理解长达一小时的录音,实现精确的时间到内容对齐。将音频组织为带时间戳的结构,生成基于时间的摘要,通过时间(或内容)检索内容,并在录音中推理分布的证据。
FireRedTTS3:基于语义丰富语音表示的统一语音生成与编辑
HuggingFace : https://huggingface.co/FireRedTeam/FireRedTTS3
GitHub : https://github.com/FireRedTeam/FireRedTTS3
Demo : https://fireredteam.github.io/demos/firered_tts_3/
arXiv : https://arxiv.org/abs/2608.17492
概述
FireRedTTS3 是一个基于语义丰富连续语音表示的统一语音生成与编辑系统。它有两个变体:FireRedTTS3-Base — 跨24种语言和21种中国方言的零样本语音克隆
FireRedTTS3-Instruct — 在一个统一模型中支持自然语言语音设计和语音编辑(语义 + 声学)
亮点 ✨
🌍 多语言 — 24种语言 — 在MiniMax-MLS-Test上实现最佳平均WER/CER(平均3.754%)和最佳平均说话人相似度(平均84.8%),以及在Seed-TTS-eval上实现最佳克隆WER/CER(平均3.04%)和相似度(平均78.8%)。支持的语言:阿拉伯语 · 粤语 · 中语 · 捷克语 · 荷兰语 · 英语 · 芬兰语 · 法语 · 德语 · 希腊语 · 印地语 · 印尼语 · 意大利语 · 日语 · 韩语 · 波兰语 · 葡萄牙语 · 罗马尼亚语 · 俄语 · 西班牙语 · 泰语 · 土耳其语 · 乌克兰语 · 越南语
🗣️ 多方言 — 21种中国方言 — 跨主要中国方言群的零样本语音克隆。支持的方言:安徽 · 福建 · 甘肃 · 贵州 · 河北 · 河南 · 湖北 · 湖南 · 江西 · 辽宁 · 闽南 · 宁夏 · 陕西 · 山东 · 上海 · 山西 · 四川 · 天津 · 温州 · 吴语 · 云南
🎨 指令控制语音设计 — 从自然语言描述(性别、年龄、音色、情感、节奏、口音等)生成全新语音,无需参考音频,在合成前通过显式文本规划步骤指导。
✂️ 自由形式语音编辑 — 通过自由形式指令驱动的语义编辑(插入/删除/替换)和声学编辑(速度/音高/音量)。
项目 : https://fireredteam.github.io/
他们的开源项目:非常值得查看项目页面。生态系统很好。他们还发表了一些论文。
OpenStoryline: An Agentic Framework for Autonomous, Human-Aligned Video Creation
FireRedChat: A Fully Self-Hosted Solution for Full-Duplex Voice Interaction
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
InstantID: Zero-shot Identity-Preserving Generation in Seconds
DynamicPose: A Robust Image-to-Video Framework for Portrait Animation Driven by Pose Sequences
PhotoPoster: A High-Fidelity Two-Stage Pose-Driven Image Generation Framework
CQ-DINO: Mitigating Gradient Dilution via Category Queries for Vast Vocabulary Object Detection
FireRedASR: Open-Source Industrial-Grade Automatic Speech Recognition Models
FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System
The Xiaohongshu Speech Synthesis System for Blizzard Challenge 2023
StoryMaker: Towards Consistent Characters in Text-to-Image Generation
LayerDiffuse-Flux
InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation
相似文章
Aratako/Irodori-TTS-500M-v3
Irodori-TTS-500M-v3是一个基于Rectified Flow Diffusion Transformer的日语TTS模型,支持零样本语音克隆以及独特的基于表情符号的风格/音效控制。
[audio.cpp] 版本 0.7:62 个音频模型家族(85+ 变体)、模型比较的 Arena UI、MiniMax Music 3、FireRed TTS3/Audio、ControlFoley、Personaplex 等更多内容
audio.cpp 版本 0.7 引入了一个新的 Arena UI,用于本地比较音频模型,扩展至 62 个模型家族,拥有超过 85 个变体,并支持在边缘硬件如 NVIDIA Jetson Orin 上部署。
Audio8/Audio8-TTS-Preview-0.6b
Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。
huggingface/speech-to-speech
Hugging Face 的 speech-to-speech 是一个开源、模块化的语音代理流水线(VAD->STT->LLM->TTS),提供与 OpenAI Realtime 兼容的 WebSocket API,支持可交换的组件以及本地或托管模型。
Higgs Audio v3 TTS 4B。专为语音聊天打造。支持100种语言和内联控制。
Higgs Audio v3 是一个 4B 参数的 TTS 模型,专为语音聊天应用设计,支持 100 种语言并具备内联控制能力。