Fish Audio S2 技术报告
摘要
Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。
查看缓存全文
缓存时间: 2026/05/10 18:36
论文页面 - Fish Audio S2 技术报告
来源: https://huggingface.co/papers/2603.08823 作者:
,
,
,
,
,
,
,
,
,
摘要
Fish Audio S2 是一个开源文本转语音系统,具备多说话人能力、多轮对话生成以及通过自然语言描述实现的指令跟随控制功能,采用多阶段训练方法和生产就绪的推理引擎。
我们推出了 Fish Audio S2,一个开源的文本转语音(https://huggingface.co/papers?q=text-to-speech)系统,具有多说话人(https://huggingface.co/papers?q=multi-speaker)、多轮对话生成(https://huggingface.co/papers?q=multi-turn%20generation),以及最重要的——通过自然语言描述(https://huggingface.co/papers?q=natural-language%20descriptions)实现指令跟随控制(https://huggingface.co/papers?q=instruction-following%20control)的能力。为了扩展训练规模,我们开发了一种多阶段训练(https://huggingface.co/papers?q=multi-stage%20training)方法,并结合了一个分阶段的数据流水线(https://huggingface.co/papers?q=staged%20data%20pipeline),涵盖视频字幕生成(https://huggingface.co/papers?q=video%20captioning)和语音字幕生成(https://huggingface.co/papers?q=speech%20captioning)、语音质量评估(https://huggingface.co/papers?q=voice-quality%20assessment)以及奖励建模(https://huggingface.co/papers?q=reward%20modeling)。为了推动开源 TTS 的前沿发展,我们发布了模型权重、微调代码和一个基于 SGLang 的推理引擎(https://huggingface.co/papers?q=SGLang-based%20inference%20engine)。该推理引擎支持生产级流式输出,实现了 0.195 的实时因子(RTF)(https://huggingface.co/papers?q=RTF)和低于 100 毫秒的首音频延迟时间(time-to-first-audio)(https://huggingface.co/papers?q=time-to-first-audio)。我们的代码和权重可在 GitHub(https://github.com/fishaudio/fish-speech)和 Hugging Face(https://huggingface.co/fishaudio/s2-pro)上获取。我们强烈建议读者访问 https://fish.audio 尝试自定义语音。
查看 arXiv 页面 (https://arxiv.org/abs/2603.08823) 查看 PDF (https://arxiv.org/pdf/2603.08823) 项目页面 (https://fish.audio/) GitHub30.2k (https://github.com/fishaudio/fish-speech) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.08823)
社区
通过拖入文本输入框、粘贴或点击此处上传图片、音频和视频。
点击或粘贴此处上传图片
在你的 agent 中获取这篇论文:
hf papers read 2603\.08823
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型37
fishaudio/s2-pro 文本转语音• 5B• 更新于3月11日 • 104k • 936 (https://huggingface.co/fishaudio/s2-pro)
drbaph/s2-pro-fp8 文本转语音• 更新于3月12日 • 1.84k • 18 (https://huggingface.co/drbaph/s2-pro-fp8)
mlx-community/fish-audio-s2-pro-bf16 文本转语音• 5B• 更新于3月20日 • 1.47k • 17 (https://huggingface.co/mlx-community/fish-audio-s2-pro-bf16)
mlx-community/fish-audio-s2-pro-8bit 文本转语音• 1B• 更新于3月20日 • 856 • 10 (https://huggingface.co/mlx-community/fish-audio-s2-pro-8bit)
浏览引用此论文的37个模型 (https://huggingface.co/models?other=arxiv:2603.08823)
引用此论文的数据集1
Izzyzlin/CFSDD 查看器• 更新于4月7日 • 395k • 264 (https://huggingface.co/datasets/Izzyzlin/CFSDD)
引用此论文的 Spaces22
包含此论文的收藏6
浏览包含此论文的6个收藏集 (https://huggingface.co/collections?paper=2603.08823)
相似文章
Fish Audio 推出支持83种语言的S2.1 Pro(2分钟阅读)
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
Fish Audio 获得5200万美元种子轮融资,面向创作者和企业构建AI语音模型
Fish Audio 已获得5200万美元种子轮融资,用于面向创作者和企业开发AI语音模型。这家初创公司年经常性收入(ARR)达2100万美元,拥有800万用户,提供开源和付费语音生成模型,包括其最新的S2.1 Pro API。
@svpino: 这里有一个新的开源权重音频模型,你可以集成到你的应用中。我非常喜欢那种你可以托管的开源模型,这样……
Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。
StepAudio 2.5 技术报告
StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。
@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…
Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。