Fish Audio S2 技术报告

Papers with Code Trending 模型

摘要

Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。

我们推出了 Fish Audio S2,这是一个开源的文本转语音(TTS)系统,具备多说话人、多轮生成能力,更重要的是,它能够通过自然语言描述实现指令跟随控制。为了扩展训练规模,我们开发了一套多阶段训练方案,以及包含视频字幕、语音字幕、语音质量评估和奖励建模的分阶段数据流水线。为了推动开源 TTS 的技术前沿,我们发布了模型权重、微调代码以及基于 SGLang 的推理引擎。该推理引擎已具备生产级流式处理能力,实现了 0.195 的实时因子(RTF),且首音频输出时间低于 100 毫秒。 我们的代码和权重托管在 GitHub (https://github.com/fishaudio/fish-speech) 和 Hugging Face (https://huggingface.co/fishaudio/s2-pro) 上。我们强烈建议读者访问 https://fish.audio 体验自定义语音。
查看原文
查看缓存全文

缓存时间: 2026/05/10 18:36

论文页面 - Fish Audio S2 技术报告

来源: https://huggingface.co/papers/2603.08823 作者:

,

,

,

,

,

,

,

,

,

摘要

Fish Audio S2 是一个开源文本转语音系统,具备多说话人能力、多轮对话生成以及通过自然语言描述实现的指令跟随控制功能,采用多阶段训练方法和生产就绪的推理引擎。

我们推出了 Fish Audio S2,一个开源的文本转语音(https://huggingface.co/papers?q=text-to-speech)系统,具有多说话人(https://huggingface.co/papers?q=multi-speaker)、多轮对话生成(https://huggingface.co/papers?q=multi-turn%20generation),以及最重要的——通过自然语言描述(https://huggingface.co/papers?q=natural-language%20descriptions)实现指令跟随控制(https://huggingface.co/papers?q=instruction-following%20control)的能力。为了扩展训练规模,我们开发了一种多阶段训练(https://huggingface.co/papers?q=multi-stage%20training)方法,并结合了一个分阶段的数据流水线(https://huggingface.co/papers?q=staged%20data%20pipeline),涵盖视频字幕生成(https://huggingface.co/papers?q=video%20captioning)和语音字幕生成(https://huggingface.co/papers?q=speech%20captioning)、语音质量评估(https://huggingface.co/papers?q=voice-quality%20assessment)以及奖励建模(https://huggingface.co/papers?q=reward%20modeling)。为了推动开源 TTS 的前沿发展,我们发布了模型权重、微调代码和一个基于 SGLang 的推理引擎(https://huggingface.co/papers?q=SGLang-based%20inference%20engine)。该推理引擎支持生产级流式输出,实现了 0.195 的实时因子(RTF)(https://huggingface.co/papers?q=RTF)和低于 100 毫秒的首音频延迟时间(time-to-first-audio)(https://huggingface.co/papers?q=time-to-first-audio)。我们的代码和权重可在 GitHub(https://github.com/fishaudio/fish-speech)和 Hugging Face(https://huggingface.co/fishaudio/s2-pro)上获取。我们强烈建议读者访问 https://fish.audio 尝试自定义语音。

查看 arXiv 页面 (https://arxiv.org/abs/2603.08823) 查看 PDF (https://arxiv.org/pdf/2603.08823) 项目页面 (https://fish.audio/) GitHub30.2k (https://github.com/fishaudio/fish-speech) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.08823)

社区

通过拖入文本输入框、粘贴或点击此处上传图片、音频和视频。

点击或粘贴此处上传图片

在你的 agent 中获取这篇论文:

hf papers read 2603\.08823

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型37

fishaudio/s2-pro 文本转语音• 5B• 更新于3月11日 • 104k • 936 (https://huggingface.co/fishaudio/s2-pro)

drbaph/s2-pro-fp8 文本转语音• 更新于3月12日 • 1.84k • 18 (https://huggingface.co/drbaph/s2-pro-fp8)

mlx-community/fish-audio-s2-pro-bf16 文本转语音• 5B• 更新于3月20日 • 1.47k • 17 (https://huggingface.co/mlx-community/fish-audio-s2-pro-bf16)

mlx-community/fish-audio-s2-pro-8bit 文本转语音• 1B• 更新于3月20日 • 856 • 10 (https://huggingface.co/mlx-community/fish-audio-s2-pro-8bit)

浏览引用此论文的37个模型 (https://huggingface.co/models?other=arxiv:2603.08823)

引用此论文的数据集1

Izzyzlin/CFSDD 查看器• 更新于4月7日 • 395k • 264 (https://huggingface.co/datasets/Izzyzlin/CFSDD)

引用此论文的 Spaces22

包含此论文的收藏6

浏览包含此论文的6个收藏集 (https://huggingface.co/collections?paper=2603.08823)

相似文章

StepAudio 2.5 技术报告

Hugging Face Daily Papers

StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。