@svpino: 这里有一个新的开源权重音频模型,你可以集成到你的应用中。我非常喜欢那种你可以托管的开源模型,这样……
摘要
Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。
查看缓存全文
缓存时间: 2026/07/29 03:56
这里有一个新的开源音频模型,你可以集成到自己的应用中。
我非常偏爱那些能自行托管、确保数据安全、远离大型AI公司的开源模型。
这个模型是 Fish Audio S2。
你可以在 Hugging Face 上找到它的权重、微调代码以及流式推理引擎(链接见下)。
本质上,它由两个模型组成:一个 4B 参数模型负责处理时序和语义,另一个 400M 参数模型负责填充声学细节。
这个模型真的很快!
如果你将其托管在 H200 上,大约 100 毫秒后就能开始返回音频。
如果你不想自行托管,Fish Audio 还提供托管版本:S2.1 Pro。
这个模型更快,延迟约 90 毫秒,支持 83 种语言。
S2.1 Pro 的价格也比 ElevenLabs 便宜约 83%:大约 15 美元就能获得约 12 小时的转录音频,非常划算。
HuggingFace 链接见下方。
相似文章
Fish Audio 推出支持83种语言的S2.1 Pro(2分钟阅读)
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
Fish Audio S2 技术报告
Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。
@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…
Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。
Fish Audio 获得5200万美元种子轮融资,面向创作者和企业构建AI语音模型
Fish Audio 已获得5200万美元种子轮融资,用于面向创作者和企业开发AI语音模型。这家初创公司年经常性收入(ARR)达2100万美元,拥有800万用户,提供开源和付费语音生成模型,包括其最新的S2.1 Pro API。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。