@svpino: 这里有一个新的开源权重音频模型,你可以集成到你的应用中。我非常喜欢那种你可以托管的开源模型,这样……

X AI KOLs Following 模型

摘要

Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。

这里有一个新的开源权重音频模型,你可以集成到你的应用中。 我非常喜欢那种可以自己托管的开源模型,这样可以保护数据安全,远离大型 AI 公司。 这个模型就是 Fish Audio S2。 你可以在 Hugging Face 上找到它的权重、微调代码以及流式推理引擎。(链接见下方) 其内部由两个模型组成:一个 4B 参数模型负责处理时序和语义,另一个 400M 参数模型负责填充声学细节。 这个模型速度非常快! 如果你将其托管在 H200 上,它大约在 100ms 内就能开始返回音频。 如果你不想自己托管,Fish Audio 提供了托管版本:S2.1 Pro。 这个模型更快,延迟约 90ms,并且支持 83 种语言。 S2.1 Pro 比 ElevenLabs 便宜约 83%:你只需支付约 15 美元就能获得约 12 小时的转录音频,这非常划算。 HuggingFace 链接见下方。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:56

这里有一个新的开源音频模型,你可以集成到自己的应用中。

我非常偏爱那些能自行托管、确保数据安全、远离大型AI公司的开源模型。

这个模型是 Fish Audio S2。

你可以在 Hugging Face 上找到它的权重、微调代码以及流式推理引擎(链接见下)。

本质上,它由两个模型组成:一个 4B 参数模型负责处理时序和语义,另一个 400M 参数模型负责填充声学细节。

这个模型真的很快!

如果你将其托管在 H200 上,大约 100 毫秒后就能开始返回音频。

如果你不想自行托管,Fish Audio 还提供托管版本:S2.1 Pro。

这个模型更快,延迟约 90 毫秒,支持 83 种语言。

S2.1 Pro 的价格也比 ElevenLabs 便宜约 83%:大约 15 美元就能获得约 12 小时的转录音频,非常划算。

HuggingFace 链接见下方。

相似文章

Fish Audio S2 技术报告

Papers with Code Trending

Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。