@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…
摘要
Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。
查看缓存全文
缓存时间: 2026/07/31 00:43
Fish Audio 刚刚宣布 S2.1 Pro 免费开放一个月。
以下是关于它的全部信息:
- 仅需 10 到 15 秒音频即可克隆任意声音
- 响应约 90 毫秒,足以支持实时对话
- 一个模型支持 83 种语言
- 可控制发音和停顿到词级精度
- 同时提供开放权重模型
其底层采用双自回归(Dual-AR)架构:一个 40 亿参数的模型负责决定说什么以及情感表达,另一个 4 亿参数的模型则填充精细的声音细节。这种分工带来了速度与表现力的兼顾。
该模型基于 Fish Speech 构建,这是他们的一个开源项目,在 GitHub 上获得了数万星标。他们仍会发布可自行部署的开放权重模型。
价格:同等输出下,成本约为 ElevenLabs 的六分之一。
真正的卖点不是一段完美的 10 秒片段,而是一个能贯穿整场对话的声音——包括被打断、纠正、笑声和语言切换等场景。
相似文章
Fish Audio 推出支持83种语言的S2.1 Pro(2分钟阅读)
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
@driscollis: Fish Audio 的 AI 可以在5秒内克隆声音!我认为这对于内容创作来说非常有用,特别是…
Fish Audio 宣布了其 S2.1 Pro 模型,该模型仅需5秒音频即可克隆声音,同时完成了5200万美元的种子轮融资。
Fish Audio 获得5200万美元种子轮融资,面向创作者和企业构建AI语音模型
Fish Audio 已获得5200万美元种子轮融资,用于面向创作者和企业开发AI语音模型。这家初创公司年经常性收入(ARR)达2100万美元,拥有800万用户,提供开源和付费语音生成模型,包括其最新的S2.1 Pro API。
这个新出的MOSS TTS 1.5语音克隆功能非常厉害
MOSS TTS 1.5是一款具备语音克隆功能的新款文本转语音模型,可通过Hugging Face Space使用。由于其开放许可协议,被认为优于Fish Audio S2 Pro。
@svpino: 这里有一个新的开源权重音频模型,你可以集成到你的应用中。我非常喜欢那种你可以托管的开源模型,这样……
Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。