@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…

X AI KOLs Following 产品

摘要

Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。

Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。 以下是你需要了解的一切 - 从10到15秒的音频中克隆任何声音。 - 约90ms响应时间,足够快以进行实时对话 - 83种语言,一个模型。 - 对发音和停顿进行单词级控制 - 还提供开放权重模型 底层采用 Dual-AR 设计:一个4B参数模型负责确定说什么以及如何表达情感,而一个400M参数模型负责填充精细的声音细节。这种拆分正是它既快速又富有表现力的原因。 它基于 Fish Speech 构建,这是他们在 GitHub 上拥有数万星标的开源项目,而且他们仍然提供你可以自行部署的开放权重模型。 价格:大约是 ElevenLabs 相同输出的六分之一。 真正的卖点并不是一段干净的10秒片段。而是一个能支撑整个对话的声音,包括打断、纠正、笑声和语言切换。 1.
查看原文
查看缓存全文

缓存时间: 2026/07/31 00:43

Fish Audio 刚刚宣布 S2.1 Pro 免费开放一个月。

以下是关于它的全部信息:

  • 仅需 10 到 15 秒音频即可克隆任意声音
  • 响应约 90 毫秒,足以支持实时对话
  • 一个模型支持 83 种语言
  • 可控制发音和停顿到词级精度
  • 同时提供开放权重模型

其底层采用双自回归(Dual-AR)架构:一个 40 亿参数的模型负责决定说什么以及情感表达,另一个 4 亿参数的模型则填充精细的声音细节。这种分工带来了速度与表现力的兼顾。

该模型基于 Fish Speech 构建,这是他们的一个开源项目,在 GitHub 上获得了数万星标。他们仍会发布可自行部署的开放权重模型。

价格:同等输出下,成本约为 ElevenLabs 的六分之一。

真正的卖点不是一段完美的 10 秒片段,而是一个能贯穿整场对话的声音——包括被打断、纠正、笑声和语言切换等场景。

相似文章