Fish Audio 获得5200万美元种子轮融资,面向创作者和企业构建AI语音模型
摘要
Fish Audio 已获得5200万美元种子轮融资,用于面向创作者和企业开发AI语音模型。这家初创公司年经常性收入(ARR)达2100万美元,拥有800万用户,提供开源和付费语音生成模型,包括其最新的S2.1 Pro API。
自去年推出以来,这家初创公司如今已有超过800万人使用其开源或托管版本的模型,并且年经常性收入已达2100万美元。
查看缓存全文
缓存时间: 2026/07/28 15:26
# Fish Audio 获 5200 万美元种子轮融资,为创作者和企业打造 AI 语音模型 | TechCrunch
来源:https://techcrunch.com/2026/07/28/fish-audio-raises-50m-seed-to-build-ai-voice-models-for-creators-and-enterprises/
AI 生成的语音模型市场潜力巨大。创意类应用场景要求 AI 语音模型更具表现力,而希望自动化客服和销售运营的企业则需要模型更具可操控性。
总部位于帕洛阿尔托的 Fish Audio 希望通过其包含 1.5 万多种自然语言控制的语音库来满足所有这些应用场景。自去年上线以来,这家初创公司目前已有超过 800 万人使用其开源或托管版本的模型,年经常性收入已达 2100 万美元。
为了持续扩大这一势头,这家初创公司周二宣布,已在一轮由 Coreline Ventures 和 Capital Today 领投的种子轮融资中筹集了 5200 万美元。参与本轮融资的还有 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 以及 HF0。
Fish Audio 最初只是前 NVIDIA 研究员 Shijia Liao 的一个小项目。他对市场上缺乏表现力的合成语音感到不满,于是在单个 GPU 上训练了一个语音生成模型,并将其开源。GitHub 上的 Fish Speech 仓库如今已获得超过 3.1 万颗星,被独立开发者、游戏设计师和创作者广泛使用。
该公司在过去一年发布了五款模型:四款语音生成模型和一款语音转文本模型。其中三款语音生成模型已开源,但其最新的 S2.1 Pro 模型仅通过付费 API 提供。
Fish Audio 提供适合创作者和团队的付费月度套餐,包含固定的生成时长以及语音克隆功能。该公司还提供面向企业的 API 和平台,并称 HeyGen 和 Sanas 等组织已经在使用其服务。
“每个企业都有不同的用例和偏好。例如,像 HeyGen 这样用我们的语音来驱动 AI 虚拟形象的公司,希望声音听起来更真实;游戏工作室则希望角色声音更具表现力;而像 LiveKit 这样的语音代理公司,则想要更自然、低延迟、且通话时足够富有表现力的声音,”Cao 说道。
Fish Audio 建立语音库的方式之一是,直接邀请用户提交自己的声音用于训练模型,并在用户声音被采用后给予补偿。但几个月前,这引发了一些麻烦:有创作者声称他们的声音在未经同意的情况下被上传到 Fish Audio。该初创公司当时设有 DMCA 内容删除流程来处理此类问题,但删除过程耗时很长。
Fish Audio 的 CEO 兼联合创始人 Rissa Cao 告诉 TechCrunch,公司现已实现了删除流程的自动化。她说,创作者只需提交简短的声音样本或合同来证明某条上传声音属于自己,他们的声音将在不到 3 分钟内从该初创公司的平台上移除。
不过,这仍然无法阻止任何人在创作者不知情的情况下上传其声音。在创作者发现之前,其声音仍会在平台上被使用,直到他们申请删除为止。
Coreline Ventures 的合伙人 Osuke Honda 表示,以社区驱动的模式只有在创作者信任平台时才能奏效。
“以社区为中心的方法要想成为持久的优势,就必须让创作者信任平台。这意味着同意、透明度和归属必须内置于产品中,而不是事后才考虑。我认为,行业需要朝着可验证的声音所有权、明确的许可条款、便捷的举报和删除流程,以及最终实现收益分享模式的方向发展——当创作者的声音被授权或商业使用时,他们能够从中获得经济利益,”他说道。
Cao 表示,当初这家初创公司只是将其产品作为开源项目提供给创作者时,运营效率很高,并不需要资金。但随着投资者兴趣升温,公司希望开发更先进的模型,也想更好地服务企业,因此决定寻求资本。
展望未来,Fish Audio 计划在今年发布一款音频理解模型,同时还在开发一款语音到语音模型。
语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(原 Podcastle)以及 Krisp 等公司都在争夺创作者和企业的预算。
据 359 Capital 合伙人 Rico Mallozzi 称,为开发者提供精细控制以及成本高效的模型训练,将帮助 Fish Audio 与大型 AI 实验室更好地竞争。
“我认为,他们以现有团队打造出这些最先进的模型,与那些资金雄厚的大型 AI 实验室或公司相比,实在是令人难以置信。这显示了他们在缩小机器合成语音与真人语音之间差距方面的技术能力,”Mallozzi 在接受 TechCrunch 电话采访时表示。
*本文已更新,以反映该公司在种子轮融资中筹集了 5200 万美元。*
*当您通过我们文章中的链接购买商品时,我们可能会获得少量佣金。这并不影响我们的编辑独立性。*
相似文章
Fish Audio 推出支持83种语言的S2.1 Pro(2分钟阅读)
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
@driscollis: Fish Audio 的 AI 可以在5秒内克隆声音!我认为这对于内容创作来说非常有用,特别是…
Fish Audio 宣布了其 S2.1 Pro 模型,该模型仅需5秒音频即可克隆声音,同时完成了5200万美元的种子轮融资。
Fish Audio S2 技术报告
Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。
@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…
Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。
@svpino: 这里有一个新的开源权重音频模型,你可以集成到你的应用中。我非常喜欢那种你可以托管的开源模型,这样……
Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。