标签
Voicebox 是一个本地运行的开源AI语音工作室,支持7种TTS引擎、23种语言和声音克隆,所有处理在本地完成以保护隐私。项目在GitHub已获33.8k星标。
Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
OpenVoice 是一个开源的即时语音克隆模型,具备风格和语言控制能力,现已在 GitHub 上可用。
Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。
文章指出,识别AI语音钓鱼的常见建议存在缺陷,因为真实攻击使用的是实时变声器,而非文本转语音的人工痕迹,作者提供了一个免费演示来帮助用户了解。
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
Fish Audio 宣布了其 S2.1 Pro 模型,该模型仅需5秒音频即可克隆声音,同时完成了5200万美元的种子轮融资。
Duix.Avatar 是一款本地 AI 头像工具包,能够根据视频、语音和脚本输入生成口型同步的头像视频,无需将数据发送到云端。它支持八种语言,并在 GitHub 上以社区许可证发布。
一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。
Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。
Savi Security推出一款应用,保护消费者免受AI生成的诈骗,例如通过语音克隆实施的绑架者勒索赎金。此前,创始人的母亲险些落入此类骗局。该初创公司筹集了700万美元种子资金。
一项CPU TTS基准测试使用UTMOS MOS评分对比了Kokoro、Supertonic、Inflect-Nano和Kyutai的Pocket TTS,揭示了关于RTF缩放、UTMOS在小声码器上的局限性以及未记录的输出上限的有趣发现。Pocket TTS在CPU上提供了独特的零样本声音克隆能力。
Kyutai 发布了 Pocket TTS,这是一个文本转语音模型,只需 5 秒音频即可克隆声音,可在 CPU 上运行,并以 MIT 许可证发布。该模型在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。
LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。
Alexandria 是一个开源工具,利用 AI 驱动的脚本注释和文本转语音技术将书籍转化为全语音有声书,支持本地/云端大语言模型、语音克隆以及内置的 Qwen3-TTS 引擎。
一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。
一个免费、完全本地的语音克隆和TTS工具,由Qwen3-TTS和Kokoro驱动,通过MLX在Apple Silicon上运行,无需云服务即可从PDF生成工作室级有声书。