voice-cloning

标签

Cards List
#voice-cloning

@yiyirats: 依赖第三方语音服务时,数据隐私和稳定性始终是需要考虑的因素。Voicebox 是一个本地运行的AI语音工作室,所有处理都在本地完成,数据不上云,也不需要注册账号。 功能覆盖比较全面:支持Qwen3-TTS、LuxTTS、Chatterbo…

X AI KOLs Timeline · 2天前 缓存

Voicebox 是一个本地运行的开源AI语音工作室,支持7种TTS引擎、23种语言和声音克隆,所有处理在本地完成以保护隐私。项目在GitHub已获33.8k星标。

0 人收藏 0 人点赞
#voice-cloning

Scenema Audio 登陆 ComfyUI,可在 8GB 显存上运行

Reddit r/LocalLLaMA · 3天前

Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。

0 人收藏 0 人点赞
#voice-cloning

Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持

Reddit r/LocalLLaMA · 3天前

Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。

0 人收藏 0 人点赞
#voice-cloning

@DanKornas: myshell-ai/OpenVoice 即时语音克隆,支持风格和语言控制 GitHub: 存档:

X AI KOLs Timeline · 6天前 缓存

OpenVoice 是一个开源的即时语音克隆模型,具备风格和语言控制能力,现已在 GitHub 上可用。

0 人收藏 0 人点赞
#voice-cloning

@rohanpaul_ai: Fish Audio 刚刚将 S2.1 Pro 免费开放一个月。以下是您需要了解的一切 - 从10秒音频克隆任何声音…

X AI KOLs Following · 2026-07-30 缓存

Fish Audio 已将其 S2.1 Pro 语音克隆服务免费开放一个月,支持10-15秒语音克隆、约90毫秒响应时间、83种语言、单词级控制,以及开放权重模型,成本仅为 ElevenLabs 的六分之一。

0 人收藏 0 人点赞
#voice-cloning

AI语音钓鱼和深度伪造的演示方式反而让人们更难识别它们

Reddit r/ArtificialInteligence · 2026-07-29

文章指出,识别AI语音钓鱼的常见建议存在缺陷,因为真实攻击使用的是实时变声器,而非文本转语音的人工痕迹,作者提供了一个免费演示来帮助用户了解。

0 人收藏 0 人点赞
#voice-cloning

Fish Audio 推出支持83种语言的S2.1 Pro(2分钟阅读)

TLDR AI · 2026-07-29 缓存

Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。

0 人收藏 0 人点赞
#voice-cloning

@driscollis: Fish Audio 的 AI 可以在5秒内克隆声音!我认为这对于内容创作来说非常有用,特别是…

X AI KOLs Timeline · 2026-07-28 缓存

Fish Audio 宣布了其 S2.1 Pro 模型,该模型仅需5秒音频即可克隆声音,同时完成了5200万美元的种子轮融资。

0 人收藏 0 人点赞
#voice-cloning

@DanKornas: 想要生成头像视频但不想将面部和语音数据发送到云端服务?Duix.Avatar 是一款本地 AI 工具…

X AI KOLs Timeline · 2026-07-24 缓存

Duix.Avatar 是一款本地 AI 头像工具包,能够根据视频、语音和脚本输入生成口型同步的头像视频,无需将数据发送到云端。它支持八种语言,并在 GitHub 上以社区许可证发布。

0 人收藏 0 人点赞
#voice-cloning

面向语音代理构建者的TTS精选列表 — 聚焦于流式延迟和流中取消

Reddit r/ArtificialInteligence · 2026-07-21 缓存

一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。

0 人收藏 0 人点赞
#voice-cloning

@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…

X AI KOLs Timeline · 2026-07-20 缓存

阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。

0 人收藏 0 人点赞
#voice-cloning

三秒欺诈:AI语音诈骗为何超越所有防御

Hacker News Top · 2026-07-15 缓存

AI语音克隆技术可实现精密欺诈,常以老年人为目标,FBI报告损失达数十亿美元,凸显防御之难。

0 人收藏 0 人点赞
#voice-cloning

Gepard:面向实时对话的0.6B流式TTS模型——20倍实时因子、约50ms首音延迟、vLLM原生支持、Apache 2.0许可

Reddit r/LocalLLaMA · 2026-07-07 缓存

Gepard是一款新的流式TTS模型,具备实时对话能力,首音延迟约50ms,支持语音克隆和高并行度,以Apache 2.0许可发布。

0 人收藏 0 人点赞
#voice-cloning

Savi的应用旨在保护消费者免受逼真AI诈骗,例如勒索赎金的绑架案

TechCrunch AI · 2026-07-07 缓存

Savi Security推出一款应用,保护消费者免受AI生成的诈骗,例如通过语音克隆实施的绑架者勒索赎金。此前,创始人的母亲险些落入此类骗局。该初创公司筹集了700万美元种子资金。

0 人收藏 0 人点赞
#voice-cloning

CPU TTS基准测试与UTMOS MOS评分:Kokoro、Supertonic、Inflect-Nano和Kyutai的新Pocket TTS [P]

Reddit r/MachineLearning · 2026-07-06

一项CPU TTS基准测试使用UTMOS MOS评分对比了Kokoro、Supertonic、Inflect-Nano和Kyutai的Pocket TTS,揭示了关于RTF缩放、UTMOS在小声码器上的局限性以及未记录的输出上限的有趣发现。Pocket TTS在CPU上提供了独特的零样本声音克隆能力。

0 人收藏 0 人点赞
#voice-cloning

Kyutai 的 Pocket TTS 能在 CPU 上运行,仅需 5 秒音频即可克隆声音,采用 MIT 许可证发布。在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。

Reddit r/LocalLLaMA · 2026-07-06

Kyutai 发布了 Pocket TTS,这是一个文本转语音模型,只需 5 秒音频即可克隆声音,可在 CPU 上运行,并以 MIT 许可证发布。该模型在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。

0 人收藏 0 人点赞
#voice-cloning

@NFTCPS: 电诈园区又有新武器用了,语音克隆这块又被卷到新高度了。 LuxTTS,一个轻量级 TTS 模型,我看完只想说三个字:真离谱。 快:单卡 150 倍实时,连 CPU 都能跑得比真人说话还快 清:直接 48khz,大部分模型还卡在 24khz…

X AI KOLs Timeline · 2026-07-05 缓存

LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。

0 人收藏 0 人点赞
#voice-cloning

@tom_doerr: Alexandria 使用 AI 从书籍生成有声书 https://github.com/Finrandojin/alexandria-audiobook…

X AI KOLs Timeline · 2026-07-04 缓存

Alexandria 是一个开源工具,利用 AI 驱动的脚本注释和文本转语音技术将书籍转化为全语音有声书,支持本地/云端大语言模型、语音克隆以及内置的 Qwen3-TTS 引擎。

0 人收藏 0 人点赞
#voice-cloning

@cevenif: 兄弟们,那些还得掏钱才能用的语音工具,是时候跟它们说88了! 开源免费的 Voicebox 已经杀出来了,直接把 ElevenLabs 和 WisprFlow 这两家付费巨头按在地上摩擦。 功能: 声音克隆,秒变任何人 全局语音输入,随时…

X AI KOLs Timeline · 2026-07-02 缓存

一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。

0 人收藏 0 人点赞
#voice-cloning

@0x0SojalSec: 别再为ElevenLabs或云端TTS付费了。只需3秒即可在笔记本电脑上完全本地克隆声音,将你的文档转…

X AI KOLs Timeline · 2026-07-01 缓存

一个免费、完全本地的语音克隆和TTS工具,由Qwen3-TTS和Kokoro驱动,通过MLX在Apple Silicon上运行,无需云服务即可从PDF生成工作室级有声书。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈