voice-cloning

标签

Cards List
#voice-cloning

Qwen3.8-LiveTranslate:标注说话者,传达含义(3分钟阅读)

TLDR AI ↗ · 2026-09-21

Qwen3.8-LiveTranslate 是一款 AI 模型,采用交错音频文本架构,减少翻译延迟并提升质量,支持实时说话人分离和语音克隆,涵盖60种语言。

0 人收藏 0 人点赞
#voice-cloning

@sentient_agency: 天啊……GitHub 现在太疯狂了,开发者们随意开源 AI 代理、浏览器自动化、语音克隆……

X AI KOLs Timeline ↗ · 2026-09-18 缓存

这条推文展示了十个热门的开源 GitHub 仓库,专注于 AI 代理、浏览器自动化、语音克隆和本地模型执行,表明 AI 代理开发基础设施正在增长。

0 人收藏 0 人点赞
#voice-cloning

@nikola_mr64990: 这简直太疯狂了!一个独立开发者刚刚开源了一个100%免费的ElevenLabs替代品,它完全在你自己的机器上运行……

X AI KOLs Timeline ↗ · 2026-09-13 缓存

一位独立开发者开源了一款免费的本地AI工具,作为ElevenLabs的替代品,支持语音克隆、646种语言的视频配音等功能,且所有数据均不离开用户设备。

0 人收藏 0 人点赞
#voice-cloning

@Ryrenz:太强大了——OpenVoice 只需要一段简短的参考音频就能克隆那种音色,甚至还能切换语言……

X AI KOLs Timeline ↗ · 2026-09-12 缓存

OpenVoice 是一个开源的 AI 语音克隆工具,利用一段简短的参考音频来复制音色,支持多语言和情感调整,并在 GitHub 上获得了显著关注。

0 人收藏 0 人点赞
#voice-cloning

Steven Johnson(Google Labs)刚详细描述了如何在未经授权的情况下克隆作家的声音

Reddit r/artificial ↗ · 2026-09-12

Google Labs的Steven Johnson解释了AI如何在未经许可的情况下克隆作家的声音,突出了对版权保护和自由职业经济的挑战。

0 人收藏 0 人点赞
#voice-cloning

LoudKit:本地TTS,支持声音克隆、10种语言,并提供Python、Swift、Go、Rust和TypeScript的SDK

Reddit r/LocalLLaMA ↗ · 2026-09-10

LoudKit是一款开源的本地TTS工具,支持声音克隆和10种语言,并提供Python、Swift、Go、Rust和TypeScript的SDK,专为在边缘设备上高效运行而设计。

0 人收藏 0 人点赞
#voice-cloning

@TeksEdge: 腾讯开源了一个小型1.5B AI模型,能替代多个独立音频工具,击败Qwen3-TTS!Thi…

X AI KOLs Timeline ↗ · 2026-09-10 缓存

腾讯开源了一个名为AuK的1.5B参数AI模型,可以替代多个音频工具,通过自然语言指令处理TTS、语音克隆和降噪等任务。

0 人收藏 0 人点赞
#voice-cloning

Neural Vocals: 声音克隆与音色转换 · Trust Node Logic

Reddit r/artificial ↗ · 2026-09-10 缓存

本文探讨了神经语音合成中的三个汇聚工具链——声音身份、信号处理和表演真实感——重点关注声音克隆和音色转换,以转换人声表演,同时保留原始的乐句和动态。

0 人收藏 0 人点赞
#voice-cloning

构建与评估基于合成语音的固定语音泰语TTS系统

arXiv cs.CL ↗ · 2026-09-04 缓存

本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。

0 人收藏 0 人点赞
#voice-cloning

构建与评估基于合成语音的固定语音泰语TTS

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文介绍了Wayu-Paxa-TTS-Edge,一个拥有8200万参数的泰语TTS模型,该模型通过语音克隆教师的合成语音进行训练,在无需参考音频的情况下实现了高精度和韵律,适用于设备端使用。

0 人收藏 0 人点赞
#voice-cloning

@ErickSky: 今晚我要介绍的项目是ElevenLabs……但它是本地的,支持646种语言。[VoiceStudio] 它是开源的……

X AI KOLs Timeline ↗ · 2026-09-01 缓存

VoiceStudio是一款开源的本地语音工作室工具,提供语音克隆、配音、转录等多种功能,支持646种语言,是ElevenLabs的替代方案。

0 人收藏 0 人点赞
#voice-cloning

@Huahuazo: 这声音克隆工具我试完直接愣住了。 随手截了8秒自己说话的录音扔进去,出来的声音——语气、停顿、那种欠欠的调调,简直跟我本人在抬杠一模一样。 最绝的是完全本地跑,音频不用上传,隐私安全直接拉满。说实话第一反应不是厉害,是头皮发麻:以后光凭一…

X AI KOLs Timeline ↗ · 2026-08-30 缓存

介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。

0 人收藏 0 人点赞
#voice-cloning

@leeoxiang: 确实非常轻量的 TTS 实现,尝试用 2000 个小时数据复现了一下 Audio8的从头训练,在 H200上训了不到 10 个小时 SIM 指标就已经达到 0.72了。

X AI KOLs Timeline ↗ · 2026-08-29 缓存

一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。

0 人收藏 0 人点赞
#voice-cloning

TontaubeV1 - 本地长篇生成开放语音合成模型发布

Reddit r/LocalLLaMA ↗ · 2026-08-28

TontaubeV1 是一个开放权重的语音合成模型,专为本地长篇生成发布,支持英语和德语,具备零样本语音克隆功能,并可在 GPU 上实现低延迟推理。

0 人收藏 0 人点赞
#voice-cloning

快速设备端语音克隆 (9分钟阅读)

TLDR AI ↗ · 2026-08-28 缓存

Sopro V2 是一个开源、快速、设备端的文本转语音模型,具有语音克隆功能,专门针对欧洲葡萄牙语及其他语言,以实现低延迟和隐私通信。

0 人收藏 0 人点赞
#voice-cloning

2026年最佳AI语音克隆:如何用AI克隆你的声音

Reddit r/LocalLLaMA ↗ · 2026-08-24 缓存

本文对2026年的AI语音克隆模型进行了评测与排名,包括CosyVoice 3和VibeVoice等。评测依据这些模型在通过微调和零样本方法复制作者声音时的准确度。

0 人收藏 0 人点赞
#voice-cloning

构建和评估用于电信客户服务的合成孟加拉语音资源

arXiv cs.CL ↗ · 2026-08-24 缓存

本文介绍了一个用于电信客户服务场景的合成孟加拉语音数据集,包含10,000个音频-文本对,使用OmniVoice语音克隆技术生成,并通过ASR模型评估,实现了较低的单词错误率。

0 人收藏 0 人点赞
#voice-cloning

@IndieDevHailey: VoiceStudio:本地版ElevenLabs,语音克隆、声音设计、视频配音、听写、有声书全包,支持646种语言。 16个TTS引擎随便切,完全本地跑,不用账号不用API不用订阅,数据全在你机器上。 刚从OmniVoice改名,已经1…

X AI KOLs Timeline ↗ · 2026-08-22 缓存

VoiceStudio是一个本地运行的AI语音工具,提供语音克隆、声音设计、视频配音等功能,支持646种语言,无需网络连接或订阅,数据完全在本地处理。

0 人收藏 0 人点赞
#voice-cloning

FireRedAudio 和 FireRedTTS3 由 FireRedTeam 开发 - Huggingface

Reddit r/LocalLLaMA ↗ · 2026-08-21

FireRedAudio 和 FireRedTTS3 是统一音频理解与生成的AI模型,提供ASR、TTS、语音克隆、编辑和多语言支持,并具有竞争力的基准测试结果。

0 人收藏 0 人点赞
#voice-cloning

Audio8/Audio8-TTS-预览版-0.1b

Hugging Face Models Trending ↗ · 2026-08-19 缓存

Audio8 TTS Preview 0.1b 是一个紧凑的零样本文本转语音模型,主模型拥有约1.7亿参数,支持语音克隆和多语言。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈