标签
Qwen3.8-LiveTranslate 是一款 AI 模型,采用交错音频文本架构,减少翻译延迟并提升质量,支持实时说话人分离和语音克隆,涵盖60种语言。
这条推文展示了十个热门的开源 GitHub 仓库,专注于 AI 代理、浏览器自动化、语音克隆和本地模型执行,表明 AI 代理开发基础设施正在增长。
一位独立开发者开源了一款免费的本地AI工具,作为ElevenLabs的替代品,支持语音克隆、646种语言的视频配音等功能,且所有数据均不离开用户设备。
OpenVoice 是一个开源的 AI 语音克隆工具,利用一段简短的参考音频来复制音色,支持多语言和情感调整,并在 GitHub 上获得了显著关注。
Google Labs的Steven Johnson解释了AI如何在未经许可的情况下克隆作家的声音,突出了对版权保护和自由职业经济的挑战。
LoudKit是一款开源的本地TTS工具,支持声音克隆和10种语言,并提供Python、Swift、Go、Rust和TypeScript的SDK,专为在边缘设备上高效运行而设计。
腾讯开源了一个名为AuK的1.5B参数AI模型,可以替代多个音频工具,通过自然语言指令处理TTS、语音克隆和降噪等任务。
本文探讨了神经语音合成中的三个汇聚工具链——声音身份、信号处理和表演真实感——重点关注声音克隆和音色转换,以转换人声表演,同时保留原始的乐句和动态。
本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。
本文介绍了Wayu-Paxa-TTS-Edge,一个拥有8200万参数的泰语TTS模型,该模型通过语音克隆教师的合成语音进行训练,在无需参考音频的情况下实现了高精度和韵律,适用于设备端使用。
VoiceStudio是一款开源的本地语音工作室工具,提供语音克隆、配音、转录等多种功能,支持646种语言,是ElevenLabs的替代方案。
介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。
一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。
TontaubeV1 是一个开放权重的语音合成模型,专为本地长篇生成发布,支持英语和德语,具备零样本语音克隆功能,并可在 GPU 上实现低延迟推理。
Sopro V2 是一个开源、快速、设备端的文本转语音模型,具有语音克隆功能,专门针对欧洲葡萄牙语及其他语言,以实现低延迟和隐私通信。
本文对2026年的AI语音克隆模型进行了评测与排名,包括CosyVoice 3和VibeVoice等。评测依据这些模型在通过微调和零样本方法复制作者声音时的准确度。
本文介绍了一个用于电信客户服务场景的合成孟加拉语音数据集,包含10,000个音频-文本对,使用OmniVoice语音克隆技术生成,并通过ASR模型评估,实现了较低的单词错误率。
VoiceStudio是一个本地运行的AI语音工具,提供语音克隆、声音设计、视频配音等功能,支持646种语言,无需网络连接或订阅,数据完全在本地处理。
FireRedAudio 和 FireRedTTS3 是统一音频理解与生成的AI模型,提供ASR、TTS、语音克隆、编辑和多语言支持,并具有竞争力的基准测试结果。
Audio8 TTS Preview 0.1b 是一个紧凑的零样本文本转语音模型,主模型拥有约1.7亿参数,支持语音克隆和多语言。