开源:将声音模仿转化为音效(声音生成的新用户体验)
摘要
一个开源AI模型,通过声音模仿和文字描述生成音效,解决了搜索特定声音的难题。
大家好,我想介绍我的新项目!在制作视频或游戏时,你是否曾经需要某种特定音效?你脑海中很清楚它的声音,却不知道如何搜索。这就是为什么游戏工作室的音效设计会议经常变成人们用嘴巴模拟声音。“不是pewpew……更像是pew↘︎pew↘︎。”这正是这个项目的灵感来源!这个模型让你可以用声音模仿音效,然后将声音模仿与文字一起作为输入,生成你真正想要的音效。
仓库:[https://github.com/thxxx/VTS](https://github.com/thxxx/VTS) *(查看仓库中的演示可以更好地了解它。欢迎在评论区留下你的反馈。)*
相似文章
@Ryrenz:太强大了——OpenVoice 只需要一段简短的参考音频就能克隆那种音色,甚至还能切换语言……
OpenVoice 是一个开源的 AI 语音克隆工具,利用一段简短的参考音频来复制音色,支持多语言和情感调整,并在 GitHub 上获得了显著关注。
@CycleDecoded: 上海人工智能实验室(OpenMMLab)这次直接把“声音制造”给彻底打穿了。 他们开源的 Amphion,简直就是音视频创作界的“全能兵工厂”。从语音合成到 AI 歌声变换,这玩意儿能把绝大多数收费语音软件吊起来打。 基本信息 项目名称:…
OpenMMLab开源了Amphion,一个支持TTS、歌声转换、音效生成等多功能的音频生成工具箱,完全免费可商用,支持本地部署。
Scenema Audio:零样本富有表现力的语音克隆与语音生成 [N]
Scenema AI 发布了 Scenema Audio,一个开源的基于扩散模型的零样本富有表现力的语音克隆与语音生成模型,将情感表现与声音身份分离,使任何声音都能演绎任何情感。
@FakeMaidenMaker: 炸裂!这个开源项目免费文字转无 AI 味人声,还能克隆任何人的嗓音,并且用文字调整音色! GitHub 狂揽 30K star,出自面壁智能 OpenBMB,VoxCPM 之前拿过 GitHub 和 HuggingFace 双榜第一。 做…
VoxCPM2是OpenBMB开源的语音合成模型,采用无分词器的扩散自回归架构,支持30种语言、语音设计和可控语音克隆,仅需一句话即可克隆音色,或用文字创建全新声音,输出48kHz高质量音频,可商用。
终极清单:最佳开源代码、对话、视觉、音频等模型
精选开源模型清单,涵盖代码、对话、视觉、音频、语音合成、声音克隆、音乐、图像与视频生成,附链接与性能简评。