开源:将声音模仿转化为音效(声音生成的新用户体验)

Reddit r/LocalLLaMA 模型

摘要

一个开源AI模型,通过声音模仿和文字描述生成音效,解决了搜索特定声音的难题。

大家好,我想介绍我的新项目!在制作视频或游戏时,你是否曾经需要某种特定音效?你脑海中很清楚它的声音,却不知道如何搜索。这就是为什么游戏工作室的音效设计会议经常变成人们用嘴巴模拟声音。“不是pewpew……更像是pew↘︎pew↘︎。”这正是这个项目的灵感来源!这个模型让你可以用声音模仿音效,然后将声音模仿与文字一起作为输入,生成你真正想要的音效。 仓库:[https://github.com/thxxx/VTS](https://github.com/thxxx/VTS) *(查看仓库中的演示可以更好地了解它。欢迎在评论区留下你的反馈。)*
查看原文

相似文章

@FakeMaidenMaker: 炸裂!这个开源项目免费文字转无 AI 味人声,还能克隆任何人的嗓音,并且用文字调整音色! GitHub 狂揽 30K star,出自面壁智能 OpenBMB,VoxCPM 之前拿过 GitHub 和 HuggingFace 双榜第一。 做…

X AI KOLs Timeline

VoxCPM2是OpenBMB开源的语音合成模型,采用无分词器的扩散自回归架构,支持30种语言、语音设计和可控语音克隆,仅需一句话即可克隆音色,或用文字创建全新声音,输出48kHz高质量音频,可商用。

在API中引入下一代音频模型

OpenAI Blog

OpenAI 为 API 引入了下一代音频模型,包括改进的语音转文本(gpt-4o-transcribe、gpt-4o-mini-transcribe)和可自定义的文本转语音模型,使开发者能够构建更智能、更具表现力的语音代理,在具有挑战性的场景中提升准确性。

ScenemaAI/scenema-audio

Hugging Face Models Trending

Scenema Audio 是一种零样本表现性语音克隆和语音生成模型,能够根据文本提示生成带有情感曲线、节奏和呼吸控制的语音。该模型基于音频扩散变换器,支持多语言生成、从10-20秒参考音频进行语音克隆,以及包含环境效果的场景感知音频。