seshat-tts:一款支持语音克隆的本地实时游戏旁白工具

Reddit r/ArtificialInteligence 工具

摘要

seshat-tts 是一款开源工具,可通过 OCR 或大语言模型提取文本,并使用 pocket-tts 进行本地合成,实现带语音克隆的实时游戏旁白。语音克隆在 RTX 2070 Super 上约需 10 秒,缓存后可在 CPU 上运行。

大家好,这个程序允许你接入自己的大语言模型,或者仅依赖 OCR(文本提取器)利用 pocket-tts 进行实时音频合成。通过 uvx 关联你的 HuggingFace 账户即可使用语音克隆功能,在 RTX 2070 Super 上克隆一个声音大约需要 10 秒。之后它会作为 safetensor 缓存在模型中,因此几乎是即时的,并在 CPU 上运行。你可以轻松地将这个程序扩展到使用 Unity 的游戏,通过语音克隆管理器为 NPC 实例化他们自己的自定义声音。你可以在任何游戏中使用它,并通过许可证将其适配到你喜欢的任何工作流程或工具。源代码基于 MIT 许可证发布。https://github.com/scriptriva/seshat-tts
查看原文

相似文章