seshat-tts:一款支持语音克隆的本地实时游戏旁白工具
摘要
seshat-tts 是一款开源工具,可通过 OCR 或大语言模型提取文本,并使用 pocket-tts 进行本地合成,实现带语音克隆的实时游戏旁白。语音克隆在 RTX 2070 Super 上约需 10 秒,缓存后可在 CPU 上运行。
大家好,这个程序允许你接入自己的大语言模型,或者仅依赖 OCR(文本提取器)利用 pocket-tts 进行实时音频合成。通过 uvx 关联你的 HuggingFace 账户即可使用语音克隆功能,在 RTX 2070 Super 上克隆一个声音大约需要 10 秒。之后它会作为 safetensor 缓存在模型中,因此几乎是即时的,并在 CPU 上运行。你可以轻松地将这个程序扩展到使用 Unity 的游戏,通过语音克隆管理器为 NPC 实例化他们自己的自定义声音。你可以在任何游戏中使用它,并通过许可证将其适配到你喜欢的任何工作流程或工具。源代码基于 MIT 许可证发布。https://github.com/scriptriva/seshat-tts
相似文章
@0x0SojalSec: 别再为ElevenLabs或云端TTS付费了。只需3秒即可在笔记本电脑上完全本地克隆声音,将你的文档转…
一个免费、完全本地的语音克隆和TTS工具,由Qwen3-TTS和Kokoro驱动,通过MLX在Apple Silicon上运行,无需云服务即可从PDF生成工作室级有声书。
Kyutai 的 Pocket TTS 能在 CPU 上运行,仅需 5 秒音频即可克隆声音,采用 MIT 许可证发布。在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。
Kyutai 发布了 Pocket TTS,这是一个文本转语音模型,只需 5 秒音频即可克隆声音,可在 CPU 上运行,并以 MIT 许可证发布。该模型在英文 TTS 上与 Kokoro、Supertonic 和 Inflect-Nano 进行了基准测试。
本地测试了VoxCPM2(开源TTS)。“终极克隆”模式对呼吸和口音的捕捉效果令人惊叹。
对VoxCPM2的技术解析与基准测试,这是一款开源TTS模型,具备“终极克隆模式”以捕捉呼吸与口音。本地测试显示其低VRAM占用和跨语言口音保持能力。
Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
@MosiAI_Official: MOSS-TTS Local Transformer v1.5 现已推出。克隆任意声音。说任何语言。听到每一个细节。30多种语言,48 kHz …
MosiAI发布了MOSS-TTS Local Transformer v1.5,这是一款支持语音克隆、30多种语言以及48 kHz高质量输出的文本转语音模型。