Scenema Audio 登陆 ComfyUI,可在 8GB 显存上运行

Reddit r/LocalLLaMA 工具

摘要

Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。

嘿,大家好!Scenema Audio 现在已成为 ComfyUI 的原生自定义节点。为 scenema.ai 提供支持的同一模型现已量化,可在 8GB 显存上运行。几个月前我们首次以 API 和 Docker 栈形式发布时,全精度 Transformer 对大多数人来说过于笨重,难以自行托管。现在这个问题已经解决了。具有零样本声音克隆功能的表现力丰富的文本转语音。你可以描述语音应如何表演(愤怒、悲伤、孩童般的好奇),也可以提供参考音频来设定声音身份,模型便会生成一段表演。像 [他轻声笑了] 或 [声音哽咽] 这样的内联舞台指示提示会在准确位置被执行。下拉菜单中内置了 12 种预设语音,涵盖口音、年龄和情绪表达范围。我们还放弃了原始版本使用的 XML 提示词格式。将每个表演指令都用标签包裹写起来很笨拙。内联括号提示更适合 ComfyUI 的文本编辑器。安装 ComfyUI Registry(推荐):打开 ComfyUI Manager,选择 Custom Nodes Manager,搜索 "Scenema Audio",点击 Install,然后重启。GitHub:cd custom_nodes git clone https://github.com/ScenemaAI/ComfyUI-ScenemaAudio.git pip install -r ComfyUI-ScenemaAudio/requirements.txt 两种方式都会自动将预先配置好的工作流放入 Workflows 侧边栏的 Scenema Audio 文件夹中。单击一次即可将官方工作流加载到画布中。要求:最低 8GB 显存。已在 RTX 3070 和 RTX 4090 上完成端到端测试。生成速度最高可达实时速度的 2 倍。首次运行会下载约 30GB 的权重文件(仅一次)。文本编码器是 Gemma 3 12B,这是一个受门控的 HuggingFace 模型,因此你需要在首次生成之前接受其许可证并设置 HF_TOKEN。关于限制(与原始版本相同):这是一个扩散模型,不是传统的 TTS 流水线。某些种子会产生重复或乱码。适用于后期编辑工作流:生成、挑选最佳片段、裁剪。提示词很重要。具体、富有戏剧性的语音描述加上动作标签才能产生好的表演。泛泛的描述只会产生泛泛的输出。对于专有名词和难读的词,使用语音拼写会有所帮助(如果 "Tchaikovsky" 出现乱码,请将其拼写为 "Chai-koff-skee")。许可证:我们所有的节点代码和推理流水线均采用 MIT 许可证。Transformer 权重衍生自 LTX-2 社区许可证。链接:博客文章:https://scenema.ai/audio/comfy-ui ComfyUI 节点:https://github.com/ScenemaAI/ComfyUI-ScenemaAudio 模型权重:https://huggingface.co/ScenemaAI/scenema-audio 独立 Docker/API:https://github.com/ScenemaAI/scenema-audio 原始公告:https://scenema.ai/audio 你希望接下来从 Scenema Audio 看到什么?我们很乐意了解大家实际上想用生成式音频构建什么。
查看原文

相似文章

ScenemaAI/scenema-audio

Hugging Face Models Trending

Scenema Audio 是一种零样本表现性语音克隆和语音生成模型,能够根据文本提示生成带有情感曲线、节奏和呼吸控制的语音。该模型基于音频扩散变换器,支持多语言生成、从10-20秒参考音频进行语音克隆,以及包含环境效果的场景感知音频。

Comfy-Org/ComfyUI

GitHub Trending (daily)

ComfyUI is an open-source, modular node-based AI engine for generating images, videos, 3D models, and audio, with support for state-of-the-art open-source models and cloud/desktop deployment.

sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Hugging Face Models Trending

发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。

Qwen3-tts.cpp + Compose 桌面 GUI

Reddit r/LocalLLaMA

开发者改进了 qwen3-tts.cpp,使其在 RTX 5080 上实现 5 倍实时运行,并使用 Kotlin Compose Multiplatform 创建了跨平台桌面 GUI,具备语音克隆、流式传输和说话人嵌入管理功能。