VoxGen,针对AMD优化的VoxCPM 2模型TTS推理引擎
摘要
VoxGen是专为VoxCPM2模型设计的新轻量级原生推理引擎,使用Rust和Vulkan计算针对AMD显卡优化,以提升性能并消除Python/PyTorch依赖。
大家好,我刚刚发布了VoxGen,这是一个为VoxCPM2设计的轻量级原生推理引擎,使用Rust编写并采用Vulkan计算,而非Python/PyTorch/CUDA。为什么选择VoxGen?启动这个项目的主要原因是我需要一个不错的本地文本转语音解决方案。因此,我认为VoxCPM 2是一个合理的选择。然而,大多数框架都优先支持NVIDIA,VoxCPM 2也不例外;结果,我的显卡严重卡顿,GPU总是飙升。此外,依赖Python和PyTorch简直是噩梦。这就是创建VoxGen的原因:我们不仅完全避开了PyTorch,而且在AMD显卡上的性能非常流畅(如果你有XTX 7900,我还设计了一个更激进的功耗和速度优化模式)!这个应用程序也可以从shell运行,因此可以与其他程序和脚本集成!安装:你只需要voxgen.exe(或Linux等效文件)以及以下文件来自 https://huggingface.co/DennisHuang648/VoxCPM2-GGUF:VoxCPM2-BaseLM-Q8_0.gguf VoxCPM2-Acoustic-F16.gguf 就这样!如果你感兴趣,请查看Github页面:https://github.com/NullMagic2/VoxGen 预构建二进制文件(目前仅限Windows)可在此处获取:https://github.com/NullMagic2/VoxGen/releases
相似文章
openbmb/VoxCPM2
VoxCPM2 是一个开源的、无分词器的扩散自回归文本转语音模型,支持30种语言,拥有20亿参数,48kHz音频输出,并具备从自然语言描述进行语音设计、可控语音克隆以及实时流式处理等功能。
本地测试了VoxCPM2(开源TTS)。“终极克隆”模式对呼吸和口音的捕捉效果令人惊叹。
对VoxCPM2的技术解析与基准测试,这是一款开源TTS模型,具备“终极克隆模式”以捕捉呼吸与口音。本地测试显示其低VRAM占用和跨语言口音保持能力。
Vox
Vox 是一款产品,让用户能够与 GitHub Copilot 进行语音对话,提供编程辅助的语音界面。
OpenBMB/VoxCPM
OpenBMB发布VoxCPM2,一个2B参数的无分词器TTS模型,基于超过200万小时的多语言语音数据训练,支持30种语言、语音设计、可控克隆和48kHz输出。
Voxatron
Voxatron 是一款幻想游戏机,以及一个完全由体素构成的游戏集合,包含竞技场射击游戏和动作冒险卡带,同时附带强大的设计工具,用于创建自定义体素游戏。