[audio.cpp] GGML之音——C++/GGML原生ACE-Step、Stable Audio、HeartMuLa、RoFormer、HTDemucs发布。60秒生成10分钟音乐!
摘要
audio.cpp发布重大更新,新增音乐/SFX生成和源分离功能,支持ACE-Step、HeartMuLa、Stable Audio 3和HTDemucs,在原生C++/GGML中实现长音乐生成高达10倍的实时速度。
https://preview.redd.it/yxa9dlzquxah1.png?width=2000&format=png&auto=webp&s=b07c74b8832b26b46531e2fddba19fd2437ce4c6
我刚刚在audio.cpp中发布了一个大型音乐/音频扩展。此次更新为已发布的框架新增了音乐生成、SFX生成和源分离功能:
新发布:
- ACE-Step 1.5 Turbo / Base
- HeartMuLa
- Stable Audio 3 Small Music / SFX
- Stable Audio 3 Medium
- Mel-Band RoFormer
- HTDemucs
额外消息:HeartMuLa不再受旧版短时长限制,现在一次运行可生成约10分钟的音频。
当前框架进展:21/28(75%)
这不再仅仅是“C++中的TTS”。audio.cpp版本现在可以通过相同的原生C++/ggml框架路径覆盖语音、声音、ASR/VAD/话者分离、语音转换、音乐/SFX生成和源分离。
ACE-Step Turbo,600秒音乐生成
audio.cpp:60.16秒实际时间,RTF 0.100,9.97倍实时
Python:88.52秒实际时间,RTF 0.148,6.78倍实时
并非所有内容都神奇地变快了。HTDemucs目前在我的测试中比Python路径慢,Stable Audio的热启动运行结果参差不齐。我无意掩饰这一点。当前版本的重点是先让端到端路径进入共享框架,然后再优化特定后端的性能。
这些模型有一个mem_saver模式,适用于长时间运行/服务器式使用。它并不总能降低推理期间的绝对峰值,但可以在运行后减少常驻显存,且对速度影响不大。
Repo: https://github.com/0xShug0/audio.cpp
我希望从在不同GPU/CPU上尝试这些功能的人那里获得反馈,特别是长时间生成、怪异的提示词、音轨分离质量、后端问题、性能数据以及任何异常情况。
相似文章
[audio.cpp] 0.4 版本发布:Higgs Audio v3 TTS 4B(10倍实时)+ Fish Audio S2 Pro 基于 C++/GGML,完整 GGUF 加载,Q8 速度与显存优化
audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。
[audio.cpp] 在RTX 5090上3分钟生成10小时音频(含演示)!基于C++/GGML的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS发布
audio.cpp中发布了基于C++/GGML实现的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS,能够在RTX 5090上3分钟内生成10小时音频。
[audio.cpp] 狐狸说什么:原生C++/GGML中的4个ASR模型(Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR和Hviske ASR),初始流式支持,327秒音频在2.17秒内转录完成。
audio.cpp更新引入了流式支持和四个ASR/STT模型(Nemotron 3.5、Higgs Audio STT、VibeVoice ASR、Hviske ASR),采用原生C++/GGML实现,速度比Python快高达2.41倍,词错误率(WER)和显存占用具有竞争力。
[audio.cpp] 0.6版本发布:dots.tts、MiniMax-H3文本转音频(最高3倍实时)、MiniMax-Music3(预览版)等新音频模型,附带5+演示。
audio.cpp 0.6版本引入新音频模型,包括dots.tts和MiniMax-H3,并带来原生WebUI以及文本转音频和音乐生成的性能改进。
[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。