[audio.cpp] 0.6版本发布:dots.tts、MiniMax-H3文本转音频(最高3倍实时)、MiniMax-Music3(预览版)等新音频模型,附带5+演示。
摘要
audio.cpp 0.6版本引入新音频模型,包括dots.tts和MiniMax-H3,并带来原生WebUI以及文本转音频和音乐生成的性能改进。
大家好 :) audio.cpp 0.6版本已经发布一段时间了,所以这次更多的是对已发布内容和相关改进的更新。0.6版本新增了5个模型家族:dots.tts、NeuTTS-2e、MuScriptor(音乐转MIDI)、MiniMax-H3和SenseVoice-Small,使得audio.cpp的总模型家族达到49个,模型变体超过70个。自0.6版本发布以来,贡献者们已添加了Irodori-TTS v4、IndexTTS 2.5、ACE-Step 1.5 XL和MiniMax-Music3。亮点包括:(1) 原生WebUI!非常感谢 https://github.com/mirek190 (2) 当然是MiniMax-H3和MiniMax-Music3。我们实现了MiniMax-H3的文本转音频流水线,一个有趣的用例是TTS/语音克隆/音乐生成。它比专用音频模型更灵活、更强大,性能也相当不错。请查看主帖中的多说话者对话演示,以及评论中的其他演示。我对MiniMax-H3实现非常兴奋的一点是,它极大地丰富了框架对DiT模型的构建模块。现在,你不再需要手动设置SageAttention、First Block Cache或Spectrum的麻烦。只需更改几个参数,就可以实验模型。初步的配置、内存和性能权衡检查可在仓库的 docs/reports/minimax_h3_performance.md 中找到。奖励:audio.cpp的MiniMax-H3实现还可以生成视频帧,因为DiT一起生成音频和视频潜在表示,而视频VAE路径相对容易支持。目前,输出保存为RGB帧数据加上JSON中的元数据,因此你需要自己将其编码为视频文件。不支持升频器或后处理。仅供娱乐。MiniMax-Music3目前处于预览状态(preview/minimax-music-3分支)。已测试CUDA/Vulkan/HIP。仍有优化空间。显存使用量和RTF取决于音频时长和提示长度。演示使用了官方演示提示(4000+字符说明和1200字符歌词),以及30步加CFG。在此设置下,30秒音频的显存约为11 GB,60秒为14 GB,180秒为17 GB。如果调整设置,很容易获得超实时性能并大幅降低显存使用量。(3) 适用于IOS的VibeVoice 1.5B源代码已在vibevoice-optimizations分支上发布,以防你错过。如果你想提前访问下一个版本的模型,请关注dev分支。它通常会在发布前几天更新新发布内容以供测试。欢迎对原生UI、MiniMax-Music3和audio.cpp的所有其他方面提供反馈和PR。
相似文章
@Prince_Canuma: mlx-audio v0.4.3 正式发布!模型、服务器和开发体验全面升级 → 6 个全新 TTS 模型:Higgs Audio v2(声音克隆)…
mlx-audio v0.4.3 发布,新增 6 个 TTS 模型,包括 Higgs Audio v2 和支持 646+ 种语言的 OmniVoice,同时带来并发请求与持续批处理等服务器改进,Voxtral Realtime 4-bit 模式速度提升约 3 倍,并精简了 Apple Silicon 上的依赖项。
MiniMax-Music3 发布!
MiniMax 发布 Music 3,一款高性能音乐生成模型,可根据歌词和详细描述生成最长五分钟的完整歌曲,配备 8B 全局大语言模型和 0.6B 局部大语言模型,以实现长程连贯性和声学细节。
[audio.cpp] 0.4 版本发布:Higgs Audio v3 TTS 4B(10倍实时)+ Fish Audio S2 Pro 基于 C++/GGML,完整 GGUF 加载,Q8 速度与显存优化
audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。
[audio.cpp] GGML之音——C++/GGML原生ACE-Step、Stable Audio、HeartMuLa、RoFormer、HTDemucs发布。60秒生成10分钟音乐!
audio.cpp发布重大更新,新增音乐/SFX生成和源分离功能,支持ACE-Step、HeartMuLa、Stable Audio 3和HTDemucs,在原生C++/GGML中实现长音乐生成高达10倍的实时速度。
[audio.cpp] 在RTX 5090上3分钟生成10小时音频(含演示)!基于C++/GGML的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS发布
audio.cpp中发布了基于C++/GGML实现的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS,能够在RTX 5090上3分钟内生成10小时音频。