[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml
摘要
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。
我是audio.cpp的作者,这是一个用于本地音频模型的C++/ggml运行时。我刚刚添加了对VibeVoice 1.5B的支持,并希望分享基准测试结果,因为长篇幅多说话人TTS是对本地推理运行时很好的压力测试。RTX 5090上的结果:VibeVoice 1.5B 音频长度:5615.73秒 / 93.60分钟 实际耗时:1376.84秒 / 22.95分钟 RTF:0.245 速度:4.08倍实时 Python基线:92.66分钟音频用时65.70分钟 相对于基线的加速比:2.86倍 量化:无 扩散步数:10
主要目的不仅仅是避免Python环境配置的麻烦(尽管这也是其中一部分)。目标是让音频模型在原生本地运行时中变得实用:可重用的会话、类似服务器的使用方式、长篇幅生成、稳定的内存行为以及针对CUDA的优化(后续支持CPU和Metal)。VibeVoice是一个有用的里程碑,因为它不仅仅是短句子的TTS,而是专为长篇幅、多说话人对话(如播客、角色聊天和旁白)设计的,这些场景中运行时行为非常重要。
当前框架进展:已发布的模型系列:16 / 28 [███████████░░░░░░░░░] 57%
其他模型系列已在内部实现端到端运行,但我会在测试和清理后逐步发布。仓库地址是 https://github.com/0xShug0/audio.cpp
我期待收到用户在其他GPU或CPU上测试VibeVoice的反馈,特别是长提示词、多说话人格式、VRAM行为以及性能数据。
相似文章
audio.cpp: 集成12种音频模型(Qwen3-TTS、PocketTTS、VeVo2等)于一个C++/ggml运行时 — 在CUDA上TTS速度比Python快5倍
audio.cpp是一个C++/ggml运行时,集成了包括Qwen3-TTS、PocketTTS和VeVo2在内的12种音频模型,在CUDA上实现TTS速度比Python快5倍。
VibeVoice 1.5B 本地运行……就在 iPhone 上!仅需约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍
VibeVoice 1.5B 可在 iPhone 上本地运行,占用约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍;作者计划发布 audio.cpp 的 xcframework 和代码。
[audio.cpp] 狐狸说什么:原生C++/GGML中的4个ASR模型(Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR和Hviske ASR),初始流式支持,327秒音频在2.17秒内转录完成。
audio.cpp更新引入了流式支持和四个ASR/STT模型(Nemotron 3.5、Higgs Audio STT、VibeVoice ASR、Hviske ASR),采用原生C++/GGML实现,速度比Python快高达2.41倍,词错误率(WER)和显存占用具有竞争力。
VibeVoice 技术报告
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。
[audio.cpp] 0.4 版本发布:Higgs Audio v3 TTS 4B(10倍实时)+ Fish Audio S2 Pro 基于 C++/GGML,完整 GGUF 加载,Q8 速度与显存优化
audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。