[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml

Reddit r/LocalLLaMA 模型

摘要

VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。

我是audio.cpp的作者,这是一个用于本地音频模型的C++/ggml运行时。我刚刚添加了对VibeVoice 1.5B的支持,并希望分享基准测试结果,因为长篇幅多说话人TTS是对本地推理运行时很好的压力测试。RTX 5090上的结果:VibeVoice 1.5B 音频长度:5615.73秒 / 93.60分钟 实际耗时:1376.84秒 / 22.95分钟 RTF:0.245 速度:4.08倍实时 Python基线:92.66分钟音频用时65.70分钟 相对于基线的加速比:2.86倍 量化:无 扩散步数:10 主要目的不仅仅是避免Python环境配置的麻烦(尽管这也是其中一部分)。目标是让音频模型在原生本地运行时中变得实用:可重用的会话、类似服务器的使用方式、长篇幅生成、稳定的内存行为以及针对CUDA的优化(后续支持CPU和Metal)。VibeVoice是一个有用的里程碑,因为它不仅仅是短句子的TTS,而是专为长篇幅、多说话人对话(如播客、角色聊天和旁白)设计的,这些场景中运行时行为非常重要。 当前框架进展:已发布的模型系列:16 / 28 [███████████░░░░░░░░░] 57% 其他模型系列已在内部实现端到端运行,但我会在测试和清理后逐步发布。仓库地址是 https://github.com/0xShug0/audio.cpp 我期待收到用户在其他GPU或CPU上测试VibeVoice的反馈,特别是长提示词、多说话人格式、VRAM行为以及性能数据。
查看原文

相似文章

VibeVoice 技术报告

Papers with Code Trending

VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。