VibeVoice 1.5B 本地运行……就在 iPhone 上!仅需约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍
摘要
VibeVoice 1.5B 可在 iPhone 上本地运行,占用约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍;作者计划发布 audio.cpp 的 xcframework 和代码。
我加快了演示的生成部分,免得你觉得无聊 😄 我还测试了另一个长文本生成,VRAM 使用情况看起来很稳定。这个演示大约一分钟长,我已经发布到了 X 上。这最初只是一个随机的想法,结果却变成了对 audio.cpp 下一个版本开发的完全绕路。模型已经上传到了 audio.cpp 的 HF 仓库。我稍后会上传 xcframework,然后在 0.6 版本发布后将代码推送到一个分支。
相似文章
[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。
VibeVoice 技术报告
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。
microsoft/VibeVoice
Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。
microsoft/VibeVoice-ASR-BitNet
Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。
本地测试了VoxCPM2(开源TTS)。“终极克隆”模式对呼吸和口音的捕捉效果令人惊叹。
对VoxCPM2的技术解析与基准测试,这是一款开源TTS模型,具备“终极克隆模式”以捕捉呼吸与口音。本地测试显示其低VRAM占用和跨语言口音保持能力。