microsoft/VibeVoice-ASR-BitNet
摘要
Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。
查看缓存全文
缓存时间: 2026/07/28 06:35
microsoft/VibeVoice-ASR-BitNet · Hugging Face
来源:https://huggingface.co/microsoft/VibeVoice-ASR-BitNet GitHub (https://github.com/microsoft/VibeASR.cpp) 技术报告 (https://arxiv.org/abs/2607.21075) 许可证:MIT (https://opensource.org/licenses/MIT)
VibeVoice-ASR-BitNet 是 VibeVoice-ASR (https://huggingface.co/microsoft/VibeVoice-ASR) 的压缩变体,针对边缘 CPU 上的实时推理进行了优化——无需 GPU。通过异构量化,模型从 4.62 GB 压缩至 1.58 GB,同时在仅 3 个 CPU 线程下实现 1.6–2.3 倍 于 Whisper.cpp 的推理速度,并具备实时能力(RTF < 1)。
➡️ 代码: microsoft/VibeASR.cpp (https://github.com/microsoft/VibeASR.cpp)
➡️ 报告: VibeVoice-ASR-BitNet 技术报告 (https://arxiv.org/abs/2607.21075)
➡️ 基础模型: microsoft/VibeVoice-ASR (https://huggingface.co/microsoft/VibeVoice-ASR)
🔥 关键特性
- ⚡ CPU 实时推理——在消费级 x86(AVX2)和 ARM(NEON)硬件上,使用 3 个或更多线程即可实现 RTF < 1
- 📦 紧凑存储——总计 1.58 GB(相比 FP16 压缩 2.9 倍),适用于边缘设备内存
- 🌍 多语言支持——英语、中文、法语、意大利语、韩语、葡萄牙语、越南语等
- 🔧 自定义 SIMD 内核——在 ggml 框架内为 ARM 和 x86 平台集成了融合算子
量化策略
| 组件 | FP16 | 量化后 | 量化方法 | 压缩比 |
|---|---|---|---|---|
| VAE 分词器 | 1.31 GB | 0.65 GB | I8_S | 2.0× |
| LM 解码器 | 3.32 GB | 0.92 GB | I2_S + Q6_K | 3.6× |
| 总计 | 4.62 GB | 1.58 GB | — | 2.9× |
评估
推理速度
| 线程数 | 1 | 2 | 3 | 4 | 6 | 8 |
|---|---|---|---|---|---|---|
| RTF | 1.98 | 1.08 | 0.77 | 0.63 | 0.49 | 0.42 |
| vs. Whisper.cpp | 2.28× | 2.12× | 1.86× | 1.86× | 1.71× | 1.55× |
在 AMD EPYC 7V13(AVX2+FMA)上使用 20 秒音频进行基准测试。粗体表示 RTF < 1(实时)。
准确率(WER%)
| 基准测试 | VibeVoice-ASR-7B | VibeVoice-ASR-BitNet | Parakeet | Whisper | SenseVoice | FunASR |
|---|---|---|---|---|---|---|
| MLC-EN | 7.82 | 8.25 | 8.40 | 13.57 | 12.39 | 11.36 |
| MLC-FR | 16.03 | 17.41 | — | — | — | — |
| MLC-IT | 15.67 | 17.23 | — | — | — | — |
| MLC-KO | 9.83 | 11.15 | — | — | — | — |
| MLC-PT | 22.41 | 24.87 | — | — | — | — |
| MLC-VI | 20.15 | 22.38 | — | — | — | — |
| AISHELL4 | 19.83 | 27.45 | — | — | 22.52 | 20.41 |
| AMI-ihm | 17.42 | 21.36 | 21.92 | 27.07 | 30.81 | 32.07 |
| AMI-sdm | 24.18 | 25.87 | 26.33 | 36.92 | 48.11 | 40.17 |
| AliMeeting | 36.21 | 40.58 | — | — | 38.75 | 39.27 |
| Fleurs-en | 4.73 | 5.21 | 4.09 | 3.99 | 6.84 | 4.93 |
| Fleurs-zh | 7.92 | 8.35 | — | — | 5.56 | 7.00 |
| Libri-clean | 2.17 | 2.41 | 1.49 | 1.98 | 2.78 | 1.58 |
| Libri-other | 5.84 | 6.27 | 3.13 | 3.60 | 6.81 | 4.01 |
| VoxPopuli | 4.92 | 5.18 | 5.26 | 7.19 | 8.63 | 6.46 |
模型文件
| 文件名 | 大小 | 描述 |
|---|---|---|
vibeasr-vae-encoder-i8_s.gguf | 0.65 GB | VAE 分词器,I8_S 量化(可直接使用) |
vibeasr-lm-i2_s-embed-q6_k.gguf | 0.92 GB | LM 解码器,I2_S 量化(可直接使用) |
model-*.safetensors | 10.7 GB | 原始 SafeTensors(用于转换) |
许可证
本项目采用 MIT 许可证。
联系方式
该项目由微软研究院成员完成。如有建议、问题或观察到意外行为,请通过 [email protected] 联系我们。
相似文章
microsoft/VibeVoice
Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。
VibeVoice 技术报告
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。
[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。
@oliviscusAI: Microsoft 刚发布了一个工具,可以一次性转录整整一小时的音频,并追踪谁在什么时候说话。它叫……
Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。
[audio.cpp] 狐狸说什么:原生C++/GGML中的4个ASR模型(Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR和Hviske ASR),初始流式支持,327秒音频在2.17秒内转录完成。
audio.cpp更新引入了流式支持和四个ASR/STT模型(Nemotron 3.5、Higgs Audio STT、VibeVoice ASR、Hviske ASR),采用原生C++/GGML实现,速度比Python快高达2.41倍,词错误率(WER)和显存占用具有竞争力。