microsoft/VibeVoice-ASR-BitNet

Reddit r/LocalLLaMA 模型

摘要

Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:35

microsoft/VibeVoice-ASR-BitNet · Hugging Face

来源:https://huggingface.co/microsoft/VibeVoice-ASR-BitNet GitHub (https://github.com/microsoft/VibeASR.cpp) 技术报告 (https://arxiv.org/abs/2607.21075) 许可证:MIT (https://opensource.org/licenses/MIT)

VibeVoice-ASR-BitNet 是 VibeVoice-ASR (https://huggingface.co/microsoft/VibeVoice-ASR) 的压缩变体,针对边缘 CPU 上的实时推理进行了优化——无需 GPU。通过异构量化,模型从 4.62 GB 压缩至 1.58 GB,同时在仅 3 个 CPU 线程下实现 1.6–2.3 倍 于 Whisper.cpp 的推理速度,并具备实时能力(RTF < 1)。

➡️ 代码: microsoft/VibeASR.cpp (https://github.com/microsoft/VibeASR.cpp)
➡️ 报告: VibeVoice-ASR-BitNet 技术报告 (https://arxiv.org/abs/2607.21075)
➡️ 基础模型: microsoft/VibeVoice-ASR (https://huggingface.co/microsoft/VibeVoice-ASR)


🔥 关键特性

  • ⚡ CPU 实时推理——在消费级 x86(AVX2)和 ARM(NEON)硬件上,使用 3 个或更多线程即可实现 RTF < 1
  • 📦 紧凑存储——总计 1.58 GB(相比 FP16 压缩 2.9 倍),适用于边缘设备内存
  • 🌍 多语言支持——英语、中文、法语、意大利语、韩语、葡萄牙语、越南语等
  • 🔧 自定义 SIMD 内核——在 ggml 框架内为 ARM 和 x86 平台集成了融合算子

量化策略

组件FP16量化后量化方法压缩比
VAE 分词器1.31 GB0.65 GBI8_S2.0×
LM 解码器3.32 GB0.92 GBI2_S + Q6_K3.6×
总计4.62 GB1.58 GB2.9×

评估

推理速度

线程数123468
RTF1.981.080.770.630.490.42
vs. Whisper.cpp2.28×2.12×1.86×1.86×1.71×1.55×

在 AMD EPYC 7V13(AVX2+FMA)上使用 20 秒音频进行基准测试。粗体表示 RTF < 1(实时)。

准确率(WER%)

基准测试VibeVoice-ASR-7BVibeVoice-ASR-BitNetParakeetWhisperSenseVoiceFunASR
MLC-EN7.828.258.4013.5712.3911.36
MLC-FR16.0317.41
MLC-IT15.6717.23
MLC-KO9.8311.15
MLC-PT22.4124.87
MLC-VI20.1522.38
AISHELL419.8327.4522.5220.41
AMI-ihm17.4221.3621.9227.0730.8132.07
AMI-sdm24.1825.8726.3336.9248.1140.17
AliMeeting36.2140.5838.7539.27
Fleurs-en4.735.214.093.996.844.93
Fleurs-zh7.928.355.567.00
Libri-clean2.172.411.491.982.781.58
Libri-other5.846.273.133.606.814.01
VoxPopuli4.925.185.267.198.636.46

模型文件

文件名大小描述
vibeasr-vae-encoder-i8_s.gguf0.65 GBVAE 分词器,I8_S 量化(可直接使用)
vibeasr-lm-i2_s-embed-q6_k.gguf0.92 GBLM 解码器,I2_S 量化(可直接使用)
model-*.safetensors10.7 GB原始 SafeTensors(用于转换)

许可证

本项目采用 MIT 许可证。

联系方式

该项目由微软研究院成员完成。如有建议、问题或观察到意外行为,请通过 [email protected] 联系我们。

相似文章

microsoft/VibeVoice

GitHub Trending (daily)

Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。

VibeVoice 技术报告

Papers with Code Trending

VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。