微软发布VibeVoice-ASR-Streaming流式语音识别模型

Reddit r/LocalLLaMA 模型

摘要

微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/03 02:09

microsoft/VibeVoice-ASR-Streaming-7B · Hugging Face

来源: https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B
GitHub 仓库 (https://github.com/microsoft/VibeVoice) 在线演示 (https://aka.ms/vibeasr)

VibeVoice-ASR-Streaming 是一个统一的流式语音识别模型,能够转录谁(说话人)说了什么(内容),并支持自定义热词10种语言

➡️ 代码库: microsoft/VibeVoice (https://github.com/microsoft/VibeVoice)
➡️ 演示: VibeVoice-ASR-Streaming (https://aka.ms/vibeasr)

VibeVoice-ASR-Streaming 架构

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#%F0%9F%94%A5-key-features🔥 主要功能

  • 📝 流式说话人归属转录:在语音输入时,持续转录说了什么
  • 👤 自定义热词:用户可以提供自定义热词,例如人名和专业术语,以提高特定领域内容的识别准确率。
  • 🌍 多语言支持:支持中文、英文、法文、德文、意大利文、日文、韩文、葡萄牙文、俄文和西班牙文。

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#evaluation评估

VibeVoice-ASR-Streaming 评估结果

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#installation-and-usage安装与使用

请参考 GitHub 仓库 (https://github.com/microsoft/VibeVoice)。

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#license许可协议

本项目采用 MIT 许可证。

https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#contact联系方式

本项目由微软研究院成员开展。我们欢迎来自各方的反馈与合作。如果您有任何建议、问题,或在我们的技术中发现意外/不当行为,请通过 [email protected] 与我们联系。如果团队收到不良行为报告或自行发现问题,我们将通过相应的缓解措施更新此仓库。

相似文章

microsoft/VibeVoice

GitHub Trending (daily)

Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。

microsoft/VibeVoice-ASR-BitNet

Reddit r/LocalLLaMA

Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。

VibeVoice-ASR-Streaming 技术报告

Hugging Face Daily Papers

VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。

VibeVoice 技术报告

Papers with Code Trending

VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。