微软发布VibeVoice-ASR-Streaming流式语音识别模型
摘要
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。
查看缓存全文
缓存时间: 2026/09/03 02:09
microsoft/VibeVoice-ASR-Streaming-7B · Hugging Face
来源: https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B
GitHub 仓库 (https://github.com/microsoft/VibeVoice) 在线演示 (https://aka.ms/vibeasr)
VibeVoice-ASR-Streaming 是一个统一的流式语音识别模型,能够转录谁(说话人)说了什么(内容),并支持自定义热词和10种语言。
➡️ 代码库: microsoft/VibeVoice (https://github.com/microsoft/VibeVoice)
➡️ 演示: VibeVoice-ASR-Streaming (https://aka.ms/vibeasr)
VibeVoice-ASR-Streaming 架构
https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#%F0%9F%94%A5-key-features🔥 主要功能
- 📝 流式说话人归属转录:在语音输入时,持续转录谁说了什么。
- 👤 自定义热词:用户可以提供自定义热词,例如人名和专业术语,以提高特定领域内容的识别准确率。
- 🌍 多语言支持:支持中文、英文、法文、德文、意大利文、日文、韩文、葡萄牙文、俄文和西班牙文。
https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#evaluation评估
VibeVoice-ASR-Streaming 评估结果
https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#installation-and-usage安装与使用
请参考 GitHub 仓库 (https://github.com/microsoft/VibeVoice)。
https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#license许可协议
本项目采用 MIT 许可证。
https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B#contact联系方式
本项目由微软研究院成员开展。我们欢迎来自各方的反馈与合作。如果您有任何建议、问题,或在我们的技术中发现意外/不当行为,请通过 [email protected] 与我们联系。如果团队收到不良行为报告或自行发现问题,我们将通过相应的缓解措施更新此仓库。
相似文章
microsoft/VibeVoice
Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。
microsoft/VibeVoice-ASR-BitNet
Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。
VibeVoice-ASR-Streaming 技术报告
VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。
@oliviscusAI: Microsoft 刚发布了一个工具,可以一次性转录整整一小时的音频,并追踪谁在什么时候说话。它叫……
Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。
VibeVoice 技术报告
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。