VibeVoice 技术报告
摘要
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。
查看缓存全文
缓存时间: 2026/05/08 08:34
论文页面 - VibeVoice 技术报告
来源: https://huggingface.co/papers/2508.19205 发布于 2025年8月26日
·
由https://huggingface.co/unilm提交
Li Dong (https://huggingface.co/unilm) 于 2025年8月27日
当日最热论文 #1 (https://huggingface.co/papers/date/2025-08-27) 作者:
,
,
,
,
,
,
,
,
,
摘要
VibeVoice 利用下一标记扩散(next-token diffusion)和一种高效连续的语音分词器,生成长格式多说话人语音,实现了卓越的性能和高保真度。
本报告介绍了 VibeVoice,这是一种新颖的模型,旨在通过采用下一标记扩散(next-token diffusion)来生成具有多个说话人的长格式语音(long-form speech)。下一标记扩散是一种统一建模连续数据的方法,通过自回归生成潜在向量来实现扩散。为此,我们提出了一种新颖的连续语音分词器(continuous speech tokenizer),与流行的 Encodec 模型相比,在保持可比性能的同时,将数据压缩率提高了80倍。该分词器在有效保持音频保真度(audio fidelity)的同时,显著提升了处理长序列的计算效率(computational efficiency)。因此,VibeVoice 可以在最多4个说话人的情况下,合成长达90分钟的长格式语音(在64K上下文窗口长度内),捕捉真实的对话“氛围”(vibe),并超越了开源和专有的对话模型(dialogue models)。
查看 arXiv 页面 (https://arxiv.org/abs/2508.19205)查看 PDF (https://arxiv.org/pdf/2508.19205)项目页面 (https://microsoft.github.io/VibeVoice/)GitHub46.8k (https://github.com/microsoft/VibeVoice)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2508.19205)
在您的 agent 中获取此论文:
hf papers read 2508.19205
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型66
microsoft/VibeVoice-1.5B Text-to-Speech• 3B• 更新于1月22日 • 259k • 2.36k (https://huggingface.co/microsoft/VibeVoice-1.5B)
microsoft/VibeVoice-Realtime-0.5B Text-to-Speech• 1B• 更新于2025年12月12日 • 949k • 1.22k (https://huggingface.co/microsoft/VibeVoice-Realtime-0.5B)
aoi-ot/VibeVoice-Large Text-to-Speech• 9B• 更新于2025年9月25日 • 8.38k • 230 (https://huggingface.co/aoi-ot/VibeVoice-Large)
vibevoice/VibeVoice-7B Text-to-Speech• 9B• 更新于2025年9月5日 • 8.42k • 178 (https://huggingface.co/vibevoice/VibeVoice-7B)
浏览引用此论文的66个模型 (https://huggingface.co/models?other=arxiv:2508.19205)## 引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2508.19205 以从此页面链接。
引用此论文的 Spaces123
包含此论文的收藏集22
浏览包含此论文的22个收藏集 (https://huggingface.co/collections?paper=2508.19205)
相似文章
microsoft/VibeVoice
Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。
[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。
@oliviscusAI: Microsoft 刚发布了一个工具,可以一次性转录整整一小时的音频,并追踪谁在什么时候说话。它叫……
Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。
microsoft/VibeVoice-ASR-BitNet
Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。
@uniswap12: 微软开源了一个语音 AI,60 分钟长音频一次转写,4 个人同时说话都能搞定 VibeVoice,微软开源,24.8k star,今天才知道这个。录音一键转文字这件事,我之前一直用 Whisper,但它处理长会议录音经常超时,多人说话识别…
微软开源了语音AI框架VibeVoice,支持60分钟长音频一次性转写、多说话人分离和时间戳标注,同时提供多角色TTS合成能力,底层基于Qwen2.5并配有0.5B轻量实时版本,已在GitHub获得24.8k星标。