WavFlow:波形空间中的音频生成
摘要
WavFlow 通过波形分块和振幅提升,直接在原始波形空间中生成高保真音频,在视频到音频和文本到音频基准测试中取得了具有竞争力的性能,无需中间潜在表示。
查看缓存全文
缓存时间: 2026/05/19 22:34
论文页面 - WavFlow: 波形空间中的音频生成
来源:https://huggingface.co/papers/2605.18749
摘要
WavFlow 直接基于原始波形空间生成高保真音频,采用波形分块(waveform patchify)和幅度提升(amplitude lifting)技术,在视频到音频和文本到音频基准测试中取得了具有竞争力的性能,无需中间潜在表示。
现代音频生成主要依赖潜在空间压缩(https://huggingface.co/papers?q=latent-space%20compression),这引入了额外的复杂性并可能导致信息丢失。在这项工作中,我们通过 WavFlow 挑战了这一范式,该框架直接基于原始波形空间(https://huggingface.co/papers?q=raw%20waveform%20space)生成高保真音频,无需中间表示。为了克服高维、低能量信号建模的内在困难,我们通过波形分块(waveform patchify)(https://huggingface.co/papers?q=waveform%20patchify)将音频重塑为 2D 令牌网格,并引入幅度提升(amplitude lifting)(https://huggingface.co/papers?q=amplitude%20lifting)来对齐信号尺度,从而通过流匹配(flow matching)(https://huggingface.co/papers?q=flow%20matching)中的直接 x 预测(x-prediction)(https://huggingface.co/papers?q=x-prediction)实现稳定优化。为了捕捉复杂的语义对齐和时间同步,我们利用自动化数据管道整理出 500 万个高质量的视频-文本-音频三元组(https://huggingface.co/papers?q=video-text-audio%20triplets),使模型能够从零开始学习细粒度的声学模式。实验结果表明,WavFlow 在视频到音频基准 VGGSound(https://huggingface.co/papers?q=VGGSound)(FD_PaSST: 59.98,IS_PANNs: 17.40,DeSync: 0.44)和文本到音频基准 AudioCaps(https://huggingface.co/papers?q=AudioCaps)(FD_PANNs: 10.63,IS_PANNs: 12.62)上取得了具有竞争力的性能,达到或超过了已建立的基于潜在方法的性能。我们的工作表明,中间压缩并非高质量合成的先决条件,为多模态音频生成(https://huggingface.co/papers?q=multimodal%20audio%20generation)提供了一种更简单、更具可扩展性的替代方案。
查看 arXiv 页面(https://arxiv.org/abs/2605.18749)查看 PDF(https://arxiv.org/pdf/2605.18749)项目页面(https://facebookresearch.github.io/WavFlow/)GitHub(https://github.com/facebookresearch/WavFlow)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.18749)
在您的 Agent 中获取此论文:
hf papers read 2605\.18749
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接到此论文的模型
请在模型 README.md 中引用 arxiv.org/abs/2605.18749 以将其链接到此页面。
引用此论文的数据集0
没有链接到此论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2605.18749 以将其链接到此页面。
引用此论文的 Space0
没有链接到此论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2605.18749 以将其链接到此页面。
包含此论文的收藏集1
相似文章
WavFlow 直接在波形空间中生成音频(GitHub 仓库)
WavFlow 是 Meta AI 提出的一种新方法,它直接从视频和文本输入在原始波形空间中生成同步、高保真的音频,绕过了潜在压缩。在 VGGSound 和 AudioCaps 基准测试中,其性能与基于潜在空间的方法相当。
WavTTS: 通过直接原始波形建模实现高质量零样本TTS
WavTTS 提出了首个使用流匹配和扩散变换器的原始波形生成式文本转语音模型,其性能可与潜在空间扩散模型相媲美,同时避免了压缩表示导致的信息损失。
FlowMimic: 基于像素对扭曲流场的无掩码视觉编辑与生成——面向在线视频编辑数据生成与模态模仿
FlowMimic 提出了一种方法,利用像素对扭曲流场实现跨视频和图像模态的无掩码视觉编辑与生成,能够从图像编辑样本实时生成视频编辑数据,并通过模仿损失对齐模态能力。
FlowLet: 基于小波流匹配的条件性3D脑MRI合成
FlowLet是一个条件生成框架,通过在可逆小波域中使用流匹配生成基于年龄条件的3D脑MRI,高效改善低代表性年龄组的脑龄预测准确性。
RhymeFlow: 基于异步去噪流调度的视频生成无训练加速方法
RhymeFlow通过跨帧解耦去噪轨迹来加速视频生成的扩散变换器,利用关键帧锚定和潜在轨迹投影减少计算开销,同时保持视觉质量。