WavFlow:波形空间中的音频生成

Hugging Face Daily Papers 论文

摘要

WavFlow 通过波形分块和振幅提升,直接在原始波形空间中生成高保真音频,在视频到音频和文本到音频基准测试中取得了具有竞争力的性能,无需中间潜在表示。

现代音频生成主要依赖于潜在空间压缩,这引入了额外的复杂性和潜在的信息损失。在这项工作中,我们通过 WavFlow 挑战了这一范式,该框架直接在原始波形空间中生成高保真音频,无需中间表示。为了克服建模高维低能量信号的固有困难,我们通过波形分块将音频重塑为二维令牌网格,并引入振幅提升以对齐信号尺度,从而通过流匹配中的直接 x 预测实现稳定优化。为了捕捉复杂的语义对齐和时间同步,我们利用自动化数据管道整理了 500 万个高质量的视频-文本-音频三元组,使模型能够从头学习细粒度的声学模式。实验结果表明,WavFlow 在视频到音频基准 VGGSound (FD_PaSST: 59.98, IS_PANNs: 17.40, DeSync: 0.44) 和文本到音频基准 AudioCaps (FD_PANNs: 10.63, IS_PANNs: 12.62) 上取得了具有竞争力的性能,匹配或超越了现有基于潜在的方法的表现。我们的工作表明,中间压缩并非高质量合成的先决条件,为多模态音频生成提供了更简单且可扩展的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/05/19 22:34

论文页面 - WavFlow: 波形空间中的音频生成

来源:https://huggingface.co/papers/2605.18749

摘要

WavFlow 直接基于原始波形空间生成高保真音频,采用波形分块(waveform patchify)和幅度提升(amplitude lifting)技术,在视频到音频和文本到音频基准测试中取得了具有竞争力的性能,无需中间潜在表示。

现代音频生成主要依赖潜在空间压缩(https://huggingface.co/papers?q=latent-space%20compression),这引入了额外的复杂性并可能导致信息丢失。在这项工作中,我们通过 WavFlow 挑战了这一范式,该框架直接基于原始波形空间(https://huggingface.co/papers?q=raw%20waveform%20space)生成高保真音频,无需中间表示。为了克服高维、低能量信号建模的内在困难,我们通过波形分块(waveform patchify)(https://huggingface.co/papers?q=waveform%20patchify)将音频重塑为 2D 令牌网格,并引入幅度提升(amplitude lifting)(https://huggingface.co/papers?q=amplitude%20lifting)来对齐信号尺度,从而通过流匹配(flow matching)(https://huggingface.co/papers?q=flow%20matching)中的直接 x 预测(x-prediction)(https://huggingface.co/papers?q=x-prediction)实现稳定优化。为了捕捉复杂的语义对齐和时间同步,我们利用自动化数据管道整理出 500 万个高质量的视频-文本-音频三元组(https://huggingface.co/papers?q=video-text-audio%20triplets),使模型能够从零开始学习细粒度的声学模式。实验结果表明,WavFlow 在视频到音频基准 VGGSound(https://huggingface.co/papers?q=VGGSound)(FD_PaSST: 59.98,IS_PANNs: 17.40,DeSync: 0.44)和文本到音频基准 AudioCaps(https://huggingface.co/papers?q=AudioCaps)(FD_PANNs: 10.63,IS_PANNs: 12.62)上取得了具有竞争力的性能,达到或超过了已建立的基于潜在方法的性能。我们的工作表明,中间压缩并非高质量合成的先决条件,为多模态音频生成(https://huggingface.co/papers?q=multimodal%20audio%20generation)提供了一种更简单、更具可扩展性的替代方案。

查看 arXiv 页面(https://arxiv.org/abs/2605.18749)查看 PDF(https://arxiv.org/pdf/2605.18749)项目页面(https://facebookresearch.github.io/WavFlow/)GitHub(https://github.com/facebookresearch/WavFlow)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.18749)

在您的 Agent 中获取此论文:

hf papers read 2605\.18749

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接到此论文的模型

请在模型 README.md 中引用 arxiv.org/abs/2605.18749 以将其链接到此页面。

引用此论文的数据集0

没有链接到此论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2605.18749 以将其链接到此页面。

引用此论文的 Space0

没有链接到此论文的 Space

请在 Space README.md 中引用 arxiv.org/abs/2605.18749 以将其链接到此页面。

包含此论文的收藏集1

相似文章

WavFlow 直接在波形空间中生成音频(GitHub 仓库)

TLDR AI

WavFlow 是 Meta AI 提出的一种新方法,它直接从视频和文本输入在原始波形空间中生成同步、高保真的音频,绕过了潜在压缩。在 VGGSound 和 AudioCaps 基准测试中,其性能与基于潜在空间的方法相当。