WavFlow 直接在波形空间中生成音频(GitHub 仓库)
摘要
WavFlow 是 Meta AI 提出的一种新方法,它直接从视频和文本输入在原始波形空间中生成同步、高保真的音频,绕过了潜在压缩。在 VGGSound 和 AudioCaps 基准测试中,其性能与基于潜在空间的方法相当。
WavFlow 是 Meta AI 的一个流匹配框架,它直接从视频和文本输入在原始波形空间中生成同步音频,无需依赖潜在音频压缩。
查看缓存全文
缓存时间: 2026/05/21 18:14
WavFlow: 波形空间中的音频生成
相似文章
WavFlow:波形空间中的音频生成
WavFlow 通过波形分块和振幅提升,直接在原始波形空间中生成高保真音频,在视频到音频和文本到音频基准测试中取得了具有竞争力的性能,无需中间潜在表示。
WavTTS: 通过直接原始波形建模实现高质量零样本TTS
WavTTS 提出了首个使用流匹配和扩散变换器的原始波形生成式文本转语音模型,其性能可与潜在空间扩散模型相媲美,同时避免了压缩表示导致的信息损失。
FlowMimic: 基于像素对扭曲流场的无掩码视觉编辑与生成——面向在线视频编辑数据生成与模态模仿
FlowMimic 提出了一种方法,利用像素对扭曲流场实现跨视频和图像模态的无掩码视觉编辑与生成,能够从图像编辑样本实时生成视频编辑数据,并通过模仿损失对齐模态能力。
RhymeFlow: 基于异步去噪流调度的视频生成无训练加速方法
RhymeFlow通过跨帧解耦去噪轨迹来加速视频生成的扩散变换器,利用关键帧锚定和潜在轨迹投影减少计算开销,同时保持视觉质量。
FlowLet: 基于小波流匹配的条件性3D脑MRI合成
FlowLet是一个条件生成框架,通过在可逆小波域中使用流匹配生成基于年龄条件的3D脑MRI,高效改善低代表性年龄组的脑龄预测准确性。