OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成

Hugging Face Daily Papers 论文

摘要

OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。

最近的生成模型正从无声视频或独立音频合成向同步音频和视频的联合生成发展。尽管取得了进展,但由于音频和视频在结构上的根本差异,实现细粒度跨模态对应的联合生成仍然具有挑战性。大多数现有方法使用分别训练的音频和视频VAE,导致两个潜在空间缺乏跨模态对齐,迫使下游生成模型从头学习跨模态同步。我们提出OmniVAE,这是一种联合训练的音频-视频VAE,能够学习音频和视频潜在表示之间的细粒度语义对齐。除了重建之外,OmniVAE还采用分段级音频-视频对比目标来捕捉时间-语义对应关系并对齐两个潜在空间。同时,它从预训练的模态特定语义编码器中提取特征并注入每个模态,提升两个潜在空间的下游可学习性。大量实验表明,这两个目标持续改善了潜在空间的可学习性,从而在下游文本到音频-视频生成中带来更高的生成质量和更准确的跨模态同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。1
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

Paper page - OmniVAE: 一种用于联合生成的跨模态对齐音视频VAE

来源: https://huggingface.co/papers/2607.23855

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

最近的生成模型正从无声视频或独立音频合成,转向同步音频与视频的联合生成。尽管取得了进展,但由于音频和视频在基本结构上的差异,联合生成具有细粒度跨模态对应关系的音频和视频仍然具有挑战性。大多数现有方法使用分别训练的音频和视频VAE。结果,两个潜在空间缺乏跨模态对齐,让下游生成模型从头学习跨模态同步。我们提出OmniVAE,一种联合训练的音视频VAE,能够在音频和视频潜在表示之间学习细粒度的语义对齐。除了重建之外,OmniVAE还使用段级音视频对比目标来捕获时间-语义对应关系并对齐两个潜在空间。同时,它从预训练的模态特定语义编码器中提取特征到每个模态,提高两个潜在空间的下游可学习性。大量实验表明,这两个目标一致地提高了潜在空间的可学习性,转化为下游文本到音视频生成中更高的生成质量和更精确的跨模态同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。

查看 arXiv 页面 (https://arxiv.org/abs/2607.23855) 查看 PDF (https://arxiv.org/pdf/2607.23855) 项目页面 (https://openmoss.ai/OmniVAE.github.io/) GitHub31 (https://github.com/OpenMOSS/OmniVAE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23855)

引用本文的模型1

OpenMOSS-Team/OmniVAE 更新于约1小时前 • 15 (https://huggingface.co/OpenMOSS-Team/OmniVAE)

引用本文的数据集0

没有数据集关联本文

请在数据集的README.md中引用 arxiv.org/abs/2607.23855 以从此页面链接。

引用本文的Space0

没有Space关联本文

请在Space的README.md中引用 arxiv.org/abs/2607.23855 以从此页面链接。

包含本文的收藏集0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

原生视听对齐生成

Hugging Face Daily Papers

NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。

AV-JEPA: 将LeJEPA扩展到音视频自监督学习

arXiv cs.AI

AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。