OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成
摘要
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
查看缓存全文
缓存时间: 2026/07/28 06:33
Paper page - OmniVAE: 一种用于联合生成的跨模态对齐音视频VAE
来源: https://huggingface.co/papers/2607.23855
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
最近的生成模型正从无声视频或独立音频合成,转向同步音频与视频的联合生成。尽管取得了进展,但由于音频和视频在基本结构上的差异,联合生成具有细粒度跨模态对应关系的音频和视频仍然具有挑战性。大多数现有方法使用分别训练的音频和视频VAE。结果,两个潜在空间缺乏跨模态对齐,让下游生成模型从头学习跨模态同步。我们提出OmniVAE,一种联合训练的音视频VAE,能够在音频和视频潜在表示之间学习细粒度的语义对齐。除了重建之外,OmniVAE还使用段级音视频对比目标来捕获时间-语义对应关系并对齐两个潜在空间。同时,它从预训练的模态特定语义编码器中提取特征到每个模态,提高两个潜在空间的下游可学习性。大量实验表明,这两个目标一致地提高了潜在空间的可学习性,转化为下游文本到音视频生成中更高的生成质量和更精确的跨模态同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。
查看 arXiv 页面 (https://arxiv.org/abs/2607.23855) 查看 PDF (https://arxiv.org/pdf/2607.23855) 项目页面 (https://openmoss.ai/OmniVAE.github.io/) GitHub31 (https://github.com/OpenMOSS/OmniVAE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23855)
引用本文的模型1
OpenMOSS-Team/OmniVAE 更新于约1小时前 • 15 (https://huggingface.co/OpenMOSS-Team/OmniVAE)
引用本文的数据集0
没有数据集关联本文
请在数据集的README.md中引用 arxiv.org/abs/2607.23855 以从此页面链接。
引用本文的Space0
没有Space关联本文
请在Space的README.md中引用 arxiv.org/abs/2607.23855 以从此页面链接。
包含本文的收藏集0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
原生视听对齐生成
NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。
AV-JEPA: 将LeJEPA扩展到音视频自监督学习
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
UniVidX:基于扩散先验的多功能视频生成统一多模态框架
本文介绍了 UniVidX 论文,该论文提出了一种利用扩散先验进行视频生成的统一多模态框架,并讨论了其跨模态一致性机制。
AVOC: 通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解
AVOC 提出了一种针对全模态大语言模型的检索启发的令牌压缩方法,通过基于相关性、重要性和多样性选择信息丰富的令牌,有效处理长达一小时的音视频输入。该框架在长时音视频理解基准测试中取得了最先进的结果,大幅超越了先前的方法。