原生视听对齐生成

Hugging Face Daily Papers 论文

摘要

NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。

联合音频-视频生成旨在合成时间同步且语义一致的视觉-听觉内容。然而,现有的开源方法主要依赖两种方式:要么是带有后对齐的双塔设计,要么是完全统一的三模态设计,将文本上下文、音频和视频混合在同一共享空间中。前者削弱了细粒度的音频-视频协同进化,而后者则将语义条件与低级同步耦合在一起。为了解决这些限制,我们提出了 NAVA,一个用于联合音频-视频生成的原生视听对齐框架。NAVA 基于上下文条件的原生视听对齐:它首先在专门的交互空间中建立音频-视频对应关系,然后使用外部上下文来约束联合去噪过程。具体来说,NAVA 通过 Align-then-Fuse MMDiT 架构实现,该架构从模态感知的音频-视频对齐过渡到模态共享的联合去噪。此外,我们引入了 Timbre-in-Context Conditioning,将参考音色线索与相应的语音片段关联,以实现可控的语音音色。在 Verse-Bench 和 Seed-TTS 上的实验以及用户研究表明,NAVA 仅使用 6.3B 参数就实现了卓越的视频质量、精确的视听同步、有竞争力的音频质量和更强的参考音色可控性。
查看原文
查看缓存全文

缓存时间: 2026/05/29 03:00

论文页面 - 原生音视频对齐生成

来源:https://huggingface.co/papers/2605.30073

摘要

NAVA 通过原生音视频对齐和上下文条件去噪,实现了同步性和可控性更强的联合音视频生成。

联合音视频生成 (https://huggingface.co/papers?q=Joint%20audio-video%20generation) 旨在合成时间同步且语义连贯的视觉-听觉内容。然而,现有开源方法主要依赖于两种方案:要么采用后对齐的双塔设计 (https://huggingface.co/papers?q=dual-tower%20designs) (https://huggingface.co/papers?q=posterior%20alignment),要么采用完全统一的三种模态设计 (https://huggingface.co/papers?q=unified%20tri-modal%20designs),将文本上下文、音频和视频混合在同一个共享空间中。前者削弱了细粒度的音视频协同演化,而后者则将语义条件与低级同步耦合。为解决这些局限性,我们提出 NAVA,一个面向联合音视频生成 (https://huggingface.co/papers?q=joint%20audio-video%20generation) 的原生音视频对齐框架。NAVA 基于上下文条件的原生音视频对齐构建:首先在专用的交互空间中建立音视频对应关系,然后使用外部上下文来调节联合去噪过程。具体来说,NAVA 通过 Align-then-Fuse MMDiT 架构 (https://huggingface.co/papers?q=MMDiT%20architecture) 实例化,该架构从模态感知的音视频对齐过渡到模态共享的联合去噪。此外,我们引入了 Timbre-in-Context Conditioning (https://huggingface.co/papers?q=Timbre-in-Context%20Conditioning) 来将参考音色线索 (https://huggingface.co/papers?q=reference%20timbre%20cues) 与对应的语音片段相关联,实现可控的语音音色。在 Verse-Bench 和 Seed-TTS 上的实验以及一项用户研究表明,NAVA 仅使用 6.3B 参数即可实现卓越的视频质量、精确的音视频同步 (https://huggingface.co/papers?q=audio-visual%20synchronization)、具有竞争力的音频质量以及更强的参考音色可控性。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30073)查看 PDF (https://arxiv.org/pdf/2605.30073)项目页面 (https://ernie-research.github.io/NAVA/)GitHub23 (https://github.com/ernie-research/NAVA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30073)

在你的 agent 中获取此论文:

hf papers read 2605\.30073

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型2

robingg1/NAVA Text-to-Video • 更新于约2小时前 • 23 • 5 (https://huggingface.co/robingg1/NAVA)

ernie-research/NAVA Text-to-Video • 更新于35分钟前 • 2 (https://huggingface.co/ernie-research/NAVA)

引用本文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.30073 以从此页面链接它。

引用本文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.30073 以从此页面链接它。

包含本文的收藏1

相似文章

一种用于音频-视觉导航的混合Mamba架构

arXiv cs.LG

本文提出了Samba,一种用于音频-视觉导航的混合状态空间架构。它使用Mamba状态编码器(M-SE)替代GRU进行时间聚合,并构建了音频Mamba编码器(AME)以更好地捕捉频谱图中的全局时频依赖关系。在Matterport3D数据集上,导航成功率(SR)相比现有最先进模型提升了11.3%。