原生视听对齐生成
摘要
NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。
查看缓存全文
缓存时间: 2026/05/29 03:00
论文页面 - 原生音视频对齐生成
来源:https://huggingface.co/papers/2605.30073
摘要
NAVA 通过原生音视频对齐和上下文条件去噪,实现了同步性和可控性更强的联合音视频生成。
联合音视频生成 (https://huggingface.co/papers?q=Joint%20audio-video%20generation) 旨在合成时间同步且语义连贯的视觉-听觉内容。然而,现有开源方法主要依赖于两种方案:要么采用后对齐的双塔设计 (https://huggingface.co/papers?q=dual-tower%20designs) (https://huggingface.co/papers?q=posterior%20alignment),要么采用完全统一的三种模态设计 (https://huggingface.co/papers?q=unified%20tri-modal%20designs),将文本上下文、音频和视频混合在同一个共享空间中。前者削弱了细粒度的音视频协同演化,而后者则将语义条件与低级同步耦合。为解决这些局限性,我们提出 NAVA,一个面向联合音视频生成 (https://huggingface.co/papers?q=joint%20audio-video%20generation) 的原生音视频对齐框架。NAVA 基于上下文条件的原生音视频对齐构建:首先在专用的交互空间中建立音视频对应关系,然后使用外部上下文来调节联合去噪过程。具体来说,NAVA 通过 Align-then-Fuse MMDiT 架构 (https://huggingface.co/papers?q=MMDiT%20architecture) 实例化,该架构从模态感知的音视频对齐过渡到模态共享的联合去噪。此外,我们引入了 Timbre-in-Context Conditioning (https://huggingface.co/papers?q=Timbre-in-Context%20Conditioning) 来将参考音色线索 (https://huggingface.co/papers?q=reference%20timbre%20cues) 与对应的语音片段相关联,实现可控的语音音色。在 Verse-Bench 和 Seed-TTS 上的实验以及一项用户研究表明,NAVA 仅使用 6.3B 参数即可实现卓越的视频质量、精确的音视频同步 (https://huggingface.co/papers?q=audio-visual%20synchronization)、具有竞争力的音频质量以及更强的参考音色可控性。
查看 arXiv 页面 (https://arxiv.org/abs/2605.30073)查看 PDF (https://arxiv.org/pdf/2605.30073)项目页面 (https://ernie-research.github.io/NAVA/)GitHub23 (https://github.com/ernie-research/NAVA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30073)
在你的 agent 中获取此论文:
hf papers read 2605\.30073
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型2
robingg1/NAVA Text-to-Video • 更新于约2小时前 • 23 • 5 (https://huggingface.co/robingg1/NAVA)
ernie-research/NAVA Text-to-Video • 更新于35分钟前 • 2 (https://huggingface.co/ernie-research/NAVA)
引用本文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.30073 以从此页面链接它。
引用本文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.30073 以从此页面链接它。
包含本文的收藏1
相似文章
LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估
LongAV-Compass是一个综合基准,用于评估分钟级音视频生成在文本、图像和视频条件模态下的表现,衡量长时间序列上的质量、一致性和对齐程度。
MSAVBench:迈向多镜头音视频生成的全面可靠评估
MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。
Geo-Align: 基于度量几何奖励的视频生成对齐
Geo-Align 提出了一个用于相机可控视频重新渲染的强化学习框架,通过尺度感知的感知奖励和用于相机轨迹提取的度量三维估计来提高泛化能力。
MVTrack4Gen:多视角点跟踪作为4D视频生成的几何监督
MVTrack4Gen提出了一种训练框架,利用多视角点跟踪作为几何监督来增强运动感知扩散模型,在从单目视频生成新视角视频中实现了最先进的几何一致性和运动保真度。
一种用于音频-视觉导航的混合Mamba架构
本文提出了Samba,一种用于音频-视觉导航的混合状态空间架构。它使用Mamba状态编码器(M-SE)替代GRU进行时间聚合,并构建了音频Mamba编码器(AME)以更好地捕捉频谱图中的全局时频依赖关系。在Matterport3D数据集上,导航成功率(SR)相比现有最先进模型提升了11.3%。