AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers 论文

摘要

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

音视频生成近期获得了前所未有的研究关注,旨在合成高质量的带声视频内容,并在听觉与视觉组件之间实现精细同步与语义对齐。此前的方法主要采用双分支设计,为每种模态设置独立的标记化和生成模块,忽视了表示间隙,同时需要大量计算资源进行适当训练。受一维视觉标记化最新进展的启发,我们提出了AVTok,这是一种专为整体音视频生成而设计的新型统一标记器。AVTok采用基于双流Transformer的架构,具有共享编码器-解码器和模态特定可学习查询,能够高效且有效地将音视频对编码为带有统一码本的紧凑一维潜在表示。为应对阻碍AVTok利用对齐音视频信息的异构信息不平衡问题,我们设计了一种分层训练策略,逐步实现每种模态的重建能力。大量实验表明,AVTok在音视频重建以及集成到音频到视频、视频到音频和类条件联合音视频生成的下游管线中均表现出色。AVTok为联合音视频标记化的挑战铺平了道路,并为构建用于音视频生成的统一大型多模态模型提供了潜在方向。
查看原文
查看缓存全文

缓存时间: 2026/07/01 03:40

论文页面 - AVTok: 面向全息音频-视频生成的1D统一标记化

来源:https://huggingface.co/papers/2606.30811

摘要

AVTok 是一个用于音频-视频生成的统一标记器,采用双流 Transformer 架构,配备共享编码器-解码器和模态特定的可学习查询,以生成紧凑的一维潜在表示。

音频-视频生成(https://huggingface.co/papers?q=Audio-video%20generation)近期引起了前所未有的研究关注,旨在合成高质量的带声视频内容,并实现听觉与视觉组件之间的细粒度同步与语义对齐。先前方法主要采用双分支设计,为每种模态配备独立的标记化和生成模块,忽略了表示差距,同时需要大量计算资源才能进行适当训练。受一维视觉标记化最新进展的启发,我们提出了 AVTok——一种专为全息音频-视频生成(https://huggingface.co/papers?q=audio-video%20generation)而设计的新型统一标记器(https://huggingface.co/papers?q=unified%20tokenizer)。AVTok 采用基于双流 Transformer(https://huggingface.co/papers?q=dual-stream%20transformer)的架构,包含共享编码器-解码器(https://huggingface.co/papers?q=shared%20encoder-decoder)和模态特定的可学习查询(https://huggingface.co/papers?q=modal-specific%20learnable%20queries),以高效且有效地将音频-视频对编码为紧凑的一维潜在表示(https://huggingface.co/papers?q=one-dimensional%20latent%20representation),并使用统一的码本。为应对阻碍 AVTok 利用对齐音视频信息的异构信息不平衡问题,我们设计了一种分层训练策略(https://huggingface.co/papers?q=hierarchical%20training%20strategy),逐步实现各模态的重建能力。大量实验表明,AVTok 在音频-视频重建(https://huggingface.co/papers?q=audio-video%20reconstruction)以及集成到下游管线(https://huggingface.co/papers?q=downstream%20pipelines)用于音频到视频、视频到音频以及类别条件联合音频-视频生成(https://huggingface.co/papers?q=audio-video%20generation)方面均表现出色。AVTok 为联合音频-视频标记化这一挑战铺平了道路,并为构建用于音频-视频生成(https://huggingface.co/papers?q=audio-video%20generation)的统一大规模多模态模型(https://huggingface.co/papers?q=multimodal%20models)提供了潜在方向。

查看 arXiv 页面 (https://arxiv.org/abs/2606.30811)查看 PDF (https://arxiv.org/pdf/2606.30811)项目页面 (https://hkust-longgroup.github.io/AVTok)GitHub2 (https://github.com/hkust-longgroup/AVTok)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30811)

在您的代理中获取本文:

hf papers read 2606\.30811

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 (0)

没有模型引用此论文

在模型 README.md 中引用 arxiv.org/abs/2606.30811 以从本页面链接。

引用本文的数据集 (0)

没有数据集引用此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.30811 以从本页面链接。

引用本文的 Spaces (0)

没有 Space 引用此论文

在 Space README.md 中引用 arxiv.org/abs/2606.30811 以从本页面链接。

包含本文的收藏 (0)

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

基于时间冗余掩蔽和潜在修补的自适应令牌化 [R]

Reddit r/MachineLearning

本文提出了一种自适应视频令牌化方法,利用潜在空间中的时间冗余动态分配令牌,实现高效压缩,无需辅助网络。所提出的潜在修补变压器(Latent Inpainting Transformer)重建被丢弃的位置,相比ElasticTok-CV实现31倍加速,相比InfoTok实现2倍加速。