KVAE:用于多模态生成模型的系列分词器

Hugging Face Daily Papers 论文

摘要

本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。

潜在扩散建模(LDM)是一种重要的范式,它利用分词器将输入信号映射为压缩表示。这种依赖关系使分词器成为生成过程本身不可或缺的一部分,因为它影响学习速度、合成样本的质量,并为后续应用奠定基础。本报告介绍了KVAE系列分词器,涵盖音频、图像和视频,均设计用于后续的文本条件生成:KVAE-Audio,一个连续的48 kHz全频带分词器,具有50 Hz潜变量和64个通道;KVAE-3D —— 两个因果视频分词器,分别实现4x16x16和4x8x8压缩;KVAE-2D,一个图像模型,以32个通道将输入压缩8倍。我们证明,在重建(PSNR、LPIPS、PESQ等)和生成结果的客观指标(Frechet Distance、CLIP score、CLAP score等)以及主观指标(并排评估)上,我们的方法均达到或超越了前沿开源分词器,例如来自Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio和MMAudio的VAE。考虑到开发难度,我们向社区分享了训练细节、模型选择方法和设计选择的消融实验。代码公开于 https://github.com/kandinskylab/kvae 和 https://github.com/kandinskylab/kvae-audio。
查看原文
查看缓存全文

缓存时间: 2026/08/07 21:59

论文页面 - KVAE:多模态生成模型的 Tokenizer 系列

来源:https://huggingface.co/papers/2608.05798 作者:

,

,

,

,

,

,

,

,

,

摘要

潜在扩散建模(LDM)是一种重要范式,它利用 tokenizer 将输入信号映射到压缩表示。这种依赖关系使 tokenizer 成为生成过程本身不可或缺的一部分,因为它影响学习速度、合成样本的质量,并为后续应用奠定基础。本报告介绍了用于音频、图像和视频的系列 KVAE tokenizer,所有设计均服务于后续的文本条件生成:KVAE-Audio,一个连续的全频段 48kHz tokenizer,具有 64 通道的 50Hz 潜在表示;KVAE-3D——两个用于 4x16x16 和 4x8x8 压缩的因果视频 tokenizer;KVAE-2D,一个图像模型,以 32 个通道将输入压缩 8 倍。我们证明,在重建(PSNR、LPIPS、PESQ 等)和生成的客观指标(Frechet Distance、CLIP score、CLAP score 等)以及主观(并排评估)指标上,其结果匹配或超越了前沿开源 tokenizer,如 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio 和 MMAudio 中的 VAE。考虑到开发难度,我们与社区分享了训练细节、模型选择方法以及设计选择的消融实验。代码公开于 https://github.com/kandinskylab/kvae 和 https://github.com/kandinskylab/kvae-audio。

查看 arXiv 页面 (https://arxiv.org/abs/2608.05798) 查看 PDF (https://arxiv.org/pdf/2608.05798) GitHub48 (https://github.com/kandinskylab/kvae) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05798)

在你的 agent 中获取此论文:

hf papers read 2608\.05798

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 2

kandinskylab/KVAE-3D-2.0-t4s16 其他 • 2B • 更新于约 7 小时前 • 65 • 11 (https://huggingface.co/kandinskylab/KVAE-3D-2.0-t4s16)

kandinskylab/KVAE-3D-2.0-t4s8 其他 • 0.6B • 更新于约 7 小时前 • 10 • 9 (https://huggingface.co/kandinskylab/KVAE-3D-2.0-t4s8)

引用此论文的数据集

相似文章

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

星系的分词器指南:科学基础模型的基准测试

Hugging Face Daily Papers

本文在统一的transformer框架内,比较了四种分词方法(Affine、AIM、JetFormer、VQ-VAE)用于天文图像,使用64万张星系图像评估重构质量、物理属性预测和形态保持能力。研究发现,没有单一方法在所有任务中表现最佳,突显了表示学习中的权衡。

Vokenization:面向视觉与语言的多模态学习

ML at Berkeley

本文介绍了“Vokenization”,这是一种多模态学习技术,通过利用弱监督将视觉数据与语言标记联系起来,从而架起计算机视觉与自然语言处理之间的桥梁。文章将其与 GPT-3 和 BERT 等纯文本模型进行了对比,强调了视觉定位如何提升语言理解能力。