HYDRA-X: 原生统一多模态模型与整体视觉分词器

Hugging Face Daily Papers 论文

摘要

HYDRA-X 提出了一种统一的多模态模型,将图像和视频分词集成到单个视觉变换器中,在理解和生成任务上均取得了强劲性能。

整体视觉分词器是统一多模态模型(UMM)的基础,因为它们将多样化的视觉输入映射到统一的表示空间。在本文中,我们提出了 HYDRA-X,这是首个在单个视觉变换器(ViT)中统一图像和视频分词的 UMM。我们的设计基于两个核心挑战:高效地为原生 ViT 注入时空重建能力,以及将图像级和视频级的语义意识嵌入到潜在空间中。为解决第一个挑战,全面的消融实验揭示了两项关键发现:(1)帧级因果时间注意力足以进行视觉重建,而完整时空注意力会降低其性能;(2)分层时间压缩显著优于单步替代方案。为解决第二个挑战,我们提出了一种轻量化解压缩器,在联合图像-视频教师监督下对时间压缩特征进行上采样,从而在紧凑的潜在空间中强制执行互补的语义结构。基于这种整体分词器,我们进一步提出了对编辑流水线的原则性改进:源-目标交互应在分词器内部的潜在层级进行,而非在 LLM 内部的语义层级,这显著提高了编辑一致性并加速了收敛。在 7B 密集模型上实例化后,HYDRA-X 在图像和视频理解与生成任务上均取得了强劲性能,为未来的统一分词器 UMM 铺平了道路。
查看原文
查看缓存全文

缓存时间: 2026/06/12 10:52

论文页面 - HYDRA-X: 原生统一多模态模型与全息视觉分词器

来源:https://huggingface.co/papers/2606.13289 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

HYDRA-X 提出了一种统一多模态模型,该模型在单个 Vision Transformer 内集成了图像和视频分词,通过因果时序注意力和层次化压缩解决了时空重建与语义感知问题。

全息视觉分词器 (https://huggingface.co/papers?q=visual%20tokenizers) 是统一多模态模型 (https://huggingface.co/papers?q=unified%20multimodal%20models) (UMMs) 的基础,因为它们将多样化的视觉输入映射到统一的表示空间。在本文中,我们提出了 HYDRA-X,这是第一个在单个 Vision Transformer (https://huggingface.co/papers?q=Vision%20Transformer) (ViT) 内统一图像和视频分词的 UMM。我们的设计由两个核心挑战驱动:高效地将时空重建 (https://huggingface.co/papers?q=spatiotemporal%20reconstruction) 能力注入原生 ViT,以及将图像和视频级别的语义感知嵌入到潜在空间 (https://huggingface.co/papers?q=latent%20space) 中。针对第一个挑战,全面的消融实验揭示了两项关键发现:(1) 帧级因果时序注意力 (https://huggingface.co/papers?q=causal%20temporal%20attention) 足以用于视觉重建,而全面的时空注意力反而会降低效果;(2) 层次化时序压缩 (https://huggingface.co/papers?q=hierarchical%20temporal%20compression) 显著优于单步替代方案。针对第二个挑战,我们提出了一种轻量级解压器 (https://huggingface.co/papers?q=decompressor),在联合图像-视频教师监督 (https://huggingface.co/papers?q=teacher%20supervision) 下对时序压缩后的特征进行上采样,从而在紧凑的潜在空间 (https://huggingface.co/papers?q=latent%20space) 内强制实现互补的语义结构。基于这一全息分词器,我们进一步提出了编辑流程的一项原则性改进:源-目标交互应当在分词器内部的潜在层面进行,而非在 LLM 内部的语义层面进行,从而显著提升编辑一致性并加速收敛。在 7B 密集模型上的实例化实验中,HYDRA-X 在图像和视频理解及生成任务上均取得了强劲性能,为未来基于统一分词器的 UMM 铺平了道路。

查看 arXiv 页面 (https://arxiv.org/abs/2606.13289)查看 PDF (https://arxiv.org/pdf/2606.13289)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13289)

在您的 agent 中获取此论文:

hf papers read 2606.13289

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.13289 可从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.13289 可从此页面链接。

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.13289 可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 可从此页面链接。

相似文章

ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。