HYDRA-X: 原生统一多模态模型与整体视觉分词器
摘要
HYDRA-X 提出了一种统一的多模态模型,将图像和视频分词集成到单个视觉变换器中,在理解和生成任务上均取得了强劲性能。
查看缓存全文
缓存时间: 2026/06/12 10:52
论文页面 - HYDRA-X: 原生统一多模态模型与全息视觉分词器
来源:https://huggingface.co/papers/2606.13289 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
HYDRA-X 提出了一种统一多模态模型,该模型在单个 Vision Transformer 内集成了图像和视频分词,通过因果时序注意力和层次化压缩解决了时空重建与语义感知问题。
全息视觉分词器 (https://huggingface.co/papers?q=visual%20tokenizers) 是统一多模态模型 (https://huggingface.co/papers?q=unified%20multimodal%20models) (UMMs) 的基础,因为它们将多样化的视觉输入映射到统一的表示空间。在本文中,我们提出了 HYDRA-X,这是第一个在单个 Vision Transformer (https://huggingface.co/papers?q=Vision%20Transformer) (ViT) 内统一图像和视频分词的 UMM。我们的设计由两个核心挑战驱动:高效地将时空重建 (https://huggingface.co/papers?q=spatiotemporal%20reconstruction) 能力注入原生 ViT,以及将图像和视频级别的语义感知嵌入到潜在空间 (https://huggingface.co/papers?q=latent%20space) 中。针对第一个挑战,全面的消融实验揭示了两项关键发现:(1) 帧级因果时序注意力 (https://huggingface.co/papers?q=causal%20temporal%20attention) 足以用于视觉重建,而全面的时空注意力反而会降低效果;(2) 层次化时序压缩 (https://huggingface.co/papers?q=hierarchical%20temporal%20compression) 显著优于单步替代方案。针对第二个挑战,我们提出了一种轻量级解压器 (https://huggingface.co/papers?q=decompressor),在联合图像-视频教师监督 (https://huggingface.co/papers?q=teacher%20supervision) 下对时序压缩后的特征进行上采样,从而在紧凑的潜在空间 (https://huggingface.co/papers?q=latent%20space) 内强制实现互补的语义结构。基于这一全息分词器,我们进一步提出了编辑流程的一项原则性改进:源-目标交互应当在分词器内部的潜在层面进行,而非在 LLM 内部的语义层面进行,从而显著提升编辑一致性并加速收敛。在 7B 密集模型上的实例化实验中,HYDRA-X 在图像和视频理解及生成任务上均取得了强劲性能,为未来基于统一分词器的 UMM 铺平了道路。
查看 arXiv 页面 (https://arxiv.org/abs/2606.13289)查看 PDF (https://arxiv.org/pdf/2606.13289)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.13289)
在您的 agent 中获取此论文:
hf papers read 2606.13289
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.13289 可从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.13289 可从此页面链接。
引用此论文的 Spaces0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.13289 可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 可从此页面链接。
相似文章
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
研究图像分词器作为统一多模态模型中的视觉语言
本文使用受控的自回归测试平台,分析了图像分词器设计如何影响多模态模型中的联合文本-图像建模,揭示了不同的扩展行为及其与下游性能的相关性。
ReToken:一个Token提升视觉语言模型的视觉检索能力
ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。
EVA01:通过混合变换器实现统一原生3D理解与生成
EVA01是一个统一框架,通过混合变换器架构将3D网格作为原生模态集成到多模态语言模型中,实现了先进的文本到3D生成以及长上下文多轮几何编辑。
AVTok: 面向整体音视频生成的一维统一标记化
AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。