UniSpace:统一的视觉表示与可扩展的多模态建模

Hugging Face Daily Papers 论文

摘要

UniSpace引入了一种统一的视觉表示,通过使用重新参数化的ViT,在单一空间中统一了语义理解、高保真重建和图像生成,消除了对独立VAE的需求。

语义视觉编码器已成为图像生成中多模态理解和语义条件化的核心视觉接口。然而,它们的最终标记丢弃了细粒度的视觉细节,导致像素重建性能差,并限制了其在重建敏感任务(如图像生成和编辑)中的应用。在这项工作中,我们探讨是否可以在基于预训练语义ViT构建的单一视觉表示空间中建模理解、生成和编辑。我们表明,语义ViT的冻结Transformer模块并非本质上无法保留视觉细节。相反,原始的patch参数化使表示趋向语义抽象,使得细粒度信息难以从最终标记中恢复。基于这一观察,我们引入了Patch重参数化,它保留了原始的语义路径,同时添加了一个重建感知的patch嵌入,为相同的冻结ViT模块提供细粒度的视觉信息。由此产生的统一表示在保留多模态理解的同时,实现了高保真图像重建和有利的重建-生成权衡。我们进一步将此表示扩展为UniSpace,一个8B的Mixture-of-Transformer-Experts模型,在同一视觉空间中执行理解、生成和编辑,无需独立的VAE路径。系统级评估展示了实用的文本到图像生成和基于指令的图像编辑,表明重新参数化的预训练ViT可以作为可扩展多模态建模的统一视觉接口。
查看原文
查看缓存全文

缓存时间: 2026/08/24 12:29

论文页面 - UniSpace:统一视觉表征与可扩展多模态建模

来源:https://huggingface.co/papers/2608.08676 发布于8月9日

·

由https://huggingface.co/yjb6提交

yjb (https://huggingface.co/yjb6) 于8月24日

摘要

我们提出了一种经过重参数化的预训练视觉Transformer,可在单一视觉空间内统一实现语义理解、高保真重建与图像生成,无需依赖独立的VAE。

语义视觉编码器已成为多模态理解与图像生成中语义条件控制的核心视觉接口。然而,其最终输出的标记丢弃了细粒度视觉细节,导致像素级重建效果不佳,从而限制了其在图像生成、编辑等对重建敏感任务中的应用。本研究探讨:能否基于预训练的语义ViT构建单一视觉表征空间,统一建模理解、生成与编辑?我们发现,语义ViT中冻结的Transformer模块本身并非无法保留视觉细节,而是原有的块参数化方式促使表征偏向语义抽象,使得最终标记难以恢复细粒度信息。基于这一观察,我们引入了块重参数化技术,在保留原始语义通路的同时,增加了一个面向重建的块嵌入层,向相同的冻结ViT模块提供细粒度视觉信息。由此生成的统一表征在保持多模态理解能力的同时,实现了高保真图像重建,并取得了良好的重建-生成权衡。我们进一步将该表征扩展为UniSpace——一个基于8B参数混合Transformer专家模型,在同一视觉空间内执行理解、生成与编辑任务,无需独立的VAE通路。系统级评估表明,该模型在文本到图像生成和基于指令的图像编辑任务中表现优异,证明重参数化的预训练ViT可作为可扩展多模态建模的统一视觉接口

查看arXiv页面 (https://arxiv.org/abs/2608.08676)查看PDF (https://arxiv.org/pdf/2608.08676)项目主页 (https://yjb6.github.io/UniSpace/)GitHub5 (https://github.com/yjb6/UniSpace)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08676)

通过智能体获取论文:

hf papers read 2608\.08676

尚未安装最新版CLI?运行curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

yjb6/UniSpace (https://huggingface.co/yjb6/UniSpace)

引用本文的数据集0

暂无关联数据集

在数据集的README.md中引用arxiv.org/abs/2608.08676可将数据集链接至本页。

引用本文的应用空间0

暂无关联应用空间

在应用空间的README.md中引用arxiv.org/abs/2608.08676可将应用空间链接至本页。

包含本文的收藏0

暂无包含本文的收藏

将本文添加至收藏夹 (https://huggingface.co/new-collection)即可在本页建立链接。

相似文章

UniMesh:统一3D网格理解与生成

Hugging Face Daily Papers

UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。