UniSpace:统一的视觉表示与可扩展的多模态建模
摘要
UniSpace引入了一种统一的视觉表示,通过使用重新参数化的ViT,在单一空间中统一了语义理解、高保真重建和图像生成,消除了对独立VAE的需求。
查看缓存全文
缓存时间: 2026/08/24 12:29
论文页面 - UniSpace:统一视觉表征与可扩展多模态建模
来源:https://huggingface.co/papers/2608.08676 发布于8月9日
·
由https://huggingface.co/yjb6提交
yjb (https://huggingface.co/yjb6) 于8月24日
摘要
我们提出了一种经过重参数化的预训练视觉Transformer,可在单一视觉空间内统一实现语义理解、高保真重建与图像生成,无需依赖独立的VAE。
语义视觉编码器已成为多模态理解与图像生成中语义条件控制的核心视觉接口。然而,其最终输出的标记丢弃了细粒度视觉细节,导致像素级重建效果不佳,从而限制了其在图像生成、编辑等对重建敏感任务中的应用。本研究探讨:能否基于预训练的语义ViT构建单一视觉表征空间,统一建模理解、生成与编辑?我们发现,语义ViT中冻结的Transformer模块本身并非无法保留视觉细节,而是原有的块参数化方式促使表征偏向语义抽象,使得最终标记难以恢复细粒度信息。基于这一观察,我们引入了块重参数化技术,在保留原始语义通路的同时,增加了一个面向重建的块嵌入层,向相同的冻结ViT模块提供细粒度视觉信息。由此生成的统一表征在保持多模态理解能力的同时,实现了高保真图像重建,并取得了良好的重建-生成权衡。我们进一步将该表征扩展为UniSpace——一个基于8B参数混合Transformer专家模型,在同一视觉空间内执行理解、生成与编辑任务,无需独立的VAE通路。系统级评估表明,该模型在文本到图像生成和基于指令的图像编辑任务中表现优异,证明重参数化的预训练ViT可作为可扩展多模态建模的统一视觉接口。
查看arXiv页面 (https://arxiv.org/abs/2608.08676)查看PDF (https://arxiv.org/pdf/2608.08676)项目主页 (https://yjb6.github.io/UniSpace/)GitHub5 (https://github.com/yjb6/UniSpace)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08676)
通过智能体获取论文:
hf papers read 2608\.08676
尚未安装最新版CLI?运行curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
yjb6/UniSpace (https://huggingface.co/yjb6/UniSpace)
引用本文的数据集0
暂无关联数据集
在数据集的README.md中引用arxiv.org/abs/2608.08676可将数据集链接至本页。
引用本文的应用空间0
暂无关联应用空间
在应用空间的README.md中引用arxiv.org/abs/2608.08676可将应用空间链接至本页。
包含本文的收藏0
暂无包含本文的收藏
将本文添加至收藏夹 (https://huggingface.co/new-collection)即可在本页建立链接。
相似文章
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
UniWorld-View:基于视频扩散模型的大基线视图合成
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
UniVR:在视觉空间中思考以实现统一视觉推理
UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。
UniMesh:统一3D网格理解与生成
UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。