统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键

Hugging Face Daily Papers 论文

摘要

UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。

统一多模态建模旨在将视觉理解和生成整合到单一系统中。然而,现有方法通常依赖两个不同的视觉分词器,这分裂了表示空间,阻碍了真正的统一建模。我们提出UniAR,一种统一的自回归框架,其中单个离散视觉分词器作为理解与生成之间的关键桥梁,使得模型能够直接解释自身生成的视觉标记,而无需额外的重新编码。UniAR适配了预训练的视觉编码器,采用多级特征融合和无查找的逐位量化方案,在保留高级语义和低级细节的同时,以最小代价扩展有效的视觉词汇量。在此基础上,统一自回归模型采用并行逐位预测来联合预测空间分组的多级视觉编码,大幅减少视觉序列长度并加速生成。最后,基于扩散的视觉解码器对离散视觉标记进行操作,解码出高保真图像。通过大规模预训练,然后进行监督微调和强化学习,UniAR在图像生成和图像编辑方面取得了最先进的性能,同时在多模态理解基准上保持竞争力。项目页面见 https://sharelab-sii.github.io/uniar-web。
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:36

论文页面 - 统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键

来源:https://huggingface.co/papers/2606.18249

摘要

UniAR 提出了一种统一的自回归框架,该框架使用单个离散视觉分词器来桥接视觉理解与生成,通过多级特征融合、按位量化和并行预测,在图像生成和编辑方面取得了最先进的成果。

统一多模态建模旨在将视觉理解与生成集成到单个系统中。然而,现有方法通常依赖于两个不同的视觉分词器,这会分割表示空间并阻碍真正的统一建模。我们提出 UniAR,这是一种统一的自回归框架 (https://huggingface.co/papers?q=unified%20autoregressive%20framework),其中单个离散视觉分词器 (https://huggingface.co/papers?q=discrete%20visual%20tokenizer) 充当理解与生成之间的关键桥梁,实现了共享上下文,使模型能够直接解释自己生成的视觉分词,无需额外的重新编码。UniAR 对预训练的视觉编码器进行了适配,采用了多级特征融合 (https://huggingface.co/papers?q=multi-level%20feature%20fusion) 和无查找按位量化 (https://huggingface.co/papers?q=lookup-free%20bitwise%20quantization) 方案,在保留高层语义和低层细节的同时,以极小的成本扩展有效视觉词汇量。在此基础上,统一自回归模型采用并行按位预测 (https://huggingface.co/papers?q=parallel-bitwise-prediction) 来联合预测空间分组的多级视觉编码,显著减少了视觉序列长度 (https://huggingface.co/papers?q=visual%20sequence%20length) 并加速了生成。最后,基于扩散的视觉解码器 (https://huggingface.co/papers?q=diffusion-based%20visual%20decoder) 对离散视觉分词进行操作,解码出高保真图像。通过大规模预训练,继之以监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning) 和强化学习 (https://huggingface.co/papers?q=reinforcement%20learning),UniAR 在图像生成和图像编辑方面达到了最先进的性能,同时在多模态理解基准上保持竞争力。项目页面见 https://sharelab-sii.github.io/uniar-web/。

查看 arXiv 页面 (https://arxiv.org/abs/2606.18249) 查看 PDF (https://arxiv.org/pdf/2606.18249) 项目页面 (https://sharelab-sii.github.io/uniar-web/) GitHub2 (https://github.com/ShareLab-SII/UniAR) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.18249)

引用本文的模型(2个)

ShareLab-SII/UniAR-RL 图像到文本 • 10B • 更新于约2小时前 (https://huggingface.co/ShareLab-SII/UniAR-RL)

ShareLab-SII/UniAR-SFT 图像到文本 • 10B • 更新于约2小时前 (https://huggingface.co/ShareLab-SII/UniAR-SFT)

引用本文的数据集(0个)

暂无数据集链接到此论文

请在一个数据集的 README.md 中引用 arxiv.org/abs/2606.18249 以将其链接至此页面。

引用本文的 Spaces(0个)

暂无 Space 链接到此论文

请在一个 Space 的 README.md 中引用 arxiv.org/abs/2606.18249 以将其链接至此页面。

包含此论文的收藏集(0个)

暂无收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以将其链接至此页面。

相似文章

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。