统一多模态模型的语义生成微调
摘要
介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。
查看缓存全文
缓存时间: 2026/05/20 06:37
论文页面 - 统一多模态模型的语义生成调优
来源:https://huggingface.co/papers/2605.18714 image (https://cdn-uploads.huggingface.co/production/uploads/664da5a094234f3c17df8d3b/Gk_1EKgjEhPR36Cqv6HzG.png) 统一多模态模型 (UMMs) 力求在单一架构中整合视觉理解与视觉生成。然而,当前的主流训练范式通过稀疏文本信号独立优化理解能力,再通过密集像素目标独立优化生成能力。这种解耦策略导致表征空间不对齐,使得视觉理解与生成相互孤立,阻碍了二者的相互增强。
本文首次系统性地探索生成式后训练,将层次化的视觉任务表述为生成代理,以弥合 UMMs 中的隔离状态。我们的实证研究表明,高层次语义任务——尤其是图像分割——是最优的代理。与低层任务(会因纹理细节分散模型注意力)不同,分割提供结构化的语义信息,既能显著增强以视觉为中心的感知能力,又能提升生成布局的保真度。
基于以上发现,我们提出语义生成调优 (SGT),一种利用分割作为生成代理来对齐和协同多模态能力的新范式。大量评估表明,SGT 能持续提升多模态理解能力与生成保真度。
相似文章
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
在原生统一多模态模型中揭示理解-生成协同:从表示、任务到系统
本文探讨了统一多模态模型中视觉理解与生成之间的协同效应,表明任务解耦架构和端到端优化可以通过将共存转化为协同来提升性能。
Semantic Browsing: 图像生成中的可控多样性
Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。
生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。