统一多模态模型的语义生成微调

Hugging Face Daily Papers 论文

摘要

介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。

统一多模态模型(UMM)致力于在单一架构中整合视觉理解与视觉生成。然而,当前的训练范式通过稀疏文本信号独立优化理解能力,并通过密集像素目标独立优化生成能力。这种解耦策略导致表示空间错位,使得视觉理解与生成相互隔离,阻碍了二者的协同增强。本文首次系统性地研究了生成式后训练,将分层视觉任务构建为生成代理,以弥合UMM中的隔离。我们的实证研究发现,高层语义任务,特别是图像分割,是最佳代理。与低层任务(会因纹理细节分散模型注意力)不同,分割提供了结构语义,显著增强了以视觉为中心的感知和生成布局的保真度。基于这些发现,我们提出了语义生成微调(SGT),一种利用分割作为生成代理来对齐和协同多模态能力的新范式。机制分析进一步表明,SGT从根本上改善了特征线性可分性,并优化了视觉-文本注意力分配模式。大量评估显示,SGT在主流基准测试上一致提升了多模态理解与生成保真度。我们的代码可在 https://song2yu.github.io/SGT/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/20 06:37

论文页面 - 统一多模态模型的语义生成调优

来源:https://huggingface.co/papers/2605.18714 image (https://cdn-uploads.huggingface.co/production/uploads/664da5a094234f3c17df8d3b/Gk_1EKgjEhPR36Cqv6HzG.png) 统一多模态模型 (UMMs) 力求在单一架构中整合视觉理解与视觉生成。然而,当前的主流训练范式通过稀疏文本信号独立优化理解能力,再通过密集像素目标独立优化生成能力。这种解耦策略导致表征空间不对齐,使得视觉理解与生成相互孤立,阻碍了二者的相互增强。

本文首次系统性地探索生成式后训练,将层次化的视觉任务表述为生成代理,以弥合 UMMs 中的隔离状态。我们的实证研究表明,高层次语义任务——尤其是图像分割——是最优的代理。与低层任务(会因纹理细节分散模型注意力)不同,分割提供结构化的语义信息,既能显著增强以视觉为中心的感知能力,又能提升生成布局的保真度。

基于以上发现,我们提出语义生成调优 (SGT),一种利用分割作为生成代理来对齐和协同多模态能力的新范式。大量评估表明,SGT 能持续提升多模态理解能力与生成保真度。

相似文章

Semantic Browsing: 图像生成中的可控多样性

Hugging Face Daily Papers

Semantic Browsing 引入了一种方法,通过使用一个 Vision Language Model 和代理工作流,在文本到图像生成中实现基于语义决策的结构化、可解释的可控多样性。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。