面向主体驱动生成的多模态大语言模型能力挖掘

Hugging Face Daily Papers 论文

摘要

本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。

主体驱动图像生成旨在合成新图像,在遵循文本指令的同时保持给定主体的身份。现有方法通常将文本和参考图像分别编码。这限制了跨模态推理能力,并导致复制粘贴伪影。最近连接多模态模型和扩散模型的框架改善了指令遵循能力,但很大程度上忽略了身份保持。为解决这些限制,我们以多模态大语言模型(MLLMs)为条件来训练扩散模型,该模型联合编码文本和参考图像,并增加基于VAE的身份条件化。设计了一种新颖的双层聚合(DLA)模块,用于聚合多级MLLM特征以实现最优条件化,并在推理过程中采用多阶段去噪策略逐步平衡来自MLLM的语义信息和来自VAE的精细身份细节。大量实验表明,我们的方法协调了多模态理解与身份保持,减轻了复制粘贴问题,并在主体驱动图像生成中实现了更优的人类偏好性能。我们的项目网站位于https://zsh2000.github.io/squeeze-mllm-subject-gen/。
查看原文
查看缓存全文

缓存时间: 2026/05/27 02:47

论文页面 - 从多模态大语言模型中榨取能力用于主题驱动生成

来源:https://huggingface.co/papers/2605.26111

摘要

一种新颖方法将扩散模型与多模态大语言模型相结合,用于主题驱动图像生成,它将文本和参考图像编码与基于VAE的身份条件相结合,以同时提升语义理解与身份保持能力。

主题驱动图像生成旨在合成保留给定主题身份同时遵循文本指令的新图像。现有方法通常分别对文本和参考图像进行编码,这限制了跨模态推理能力并导致复制粘贴伪影。近期将多模态模型与扩散模型连接的框架改进了指令遵循能力,但很大程度上忽视了身份保持。为解决这些局限,我们将扩散模型条件设定在多模态大语言模型上,该模型联合编码文本和参考图像,并辅以基于VAE的身份条件约束。我们设计了一种新颖的双层聚合模块,用于聚合多级MLLM特征以实现最优条件设定,并在推理过程中应用多阶段去噪策略,逐步平衡来自MLLM的语义信息与来自VAE的精细身份细节。大量实验表明,我们的方法协调了多模态理解与身份保持,缓解了复制粘贴问题,并在主题驱动图像生成中取得了符合人类偏好的卓越性能。我们的项目网站位于 https://zsh2000.github.io/squeeze-mllm-subject-gen/。

查看 arXiv 页面(https://arxiv.org/abs/2605.26111) 查看 PDF(https://arxiv.org/pdf/2605.26111) 项目页面(https://zsh2000.github.io/squeeze-mllm-subject-gen/) 添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26111)

在您的代理中获取此论文:

hf papers read 2605.26111

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.26111 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.26111 以从此页面链接。

引用此论文的 Spaces 0

无Space链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.26111 以从此页面链接。

包含此论文的收藏集 0

无收藏集包含此论文

请将此论文添加至收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

逐令牌关注多模态生成

Hugging Face Daily Papers

本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。