面向主体驱动生成的多模态大语言模型能力挖掘
摘要
本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。
查看缓存全文
缓存时间: 2026/05/27 02:47
论文页面 - 从多模态大语言模型中榨取能力用于主题驱动生成
来源:https://huggingface.co/papers/2605.26111
摘要
一种新颖方法将扩散模型与多模态大语言模型相结合,用于主题驱动图像生成,它将文本和参考图像编码与基于VAE的身份条件相结合,以同时提升语义理解与身份保持能力。
主题驱动图像生成旨在合成保留给定主题身份同时遵循文本指令的新图像。现有方法通常分别对文本和参考图像进行编码,这限制了跨模态推理能力并导致复制粘贴伪影。近期将多模态模型与扩散模型连接的框架改进了指令遵循能力,但很大程度上忽视了身份保持。为解决这些局限,我们将扩散模型条件设定在多模态大语言模型上,该模型联合编码文本和参考图像,并辅以基于VAE的身份条件约束。我们设计了一种新颖的双层聚合模块,用于聚合多级MLLM特征以实现最优条件设定,并在推理过程中应用多阶段去噪策略,逐步平衡来自MLLM的语义信息与来自VAE的精细身份细节。大量实验表明,我们的方法协调了多模态理解与身份保持,缓解了复制粘贴问题,并在主题驱动图像生成中取得了符合人类偏好的卓越性能。我们的项目网站位于 https://zsh2000.github.io/squeeze-mllm-subject-gen/。
查看 arXiv 页面(https://arxiv.org/abs/2605.26111) 查看 PDF(https://arxiv.org/pdf/2605.26111) 项目页面(https://zsh2000.github.io/squeeze-mllm-subject-gen/) 添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26111)
在您的代理中获取此论文:
hf papers read 2605.26111
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.26111 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.26111 以从此页面链接。
引用此论文的 Spaces 0
无Space链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.26111 以从此页面链接。
包含此论文的收藏集 0
无收藏集包含此论文
请将此论文添加至收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
更快但不同:加速多模态扩散语言模型中内容漂移的诊断与控制
本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。
MMCORE:多模态连接与表征对齐的潜在嵌入
MMCORE 提出一个统一的多模态图像生成与编辑框架,将 VLM 语义嵌入与扩散条件对齐,无需昂贵融合或从零训练即可实现顶尖保真度。
Semantic DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型
本文从偏差-方差角度对扩散语言模型进行了理论分析,识别了掩码扩散与均匀扩散核之间的权衡。提出了SemDLM+,通过添加全局转移和语义频率惩罚来克服语义盆地问题,在LM1B和OpenWebText基准上实现了有竞争力的生成质量。
逐令牌关注多模态生成
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。