在推理时将图像指导注入文本条件扩散模型

Hugging Face Daily Papers 论文

摘要

视觉概念融合(VCF)使得扩散模型在推理时能够同时以图像和文本提示作为条件,无需重新训练,通过轻量级对齐器和融合策略实现。

诸如Stable Diffusion等文本到图像扩散模型可从文本生成高质量图像,但缺乏在推理时无需重新训练即可注入视觉指导(如草图、风格)的方法。现有方法要么需要计算昂贵的微调,要么依赖风格迁移技术,这存在与文本提示语义不对齐的风险。我们提出视觉概念融合(VCF),这是首个在推理时无需任何概念特定训练即可同时以图像和文本提示作为条件的方法。VCF通过将CLIP图像特征与文本嵌入空间对齐,实现向Stable Diffusion中注入视觉概念。VCF包含三个组件:(1)一个轻量级对齐器,使用InfoNCE和交叉注意力重建损失将图像令牌映射到文本嵌入流形;(2)一个保留文本和视觉语义的融合策略;(3)一个可选的提示-噪声优化(PNO)模块,用于测试时优化。实验表明,VCF成功地从参考图像转移了风格、构图和调色板等视觉属性,同时保持了对提示的遵循。定量结果显示文本对齐(CLIP分数)与视觉对应性(LPIPS)之间存在权衡,VCF在参考保真度方面优于基线。
查看原文
查看缓存全文

缓存时间: 2026/05/26 14:44

论文页面 - 在推理时将图像引导注入文本条件扩散模型

来源:https://huggingface.co/papers/2605.25191

摘要

视觉概念融合通过特征对齐与融合策略,实现了扩散模型中的文本与图像双条件控制,且无需重新训练。

文本到图像扩散模型(如Stable Diffusion)可从文本生成高质量图像,但缺乏在推理时无需重训练即可注入视觉引导(如草图、风格)的能力。现有方法要么需要计算昂贵的微调,要么依赖可能因风格迁移技术而导致与文本提示语义失配的方法。我们提出视觉概念融合(VCF),这是首个在推理时无需任何概念特定训练即可实现对图像和文本提示双重条件控制的方法。VCF通过将CLIP图像特征与文本嵌入空间对齐,实现了向Stable Diffusion中注入视觉概念。VCF包含三个组件:(1) 轻量级对齐器,利用InfoNCE和交叉注意力重建损失将图像令牌映射到文本嵌入流形;(2) 融合策略,保留文本和视觉语义;(3) 可选的提示-噪声优化(PNO)模块,用于测试时精炼。实验表明,VCF能成功从参考图像传递风格、构图和调色板等视觉属性,同时保持对提示的忠实度。定量结果展示了文本对齐(CLIP分数)与视觉对应(LPIPS)之间的权衡,VCF在参考保真度方面优于基线方法。

查看 arXiv 页面(https://arxiv.org/abs/2605.25191)查看 PDF(https://arxiv.org/pdf/2605.25191)GitHub0(https://github.com/thijmennijdam/stable-diffusion-v2)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.25191)

在您的代理中获取此论文:

hf papers read 2605\.25191

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.25191 以从本页链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.25191 以从本页链接。

引用此论文的Spaces0

没有Space链接此论文

请在Space README.md 中引用 arxiv.org/abs/2605.25191 以从本页链接。

包含此论文的收藏集0

没有包含此论文的收藏集

请将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接。

相似文章

基于概念的扩散模型反事实视觉解释

arXiv cs.AI

介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。

使用概念图在T2I扩散模型中的高效偏见缓解

arXiv cs.AI

该论文介绍了CO-ALIGN,一种用于文本到图像扩散模型的偏见缓解方法,它在文本编码器和去噪器中对齐概念图,实现了30%的公平性提升和11.4的FID增益,同时减少了88%的不连贯输出。

视觉生成中文本条件化的缩放特性

Hugging Face Daily Papers

本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。

使用CLIP潜在表示的分层文本条件图像生成

OpenAI Blog

OpenAI提出了一个使用CLIP潜在表示进行文本条件图像生成的分层两阶段模型:一个先验模型从文本标题生成CLIP图像嵌入,以及一个基于扩散的解码器从嵌入生成图像。该方法提高了图像多样性,并实现了零样本语言引导图像操作。