扩散变换器的质量感知调制
摘要
提出质量表示模块(QRM),一种轻量级Transformer模块,将质量感知信号注入扩散变换器调制中,以改善图像保真度和提示对齐,而无需更改主干网络或采样调度。
arXiv:2606.30934v1 公告类型:新
摘要:现代文本到图像扩散模型,例如扩散变换器(DiT),依赖于时间步或提示嵌入来调制每个时间步中降噪过程的强度。虽然这种调制传达了当前噪声水平,但它不提供任何质量感知信息,这可能导致生成的图像不匹配、视觉不一致且保真度不足。在本文中,我们提出质量表示模块(QRM),一种轻量级Transformer模块,基于现有模型输入学习质量感知表示,并生成一组向量$M_{qrm}$。这些向量调整DiT变换器块内的自适应层归一化调制,从而将质量敏感信号注入降噪参数。QRM不会对采样调度或扩散主干网络带来重大变化。实验包括QRM训练损失和架构的消融研究,以及经验结果,表明与基于DiT的基线模型相比,图像质量一致提升。
查看缓存全文
缓存时间: 2026/07/01 05:32
# 面向扩散变换器的质量感知调制
来源:https://arxiv.org/html/2606.30934
Luke Budny, Yuhong Guo, Kevin Cheung 卡尔顿大学 LukeBudny@cmail\.carleton\.ca,\{YuhongGuo, KevinCheung\}@cunet\.carleton\.ca
###### 摘要
现代文本到图像扩散模型,例如扩散变换器(DiT),依赖时间步或提示嵌入来调制每个时间步的去噪强度。虽然这种调制传达了当前的噪声水平,但它并未提供任何质量感知信息,这可能导致生成的图像出现不对齐、视觉不一致以及保真度不足的问题。在本文中,我们提出了质量表示模块(QRM),一个轻量级变换器模块,它基于现有模型输入学习一个质量感知表示,并生成一组向量MqrmM\_\{qrm\}。这些向量调整DiT变换器块内的自适应层归一化(AdaLN)调制,从而将质量敏感信号注入去噪参数中。QRM对采样调度或扩散主干不引入显著变化。实验包括对QRM训练损失和架构的消融研究,以及经验结果,证明了相较于基线DiT模型的一致图像质量提升。
## 1 引言
参见标题图1:使用SD3.5配合我们的质量感知奖励调制(QRM)生成的图像。QRM仅修改AdaLN调制偏移量,但显著提升了提示保真度和视觉细节。文本到图像生成领域目前由扩散模型\[3 (https://arxiv.org/html/2606.30934#bib.bib5)\]主导,例如DALL·E\[10 (https://arxiv.org/html/2606.30934#bib.bib2)\]、Midjourney\[9 (https://arxiv.org/html/2606.30934#bib.bib3)\]和Stable Diffusion\[18 (https://arxiv.org/html/2606.30934#bib.bib1)\],它们能够生成高质量、与提示对齐的图像。这些模型通过在一系列扩散时间步上迭代去噪潜在噪声来生成输出,逐步将噪声转化为结构化图像。在文本到图像生成中,扩散模型将去噪过程条件于文本提示,使得生成的图像能够反映输入描述的语义内容。
最近的进展引入了基于变换器的扩散架构,称为扩散变换器(DiT)\[11 (https://arxiv.org/html/2606.30934#bib.bib12)\],它用变换器块取代了卷积U-Net主干。这些模型在每个扩散时间步都包含条件信号,用于调制网络的内部激活。现代系统如Stable Diffusion 3.5 (SD3.5)\[19 (https://arxiv.org/html/2606.30934#bib.bib4)\]采用了这种架构,使用学习到的时间步嵌入和池化提示嵌入来控制去噪过程。虽然这些条件信号传达了关于提示和当前潜在图像噪声水平的信息,但它们并未提供关于中间生成图像质量或保真度的任何指示。
在扩散变换器中,这种条件通过调制层\[11 (https://arxiv.org/html/2606.30934#bib.bib12)\]应用。在每个扩散时间步,条件信号被转换为调制参数,用于缩放、平移和门控变换器块的激活。这些参数调整注意力和前馈计算的强度,使模型能够根据提示和时间步调整其去噪行为。虽然这种机制显著提高了生成质量和稳定性,但条件信号本身仅限于提示语义和时间步信息。
本文探讨了是否可以通过加入潜在图像质量的表示来增强调制,超越时间步和提示嵌入。在扩散过程中,由于误差累积、错误的提示解释或幻觉特征\[23 (https://arxiv.org/html/2606.30934#bib.bib17)\],视觉保真度和提示对齐度可能会下降。由于基线条件信号仅依赖于时间步和提示,调制机制无法根据潜在图像的演化状态直接纠正这些问题。
为了解决这一局限性,我们引入了质量表示模块(QRM),这是一个轻量级变换器模块\[20 (https://arxiv.org/html/2606.30934#bib.bib13)\],在扩散过程中学习一个质量感知表示。QRM接收扩散变换器使用的基线调制输入(时间步和池化提示嵌入),以及潜在图像特征和基线调制参数MbaseM\_\{base\}。利用这些输入,QRM预测一组调制更新MqrmM\_\{qrm\},用于在每个扩散时间步优化基线调制参数。QRM使用奖励反馈学习(ReFL)策略\[23 (https://arxiv.org/html/2606.30934#bib.bib17)\]进行训练,这使得模块能够学习调制变化如何影响生成图像与其相关提示之间的语义对齐。
预测的向量MqrmM\_\{qrm\}与基线调制参数MbaseM\_\{base\}相结合,形成最终应用于变换器块的调制参数。通过将质量感知信息直接注入调制路径,QRM提供了一种机制,可以在不修改底层扩散主干的情况下,在去噪过程中调整模型激活。
尽管所提出的方法总体上适用于扩散变换器架构,但我们使用Stable Diffusion 3.5 (SD3.5)\[19 (https://arxiv.org/html/2606.30934#bib.bib4)\]作为代表性的DiT模型来评估QRM。这使得我们能够在保持预训练主干权重冻结和采样计划不变的情况下,研究质量感知调制在现代化大规模扩散变换器中的效果。
我们的贡献如下:
- • 我们提出了质量表示模块(QRM),一个轻量级基于变换器的模块\[20 (https://arxiv.org/html/2606.30934#bib.bib13)\],它将质量感知调制注入扩散变换器架构中。
- • 我们引入了一种机制,用于在扩散变换器调制层中增强潜在图像质量信号,而不修改底层扩散主干或采样计划。
- • 我们证明了预测的调制更新MqrmM\_\{qrm\}在每个时间步优化了去噪过程,提高了提示遵从性和图像保真度。
- • 我们使用图像评估指标,包括CLIP Score\[2 (https://arxiv.org/html/2606.30934#bib.bib16)\]、ImageReward\[23 (https://arxiv.org/html/2606.30934#bib.bib17)\]和人类偏好得分(HPS)v2.1\[21 (https://arxiv.org/html/2606.30934#bib.bib18)\],进行了广泛的评估和消融研究,以分析QRM架构、输入特征和训练损失的效果。
## 2 相关工作
### 2.1 文本到图像生成的扩散模型
扩散模型通过迭代去噪过程,逐步将高斯噪声转化为结构化样本来生成数据\[3 (https://arxiv.org/html/2606.30934#bib.bib5)\]。在文本到图像生成中,这个去噪轨迹条件于文本提示,使得模型能够合成反映输入描述语义内容的图像。
潜在扩散模型(LDM)\[15 (https://arxiv.org/html/2606.30934#bib.bib7)\]通过在学习的潜在空间中进行扩散过程,而不是直接在像素空间,显著提高了基于扩散的生成效率。这种方法使用预训练的变分自编码器(VAE)将图像编码为紧凑的潜在表示,在保持语义结构的同时降低了计算成本。Stable Diffusion\[15 (https://arxiv.org/html/2606.30934#bib.bib7),17 (https://arxiv.org/html/2606.30934#bib.bib8),12 (https://arxiv.org/html/2606.30934#bib.bib9)\]普及了这一范式,并证明了通过将潜在扩散模型条件于文本嵌入,可以生成高质量图像。
更近期的系统,如Stable Diffusion 3.5 (SD3.5)\[19 (https://arxiv.org/html/2606.30934#bib.bib4)\]和FLUX\[5 (https://arxiv.org/html/2606.30934#bib.bib10)\],通过用扩散变换器(DiT)\[11 (https://arxiv.org/html/2606.30934#bib.bib12)\]取代传统的卷积U-Net主干,进一步推进了这一框架。这些架构使用带有自适应归一化层的变换器块,在整个去噪过程中整合条件信号,从而实现了更灵活和可扩展的生成模型。
### 2.2 扩散变换器架构
扩散变换器(DiT)架构\[11 (https://arxiv.org/html/2606.30934#bib.bib12)\]用基于自注意力架构的变换器块\[20 (https://arxiv.org/html/2606.30934#bib.bib13)\]取代了传统扩散模型中使用的卷积U-Net主干。与早期的潜在扩散系统类似,这些模型通常在预训练变分自编码器(VAE)\[4 (https://arxiv.org/html/2606.30934#bib.bib24)\]的潜在空间中运行,使得扩散可以在紧凑的语义表示上进行,而不是在全分辨率图像上。
DiT模型的一个关键组成部分是通过自适应归一化机制在每个去噪步骤中融入条件信号。条件信息通常来自两个来源:池化提示嵌入pp,由预训练文本编码器如CLIP\[13 (https://arxiv.org/html/2606.30934#bib.bib14)\]或T5\[14 (https://arxiv.org/html/2606.30934#bib.bib15)\]生成;以及时间步嵌入tt,通过对当前扩散步骤进行正弦编码得到。这些嵌入通过学习到的多层感知器进行投影并组合,形成条件向量
ct=MLPp\(p\)\+MLPt\(t\)\.c\_\{t\}=\\mathrm\{MLP\}\_\{p\}\(p\)\+\\mathrm\{MLP\}\_\{t\}\(t\)\.\(1\)
条件向量ctc\_\{t\}然后通过学习到的线性投影变换,生成每个变换器块中自适应层归一化(AdaLN)\[11 (https://arxiv.org/html/2606.30934#bib.bib12)\]使用的调制参数。对于每个块,这些投影产生对应于缩放(γ\\gamma)、平移(β\\beta)和门控项的向量,用于调制归一化的隐藏激活。缩放和平移参数调整归一化后的特征,而门控项控制注意力和前馈残差路径的强度。
因此,基线调制参数可以视为提示和时间步嵌入的函数,
Mbase=fθ\(p,t\),M\_\{\\text\{base\}\}=f\_\{\\theta\}\(p,t\),\(2\)
其中fθf\_\{\\theta\}表示生成每个变换器块AdaLN参数的学习投影。
通过这种机制,提示语义和时间步信息决定了在去噪过程中控制每个变换器块行为的调制向量。因此,这些向量作为提示、扩散时间步和内部变换器激活之间的主要条件接口。
在这项工作中,我们研究了如何用额外的质量感知信息来增强这些调制参数。在我们的实验中,我们使用Stable Diffusion 3.5 (SD3.5)\[19 (https://arxiv.org/html/2606.30934#bib.bib4)\],这是一个基于MM-DiT架构的大规模扩散变换器,作为这种设计的代表性实现。
### 2.3 生成模型中的质量感知表示
评估和改进生成图像的感知质量已成为现代文本到图像生成中的一个重要挑战。由于人类对图像质量的判断难以直接编码到训练目标中,最近的工作越来越依赖于学习到的奖励模型来估计语义对齐和感知保真度。
对比语言-图像预训练(CLIP)\[13 (https://arxiv.org/html/2606.30934#bib.bib14)\]学习了一个图像和文本的共享嵌入空间,实现了零样本分类和语义相似性度量。CLIPScore\[2 (https://arxiv.org/html/2606.30934#bib.bib16)\]利用这种表示,通过余弦相似度来评估提示-图像对齐度。
基于CLIP,已经提出了几个用于评估文本到图像生成质量的奖励模型,包括ImageReward\[23 (https://arxiv.org/html/2606.30934#bib.bib17)\]和人类偏好得分(HPSv2)\[22 (https://arxiv.org/html/2606.30934#bib.bib28),21 (https://arxiv.org/html/2606.30934#bib.bib18)\]。这些模型使用人类偏好数据集扩展了基于CLIP的架构,以更好地捕捉感知质量和提示相关性。
最近的工作将此类奖励信号整合到扩散模型中。奖励反馈学习(ReFL)\[23 (https://arxiv.org/html/2606.30934#bib.bib17)\]在训练过程中使用奖励模型,Reward-Instruct\[8 (https://arxiv.org/html/2606.30934#bib.bib20)\]使用评估分数微调扩散模型,而Schedule-on-the-Fly\[24 (https://arxiv.org/html/2606.30934#bib.bib21)\]在推理过程中动态修改去噪计划。
据我们所知,之前没有工作将质量感知表示直接整合到扩散变换器的每个时间步调制中。我们的QRM通过预测AdaLN调制参数的加法更新来引入这种机制。
## 3 方法
我们引入了质量感知奖励调制(QRM),一个轻量级模块,用于预测扩散变换器(此处以SD3.5\[19 (https://arxiv.org/html/2606.30934#bib.bib4)\]实例化)基线AdaLN调制参数的加法修正。与LoRA风格的微调不同,QRM不修改主干权重;它预测每个样本、每个时间步的调制偏移量,这些偏移量被添加到现有的AdaLN参数中。通过将质量感知信息注入每个时间步的条件路径,QRM实现了奖励引导的调制,同时保持扩散主干和采样计划冻结。
参见标题图2:提出的QRM概览。左图:QRM架构是一个变换器解码器,它结合潜在图像xtx\_\{t\}、时间步tt、提示嵌入pp和基线调制MbaseM\_\{\\text\{base\}\}来生成调制更新MqrmM\_\{\\text\{qrm\}\}。右图:在训练中,扩散从时间步TT应用到kk。在每个扩散时间步,扩散模型AdaLN层的基线调制MbaseM\_\{\\text\{base\}\}与MqrmM\_\{\\text\{qrm\}\}结合,产生更新后的调制向量。扩散模型最终生成一个潜在图像xkx\_\{k\},经过一步去噪后产生x^0\\hat\{x\}\_\{0\}\。预测的x^0\\hat\{x\}\_\{0\}估计值然后由一个冻结的奖励模型评估,提供一个标量反馈分数。
### 3.1 为什么潜在依赖调制有帮助
在扩散变换器\[11 (https://arxiv.org/html/2606.30934#bib.bib12)\]中,AdaLN调制参数通常仅从时间步和提示条件计算。因此,给定提示-时间步对的基线调制与当前潜在状态无关:
Mbase=fθ\(p,t\),∂Mbase∂xt=0\.M\_\{\\text\{base\}\}=f\_\{\\theta\}\(p,t\),\\qquad\\frac\{\\partial M\_\{\\text\{base\}\}\}\{\\partial x\_\{t\}\}=0\.\(3\)这阻止了调制路径直接对演化潜在中出现的样本特定失败模式(例如,缺失属性或幻觉关系)做出反应。QRM引入了一个潜在依赖的修正
M=Mbase\+Mqrm,Mqrm=fQRM\(xt,Mbase,p,t\),M=M\_\{\\text\{base\}\}+M\_\{\\text\{qrm\}\},\\qquad M\_\{\\text\{qrm\}\}=f\_\{\\text\{QRM\}\}\(x\_\{t\},M\_\{\\text\{base\}\},p,t\),相似文章
OrbitQuant:面向图像与视频扩散Transformer的数据无关量化方法
OrbitQuant提出了一种数据无关的扩散Transformer量化方法,消除了跨时间步和模态进行重新校准的需求,在FLUX.1和CogVideoX等模型的低位宽设置下实现了最先进的后训练量化水平。
重新思考扩散Transformer中的跨层信息路由
本文提出扩散自适应路由(DAR),这是一种可学习的、时间步自适应的残差替换方法,旨在改善扩散Transformer中的跨层信息流动,从而显著加速训练并提升质量。
REAL-Q:通过动态梯度下降实现端到端大语言模型量化
本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。
LoopQ:递归Transformer的量化
LoopQ是一种针对循环语言模型的后训练量化框架,解决了分布偏移、状态复用和误差累积问题。在4位权重和激活量化下,平均准确率提升68.8%。
面向真实世界时间序列的量子生成扩散模型
QDiffusion-TS是首个针对真实世界时间序列合成的量子生成扩散模型,它用量子神经网络替换了去噪Transformer中的前馈组件。该模型将可训练参数减少了近三个数量级,并在金融数据上将Wasserstein距离改进了44%,在下游预测任务中RMSE最高提升71%。