连续对抗性MeanFlow迁移
摘要
本文提出MeanFlow-Transfer(MF-T)和连续对抗性MeanFlow(CAMF),以统一预训练扩散和流动模型的适配和加速,实现数据有限新领域的高质量少步生成。
arXiv:2608.19540v1 公告类型:新
摘要:在数据有限的新领域训练快速生成器仍具挑战性,原因有二。首先,将预训练的扩散或流动模型适配到新领域时,其昂贵的多步采样问题未被解决,且现有加速方法与源参数化($\epsilon$、$x$、$v$或$u$)绑定,导致异构预训练模型缺乏共同的加速目标。其次,尽管对抗性精炼已被证明对少步生成质量有效,但它仅针对瞬时速度流动制定,而非MeanFlow(MF)模型预测的有限区间平均速度。我们解决了这两个问题。我们提出MeanFlow-Transfer,它将异构源输出映射到共享速度表示,用其从源权重初始化MF生成器,并在目标域上优化MF目标。这在单一训练循环中统一了广泛的预训练模型的适配和加速。然后我们引入连续对抗性MeanFlow,这是一个训练后阶段,将连续对抗性流动模型从瞬时速度扩展到MF的有限区间平均速度。CAMF对比真实和预测区间端点之间学习势能的变化,恢复MF回归平均掉的精细细节,并在区间消失极限下退化为瞬时准则。将四个基于ImageNet的源模型(DiT($\epsilon$)、SiT($v$)、JiT($x$)、iMF($u$))适配到五个目标域时,MF-T与CAMF在FID和FDD上匹配或超过微调教师模型,同时神经函数评估(NFE)减少高达$125\times$,而CAMF平均提升MF-T的少步FID $29\%$。
查看缓存全文
缓存时间: 2026/08/21 10:24
# 连续对抗均值流迁移
来源:https://arxiv.org/html/2608.19540
Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri
###### 摘要
在有限数据条件下为新领域训练快速生成器仍面临两大挑战。首先,将预训练的扩散或流模型适配到新领域时,其高成本的多步采样问题仍未解决;而现有的加速方法受限于源模型参数化($\epsilon$、$x$、$v$ 或 $u$),导致异构的预训练模型缺乏统一的加速目标。其次,尽管对抗性细化已被证明能有效提升少步生成质量,但该方法仅适用于瞬时速度流模型,无法应用于MeanFlow(MF)模型所预测的有限区间平均速度。我们同时解决了这两个问题。我们提出 **MeanFlow-Transfer(MF-T)**,该方法将异构的源模型输出映射到统一的表示空间,利用该表示从源模型权重初始化一个MF生成器,并在目标域上优化MF目标函数。这在一个训练循环中统一了适配与加速,适用于广泛的预训练模型。随后,我们引入 **连续对抗均值流(CAMF)**,作为训练后处理阶段,将连续对抗流模型从瞬时速度扩展到MF的有限区间平均速度。**CAMF** 通过对比学习到的势函数在真实与预测区间端点之间的变化,恢复了MF回归平均所损失的细节,并在区间趋近于零的极限情况下退化为瞬时速度准则。在将四个基于ImageNet的源模型(DiT($\epsilon$)、SiT($v$)、JiT($x$)、iMF($u$))适配到五个目标域的实验中,带有 **CAMF** 的 **MF-T** 在减少高达125倍神经函数评估次数(NFE)的情况下,其FID和FDD指标匹配或超越微调教师模型,同时 **CAMF** 平均将 **MF-T** 的少步生成FID提升了29%。项目页面:https://yasaman-dt.github.io/CAMFT/。
## 1 引言
见标题图1:**MF-T + CAMF** 可将具有任意输出参数化的源域扩散或流模型,适配成目标域中高质量的少步均值流(MF)生成器,其目标域NFE远少于源域(若源模型本身为MF,则 $NFE_{trg} \sim NFE_{src}$)。源域与目标域:ImageNet<sup>44</sup> 与 Birds<sup>41</sup>。
预训练的扩散和基于流的生成器为图像合成提供了强大的通用先验,使其成为在有限数据条件下迁移至新领域的有吸引力的源模型<sup>19,14,18,17,20,35,22,30</sup>。然而,适配过程并未改变源生成器的多步采样流程,限制了其在需要快速交互式生成的应用中的使用。与此同时,少步生成技术发展迅速,但这些方法通常是独立的生成范式,而非将预训练模型迁移到新领域的方案<sup>24,26,23,25,8</sup>。因此,加速与适配一直被分开研究,即使结合也仅限于单一固定的源参数化<sup>30</sup>。这暴露了跨模型迁移的第一个障碍:预训练生成器并非采用统一的预测参数化——它们可能预测输入 $x$、噪声 $\epsilon$、瞬时速度 $v$ 或平均速度 $u$——因此没有一种通用的加速与适配流程适用于所有模型系列。这留下了如何在有限数据条件下,从异构的预训练模型获得快速、高质量的目标域生成器的问题。
| 数据集 | iMF-XL/2 (NFE<sub>src→trg</sub>=2→2) | SiT-XL/2 (NFE<sub>src→trg</sub>=250→4) | DiT-XL/2 (NFE<sub>src→trg</sub>=250→8) | JiT-H/16 (NFE<sub>src→trg</sub>=50→4) |
| :--- | :---: | :---: | :---: | :---: |
| CUB | 见图 | 见图 | 见图 | 见图 |
| ArtB | 见图 | 见图 | 见图 | 见图 |
| Cars | 见图 | 见图 | 见图 | 见图 |
图2:使用从不同源模型初始化的 **MF-T+CAMF** 在目标域生成的图像。图像未经筛选。
满足此需求需要一个迁移接口,该接口能将异构的源参数化映射到统一的表示,同时生成一个快速的目标域模型。均值流(MF)家族是自然契合的选择:通过对平均速度而非瞬时速度建模,它能在少步内实现高质量生成<sup>8,9</sup>。解耦均值流(DMF)进一步将流匹配模型后训练为少步MF生成器<sup>11</sup>,同时保持相同的参数化和领域。第二个障碍是少步生成本身固有的问题。当每个采样步骤是一个大的传输跳跃时,基于回归的扩散和流模型倾向于对多个合理输出进行平均,产生模糊、保真度较低的结果<sup>25,49</sup>。MF也不例外,我们实验发现这种效应在有限数据的迁移学习中更为明显。对抗性后训练是此类模型的强力解决方案,连续对抗流模型(CAFMs)将其作为轻量级阶段应用于固定采样成本下对已训练流模型的细化<sup>47</sup>。然而,将对抗性后训练应用于MF面临一个表征鸿沟:CAFMs判别的是 *瞬时* 速度,而MF预测的是 *有限区间平均* 速度。因此,对MF施加连续对抗性准则需要在推理时判别其模型的有限区间传输,而非它从不使用的瞬时速度。
在本工作中,我们提出 **MeanFlow-Transfer(MF-T)**,并结合一个对抗性后训练阶段—— **连续对抗均值流(CAMF)**,以解决这两个障碍(图1)。**MF-T** 将源模型的输出映射到一个统一的瞬时速度表示中,为预测 $x$、$\epsilon$、$v$ 或 $u$ 的源模型提供通用接口。然后,它从源模型权重初始化一个MF生成器,并使用改进的MF(iMF)目标函数<sup>9</sup>在目标域数据上进行微调。这在一个循环中统一了适配与加速,适用于广泛的预训练模型。至关重要的是,我们映射的是参数化而非对齐调度:Diff2Flow式的调度对齐<sup>45</sup>在领域偏移和低神经函数评估次数(NFE)下会使训练不稳定,而我们的速度映射在两种场景下都保持稳定并提升质量。随后,**CAMF** 通过将CAFMs<sup>47</sup>的瞬时速度连续对抗学习扩展到MF生成器的有限区间平均速度,来细化适配后的MF模型。**CAMF** 比较学习到的势函数在真实与预测区间端点之间的变化,恢复了MF回归平均所损失的细节。我们进一步证明,它在区间趋近于零的极限情况下退化为瞬时准则。
我们在ImageNet预训练的DiT($\epsilon$)、SiT($v$)、JiT($x$)和iMF($u$)模型上评估了 **MF-T**——涵盖了所有四种源参数化——并将它们适配到五个目标域。**MF-T** 本身已能将每个预训练源模型转变为少步目标域生成器,其FID和FDD显著优于标准的少步微调。**CAMF** 平均将 **MF-T** 的少步生成FID提升了29%,超越了先前的对抗性方法。两者结合使用时,**MF-T + CAMF** 在减少高达125倍NFE的情况下,其FID和FDD匹配甚至超越微调源模型。
**贡献。**
(i) **MeanFlow-Transfer(MF-T)**,一种训练方案,通过为 $x$、$\epsilon$、$v$ 和 $u$ 参数化提供统一的瞬时速度接口,适配预训练源模型并将其压缩为少步MF生成器。我们证明了映射参数化而非对齐调度,是实现稳定迁移到MF的关键。
(ii) **连续对抗均值流(CAMF)**,一种对抗性后训练目标,将连续对抗学习从瞬时速度扩展到MF生成器预测的有限区间平均速度,并证明它在瞬时极限下退化为CAFMs。
(iii) 在涵盖 $x$、$\epsilon$、$v$ 和 $u$ 参数化的四个源模型和五个目标域上,**MF-T** 超越标准的少步微调,而 **CAMF** 后训练将质量进一步推向超越先前的对抗性方法——在减少高达125倍NFE的情况下匹配并常超越微调源模型。
见图(a) MeanFlow-Transfer(MF-T) 见图(b) 连续对抗均值流(CAMF)
图3:我们的两阶段框架概述。(a) MF-T:一个具有任意输出参数化的预训练源生成器被映射到统一的瞬时速度表示,并适配成预测有限区间平均速度 $\bm{u}_{\theta}$ 的目标域均值流(MF)模型。(b) CAMF:MF模型将 $z_t$ 传输到预测的终点 $\widehat{z}_{r} = z_t - (t-r)\bm{u}_{\theta}$,判别器通过 $\mathcal{A}_{\mathrm{real}}$ 和 $\mathcal{A}_{\mathrm{fake}}$ 比较势函数 $D_{\psi}$ 沿真实和模型预测的目标域传输段的平均变化。
## 2 相关工作
**加速扩散和流模型。** 近期工作致力于加速扩散和流模型的采样速度。基于蒸馏的方法将预训练的多步采样器压缩为单步或少步生成器,同时保持样本质量<sup>24,23,25</sup>。一致性模型<sup>26</sup>则通过强制执行去噪轨迹上的自一致性来学习少步生成器,既可以通过从预训练模型蒸馏,也可以从头训练。这一思想已被进一步扩展到 *流映射*,它建模任意时间步对之间的转换<sup>27,28,29</sup>。MF就是一种这样的公式化方法,它参数化时间步对之间的 *平均速度*<sup>8</sup>。后续工作改进了这一框架:改进的均值流(iMF)重构了训练目标以实现更高的稳定性<sup>9</sup>,而DMF通过条件化网络后期的块于第二个时间步,将流匹配模型蒸馏为MF生成器<sup>11</sup>。然而,这些加速模型仍然局限于其训练领域,其蒸馏过程通常与特定架构和预测参数化绑定。因此,它们在模型无关的领域迁移方面的灵活性有限。
**适配与加速鸿沟。** 预训练的扩散和流模型在有限数据条件下能很好地迁移到新领域,这激发了大量研究来控制源模型先验在目标域适配过程中如何被遗忘、保留或重新注入<sup>19,21,22,20</sup>。早期工作强调 *数据高效* 迁移<sup>15,14,13,12</sup> 和 *参数高效微调*(PEFT)<sup>18,16,17</sup>。然而,这些方法大多仍然依赖推理时的多步采样,使得适配生成器的 *采样成本* 问题未被解决。作为回应,近期工作探索了 *适配* 与 *加速* 的交叉点<sup>31,36,38,34,37</sup>:Uni-DAD 在一个统一框架中将两者结合<sup>30</sup>,DogFit 使用领域引导的微调实现高效的目标域采样<sup>35</sup>。然而,这些方法仍然局限于通过定制的引导机制或源模型的特定蒸馏流程。没有一种方法能同时实现快速采样、高目标域保真度以及对异构预训练扩散和流生成器的兼容性。
**对抗性学习。** 对抗性目标函数可以恢复在激进的少步蒸馏中损失的感知质量。对抗性扩散蒸馏及其潜在变体将对抗性损失与冻结教师模型的蒸馏相结合<sup>25,49</sup>,而后续方法则放弃教师模型,仅依赖对抗性信号<sup>48,50</sup>。更近期的工作针对流 *传输过程* 本身:对抗性流模型(AFMs)<sup>46</sup>使用最优传输正则化学习离散少步流映射,而CAFMs<sup>47</sup>通过学习到的标量势的导数来判断连续时间流的 *瞬时速度*。然而,两者均未提供针对有限区间平均速度的解决方案,均局限于瞬时速度模型。
**预测与损失空间。** 一系列近期工作将模型的输出参数化与其训练目标解耦:JiT 在像素空间直接预测干净样本 $x$,同时在速度目标下训练<sup>7</sup>,而pMF将这种预测/损失解耦扩展到MF公式中<sup>10</sup>。Diff2Flow通过映射输出参数化和噪声调度,以流匹配目标对扩散模型进行后训练,表明朴素的流匹配微调...相似文章
多分辨率流匹配:基于分阶段采样的免训练扩散加速
MrFlow 是一种针对流匹配文本到图像模型的免训练多分辨率加速策略,它结合了低分辨率生成、像素空间超分辨率和噪声注入,无需训练或运行时修改即可实现高达25倍的端到端加速。
Discrete MeanFlow: 通过条件转移核实现一步生成
介绍了Discrete MeanFlow,一种通过在离散状态空间中学习连续时间马尔可夫链的条件转移核来实现一步生成的方法,避免了迭代去噪。
FlowLM: 基于扩散-流适配的少步语言建模
FlowLM 提出了一种流匹配语言模型,通过高效微调从预训练扩散模型衍生而来,能够实现高质量少步文本生成,其效果可与2000步扩散采样相媲美,而训练轮次更少。
掩码语言流模型
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
MeanFlowNFT: 将前向过程强化学习引入平均速度生成器
MeanFlowNFT为平均速度生成器引入了一种前向过程强化学习方法,能够在保持快速少步采样的同时,高效地与人类偏好对齐。实验表明,它在大多数指标上优于先前经过强化学习调优的少步生成器,甚至超越了多步调优的扩散模型。