基于流生成模型的残差空间进化优化
摘要
介绍了一个结合流生成编辑和进化算法的框架,用于在残差空间中进行优化,支持使用不可微目标进行可控数据编辑。在MorphoMNIST和晶体数据上进行了验证。
arXiv:2606.20084v1 公告类型:新
摘要:使用生成方法进行数据编辑通常需要可微目标函数和基于梯度的搜索。然而,这些假设在基于流的设置中不成立,因为编辑是通过前向和后向积分进行的,并且通常涉及不可微或黑箱目标函数。我们提出了一种模型无关的框架——残差空间进化优化,通过结合流生成编辑和进化算法来解决这一差距。基于条件流匹配(CFM)可以将条件控制因素与实例特定残差解耦的观察,我们的框架直接在残差空间中操作,并分离出两个互补的搜索机制:自花授粉通过保持特征的残差细化进行局部利用,而异花授粉通过跨异质样本重组残差促进更广泛的探索。作为概念验证,我们在MorphoMNIST(一个用于反事实生成的基准数据集)和晶体数据上进行了验证,表明这种探索-利用分解为平衡目标对齐、实例保持和多样性提供了有用的机制,并且不仅限于图像,还可扩展到现实世界的科学领域。
查看缓存全文
缓存时间: 2026/06/20 14:35
# 基于流生成模型的残差空间进化优化
来源:https://arxiv.org/html/2606.20084
###### 摘要
使用生成方法进行数据编辑通常需要可微的目标函数和基于梯度的搜索。然而,这些假设在基于流的设定中不成立,因为编辑是通过前向和反向积分执行的,并且通常涉及不可微或黑盒目标。我们引入了**残差空间进化优化**,这是一个与模型无关的框架,通过将基于流的生成编辑与进化算法相结合来解决这一问题。基于条件流匹配(CFM)可以解耦条件控制因素与实例特定残差这一观察,我们的框架直接在残差空间中操作,并分离了两种互补的搜索方式:**自花授粉**通过保留特征的残差细化进行局部开发,而**异花授粉**通过重组来自异质样本的残差来促进更广泛的探索。作为概念验证,我们在MorphoMNIST(一个反事实生成基准数据集)和晶体数据上进行了验证,表明这种探索-开发分解为平衡目标对齐、实例保真度和多样性提供了一种有用的机制,并且其应用范围超越了图像,延伸到了现实世界的科学领域。
数据优化,条件流匹配,反事实解释,进化算法
## 1 引言
可控数据编辑,即在保留实例特定结构的同时修改目标属性,是机器学习中的核心操作,其应用范围从反事实解释到数据增强。除了图像领域,它在药物发现、晶体结构预测和材料优化等科学领域同样重要,在这些领域,可控编辑可以将有效样本引导至期望的功能特性。现有的大多数方法将编辑视为基于梯度的优化,隐含假设目标函数是可微的,并且生成流程是完全透明的。图像领域的一系列工作,包括特征可视化和网络剖析(Mahendran和Vedaldi,2015(https://arxiv.org/html/2606.20084#bib.bib5);Olah等人,2017(https://arxiv.org/html/2606.20084#bib.bib6);Carter等人,2019(https://arxiv.org/html/2606.20084#bib.bib15);Bau等人,2017(https://arxiv.org/html/2606.20084#bib.bib16),2019(https://arxiv.org/html/2606.20084#bib.bib17);Selvaraju等人,2020(https://arxiv.org/html/2606.20084#bib.bib13))、风格迁移和图像到图像翻译(Gatys等人,2016(https://arxiv.org/html/2606.20084#bib.bib7);Zhu等人,2017(https://arxiv.org/html/2606.20084#bib.bib12);Isola等人,2017(https://arxiv.org/html/2606.20084#bib.bib18);Park等人,2020(https://arxiv.org/html/2606.20084#bib.bib19))、GAN反演和潜在编辑(Abdal等人,2019(https://arxiv.org/html/2606.20084#bib.bib8);Shen等人,2020(https://arxiv.org/html/2606.20084#bib.bib20);Härkönen等人,2020(https://arxiv.org/html/2606.20084#bib.bib21);Patashnik等人,2021(https://arxiv.org/html/2606.20084#bib.bib22);Roich等人,2022(https://arxiv.org/html/2606.20084#bib.bib24);Pan等人,2023(https://arxiv.org/html/2606.20084#bib.bib25))、以及基于扩散的图像编辑和可控生成(Dhariwal和Nichol,2021(https://arxiv.org/html/2606.20084#bib.bib10);Meng等人,2022(https://arxiv.org/html/2606.20084#bib.bib26);Hertz等人,2023(https://arxiv.org/html/2606.20084#bib.bib29);Mokady等人,2023(https://arxiv.org/html/2606.20084#bib.bib30);Brooks等人,2023(https://arxiv.org/html/2606.20084#bib.bib31);Zhang等人,2023(https://arxiv.org/html/2606.20084#bib.bib33);Parmar等人,2023(https://arxiv.org/html/2606.20084#bib.bib34);Mou等人,2024(https://arxiv.org/html/2606.20084#bib.bib35)),都共享这一假设,即认为将编辑视为像素、特征或潜在变量上的优化问题是可行的。这一假设在基于流的生成编辑中不成立,因为编辑是通过前向和反向数值积分实现的,并且目标函数通常是非可微或黑盒的。最近的研究表明,条件流匹配(CFM)能将条件控制因素与实例特定的残差信息解耦(Li等人,2024(https://arxiv.org/html/2606.20084#bib.bib14);Cao等人,2025b(https://arxiv.org/html/2606.20084#bib.bib11)),从而通过重复积分实现迭代编辑。这种迭代机制自然非常适合进化算法(Holland,1975(https://arxiv.org/html/2606.20084#bib.bib36);Goldberg,1989(https://arxiv.org/html/2606.20084#bib.bib37);Bäck,1996(https://arxiv.org/html/2606.20084#bib.bib42);Eiben和Smith,2015(https://arxiv.org/html/2606.20084#bib.bib43);Hansen和Ostermeier,2001(https://arxiv.org/html/2606.20084#bib.bib44)),进化算法通过重复的提议、评估和细化来运作,使得残差空间编辑能够充当类似基因型的变异,通过选择来优化目标属性。
我们提出**残差空间进化优化**,一个将基于流的生成编辑与进化算法相结合的、与模型无关的框架。给定一个固定的条件生成器,我们的方法将数据映射到残差状态,通过突变和交叉编辑这些状态,并在目标条件下解码生成的候选对象。然后,使用特定于任务的标准(如目标有效性、实例保真度、特征控制或多样性)进行选择(见图1(https://arxiv.org/html/2606.20084#S2.F1)),无需生成器的梯度信息。因此,该方法充当了现有生成器之上的轻量级优化层,而非新的生成模型训练目标。
我们框架的一个核心观点是,残差空间进化将经典的探索-开发权衡分解为两种授粉机制。自花授粉利用现有样本的局部残差邻域进行开发,适用于需要保留源实例的细化问题。异花授粉通过重组来自异质样本的信息来探索更广阔的残差搜索空间,这有助于发现多样化的候选解,并缓解过早收敛到局部最优解的问题。重要的是,我们并不声称异花授粉能保证达到全局最优解;相反,它提供了一种机制,在选择之前增加目标条件解空间的覆盖率。
我们基于现有工作LeapFactual(Cao等人,2025b(https://arxiv.org/html/2606.20084#bib.bib11))实例化了该框架,并在MorphoMNIST(Castro等人,2019(https://arxiv.org/html/2606.20084#bib.bib46))上进行了评估,作为一个受控的图像编辑测试平台。尽管图像提供了一个方便的可视化领域,但该框架并非图像特有,可应用于任何具有可编辑潜在或残差表示的条件数据编辑场景。我们还在Wyckoff无机晶体生成器(WyCryst)(Zhu等人,2024(https://arxiv.org/html/2606.20084#bib.bib64))上进一步验证了该框架,展示了其超越图像领域、应用于现实世界科学数据的潜力。我们的结果表明,基于流的生成编辑器暴露的残差状态构成了受控编辑的有效搜索空间,探索-开发分解提供了用于平衡目标对齐、实例保真度和多样性的显式机制。
## 2 方法
参见图注
图1: 仅跳跃、自花授粉和异花授粉的比较。彩色框展示了各个方法。
### 2.1 预备知识
#### 进化算法。
进化算法是受自然选择启发的基于群体的优化方法。给定一个候选解群体,它们通过随机的变异算子(如*突变*和*交叉*)迭代生成新的候选解,并通过*选择*保留有希望的候选解。突变扰动单个候选解以探索其局部邻域,而交叉则重组来自多个候选解的信息以产生新的后代。然后,选择根据特定于任务的适应度函数评估候选解,并保留最符合期望目标的那部分。在我们的框架中,残差状态充当候选表示,基于流的编辑充当变异算子,特定于任务的标准定义了适应度函数。
#### LeapFactual。
我们的框架建立在Cao等人(2025b(https://arxiv.org/html/2606.20084#bib.bib11))的基于流编辑公式之上,我们在此简要回顾。设x表示输入图像,z=E(x)其自编码器潜在表示,ĉ=f(x)其预测的源类别,以及c_tgt用户指定的目标类别。我们假设一个单一共享的条件流模型v_θ(z_t, t, c),该模型使用类别条件进行训练。在编辑时,同一个流在两个积分方向中使用。
源条件反向积分,称为*提升*,从潜在表示z中移除类别相关信息:
z_res = Lift(z, ĉ), (1)
返回残差状态z_res,其中流从t=1反向积分到t=0。目标条件正向积分,称为*着陆*,在期望的目标条件c_tgt下重建完整的潜在表示z':
z' = Land(z_res, c_tgt), (2)
其中流从t=0正向积分到t=1。一次*提升*和一次*着陆*操作的组合构成一次*跳跃*,然后编辑后的图像通过自编码器的解码器D获得:x' = D(z')。
#### 设计原则。
在下面的实验中,我们使用这个公式作为更广泛的残差空间优化原则的具体实例。所有搜索操作都在z_res中执行,而不是在图像空间或自编码器的潜在空间中,从而保持了清晰的分离:类别相关信息由源和目标条件控制,而实例特定的残差变化则由搜索过程操作。尽管源条件和目标条件可能相同,但我们经验性地表明,允许类别更改使得能够更高效地利用跨实例的残差信息。
### 2.2 残差空间进化优化
我们在一个冻结的条件流模型之上引入了一个进化层,将残差状态z_res视为样本的可搜索基因组,而条件流模型负责通过*提升*和*着陆*施加源和目标条件。这种设计分离了两个角色:流模型控制语义条件,而进化层则搜索实例特定的变化。
根据残差群体的构建方式,该框架导致了两种互补的搜索方式。*自花授粉*实例化了局部开发:它从一个单一的残差开始,并使用突变在现有解的邻域内细化候选解。*异花授粉*实例化了更广泛的探索:它从多个残差开始,并通过交叉将它们重组,允许来自异质来源的残差信息在目标条件空间的不同区域生成候选解。伪代码见附录A(https://arxiv.org/html/2606.20084#A1)。
#### 自花授粉。
对于单个输入x,自花授粉首先通过源条件*提升*操作计算其残差状态:z_res = Lift(E(x), ĉ)。然后,它通过采样扰动后的残差构建一个大小为m的子代池:
z̃_res^(m) = z_res + ε^(m), ε^(m) ∼ N(0, σ²I), (3)
其中也可以使用其他扰动,例如特征交换,当残差维度被视为可交换的基因时。然后,每个子代残差在目标条件下*着陆*并解码:x'^(m) = D(Land(z̃_res^(m), c_tgt))。
选择根据用户定义的适应度分数保留最佳候选解。因此,自花授粉围绕一个输入执行局部残差开发,主要用于保留特征的细化。这使其成为反事实解释(Dombrowski等人,2023(https://arxiv.org/html/2606.20084#bib.bib53);Samangouei等人,2018(https://arxiv.org/html/2606.20084#bib.bib54);Singla等人,2019(https://arxiv.org/html/2606.20084#bib.bib55);Nemirovsky等人,2020(https://arxiv.org/html/2606.20084#bib.bib56);Kim等人,2021(https://arxiv.org/html/2606.20084#bib.bib57);Hvilshøj等人,2021(https://arxiv.org/html/2606.20084#bib.bib59);Cao等人,2025a(https://arxiv.org/html/2606.20084#bib.bib63),b(https://arxiv.org/html/2606.20084#bib.bib11))等有吸引力的目标的自然选择,在这些目标中,搜索应向目标条件收敛,同时避免不必要地偏离源实例。
#### 异花授粉。
对于一个群体{x_i}_{i=1}^{N},异花授粉首先计算源条件残差:
z_res,i = Lift(E(x_i), ĉ_i), i=1,...,N。 (4)
然后,每个残差将与一个伙伴残差配对,并通过交叉进行重组:
z̃_res,i^(m) = Crossover(z_res,i, z_res,j^(m), α) + ε^(m), (5)
其中α控制每个父本的贡献,ε^(m)是一个可选的突变项。可以应用不同的交叉机制。详见附录A(https://arxiv.org/html/2606.20084#A1)。
生成的子代残差在相同目标条件下着陆并解码。选择再次根据定义的适应度分数保留前k个候选解。与保留单个源样本身份的自花授粉不同,异花授粉利用多个来源的残差多样性来探索更广泛的目标条件搜索空间。因此,多样性对于防止早期收敛很重要。可选地,可以应用高级选择机制,如锦标赛选择和多样贪婪选择(Graham等人,2011(https://arxiv.org/html/2606.20084#bib.bib62);Liu等人,2024(https://arxiv.org/html/2606.20084#bib.bib60);Wulandari等人,2024(https://arxiv.org/html/2606.20084#bib.bib61))。在我们的实验中,我们证明了简单的前k机制效果良好,因为异花授粉引入的多样性防止了过早收敛(第3节(https://arxiv.org/html/2606.20084#S3))。
## 3 领域建模
在下文中,我们介绍了图像(第3.1节(https://arxiv.org/html/2606.20084#S3.SS1))和科学领域(第3.2节(https://arxiv.org/html/2606.20084#S3.SS2))的实验设置。
### 3.1 图像领域:MorphoMNIST
我们使用MorphoMNIST(Castro等人,2019(https://arxiv.org/html/2606.20084#bib.bib46))作为研究相似文章
@r_de_santi: 生成模型无法发现它们无法触及的东西。我们很高兴推出 ActFlow:一个持续预训练方案…
本文介绍了 ActFlow,这是一种持续预训练方案,旨在扩展流模型和扩散模型的有效设计空间,从而实现分布外生成建模,并为科学发现提供可进化的搜索空间。
Bootstrap Your Generator: 基于流匹配的非配对视觉编辑
Bootstrap Your Generator (ByG) 是一个用于流匹配编辑模型非配对训练的框架,利用基础模型知识和梯度路由,在数据稀缺的图像和视频编辑任务中实现了最先进的成果。
Flow-Direct: 通过非参数引导场实现高效反馈与可复用的流模型引导
Flow-Direct 提出了一种用于基于流的生成模型的非参数引导场,该引导场持续累积奖励反馈,提高了反馈效率,并使得收集的样本可重复用于引导多目标生成,无需额外的奖励评估。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
FlowEvo:通过工作流与可执行技能的协同演化实现自演化智能体
FlowEvo是一个免训练框架,使得大语言模型智能体能够在推理时协同演化可复用技能和工作流,在ALFWorld、HumanEval和GSM8K等基准测试中实现了最先进的准确性和效率。