通过同质-异质分割的合成图像生成后策展

arXiv cs.LG 论文

摘要

本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。

arXiv:2607.02637v1 公告类型:新论文 摘要:最近的生成模型能够生成高质量的合成图像,为数据饥渴型模型提供了可扩展的训练数据。现有利用这一潜力的方法通常包括:1)训练或微调生成器;2)采用轻量级的后置适配方法,如提示工程或推理时引导,这使得这些方法具有生成器特异性且需要专业知识。我们研究了一个互补性问题:给定一个固定的生成图像池,能否仅通过选取信息丰富的子集来提升下游效用?答案是肯定的。我们表明,有效的选择必须对抗现代生成器的一个结构性偏差:它们倾向于过度生成每个类别的规范模式,而低估类内变异。基于这一见解,我们将每个真实类别拆分为规范的同质(HO)子集和无冗余的异质(HE)子集,然后根据一个保真度-多样性准则对合成图像进行评分,该准则奖励语义对齐,同时惩罚规范冗余。该方法与生成器无关,无需重新训练。在多个基准测试中,它持续优于最先进的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。当应用于更强的任务调优生成器时,同一准则仍然有效,并且在分类和分割任务上均有所提升。因此,生成后选择并不是替代更好生成器的方法,而是一种提升合成数据效用的补充机制。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:39

# 通过同质-异质分裂的合成图像生成后筛选  
来源:https://arxiv.org/html/2607.02637  
Disheng Liu Tuo Liang Chaoda Song Yu Yin  
Department of Computer and Data Sciences  
Case Western Reserve University  
Cleveland, OH, USA  
\{dxl952,txl859,cxs965,yxy1421\}@case\.edu  

###### 摘要  
最近的生成模型能够产生高质量的合成图像,为数据渴求型模型提供了可扩展的训练数据。现有利用这一潜力的方法通常涉及:1)训练或微调生成器,或 2)使用轻量级事后调整(如提示工程或推理时引导),这使得它们依赖于特定生成器且需要大量专业知识。我们研究了一个互补问题:*给定一个固定的合成图像池,能否仅通过选择信息子集来提升下游效用?*答案是肯定的。我们表明,有效的选择必须应对现代生成器的结构性偏差:它们往往过度产生每个类别的典型模式,而低估了类内变化。基于这一洞察,我们将每个真实类别划分为一个*典型同质 (Homogeneous)* 子集和一个*非冗余异质 (Heterogeneous)* 子集,然后根据一个保真度-多样性准则对合成图像进行评分,该准则奖励语义对齐同时惩罚典型冗余。该方法与生成器无关,且无需重新训练。在多个基准测试中,它始终优于最先进的数据选择基线,并且能够以最多40%更少的合成样本达到真实数据的性能。同样的准则在应用于更强的任务调优生成器时仍然有效,在分类和分割任务上均有提升。因此,生成后选择并非更好生成器的替代品,而是一种提升合成数据效用的互补机制。

## 1 引言  
生成模型(GMs)能够产生高质量的合成数据,为数据密集型AI中的数据稀缺问题提供了有前景的解决方案。最近的研究表明,生成模型可以有效地复制数据集(例如CIFAR-10、ImageNet),并提升基于此类合成数据训练的下游模型在泛化性、迁移性和域内准确性方面的表现[74,49,4,23,38,17]。然而,实际挑战仍然存在:1)合成数据集可能包含低保真度或错误标签的样本,引入有害噪声;2)无意中过度代表主导模式可能会将固有偏差传递给下游模型;3)虽然扩大数据规模可以缓解这些问题,但会带来更高的计算开销和更长的训练时间。

为利用合成数据,研究人员优先考虑改进生成技术,以产生更逼真且更多样的数据。这些方法大致可分为:1)基于训练或微调的方法[4,31],使生成器更好地匹配目标分布;2)轻量级策略,如引导[69,33,39,14,34]或提示[50,46,15]。虽然有效,但这些方法面临不同的权衡:基于训练的方法因优化大规模模型而承受大量计算开销,而轻量级策略通常依赖于特定模型配置、大量领域知识或广泛的经验调优。

另一种选择是数据筛选[18,2],它将质量控制与图像生成分离,避免了基于引导方法的典型陷阱。这种以数据为中心的方法可作为一个实用且互补的精炼阶段,即使在经过专门任务引导的生成阶段之后,也能确保高质量的合成输出。

请参见图注  
图1:同时考虑保真度和多样性的数据筛选。真实数据(目标分布)被分为同质子集和异质子集。随后,合成样本通过参考这两个分区进行评分,以便后续筛选。

将筛选后的数据与目标分布对齐是一个很有前景的后处理原则。图像-标签对齐方法[23,11,73]假设高质量数据严格遵循生成标签,使用预训练判别器过滤噪声样本;图像-图像对齐方法[36,40]优先选择与真实图像高度相似的合成样本。这两种策略都强调保真度,但很大程度上忽略了多样性,由于重复模式和缺失新颖信息,降低了合成数据的效用[17]。

受这些局限性启发,我们提出了一个保真度-多样性平衡的生成后筛选框架,以增强合成图像在下游任务中的效用。在筛选流程中,我们首先将真实数据集划分为两个子集:一个同质子集,其特征在于高内部相似性;以及一个异质子集,富含变化。基于这种划分,我们设计了一个评分机制来识别和选择所需的合成样本,平衡高语义质量与表征多样性,如图1所示。具体来说,我们计算两个互补指标:1)保真度分数,衡量与真实样本的语义相似度;2)多样性分数,量化与重复模式的偏离程度。结合这些指标,我们筛选出最终的期望合成池。

为了量化我们筛选策略的效用,我们在不同数据集(如CIFAR-10、ImageNet等)和架构(如ResNet、ViT)上进行了实验。我们使用在目标分布上训练的生成器合成数据池,然后应用筛选方法训练下游模型进行域内和域外测试。此外,我们将筛选作为优化生成后的后处理步骤应用于下游任务。实证结果证明了我们的生成后处理在不同设置下的有效性。

总结而言,我们的贡献如下:
1. 一种具有最小性保证(命题1)的真实数据最近邻覆盖划分(homogeneous-heterogeneous),给出了典型样本与非冗余样本的明确概念。
2. 一种原则性的、生成后的选择策略,联合量化并平衡保真度和多样性。该框架与生成器无关,仅需一个合成数据池,避免了昂贵的生成器重新训练或微调。
3. 大量实验在多个生成器和骨干网络上的分类和分割基准中验证了该方法。我们的方法在域内准确性和OOD鲁棒性上始终优于基线,并在生成器侧干预方法上进行了额外的插件评估。

## 2 相关工作  
### 2.1 为提升下游效用筛选合成数据  
合成数据已成为人工智能时代数据稀缺问题的有前景解决方案[54,43,64]。近期研究表明,在合成数据上训练的模型可以学习鲁棒的视觉表征[23,75,57,20,56]。此外,用合成样本扩增真实数据集已被证明能进一步提升模型性能[49,70,44]。然而,真实数据与合成数据之间的分布差距[17,21]凸显了精心调整[38,64,63,19]以充分挖掘合成数据潜力的必要性。

在生成之前或生成期间进行干预是提升合成数据效用的有效方法。基于微调的方法使生成器适应目标分布或下游任务[4,31],而基于提示、引导和采样的方法则引导生成样本朝向所需类别、属性或更难的变体[69,33,39,46]。尽管这些方法可以提升合成数据的效用,但它们通常需要访问生成器、任务特定的调优、提示工程专业知识或额外的生成成本。

相比之下,生成后筛选为提升合成数据效用提供了一种实用且可扩展的替代方案,避免了生成时干预的缺点。

### 2.2 生成后合成数据筛选  
与真实数据剪枝[2,1,7]不同,合成数据的使用涉及生成器偏差、分布漂移和模式坍塌。这些伪影需要精心筛选以引导合成池朝向目标。

**保真度引导的筛选**。高保真度的生成确保语义正确性,使得基于保真度的选择有效。这类筛选策略大致可分为两种主要方法:1)图像-标签对齐:使用预训练或任务特定模型过滤低质量样本,丢弃那些不在top-k预测内的样本[5,72,10,60]。具体来说,CLIP[45]用于评估图像-标签语义对齐[23,40,55];2)图像-图像对齐:该方法量化合成图像与真实图像之间的相似度,以过滤偏离真实分布的低质量数据[36,40,41,8]。具体地,基于聚类的筛选[40]使用真实数据聚类中心作为锚点来检索合成样本。这些方法虽然直接,但过度依赖视觉相似性,有可能降低下游任务的数据多样性。

**多样性引导的筛选**。随着生成图像日益逼真,多样性对下游使用变得关键。先前的工作通过改变提示[50]、应用文本条件增强[15,13]、使用文本反演[59]或基于分类器输出条件化[24]来增强多样性。这些方法虽然有效,但需要微调或提示工程,且侧重于生成时的多样性,对于如何高效利用现有的合成数据集指导有限。

基于这些先验,我们通过联合考虑保真度和多样性来筛选合成数据集,而不修改生成模型的输出,形成了一个生成后数据筛选流程。

## 3 方法  
概述。我们面向以下*生成后筛选*问题,并假设仅能通过样本访问生成器。给定 (i) 一个带标签的真实参考集 DR={\(Ii,yi\)}i=1\|DR\|, (ii) 一个合成池 DS={I~j}j=1\|DS\|,其类别分配从生成器的条件化中继承,以及 (iii) 一个选择预算 k(可能远大于\|DR\|),目标是选择 A⊆DS,使得所选合成训练集提升在真实分布上的下游分类性能。我们的方法包含两个步骤。首先,我们将真实参考图像划分为同质子集 IHO(局部代表)和异质子集 IHE(非冗余变化)(第3.1节)。其次,我们将合成预算分配到这俩子集,并根据分区条件的保真度-多样性准则对每个合成候选进行评分(第3.2节)。关键设计原则是:所选集合应同时匹配真实类别的典型组成部分和异质组成部分,而不是将所有合成图像与一个单一池化的参考分布进行排序。

### 3.1 分类同质 (Homogeneous) 和异质 (Heterogeneous) 样本  
为了引导合成数据的选择,我们首先将目标真实分布划分为两个不同的集合:同质和异质。同质实例代表典型语义,在特征空间中表现出较高的类内相似性。异质实例捕获更大的变化,包括贡献多样性的非典型实例。

**识别同质和异质实例**。我们从每个真实类别在特征空间中的有向1-最近邻(1-NN)图构建同质/异质划分。该构建是局部的、非参数的,对于一个包含n个样本且输入特征维度为d的类别,复杂度为O(n^2 d)。与基于质心远近的划分(例如k-means、核心集划分)不同,它不对类别施加全局轴线:IHO 包含那些被其他样本用作最近局部代表的实例,而 IHE 包含在该局部图中入度为零的实例。

给定图像 I={I1,...,In},我们使用预训练编码器(例如MoCo v3[12])提取 l2 归一化的特征 F={f1,...,fn}。我们使用余弦距离 d(fi,fj)=1−⟨fi,fj⟩。

相似文章

通过分布级奖励优化视觉生成模型

Hugging Face Daily Papers

本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。