面向一步式视觉生成的表示分布匹配

Hugging Face Daily Papers 论文

摘要

本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。

我们阐述了表示分布匹配(RDM)的设计空间,RDM是我们对一种范式的命名,该范式通过匹配冻结的预训练编码器下生成特征与参考特征分布来训练一步式图像生成器。我们确定了两个设计轴:分布比较的方式以及进行比较的表示空间。沿着这些轴进行的受控研究得出了三个发现。首先,经典的MMD在十年前无法训练出令人信服的生成器,但一旦正确估计,它就变成了一个强大且可扩展的目标。其次,生成批次成为操作变量,其最优值超过2048,远超常规批次大小。第三,任何单一的表示都可能被欺骗,被驱动到低于真实分数,而图像仍然明显是假的,因此我们使用平衡的编码器组进行匹配,并使用SW_r14进行评估,这是一种基于14个编码器的切片Wasserstein距离,独立于训练损失且能抵抗欺骗。结合优选方案得到了改进的RDM(iRDM):它在ImageNet上以SW_r14 1.30的成绩创下了一步式最先进水平,并由PickScore(我们目标从未优化过的人类偏好代理)验证,在71.2%的匹配样本中,它优于之前最好的一步生成器。同样的方案将四步的FLUX.2 [klein]后训练为一步生成器,在GenEval上超越四步版本(0.826 vs 0.794),在PickScore上为22.76 vs 22.58,仅用90个H200 GPU小时。项目页面:https://alan-lanfeng.github.io/rdm/。
查看原文
查看缓存全文

缓存时间: 2026/07/03 03:52

论文页面 - 表示分布匹配实现一步式视觉生成

来源:https://huggingface.co/papers/2607.02375

摘要

表示分布匹配通过匹配预训练编码器下的特征分布实现高质量图像生成,并通过优化批次大小和多编码器评估指标提升性能。

我们阐明了表示分布匹配(Representation Distribution Matching, RDM)的设计空间——该范式通过匹配生成图像与参考图像在冻结的预训练编码器下的特征分布来训练一步式图像生成器。我们识别出两个设计轴:分布比较方式与比较所基于的表示空间。沿这两个轴的受控研究得出了三个发现。首先,经典的MMD(最大均值差异)在十年前无法训练出令人信服的生成器,但一旦正确估计,它便成为一个强大且可扩展的目标函数。其次,生成的批次大小成为操作变量,其最优值超过2048,远高于常规批次大小。第三,任何单一表示都可能被“钻空子“——当图像仍明显虚假时,该表示下的分数却被拉低至真实分数以下。因此,我们针对一组平衡的编码器进行匹配,并使用SW_r14(基于14个编码器的切片 Wasserstein 距离)进行评估,该指标独立于训练损失且能抵抗作弊。结合优选方案得到改进型RDM(iRDM):它在ImageNet上以SW_r14达到1.30,创下一步式方法的最优水平,同时由人类偏好代理指标PickScore(我们的目标函数从未优化过该指标)验证,在71.2%的匹配样本中优于之前的最佳一步式生成器。相同的配方将四步FLUX.2 [klein] 后训练为一步式生成器,在GenEval上以0.826对0.794超越四步版本,在PickScore上以22.76对22.58超越,仅消耗90块H200 GPU小时。项目页面:https://alan-lanfeng.github.io/rdm/。

查看 arXiv 页面 (https://arxiv.org/abs/2607.02375) 查看 PDF (https://arxiv.org/pdf/2607.02375) 项目页面 (https://alan-lanfeng.github.io/rdm/) GitHub8 (https://github.com/vita-epfl/RDM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02375)

在您的 agent 中获取此论文:

hf papers read 2607.02375

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

请在一个模型 README.md 中引用 arxiv.org/abs/2607.02375 以在此页面上建立链接。

引用此论文的数据集0

没有数据集链接到此论文

请在一个数据集 README.md 中引用 arxiv.org/abs/2607.02375 以在此页面上建立链接。

引用此论文的 Space0

没有 Space 链接到此论文

请在一个 Space README.md 中引用 arxiv.org/abs/2607.02375 以在此页面上建立链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页面上建立链接。

相似文章

通过奖励倾斜分布匹配强化少步生成器

Hugging Face Daily Papers

RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。

通过分布级奖励优化视觉生成模型

Hugging Face Daily Papers

本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。

感知流匹配用于少步生成建模

Hugging Face Daily Papers

感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。

用于视觉生成的表示 Fréchet 损失

Papers with Code Trending

本文介绍了 FD-loss,一种通过将总体规模与批次规模解耦,从而将 Fréchet 距离作为视觉生成的训练目标进行优化的方法。研究证明该方法能提高生成器的质量,并指出 FID 可能无法始终准确反映视觉质量。