面向一步式视觉生成的表示分布匹配
摘要
本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。
查看缓存全文
缓存时间: 2026/07/03 03:52
论文页面 - 表示分布匹配实现一步式视觉生成
来源:https://huggingface.co/papers/2607.02375
摘要
表示分布匹配通过匹配预训练编码器下的特征分布实现高质量图像生成,并通过优化批次大小和多编码器评估指标提升性能。
我们阐明了表示分布匹配(Representation Distribution Matching, RDM)的设计空间——该范式通过匹配生成图像与参考图像在冻结的预训练编码器下的特征分布来训练一步式图像生成器。我们识别出两个设计轴:分布比较方式与比较所基于的表示空间。沿这两个轴的受控研究得出了三个发现。首先,经典的MMD(最大均值差异)在十年前无法训练出令人信服的生成器,但一旦正确估计,它便成为一个强大且可扩展的目标函数。其次,生成的批次大小成为操作变量,其最优值超过2048,远高于常规批次大小。第三,任何单一表示都可能被“钻空子“——当图像仍明显虚假时,该表示下的分数却被拉低至真实分数以下。因此,我们针对一组平衡的编码器进行匹配,并使用SW_r14(基于14个编码器的切片 Wasserstein 距离)进行评估,该指标独立于训练损失且能抵抗作弊。结合优选方案得到改进型RDM(iRDM):它在ImageNet上以SW_r14达到1.30,创下一步式方法的最优水平,同时由人类偏好代理指标PickScore(我们的目标函数从未优化过该指标)验证,在71.2%的匹配样本中优于之前的最佳一步式生成器。相同的配方将四步FLUX.2 [klein] 后训练为一步式生成器,在GenEval上以0.826对0.794超越四步版本,在PickScore上以22.76对22.58超越,仅消耗90块H200 GPU小时。项目页面:https://alan-lanfeng.github.io/rdm/。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02375) 查看 PDF (https://arxiv.org/pdf/2607.02375) 项目页面 (https://alan-lanfeng.github.io/rdm/) GitHub8 (https://github.com/vita-epfl/RDM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02375)
在您的 agent 中获取此论文:
hf papers read 2607.02375
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在一个模型 README.md 中引用 arxiv.org/abs/2607.02375 以在此页面上建立链接。
引用此论文的数据集0
没有数据集链接到此论文
请在一个数据集 README.md 中引用 arxiv.org/abs/2607.02375 以在此页面上建立链接。
引用此论文的 Space0
没有 Space 链接到此论文
请在一个 Space README.md 中引用 arxiv.org/abs/2607.02375 以在此页面上建立链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页面上建立链接。
相似文章
通过奖励倾斜分布匹配强化少步生成器
RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。
通过判别式文本表征将一步图像生成从类别标签扩展到文本
研究者通过集成高判别力的大语言模型文本编码器,将 MeanFlow 一步图像生成从固定类别标签扩展到灵活文本输入,实现高效的文本条件合成并显著提升性能。
通过分布级奖励优化视觉生成模型
本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。
感知流匹配用于少步生成建模
感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。
用于视觉生成的表示 Fréchet 损失
本文介绍了 FD-loss,一种通过将总体规模与批次规模解耦,从而将 Fréchet 距离作为视觉生成的训练目标进行优化的方法。研究证明该方法能提高生成器的质量,并指出 FID 可能无法始终准确反映视觉质量。