AdvFD:通过对抗式弗雷歇距离损失提升视觉生成
摘要
本文介绍了对抗式弗雷歇距离(AdvFD),它在静态弗雷歇损失的基础上增加了一个可学习的对抗性特征空间,以改进生成器的后训练,并通过真实特征白化来稳定优化过程。
查看缓存全文
缓存时间: 2026/08/12 08:19
论文页面 - AdvFD: 通过对抗性 Fréchet 距离损失提升视觉生成
来源:https://huggingface.co/papers/2608.11205
摘要
对抗性 Fréchet 距离通过在静态 Fréchet 损失上添加一个可学习的对抗性特征空间,并利用白化来稳定优化,从而改进了生成器的后训练。
Fréchet 距离(https://huggingface.co/papers?q=Fr%C3%A9chet%20distance)最近已被证明是一种有效的分布级目标,用于生成器后训练(https://huggingface.co/papers?q=generator%20post-training),补充了传统的样本级扩散与流匹配损失(https://huggingface.co/papers?q=flow-matching%20loss)。然而,直接优化 Fréchet 目标会导致 Fréchet hacking(https://huggingface.co/papers?q=Fr%C3%A9chet%20hacking)。目标指标持续提升,但视觉质量以及在其他特征空间中的 Fréchet 对齐可能会停滞甚至恶化。我们将这种失败归因于现有 Fréchet 损失所采用的静态预训练特征空间(https://huggingface.co/papers?q=pretrained%20feature%20spaces)。这些特征空间只能提供关于真实分布与生成分布之间差异的不完整且固定的视角。为了解决这一局限性,我们提出了对抗性 Fréchet 距离(https://huggingface.co/papers?q=Adversarial%20Fr%C3%A9chet%20Distance)(AdvFD(https://huggingface.co/papers?q=AdvFD)),它通过一个经过校准的对抗性学习表示(https://huggingface.co/papers?q=adversarially%20learned%20representation)来补充 FD-Loss 中的静态表示目标。AdvFD(https://huggingface.co/papers?q=AdvFD)在原始静态 Fréchet 目标之上增加了一个可学习的表示,该表示以对抗方式最大化真实样本与生成样本之间的 Fréchet 差异,同时生成器在由此产生的自适应特征空间中最小化相同的差异。为了防止对抗性表示通过特征放大来琐碎地增加目标,我们进一步引入了真实特征白化(https://huggingface.co/papers?q=real-feature%20whitening),它对其尺度和协方差几何进行归一化,并稳定了最小-最大优化。大量实验表明,AdvFD(https://huggingface.co/papers?q=AdvFD)在 JiT 和 pMF 两种骨干网络以及不同模型规模上,始终能改善一步生成器(https://huggingface.co/papers?q=one-step%20generator)的后训练。
查看 arXiv 页面(https://arxiv.org/abs/2608.11205)查看 PDF(https://arxiv.org/pdf/2608.11205)项目页面(https://gasaiyu.github.io/AdvFD-page/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.11205)
在你的 agent 中获取此论文:
hf papers read 2608\.11205
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
0 没有模型链接此论文 在模型 README.md 中引用 arxiv.org/abs/2608.11205 即可从此页面链接到该模型。
引用此论文的数据集
0 没有数据集链接此论文 在数据集 README.md 中引用 arxiv.org/abs/2608.11205 即可从此页面链接到该数据集。
引用此论文的 Spaces
0 没有 Space 链接此论文 在 Space README.md 中引用 arxiv.org/abs/2608.11205 即可从此页面链接到该 Space。
包含此论文的收藏集
0 没有收藏集包含此论文 将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接到它。
相似文章
用于视觉生成的表示 Fréchet 损失
本文介绍了 FD-loss,一种通过将总体规模与批次规模解耦,从而将 Fréchet 距离作为视觉生成的训练目标进行优化的方法。研究证明该方法能提高生成器的质量,并指出 FID 可能无法始终准确反映视觉质量。
面向自回归视频生成的在线策略对抗流蒸馏
提出对抗流蒸馏(AFD),用于将异质黑盒视频生成模型蒸馏为自回归学生模型,采用在线策略反馈和前向过程流匹配更新。
通过分布级奖励优化视觉生成模型
本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。
FedOPAL: 基于解析视觉提示调整的单次联邦学习
FedOPAL 提出了一种框架,将视觉提示适配为特征校正器,用于单次联邦学习,通过解析方法实现高效的无梯度聚合,在零服务器端训练成本下,性能显著优于现有解析方法,并可与迭代方法相媲美。
AAD-1:一步自回归视频生成的非对称对抗性蒸馏
AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。