冻结的像素空间扩散模型可利用自身样本进行自我引导

Hugging Face Daily Papers 论文

摘要

本文介绍了合成自引导(Synthetic Self-Guidance, SSG)方法,该方法将一个轻量级预测头附加到冻结的预训练像素空间扩散模型上,在采样过程中利用中间预测与最终预测之间的差异作为自引导。研究表明,模型生成的样本足以训练这个预测头,在无需分类器自由引导(CFG)的情况下,多个变体的FID降低了50%以上,并且增强了使用CFG的强基线。

像素空间扩散模型的目标是直接在原始像素上学习端到端生成器。这具有挑战性,因为单个模型必须在同一高维空间中同时捕捉全局结构和局部纹理。尽管近期的工作通过替代预测目标、训练目标和架构改进了像素扩散,但这些进展通常需要从头训练新模型。我们展示了一种更便宜、互补的策略:冻结的预训练像素扩散模型可以自我引导。我们的关键观察是,预训练像素扩散Transformer的中间层可以被解码为捕捉主要低频结构的粗略预测,而最终层则逐步细化局部高频细节。因此,我们将一个轻量级预测头附加到中间层,保持骨干网络冻结,并利用中间预测与最终预测之间的差异作为采样过程中的自引导方向。为了训练这个预测头,我们进一步发现真实图像并非必要。相反,模型生成的样本足以训练该预测头,甚至在增强像素扩散往往欠拟合的高频成分方面优于真实图像。在ImageNet上的多个像素扩散模型中,我们的合成自引导(SSG)持续改善生成效果,同时适配器训练所需的计算量不到完整模型训练的1%:在无分类器自由引导(CFG)的情况下,它使所评估的JiT变体的FID降低了50%以上,并进一步增强了使用CFG的强基线,例如,JiT-H/16从1.86降至1.67,PixelREPA-H/16从1.81降至1.59。我们的代码可在 https://github.com/zfu006/SSG 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/04 13:39

论文页面 - 冻结像素空间扩散模型可利用自身样本自我引导

来源:https://huggingface.co/papers/2607.29122

摘要

像素空间扩散模型旨在直接学习从原始像素到输出的端到端生成器。这颇具挑战性,因为单个模型必须同时捕获同一高维空间中的全局结构和局部纹理。尽管近期工作通过替代预测目标、训练目标和架构改进了像素扩散,但这些进展通常需要从头训练新模型。我们证明了存在一种成本更低的互补策略:冻结的预训练像素扩散模型可以进行自我引导。我们的关键观察是,预训练像素扩散 Transformer 的中间层可以被解码为粗略预测,从而捕获主要的低频结构,而最终层则逐步细化局部高频细节。因此,我们将一个轻量级预测头附加到中间层,保持主干网络冻结,并在采样过程中利用中间层预测与最终预测之间的差异作为自我引导方向。进一步地,我们发现训练该预测头并不需要真实图像;相反,模型生成的样本就足够了,甚至在增强像素扩散往往拟合不足的高频成分方面优于真实图像。在 ImageNet 上的多个像素扩散模型中,我们的合成自我引导(SSG)持续改进了生成质量,而适配器训练所需的计算量不到完整模型训练的 1%:在没有无分类器引导(CFG)的情况下,它将所评估的 JiT 变体的 FID 降低了 50% 以上,并进一步改进了使用 CFG 的强基线,例如,JiT-H/16 从 1.86 降至 1.67,PixelREPA-H/16 从 1.81 降至 1.59。我们的代码可在 https://github.com/zfu006/SSG 获取。

查看 arXiv 页面 查看 PDF GitHub2 添加到收藏

在您的 agent 中获取此论文:

hf papers read 2607\.29122

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.29122,即可从本页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.29122,即可从本页面链接到该数据集。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.29122,即可从本页面链接到该 Space。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。

相似文章

自梯度强制:原生长视频外推

Papers with Code Trending

提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。

GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏

Hugging Face Daily Papers

GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。

ReGuide:从测试时引导到自改进扩散策略

arXiv cs.LG

ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。