冻结的像素空间扩散模型可利用自身样本进行自我引导
摘要
本文介绍了合成自引导(Synthetic Self-Guidance, SSG)方法,该方法将一个轻量级预测头附加到冻结的预训练像素空间扩散模型上,在采样过程中利用中间预测与最终预测之间的差异作为自引导。研究表明,模型生成的样本足以训练这个预测头,在无需分类器自由引导(CFG)的情况下,多个变体的FID降低了50%以上,并且增强了使用CFG的强基线。
查看缓存全文
缓存时间: 2026/08/04 13:39
论文页面 - 冻结像素空间扩散模型可利用自身样本自我引导
来源:https://huggingface.co/papers/2607.29122
摘要
像素空间扩散模型旨在直接学习从原始像素到输出的端到端生成器。这颇具挑战性,因为单个模型必须同时捕获同一高维空间中的全局结构和局部纹理。尽管近期工作通过替代预测目标、训练目标和架构改进了像素扩散,但这些进展通常需要从头训练新模型。我们证明了存在一种成本更低的互补策略:冻结的预训练像素扩散模型可以进行自我引导。我们的关键观察是,预训练像素扩散 Transformer 的中间层可以被解码为粗略预测,从而捕获主要的低频结构,而最终层则逐步细化局部高频细节。因此,我们将一个轻量级预测头附加到中间层,保持主干网络冻结,并在采样过程中利用中间层预测与最终预测之间的差异作为自我引导方向。进一步地,我们发现训练该预测头并不需要真实图像;相反,模型生成的样本就足够了,甚至在增强像素扩散往往拟合不足的高频成分方面优于真实图像。在 ImageNet 上的多个像素扩散模型中,我们的合成自我引导(SSG)持续改进了生成质量,而适配器训练所需的计算量不到完整模型训练的 1%:在没有无分类器引导(CFG)的情况下,它将所评估的 JiT 变体的 FID 降低了 50% 以上,并进一步改进了使用 CFG 的强基线,例如,JiT-H/16 从 1.86 降至 1.67,PixelREPA-H/16 从 1.81 降至 1.59。我们的代码可在 https://github.com/zfu006/SSG 获取。
查看 arXiv 页面 查看 PDF GitHub2 添加到收藏
在您的 agent 中获取此论文:
hf papers read 2607\.29122
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.29122,即可从本页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.29122,即可从本页面链接到该数据集。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.29122,即可从本页面链接到该 Space。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。
相似文章
Spectral Guidance:灵活高效的扩散模型控制方法
介绍了Spectral Guidance,一种通过利用扩散过程的低维表示来控制扩散模型的框架,无需任务特定的重新训练或通过去噪器的反向传播即可实现灵活稳定的控制。
自梯度强制:原生长视频外推
提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。
GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏
GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。
ReGuide:从测试时引导到自改进扩散策略
ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。
x-Prediction 即一切:通过端点可解码性实现无需训练加速生成
本文介绍了截断跳跃采样(Truncated Jump Sampling, TJS),这是一种无需训练的方法,通过利用端点可解码性加速扩散模型和流匹配模型的生成,将神经函数评估次数减少20-70%,同时在多个模型上保持接近匹配的质量。