像素空间文本到图像扩散模型的训练实证研究

Hugging Face Daily Papers 论文

摘要

本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。

本文研究了生成模型中一个日益重要的主题:像素空间扩散模型。尽管已有众多研究探讨了这一主题,但大多数聚焦于小规模或类别条件设置。因此,训练出能够媲美或超越成熟潜在空间模型的像素空间模型的实用方案仍然难以捉摸。通过全面的实证研究,我们首先观察到,在像素空间中进行直接大规模预训练的收敛速度明显慢于潜在空间。这一观察促使我们提出一种从潜在空间到像素空间的策略,即在潜在空间中高效获取生成先验,并在后训练阶段过渡到像素空间。随后,我们系统研究了控制这一过渡的关键设计选择,包括权重初始化、数据构成、预测目标、解码器架构和噪声调度,并确定了一个实用方案,使得所得像素空间模型能够匹配或超越其潜在空间对应模型,同时实现3.18到4.75倍的端到端推理加速。我们希望我们的发现能够为未来像素空间生成的研究提供有用的实证见解和实用指南。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:49

论文页面 - 像素空间文本到图像扩散模型训练的实证研究

来源:https://huggingface.co/papers/2608.16887 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

研究者提出一种从潜空间到像素空间的训练策略,该策略能够加速大规模像素空间扩散模型的收敛并提升推理速度。

本文探讨了生成式建模中日益重要的议题:像素空间扩散模型(https://huggingface.co/papers?q=pixel-space%20diffusion%20models)。尽管已有大量研究关注此方向,但多数集中于小规模或类别条件设定。因此,能够匹配甚至超越成熟潜空间模型的像素空间模型训练实用方案仍付之阙如。通过全面的实证研究,我们首先观察到在像素空间直接进行大规模预训练的收敛速度明显慢于潜空间。这一发现促使我们提出从潜到像素的策略(https://huggingface.co/papers?q=latent-to-pixel%20strategy),该策略能高效地在潜空间获取生成先验(https://huggingface.co/papers?q=generative%20priors),并在后训练阶段过渡到像素空间。随后,我们系统性地研究了控制这一过渡的关键设计选择,包括权重初始化(https://huggingface.co/papers?q=weight%20initialization)、数据构成、预测目标(https://huggingface.co/papers?q=prediction%20target)、解码器架构(https://huggingface.co/papers?q=decoder%20architecture)和噪声调度(https://huggingface.co/papers?q=noise%20schedule),最终总结出一套实用方案,使所得像素空间模型不仅能匹配或超越其潜空间对应模型,还能实现3.18至4.75倍的端到端推理加速。我们希望本研究的发现能为未来的像素空间生成研究提供有益的实证见解与实用指南。

查看arXiv页面(https://arxiv.org/abs/2608.16887)查看PDF(https://arxiv.org/pdf/2608.16887)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.16887)

在您的代理中获取此论文:

hf papers read 2608\.16887

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2608.16887,可从此页面链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2608.16887,可从此页面链接。

引用本文的Spaces0

无Space链接本文

在Space README.md中引用arxiv.org/abs/2608.16887,可从此页面链接。

包含本文的收藏夹0

无收藏夹包含本文

将本文添加到收藏夹(https://huggingface.co/new-collection)可从此页面链接。

相似文章

Abra:扩散图像训练的缩放研究

Hugging Face Daily Papers

本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。