像素空间文本到图像扩散模型的训练实证研究
摘要
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
查看缓存全文
缓存时间: 2026/08/18 03:49
论文页面 - 像素空间文本到图像扩散模型训练的实证研究
来源:https://huggingface.co/papers/2608.16887 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
研究者提出一种从潜空间到像素空间的训练策略,该策略能够加速大规模像素空间扩散模型的收敛并提升推理速度。
本文探讨了生成式建模中日益重要的议题:像素空间扩散模型(https://huggingface.co/papers?q=pixel-space%20diffusion%20models)。尽管已有大量研究关注此方向,但多数集中于小规模或类别条件设定。因此,能够匹配甚至超越成熟潜空间模型的像素空间模型训练实用方案仍付之阙如。通过全面的实证研究,我们首先观察到在像素空间直接进行大规模预训练的收敛速度明显慢于潜空间。这一发现促使我们提出从潜到像素的策略(https://huggingface.co/papers?q=latent-to-pixel%20strategy),该策略能高效地在潜空间获取生成先验(https://huggingface.co/papers?q=generative%20priors),并在后训练阶段过渡到像素空间。随后,我们系统性地研究了控制这一过渡的关键设计选择,包括权重初始化(https://huggingface.co/papers?q=weight%20initialization)、数据构成、预测目标(https://huggingface.co/papers?q=prediction%20target)、解码器架构(https://huggingface.co/papers?q=decoder%20architecture)和噪声调度(https://huggingface.co/papers?q=noise%20schedule),最终总结出一套实用方案,使所得像素空间模型不仅能匹配或超越其潜空间对应模型,还能实现3.18至4.75倍的端到端推理加速。我们希望本研究的发现能为未来的像素空间生成研究提供有益的实证见解与实用指南。
查看arXiv页面(https://arxiv.org/abs/2608.16887)查看PDF(https://arxiv.org/pdf/2608.16887)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.16887)
在您的代理中获取此论文:
hf papers read 2608\.16887
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型README.md中引用arxiv.org/abs/2608.16887,可从此页面链接。
引用本文的数据集0
无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2608.16887,可从此页面链接。
引用本文的Spaces0
无Space链接本文
在Space README.md中引用arxiv.org/abs/2608.16887,可从此页面链接。
包含本文的收藏夹0
无收藏夹包含本文
将本文添加到收藏夹(https://huggingface.co/new-collection)可从此页面链接。
相似文章
Abra:扩散图像训练的缩放研究
本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。
L2P:释放像素生成的潜在潜力
L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。
Nemotron-Labs-Diffusion-Image:推进掩蔽离散扩散实现高分辨率图像合成
本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。
从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测
ReChannel通过将令牌直接映射到像素空间块,适配预训练的扩散变换器(如FLUX-Klein)用于密集预测任务,在无三元图的抠图、KITTI深度和指代分割上以极少的额外参数取得了最先进的成果。