高维潜变量的扩散性
摘要
本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。
查看缓存全文
缓存时间: 2026/09/24 07:38
论文页面——论高维潜变量的可扩散性
来源:https://huggingface.co/papers/2609.28473
摘要
表示自编码器(RAEs)使扩散模型能够在预训练视觉编码器的特征空间中运作。然而,许多现成编码器并非针对忠实重构进行优化,它们会丢弃细粒度视觉细节。正如预期,通过微调这些编码器来实现图像重构可以恢复这些细节。但或许有违直觉的是,这一过程会降低所生成表示的有效维度,而这种改变的几何结构会对下游生成产生影响。具体而言,我们表明,在高维空间中使用流匹配的标准速度预测,要求模型拟合位于低维信号流形之外的正交噪声方向,这导致优化效率低下。因此,我们提出使用干净数据参数化(x₀-预测),它将学习聚焦于底层信号流形。在多个强重构编码器的实验中,我们证明了x₀-预测能持续提升文本到图像生成性能。
查看 arXiv 页面 (https://arxiv.org/abs/2609.28473) 查看 PDF (https://arxiv.org/pdf/2609.28473) 项目页面 (https://cfeng16.github.io/on_the_diffusibility/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.28473)
在您的智能体中获取此论文:
hf papers read 2609\.28473
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.28473 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.28473 以从此页面链接它。
引用此论文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.28473 以从此页面链接它。
包含此论文的收藏夹0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
扩散友好型潜在流形的关键要素是什么?用于潜在扩散的先验对齐自编码器
本文介绍了先验对齐自编码器(PAE),这是一种用于构建扩散友好型潜在流形的新型方法,在实现最先进图像生成质量的同时,使训练收敛速度加快 13 倍。
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
深度之梦由此而成:可视化扩散模型中的单义特征
本文介绍了潜在空间优化可视化(LVO),这是一种机械可解释性技术,利用稀疏自编码器来可视化 Stable Diffusion 1.5 等扩散模型中的单义特征。
流形假设下可证明的扩散模型学习:坍缩与精炼
本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。