高维潜变量的扩散性

Hugging Face Daily Papers 论文

摘要

本文表明,为重建而微调自编码器会降低有效维度,使得标准速度预测在扩散模型中效率低下,并提出使用x0预测来聚焦于信号流形,从而持续提升文本到图像生成性能。

表示自编码器 (RAEs) 使扩散模型能够在预训练视觉编码器的特征空间中运行。然而,许多现成编码器并非为忠实重建而优化,会丢弃细粒度视觉细节。正如预期,为图像重建微调这些编码器可以恢复这些细节。但或许反直觉的是,这一过程降低了所得表示的有效维度,改变后的几何结构对生成有下游效应。具体而言,我们表明在该高维空间中使用流匹配中的标准速度预测要求模型拟合低维信号流形之外的正交噪声方向,使优化效率低下。这促使我们使用干净数据参数化(x_{0}-预测)代替,它将学习聚焦于底层信号流形。在多个强重建编码器的实验中,我们显示x_{0}-预测持续提升文本到图像生成性能。
查看原文
查看缓存全文

缓存时间: 2026/09/24 07:38

论文页面——论高维潜变量的可扩散性

来源:https://huggingface.co/papers/2609.28473

摘要

表示自编码器(RAEs)使扩散模型能够在预训练视觉编码器的特征空间中运作。然而,许多现成编码器并非针对忠实重构进行优化,它们会丢弃细粒度视觉细节。正如预期,通过微调这些编码器来实现图像重构可以恢复这些细节。但或许有违直觉的是,这一过程会降低所生成表示的有效维度,而这种改变的几何结构会对下游生成产生影响。具体而言,我们表明,在高维空间中使用流匹配的标准速度预测,要求模型拟合位于低维信号流形之外的正交噪声方向,这导致优化效率低下。因此,我们提出使用干净数据参数化(x₀-预测),它将学习聚焦于底层信号流形。在多个强重构编码器的实验中,我们证明了x₀-预测能持续提升文本到图像生成性能。

查看 arXiv 页面 (https://arxiv.org/abs/2609.28473) 查看 PDF (https://arxiv.org/pdf/2609.28473) 项目页面 (https://cfeng16.github.io/on_the_diffusibility/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.28473)

在您的智能体中获取此论文:

hf papers read 2609\.28473

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.28473 以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.28473 以从此页面链接它。

引用此论文的空间0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.28473 以从此页面链接它。

包含此论文的收藏夹0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

流形假设下可证明的扩散模型学习:坍缩与精炼

arXiv cs.LG

本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。