RiT:原版扩散变换器在表示空间中已足够

Hugging Face Daily Papers 论文

摘要

论文介绍了RiT,这是一种原版扩散变换器,在冻结的DINOv2特征上使用x预测的流匹配进行训练,在ImageNet 256×256上以更少的参数和无需蒸馏的快速采样实现了有竞争力的FID分数。

使用x预测的流匹配——回归干净数据点而非环境速度——已知在像素空间中能有效利用低维流形结构(li2025back)。我们探究:预训练的表示空间,虽然包含了一个具有相当内在维度的低维数据流形,但能否提供一个更有利于流匹配学习的分布?沿四个几何轴比较像素、SD-VAE和DINOv2特征,我们发现像素和DINOv2具有几乎相同的内在维度(均为$d\approx33$),但DINOv2的有效秩高出7.3倍,协方差条件数好35倍,超额峰度低11.5倍,流形上插值误差低1.7倍;SD-VAE潜变量则始终居中,表明优势来自表示学习目标而非单纯压缩。这些统计特性使得流匹配回归变得良态,消除了先前DINOv2扩散方法中使用的专门预测头或黎曼传输的需求。我们提出表示图像变换器(RiT):一种在冻结的DINOv2特征上通过x预测训练的原始扩散变换器,仅通过维度感知噪声调度和联合[CLS]-分块建模进行增强。在ImageNet 256×256上,RiT在无引导下达到FID 1.45,在无分类器引导下达到1.14,优于DiT^DH-XL,参数减少19%(676M vs. 839M)。所得到的ODE在粗离散化下可高效求解:在无分类器引导下,5步Heun法已能达到FID 2.0,10步达到1.25,无需蒸馏或一致性训练。代码见https://github.com/lezhang7/RiT。
查看原文
查看缓存全文

缓存时间: 2026/05/22 02:32

论文页面 - RiT:基础扩散变换器在表示空间中已足够

来源:https://huggingface.co/papers/2605.21981

摘要

在具有更优统计特性的表示空间中进行流匹配,能够以更少的参数和更快的采样实现高效的扩散模型训练。

使用 x-预测(即回归干净数据点,而非环境速度)的流匹配(https://huggingface.co/papers?q=Flow%20matching),已被证明能有效利用像素空间中的低维流形结构(li2025back)。我们探究:一个预训练的表示空间(https://huggingface.co/papers?q=pretrained%20representation%20space),虽然包含一个本征维度(https://huggingface.co/papers?q=intrinsic%20dimensionality)相当的低维数据流形,但能否提供更有利于流匹配学习的分布?通过沿四个几何轴比较像素、SD-VAE 和 DINOv2 特征,我们发现像素和 DINOv2 的本征维度几乎相同(均为 d≈33),但 DINOv2 的有效秩(https://huggingface.co/papers?q=effective%20rank)高出 7.3 倍,协方差条件数(https://huggingface.co/papers?q=covariance%20conditioning)改善 35 倍,超额峰度(https://huggingface.co/papers?q=excess%20kurtosis)低 11.5 倍,流形内插值误差(https://huggingface.co/papers?q=on-manifold%20interpolation%20error)低 1.7 倍;SD-VAE 潜变量则始终处于中间水平,这表明优势来自表示学习的目标而非单纯的压缩。这些统计特性使得流匹配回归问题良态,并消除了先前 DINOv2 扩散方法所需的专用预测头或黎曼传输。我们提出表示图像变换器(RiT):一个在冻结的 DINOv2 特征上通过 x-预测训练的 vanilla 扩散变换器(https://huggingface.co/papers?q=Diffusion%20Transformer),仅增加维度感知的噪声调度和联合 [CLS]-块建模。在 ImageNet 256×256 上,RiT 在不使用引导时达到 FID 1.45,使用无分类器引导(https://huggingface.co/papers?q=classifier-free%20guidance)时达到 1.14,以少 19% 的参数(676M 对比 839M)超越了 DiT^DH-XL。得到的 ODE 在粗离散化下也能高效求解:使用无分类器引导(https://huggingface.co/papers?q=classifier-free%20guidance),5 步 Heun(https://huggingface.co/papers?q=Heun%20steps)已达到 FID 2.0,10 步达到 1.25,无需蒸馏或一致性训练。代码见 https://github.com/lezhang7/RiT。

查看 arXiv 页面(https://arxiv.org/abs/2605.21981)查看 PDF(https://arxiv.org/pdf/2605.21981)GitHub4(https://github.com/lezhang7/RiT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21981)

在你的智能体中获取这篇论文:

hf papers read 2605.21981

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2605.21981 即可从此页面链接。

引用该论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.21981 即可从此页面链接。

引用该论文的 Spaces 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2605.21981 即可从此页面链接。

包含该论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

@elonmusk:Grok 太棒了

X AI KOLs Timeline

埃隆·马斯克称赞 Grok 的图像生成能力,因为它正确描绘了一位数学家从亏格为1的物体中喝水的画面,而 ChatGPT 生成的则是亏格为2的甜甜圈马克杯。

研究PSCLS的最新进展

Reddit r/artificial

作者分享了Leo/PSCLS的早期进展,这是一个实验性系统,能够学习序列间的关系,并在训练更多故事时改进其故事生成效果和指标。

通过Nyström方法弥合超维计算与核方法之间的差距

arXiv cs.LG

本文介绍了NysHD,一种通过Nyström近似将超维计算与核方法桥接起来的方法,允许任何正半定相似性函数用作HDC编码。与现有HDC编码方法相比,它在图数据集和字符串数据集上展示了更高的分类准确率。