RiT:原版扩散变换器在表示空间中已足够
摘要
论文介绍了RiT,这是一种原版扩散变换器,在冻结的DINOv2特征上使用x预测的流匹配进行训练,在ImageNet 256×256上以更少的参数和无需蒸馏的快速采样实现了有竞争力的FID分数。
查看缓存全文
缓存时间: 2026/05/22 02:32
论文页面 - RiT:基础扩散变换器在表示空间中已足够
来源:https://huggingface.co/papers/2605.21981
摘要
在具有更优统计特性的表示空间中进行流匹配,能够以更少的参数和更快的采样实现高效的扩散模型训练。
使用 x-预测(即回归干净数据点,而非环境速度)的流匹配(https://huggingface.co/papers?q=Flow%20matching),已被证明能有效利用像素空间中的低维流形结构(li2025back)。我们探究:一个预训练的表示空间(https://huggingface.co/papers?q=pretrained%20representation%20space),虽然包含一个本征维度(https://huggingface.co/papers?q=intrinsic%20dimensionality)相当的低维数据流形,但能否提供更有利于流匹配学习的分布?通过沿四个几何轴比较像素、SD-VAE 和 DINOv2 特征,我们发现像素和 DINOv2 的本征维度几乎相同(均为 d≈33),但 DINOv2 的有效秩(https://huggingface.co/papers?q=effective%20rank)高出 7.3 倍,协方差条件数(https://huggingface.co/papers?q=covariance%20conditioning)改善 35 倍,超额峰度(https://huggingface.co/papers?q=excess%20kurtosis)低 11.5 倍,流形内插值误差(https://huggingface.co/papers?q=on-manifold%20interpolation%20error)低 1.7 倍;SD-VAE 潜变量则始终处于中间水平,这表明优势来自表示学习的目标而非单纯的压缩。这些统计特性使得流匹配回归问题良态,并消除了先前 DINOv2 扩散方法所需的专用预测头或黎曼传输。我们提出表示图像变换器(RiT):一个在冻结的 DINOv2 特征上通过 x-预测训练的 vanilla 扩散变换器(https://huggingface.co/papers?q=Diffusion%20Transformer),仅增加维度感知的噪声调度和联合 [CLS]-块建模。在 ImageNet 256×256 上,RiT 在不使用引导时达到 FID 1.45,使用无分类器引导(https://huggingface.co/papers?q=classifier-free%20guidance)时达到 1.14,以少 19% 的参数(676M 对比 839M)超越了 DiT^DH-XL。得到的 ODE 在粗离散化下也能高效求解:使用无分类器引导(https://huggingface.co/papers?q=classifier-free%20guidance),5 步 Heun(https://huggingface.co/papers?q=Heun%20steps)已达到 FID 2.0,10 步达到 1.25,无需蒸馏或一致性训练。代码见 https://github.com/lezhang7/RiT。
查看 arXiv 页面(https://arxiv.org/abs/2605.21981)查看 PDF(https://arxiv.org/pdf/2605.21981)GitHub4(https://github.com/lezhang7/RiT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21981)
在你的智能体中获取这篇论文:
hf papers read 2605.21981
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.21981 即可从此页面链接。
引用该论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.21981 即可从此页面链接。
引用该论文的 Spaces 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.21981 即可从此页面链接。
包含该论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
@elonmusk:Grok 太棒了
埃隆·马斯克称赞 Grok 的图像生成能力,因为它正确描绘了一位数学家从亏格为1的物体中喝水的画面,而 ChatGPT 生成的则是亏格为2的甜甜圈马克杯。
@heyshrutimishra: 我们衡量图像模型的方式一直是错的。多年来,我们关注的是相似度,然后是照片级真实感,每个基准测试都聚焦于……
该推文认为,图像模型一直以照片级真实感而非生产就绪性来评估,然后介绍了基于 NEO-Unify 架构的 SenseNova U1 Pro,该架构支持原生 8K 分辨率和迭代式设计推理。
研究PSCLS的最新进展
作者分享了Leo/PSCLS的早期进展,这是一个实验性系统,能够学习序列间的关系,并在训练更多故事时改进其故事生成效果和指标。
How Molecular Generative Models Organize Molecular Identity
This paper investigates how molecular generative models internally organize molecular identity in their latent spaces, revealing piecewise-constant regions and coarse-to-fine boundaries across three architectures.
通过Nyström方法弥合超维计算与核方法之间的差距
本文介绍了NysHD,一种通过Nyström近似将超维计算与核方法桥接起来的方法,允许任何正半定相似性函数用作HDC编码。与现有HDC编码方法相比,它在图数据集和字符串数据集上展示了更高的分类准确率。