从SRA到Self-Flow:数据增强还是自监督?

Hugging Face Daily Papers 论文

摘要

本文研究了扩散Transformer中自对齐方法的机制,揭示了Self-Flow等方法带来的性能提升主要来自噪声维度上的数据增强,而非噪声级别之间的token交互。作者引入Attention Separation来证明这一点,并提出了一种结合自表示对齐与双时间步增强的有效设计。

表示对齐已成为加速扩散Transformer训练并提升生成质量的有效方法。近期的自对齐方法(如SRA和Self-Flow)通过将对齐构建在扩散模型内部,进一步消除了对外部预训练编码器的依赖。然而,从SRA到Self-Flow的改进机制(即双时间步调度)尚未被充分研究:Self-Flow将其增益归因于不同噪声级别token之间的交互,其中较干净的token帮助推断更嘈杂的token。在本工作中,我们重新审视了这一解释,并质疑增益是否反而来自噪声维度上的数据增强。为了解耦这些因素,我们引入了Attention Separation,它在保留与Self-Flow相同双时间步输入的同时,阻断了分配给不同噪声级别token之间的注意力。令人惊讶的是,去除这种交互并不会降低性能,甚至可能提升性能,这表明从SRA到Self-Flow的改进主要来自数据增强。此外,我们证明Attention Separation本身通过将单个图像拆分为多个有效的训练部分来扩展训练数据,从而提供了增强效果。基于这些观察,我们将自表示对齐与双时间步和注意力分离增强相结合,并在ImageNet上验证了这一设计的有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/03 07:53

论文页面 - 从 SRA 到 Self-Flow:数据增强还是自监督?

来源:https://huggingface.co/papers/2607.02508

摘要

研究调查了扩散 Transformer 中自对齐方法背后的机制,发现性能提升主要源自沿噪声维度的数据增强,而非不同噪声层级之间的 token 交互。

表示对齐(https://huggingface.co/papers?q=Representation%20alignment)已成为加速扩散 Transformer(https://huggingface.co/papers?q=diffusion%20transformer)训练并提升生成质量的有效方式。最近的自我对齐(https://huggingface.co/papers?q=self-alignment)方法,如 SRA(https://huggingface.co/papers?q=SRA)和 Self-Flow(https://huggingface.co/papers?q=Self-Flow),通过直接在扩散模型内部构建对齐,进一步消除了对外部预训练编码器的依赖。然而,从 SRA(https://huggingface.co/papers?q=SRA)到 Self-Flow(https://huggingface.co/papers?q=Self-Flow)的改进机制——即双时间调度(https://huggingface.co/papers?q=dual-time%20scheduling)——仍未被充分探究:Self-Flow(https://huggingface.co/papers?q=Self-Flow)将其收益归因于不同噪声层级 token 之间的交互,其中更干净的 token 帮助推断更嘈杂的 token。在这项工作中,我们重新审视了这一解释,并提出疑问:这种收益实际上是否来自沿噪声维度(https://huggingface.co/papers?q=noise%20dimension)的数据增强(https://huggingface.co/papers?q=data%20augmentation)?为厘清这些因素,我们引入了注意力分离(https://huggingface.co/papers?q=Attention%20Separation),该方法保留了与 Self-Flow(https://huggingface.co/papers?q=Self-Flow)相同的双时间步输入,同时阻止了分配给不同噪声层级的 token 之间的注意力交互。令人惊讶的是,移除这种交互并不会损害性能,甚至可能提升性能,这表明从 SRA(https://huggingface.co/papers?q=SRA)到 Self-Flow(https://huggingface.co/papers?q=Self-Flow)的改进主要源自数据增强(https://huggingface.co/papers?q=data%20augmentation)。此外,我们证明注意力分离(https://huggingface.co/papers?q=Attention%20Separation)本身通过将单张图像拆分为多个有效的训练部分来扩展训练数据,从而提供增强效果。基于这些观察,我们将自表示对齐(https://huggingface.co/papers?q=representation%20alignment)与双时间步和注意力分离增强相结合,并在 ImageNet 上验证了该设计的有效性。

查看 arXiv 页面(https://arxiv.org/abs/2607.02508)查看 PDF(https://arxiv.org/pdf/2607.02508)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.02508)

在您的 agent 中获取此论文:

hf papers read 2607.02508

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有与此论文关联的模型

在模型 README.md 中引用 arxiv.org/abs/2607.02508 以从本页面链接。

引用此论文的数据集0

没有与此论文关联的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.02508 以从本页面链接。

引用此论文的 Spaces0

没有与此论文关联的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.02508 以从本页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从本页面链接。

相似文章

LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型

Hugging Face Daily Papers

LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。