从SRA到Self-Flow:数据增强还是自监督?
摘要
本文研究了扩散Transformer中自对齐方法的机制,揭示了Self-Flow等方法带来的性能提升主要来自噪声维度上的数据增强,而非噪声级别之间的token交互。作者引入Attention Separation来证明这一点,并提出了一种结合自表示对齐与双时间步增强的有效设计。
查看缓存全文
缓存时间: 2026/07/03 07:53
论文页面 - 从 SRA 到 Self-Flow:数据增强还是自监督?
来源:https://huggingface.co/papers/2607.02508
摘要
研究调查了扩散 Transformer 中自对齐方法背后的机制,发现性能提升主要源自沿噪声维度的数据增强,而非不同噪声层级之间的 token 交互。
表示对齐(https://huggingface.co/papers?q=Representation%20alignment)已成为加速扩散 Transformer(https://huggingface.co/papers?q=diffusion%20transformer)训练并提升生成质量的有效方式。最近的自我对齐(https://huggingface.co/papers?q=self-alignment)方法,如 SRA(https://huggingface.co/papers?q=SRA)和 Self-Flow(https://huggingface.co/papers?q=Self-Flow),通过直接在扩散模型内部构建对齐,进一步消除了对外部预训练编码器的依赖。然而,从 SRA(https://huggingface.co/papers?q=SRA)到 Self-Flow(https://huggingface.co/papers?q=Self-Flow)的改进机制——即双时间调度(https://huggingface.co/papers?q=dual-time%20scheduling)——仍未被充分探究:Self-Flow(https://huggingface.co/papers?q=Self-Flow)将其收益归因于不同噪声层级 token 之间的交互,其中更干净的 token 帮助推断更嘈杂的 token。在这项工作中,我们重新审视了这一解释,并提出疑问:这种收益实际上是否来自沿噪声维度(https://huggingface.co/papers?q=noise%20dimension)的数据增强(https://huggingface.co/papers?q=data%20augmentation)?为厘清这些因素,我们引入了注意力分离(https://huggingface.co/papers?q=Attention%20Separation),该方法保留了与 Self-Flow(https://huggingface.co/papers?q=Self-Flow)相同的双时间步输入,同时阻止了分配给不同噪声层级的 token 之间的注意力交互。令人惊讶的是,移除这种交互并不会损害性能,甚至可能提升性能,这表明从 SRA(https://huggingface.co/papers?q=SRA)到 Self-Flow(https://huggingface.co/papers?q=Self-Flow)的改进主要源自数据增强(https://huggingface.co/papers?q=data%20augmentation)。此外,我们证明注意力分离(https://huggingface.co/papers?q=Attention%20Separation)本身通过将单张图像拆分为多个有效的训练部分来扩展训练数据,从而提供增强效果。基于这些观察,我们将自表示对齐(https://huggingface.co/papers?q=representation%20alignment)与双时间步和注意力分离增强相结合,并在 ImageNet 上验证了该设计的有效性。
查看 arXiv 页面(https://arxiv.org/abs/2607.02508)查看 PDF(https://arxiv.org/pdf/2607.02508)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.02508)
在您的 agent 中获取此论文:
hf papers read 2607.02508
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有与此论文关联的模型
在模型 README.md 中引用 arxiv.org/abs/2607.02508 以从本页面链接。
引用此论文的数据集0
没有与此论文关联的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.02508 以从本页面链接。
引用此论文的 Spaces0
没有与此论文关联的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.02508 以从本页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从本页面链接。
相似文章
奖励始终存在于你的数据中:使用判别器引导的强化学习修正流匹配
本文提出判别器引导的强化学习(DRL),通过使用预训练表示空间中的判别器作为最优奖励信号,来修正分数匹配和流匹配模型中的对齐问题,无需人类偏好即可显著提升视觉保真度和语义质量。
@svlevine: 扩散(或流)可生成出色策略,但用强化学习训练它们却出了名的困难:BPTT不稳定,RL…
新论文展示了如何通过用单位矩阵近似流去噪过程的雅可比矩阵来优化用于强化学习的流匹配行动者,使训练变得可行。
LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型
LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。
@svlevine: 一种使用扩散进行离策略强化学习的新方法:如果我们有离策略数据,我们需要找出扩散后期…
一种新的离策略强化学习方法,使用扩散模型,通过反转扩散过程来处理离策略数据。
多分辨率流匹配:基于分阶段采样的免训练扩散加速
MrFlow 是一种针对流匹配文本到图像模型的免训练多分辨率加速策略,它结合了低分辨率生成、像素空间超分辨率和噪声注入,无需训练或运行时修改即可实现高达25倍的端到端加速。