MaskAlign: Token子集表征对齐实现高效扩散训练

Hugging Face Daily Papers 论文

摘要

MaskAlign提出了一种Token子集表征对齐方法,通过减少对完整Token集的依赖,并在扰动下保持稳定对齐,从而改进扩散Transformer训练。

与预训练视觉模型的表征对齐近期在加速扩散Transformer训练方面展现出巨大潜力。通过对齐扩散过程的中间特征与自监督视觉编码器提取的干净图像表征,现有方法能够提升收敛速度和生成质量。然而,这种对齐也引入了一个关键约束:扩散模型处理的是带噪输入,其可用信息随时间步变化,而参考特征却来自干净图像。本文从Token级视角重新审视了这一不匹配问题。我们发现,在全Token表征对齐下,对齐梯度范数较大的Token表现出稳定的空间偏好,这表明对齐目标并非均匀作用于所有Token,可能促使模型依赖于完整的干净图像Token集。为解决这一问题,我们提出了MaskAlign,一种Token子集表征对齐方法,在训练中对随机采样的Token子集进行对齐。通过使模型在不同迭代中接触不同的Token子集,MaskAlign降低了表征对齐对完整Token集的依赖,并鼓励在Token子集扰动下更稳定的对齐行为。为缓解直接丢弃Token导致的信息损失,我们进一步引入了一个轻量级预掩码Token混合模块,在掩码前在Token间共享信息。
查看原文
查看缓存全文

缓存时间: 2026/06/12 06:51

论文页面 - MaskAlign:用于高效扩散训练的令牌子集表示对齐方法

来源:https://huggingface.co/papers/2606.08788 发布于 6月7日

·

提交者:https://huggingface.co/pangly

pangly (https://huggingface.co/pangly) 于 6月12日

摘要

一种名为 MaskAlign 的令牌子集表示对齐方法通过减少对完整令牌集的依赖以及在扰动下保持稳定的对齐行为,改进了扩散Transformer训练。

与预训练视觉模型进行表示对齐 (https://huggingface.co/papers?q=Representation%20alignment) 近期在加速扩散Transformer训练方面展现出强大潜力。通过将中间扩散特征与来自自监督视觉编码器 (https://huggingface.co/papers?q=self-supervised%20vision%20encoders) 的干净图像表示进行对齐,现有方法提升了收敛速度和生成质量。然而,这种对齐也引入了一个不容忽视的约束:扩散模型处理的是含噪输入,其可用信息随时间步变化,而参考特征则提取自干净图像。本文从令牌层视角重新审视了这种不匹配。我们发现,在全令牌表示对齐 (https://huggingface.co/papers?q=representation%20alignment) 下,具有较大对齐梯度范数 (https://huggingface.co/papers?q=alignment-gradient%20norms) 的令牌表现出稳定的空间偏好,这表明对齐目标并非均匀影响所有令牌,且可能促使模型依赖于完整的干净图像令牌集。为解决此问题,我们提出 MaskAlign (https://huggingface.co/papers?q=MaskAlign),一种令牌子集表示对齐 (https://huggingface.co/papers?q=token-subset%20representation%20alignment) 方法,在训练过程中对随机采样的令牌子集应用对齐。通过在各迭代中让模型接触不同的令牌子集,MaskAlign (https://huggingface.co/papers?q=MaskAlign) 降低了表示对齐 (https://huggingface.co/papers?q=representation%20alignment) 对完整令牌集的依赖,并鼓励在令牌子集扰动下更稳定的对齐行为。为进一步缓解直接丢弃令牌导致的信息损失,我们引入了一个轻量级的预掩码令牌混合 (https://huggingface.co/papers?q=pre-mask%20token%20mixing) 模块,在掩码操作前跨令牌共享信息。

查看 arXiv 页面 (https://arxiv.org/abs/2606.08788)
查看 PDF (https://arxiv.org/pdf/2606.08788)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.08788)

在你的代理中获取这篇论文:

hf papers read 2606.08788

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2606.08788 即可从此页面链接。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.08788 即可从此页面链接。

引用此论文的 Space 0

暂无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.08788 即可从此页面链接。

包含此论文的收藏 0

暂无收藏包含此论文

将此论文添加至收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力

arXiv cs.AI

PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。