MaskAlign: Token子集表征对齐实现高效扩散训练
摘要
MaskAlign提出了一种Token子集表征对齐方法,通过减少对完整Token集的依赖,并在扰动下保持稳定对齐,从而改进扩散Transformer训练。
查看缓存全文
缓存时间: 2026/06/12 06:51
论文页面 - MaskAlign:用于高效扩散训练的令牌子集表示对齐方法
来源:https://huggingface.co/papers/2606.08788 发布于 6月7日
·
提交者:https://huggingface.co/pangly
pangly (https://huggingface.co/pangly) 于 6月12日
摘要
一种名为 MaskAlign 的令牌子集表示对齐方法通过减少对完整令牌集的依赖以及在扰动下保持稳定的对齐行为,改进了扩散Transformer训练。
与预训练视觉模型进行表示对齐 (https://huggingface.co/papers?q=Representation%20alignment) 近期在加速扩散Transformer训练方面展现出强大潜力。通过将中间扩散特征与来自自监督视觉编码器 (https://huggingface.co/papers?q=self-supervised%20vision%20encoders) 的干净图像表示进行对齐,现有方法提升了收敛速度和生成质量。然而,这种对齐也引入了一个不容忽视的约束:扩散模型处理的是含噪输入,其可用信息随时间步变化,而参考特征则提取自干净图像。本文从令牌层视角重新审视了这种不匹配。我们发现,在全令牌表示对齐 (https://huggingface.co/papers?q=representation%20alignment) 下,具有较大对齐梯度范数 (https://huggingface.co/papers?q=alignment-gradient%20norms) 的令牌表现出稳定的空间偏好,这表明对齐目标并非均匀影响所有令牌,且可能促使模型依赖于完整的干净图像令牌集。为解决此问题,我们提出 MaskAlign (https://huggingface.co/papers?q=MaskAlign),一种令牌子集表示对齐 (https://huggingface.co/papers?q=token-subset%20representation%20alignment) 方法,在训练过程中对随机采样的令牌子集应用对齐。通过在各迭代中让模型接触不同的令牌子集,MaskAlign (https://huggingface.co/papers?q=MaskAlign) 降低了表示对齐 (https://huggingface.co/papers?q=representation%20alignment) 对完整令牌集的依赖,并鼓励在令牌子集扰动下更稳定的对齐行为。为进一步缓解直接丢弃令牌导致的信息损失,我们引入了一个轻量级的预掩码令牌混合 (https://huggingface.co/papers?q=pre-mask%20token%20mixing) 模块,在掩码操作前跨令牌共享信息。
查看 arXiv 页面 (https://arxiv.org/abs/2606.08788)
查看 PDF (https://arxiv.org/pdf/2606.08788)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.08788)
在你的代理中获取这篇论文:
hf papers read 2606.08788
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.08788 即可从此页面链接。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.08788 即可从此页面链接。
引用此论文的 Space 0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.08788 即可从此页面链接。
包含此论文的收藏 0
暂无收藏包含此论文
将此论文添加至收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
重掩码,而非替换:掩码扩散语言模型中的 Token-to-Mask 精修
提出 Token-to-Mask(T2M)重掩码,在掩码扩散 LM 中通过将可疑 token 重置为掩码状态而非直接覆盖来修正生成错误,在 CMATH 上最高提升 5.92 准确率,无需额外训练或参数。
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
Nemotron-Labs-Diffusion-Image:推进掩蔽离散扩散实现高分辨率图像合成
本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。
不要重新训练,只需对齐:通过表征对齐将自回归语言模型适配为扩散语言模型
本文介绍了 Repr-Align,一种通过表征对齐将自回归语言模型适配为扩散语言模型的方法,无需从头重新训练表征即可实现高达 4 倍的训练加速。
现在谁主导解码?追踪 Masked Diffusion Language Models 集成中的可靠轨迹
本文提出 TIE,一种面向 Masked Diffusion Language Models 的知识融合框架,通过追踪置信度动态来识别可靠解码轨迹,并在模型间迭代传输部分去噪序列,从而提升推理任务的生成质量。