文本模板令牌是扩散变换器中的隐式语义寄存器

Hugging Face Daily Papers 论文

摘要

本文研究了扩散变换器(DiTs)中的文本模板令牌如何作为隐式语义寄存器,在去噪过程中因果地维持物体身份,并提出了一种无需训练的剪枝规则,该规则移除了20%的注意力FLOPs,且性能下降极小。

文本到图像的扩散变换器(DiTs)联合处理文本和图像令牌,但其在去噪过程中的内部计算仍鲜为人知。我们为现代大规模DiTs引入了一个因果可解释性框架,该框架结合了注意力分解与跨令牌跨度、注意力头和层的定向干预。利用该框架将提示内容令牌与结构模板令牌分离,我们发现结构令牌在编码器输出时携带的提示特定信息很少。然而令人惊讶的是,它们成为主要的图像到文本的注意力汇聚点,并在DiT内部因果地维持物体身份,充当隐式语义寄存器。我们表明它们间接获得这种身份——提示语义首先注入到图像潜在表示中,然后被读回模板令牌,而非直接从提示令牌转移。受上述发现启发,我们为DiT设计了一种无需训练的剪枝规则:对提示令牌关注最强的注意力头是可舍弃的,剪除它们可移除20%的注意力FLOPs,而在GenEval上仅下降1.4个百分点。我们进一步揭示了DiT中生成计算在注意力头和深度上的组织方式,将语义路由与视觉合成分离,并从身份形成逐步推进到传播和细化。我们的工作不仅揭示了输入时编码语义的令牌未必是在生成过程中维持语义的那些令牌,而且还提供了对DiT内部机制的因果视角。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - 文本模板标记是扩散Transformer中的隐式语义寄存器

来源:https://huggingface.co/papers/2607.19139 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

文本到图像扩散Transformer(DiTs)联合处理文本和图像标记,但它们在去噪过程中的内部计算机制仍鲜为人知。我们引入了一个适用于现代大规模DiTs的因果可解释性框架,该框架将注意力分解与针对标记跨度、注意力头和层的定向干预相结合。利用该框架将提示内容标记与结构模板标记分离,我们发现结构标记在编码器输出中携带的提示特定信息极少。然而令人惊讶的是,它们作为图像到文本的注意力汇(attention sinks)占据主导地位,并在DiT内部因果性地维持对象身份,充当隐式语义寄存器。我们证明它们间接获取此身份:提示语义首先被注入图像潜变量,然后被读回模板标记,而非直接从提示标记传递。受上述发现启发,我们为DiTs设计了一种无需训练的剪枝规则。那些对提示标记注意力最强的头是可裁剪的,裁剪它们可减少20%的注意力FLOPs,而GenEval分数仅下降1.4点。我们进一步揭示了DiT中的生成计算如何跨注意力头和深度进行组织,将语义路由与视觉合成分离,并从身份形成逐步过渡到传播与精炼。我们的工作不仅揭示了输入时编码语义的标记未必是生成过程中维持语义的标记,还提供了DiT内部机制的因果视角。

查看 arXiv 页面 (https://arxiv.org/abs/2607.19139)查看 PDF (https://arxiv.org/pdf/2607.19139)GitHub0 (https://github.com/Met4physics/DiT-Interpretability)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19139)

在你的智能体中获取此论文:

hf papers read 2607.19139

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.19139 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.19139 以从此页面链接。

引用此论文的Space0

没有Space链接此论文

在Space README.md 中引用 arxiv.org/abs/2607.19139 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

寄存器对像素空间扩散变换器的重要性

Hugging Face Daily Papers

本文探讨了在像素空间扩散变换器(DiTs)中使用寄存器令牌的情况,发现尽管DiTs没有补丁令牌异常值,但寄存器令牌仍能提高特征图质量。作者提出了寄存器引导(Register Guidance)技术,用于放大寄存器贡献,以改善视觉结构。