训练、阅读和编辑可解释的Transformer
摘要
本文介绍了一种通过清晰度惩罚训练带有可解释性算子的Transformer的方法,该惩罚利用每通道方差下限避免崩溃,实现了高可解释性并与传统基线保持质量一致。
arXiv:2607.08946v1 公告类型: 新
摘要: Transformer可以由从构造上即可解释的算子构建——这些算子是有界、命名的单元,行为类似于模糊集运算而非密集激活——但可解释性必须在训练过程中被强调,而这种强调存在一种失败模式。旨在将边界算子锐化为决定性检测器的清晰度惩罚,反而会使其坍缩为恒定常数。恒等式 E[v(1-v)] = mu(1-mu) - var 揭示了原因——该惩罚是一种对“活跃检测器”与“常数”之间的差异视而不见的方差最小化器——并指明了修复方法:引入每通道方差下限,将目标可解释性指标直接作为损失函数,从而同时恢复可解释性与质量。之后,学习到的每单元分数取代了先前工作中手工设置的保留GELU分区:给定选择后,模型不保留任何纯GELU单元,并将87%的承载计算路由至清晰算子。结果是迄今为止我们构建的最可解释的Transformer——其前馈算子的78%和注意力值通道的50%都是清晰且上下文相关的检测器,且每头可解释性从浅层的18%提升至深层的78%。在正确的逐层旋转框架下阅读时,这些单元将清晰的检测(单元响应什么)与更困难的命名(其输出解码成什么)区分开来;由于目标函数使每个单元清晰且稀疏,对其进行的编辑具有更高的局部性——在编辑集中的深层,局部性提升50-184倍——并且能够针对单个神经元无法表达的显式合取进行编辑。最后,单元间的去相关压力提供了一个可解释性调节旋钮:它在不牺牲质量的情况下,用电路复用换取独立性,将概念转化为单个可精确编辑的单元,并将预测转化为从少数命名操作中读出的简短解释。在整个过程中,质量与常规基线保持持平。
查看缓存全文
缓存时间: 2026/07/13 07:56
# 训练、阅读与编辑可读 Transformer
来源:https://arxiv.org/html/2607.08946
Mark Oskin 教授
计算机科学与工程学院
华盛顿大学
mhoskin@uw\.edu(2026 年 7 月)
###### 摘要
Transformer 可以用本质上可读的算子构建——这些算子是有界、可命名的单元,其行为如同模糊集操作而非密集激活——但可读性必须在训练中加以推动,而这种推动存在一种失败模式。旨在将边界算子锐化为决定性检测器的清晰度惩罚,反而会将其压制成一个死常数。恒等式 \(\mathbb{E}[v(1-v)] = \mu(1-\mu) - \mathrm{var}\) 揭示了原因——该惩罚是一个方差最小化器,无法区分活跃检测器与常数——并指明了修复方法:每个通道的方差下限,将目标可读性指标直接作为损失写入,从而同时恢复可读性与质量。随后,每个单元的可学习比例取代了先前工作中手动设定的保留 GELU 划分:给定选择,模型保留*零*个单元为纯 GELU,并将 87% 的负载计算路由至清晰算子。结果是迄今构建的最可读 Transformer——78% 的前馈操作数和 50% 的注意力值通道是清晰且上下文相关的检测器,且每个头的可读性从浅层的 18% 上升至深层的 78%。在正确的逐层旋转框架中读取时,这些单元将纯粹的*检测*(单元响应什么)与更难的*命名*(其输出解码为什么)区分开来;由于目标函数使每个单元清晰且稀疏,对它们的编辑局部性显著提升——在编辑点集中的深层,局部性可达 50–184 倍——并且可以针对单个神经元无法表达的显式合取操作。最后,单元间的去相关压力暴露了一个可读性旋钮:它以零质量代价,将电路的复用转化为独立性,将概念转化为单个可手术编辑的单元,并将预测转化为从少数命名操作中读取的简短解释。在整个过程中,质量始终与常规基线持平。
## 1 引言
大多数可解释性研究在训练后重建含义:探测密集激活,用稀疏自编码器分解,或通过词汇解码,然后人类命名所发现的内容。另一种方式是内建含义——使模型的算子本质可读,使得每个坐标承载固定、明确的解读,而非事后恢复。两种先前的构建方法沿此路线:前馈层变为有界操作数上的模糊集操作(Oskin,2026a),注意力值变为有界、可命名的检测器(Oskin,2026b),两者均达到语言模型水平的性能(图 1)。但本质可读的*基底*并非可读的*模型*。其算子只有在训练保持其可读性时才清晰可读;这两种构建从未一起训练;而阅读这样的模型,以及编辑它,本身就是问题。本文旨在使这条路线端到端可用——如何训练模型使其单元真正可读,如何阅读它们,如何编辑它们,以及单个额外的压力如何重塑它们形成的电路。
障碍恰恰在于可读性所依赖的压力。有界算子只有在*果断*激活时——接近 0 或接近 1,“不存在”或“存在”——才清晰可读,因此两种构建都添加了清晰度惩罚,将每个值推向边界。推得过度时,这一惩罚就会适得其反:它将单元驱动至一个忽略输入的固定值——*死常数*——完美清晰但毫无信息,质量也随之崩溃。原因精确。对于有界值,清晰度惩罚等于 \(\mu(1-\mu) - \mathrm{var}\),这是一个方差最小化器,无法区分活跃的上下文检测器与死常数,因此梯度下降选择了更便宜的常数。指出原因便给出了对策:每个通道的*方差下限*——即区分活跃检测器与死常数的属性,直接作为损失写入。它增加一个项,无参数,并将毁坏模型的压力转化为同时恢复可读性与质量的动力。
同样的原则取代了另一个手动设定的旋钮。先前工作保留固定比例的前馈单元作为普通 GELU 以保证可训练性;每单元可学习门控将这种保留变为模型自身的决策,而给定选择,模型保留*零*个单元为纯 GELU,并将 87% 的负载计算路由至可读算子。结果是迄今构建的最可读 Transformer,也是首次在两个子层上同时可读:78% 的前馈操作数和 50% 的注意力值通道是清晰、上下文相关的检测器。
可读模型可以被阅读,但正确阅读需要技巧。在网络的中间层,残差处于旋转框架中,通过原始词汇投影读取单元的输出是不清晰的;逐层调谐透镜将其旋转回来,使得补全背后的抽象计算比原始透镜显示的早几个层可见。在该框架中阅读分离了两个特性,这是我们的构建允许分别测量的:单元的*检测*——它响应的清晰、依赖于输入的比特——与其*命名*——它写入的内容是否解码为一个词汇。模型的检测远清晰于命名:大多数前馈操作数是选择性检测器,但仅约一半解码为词汇类别,而无法命名的概念正是那些在栈中非词汇化携带的抽象概念。这些也是它*分布*的概念:词元级特征存在于单个单元上,而抽象概念散布于多个单元,并随深度增长而更加分布——普通网络的叠加现象,现在在可读背景下可见。
由于目标函数使每个单元清晰且稀疏,编辑 Transformer 的标准工具——均值差写回、激活引导——对它们更有效。清晰、稀疏的单元是干净的操作对象:放置的编辑保持局部性,在编辑点集中的深层局部性可达 184 倍,且无需搜索即可找到。而命名的集合操作使得单个神经元无法表达的编辑成为可能——一个合取 \(A \cap B\) 写入单个可寻址、双操作数的单元。编辑借用了先前工作的机制;目标函数提供的是操作点的质量。
阅读模型的电路显示了它如何布线一个概念:冗余的,少数算子广播给许多读者——*扇出*电路,高效但难以触及,因为编辑一个概念意味着更改每个副本并干扰每个读者。单个额外的压力重塑了它。单元间的去相关惩罚——禁止单元共同激活,从而禁止复用所依赖的共享构建块——以零质量代价将扇出电路转化为*扇入*电路:许多独立单元,每个聚合宽泛、不重叠的输入。这一权衡直接购买可编辑性——存在于 562 单元纠缠中的概念变成一个可寻址单元——以及整个预测的可读性:在普通 Transformer 中散布于上千个小片段的词元归因,压缩为少数命名操作组成的短列表,可以像句子一样阅读(*“than”因为一个比较单元激活了,一个头读取了比较形容词*)。它付出的代价是复用提供的压缩,这是我们对分布外组合尚不测量的成本。
贯穿始终的主线是贡献在于*可读性*,而非不同的机器或更好的分数。这些工具读取的结构——概念存在于何处、如何冗余构建、如何广泛读取——是常规 Transformer 可能共享的结构,且每个测量都基于 GELU 模型也拥有的激活和权重;构建添加的是所有这些可以直接读取,无需事后训练的字典、选择和重新验证。质量在整个过程中与常规基线持平。
贡献。
- • **可读性目标**。每个通道的方差下限——将可读性指标作为损失写入——修复了清晰度惩罚导致的崩溃,同时恢复可读性与质量;\(\mu(1-\mu) - \mathrm{var}\) 恒等式指出了朴素惩罚失败的原因(第 4 节)。
- • **端到端可读 Transformer**。前馈和注意力构建首次一起训练,每单元可学习门控取代了手动设定的保留 GELU 划分,产生在两个子层上均可读且性能相当的模型(第 3–4 节)。
- • **阅读单元**。在每层的旋转框架中,单元将清晰的*检测*与更难的*命名*分开;模型检测远超命名,并且恰好分布了无法命名的概念(第 5 节)。
- • **编辑单元**。清晰、稀疏的单元是手术式的编辑点——比常规神经元局部性高得多——并支持单个单元合取 \(A \cap B\) 编辑,这是神经元无法表达的(第 6 节)。
- • **可读性旋钮**。单元间的去相关压力以零质量代价将电路复用(扇出)转化为独立性(扇入),使概念可手术编辑,整个预测可解释为少数命名操作的短列表(第 7 节)。
## 2 背景与相关工作
我们的工作位于五条线的交叉点:本质可解释的模型组件、可解释性训练目标、词汇空间隐状态读出、叠加及其后果、模型编辑。我们直接基于每条线的先前结果。
### 2.1 本质可解释的组件
一系列工作用本质可设计为可理解的组件取代标准组件,而非事后恢复结构。Softmax 线性单元以很小代价提高了第一眼可解释的 MLP 神经元比例,同时指出此类更改也可能隐藏特征(Elhage 等,2022a)。双线性 MLP 移除了逐元素非线性,使得交互结构可从权重本身恢复,达到语言模型性能水平(Pearce 等,2025)。码本特征将残差流量化为少量离散码(Tamkin 等,2024),而 Backpack 模型将每个词元表示为非负组合的可线性解码语义向量,实现可预测干预,达到 GPT-2 性能(Hewitt 等,2023)。Kolmogorov–Arnold 网络在边上暴露可学习的单变量函数(Liu 等,2024)。我们的乘法算子在机械上是 GLU 家族中的门控双线性单元(Shazeer,2020);特殊之处在于两个操作数均被 sigmoid 约束至 \([0,1]\) 并解读为模糊集隶属度,且显式集合差项作为一等单元。平行的神经符号文献将逻辑连接层实现为可微层:逻辑张量网络(Badreddine 等,2022)、逻辑神经网络(Riegel 等,2020)、梯度下降下模糊 t-范数的分析(van Krieken 等,2022)、逻辑结构化的语言表示(Chen,2023)、张量逻辑(Domingos,2025)以及可解释逻辑分类器(Perreault 等,2025)。这些将*外部指定的*公式具体化;而我们的单元则携带从仅通过下一个词元预测训练的模型中直接读出的涌现结构。在冻结嵌入上的训练后布尔算子演算(Vexler 等,2026)共享词汇表但并非架构性的。模糊布尔前馈单元和有界值头本身在先前的我们自己的工作中引入(Oskin,2026a, b);第 3 节回顾该构建,以使本文自包含。本文的贡献不在于算子,而在于使它们清晰且活跃的目标函数,以及由此产生的读与编辑的故事。
### 2.2 为可解释性而训练,以及目标诱导的崩溃
在训练期间而非事后诱导可解释结构已有先例:概念瓶颈模型将中间层与标注概念对齐(Koh 等,2020),自解释神经网络正则化解释的稳定性(Alvarez-Melis 和 Jaakkola,2018),端到端稀疏字典学习将任务项折叠入辅助字典(Braun 等,2024)。与概念瓶颈不同,我们不需要概念标签;与字典方法不同,结构存在于主要计算中而非单独的解码器中。我们的清晰度压力与软二值化和直通量化相关(Courbariaux 等,2016;Bengio 等,2013;Yin 等,2019),但目标是清晰布尔算子而非压缩。我们诊断并修复的失败是方差崩溃,连接到自监督学习中的抗崩溃文献。VICReg 用逐维方差铰链 \(\operatorname{ReLU}(\gamma - \mathrm{std})\) 配合协方差去相关防止表征崩溃(Bardes 等,2022);相关机制包括冗余减少(Zbontar 等,2021)、特征白化(Ermolov 等,2021)以及预测器/停止梯度方案,这些方案激励了显式方差项(Grill 等,2020;Chen 和 He,2021)。我们的方差下限与 VICReg 的铰链形状相同。不同之处在于它所修复的问题:VICReg 替代对比性负例对抗不变性损失,而我们的下限则抵消*由我们自己的清晰度项引起的*崩溃,恒等式 \(\mathrm{mean}\, v(1-v) = \mu(1-\mu) - \mathrm{var}\) 揭示该清晰度项是一个方差最小化器,无法区分活跃上下文算子与死常数。由此产生的死单元是清晰度诱导的经典 dying-ReLU 状态(Lu 等,2020)的模拟。优化一个最终摧毁其目标的清晰度代理是一个特定的相似文章
利用测试时训练线性化视觉Transformer
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。
语法引导的稀疏注意力机制:实现高效可解释的Transformer
本文介绍了一种针对Transformer的语法引导稀疏注意力机制,旨在通过利用语言结构来提高效率和可解释性。
变宽变换器
提出了一种非均匀宽度分配的变换器(沙漏形状),在语言建模中优于均匀基线,减少了FLOPs和KV缓存大小。
通过ReLU催化的抽象精化实现Transformer的精确验证
本文提出了一种新颖的Transformer验证方法,利用ReLU表示点积的精确但非线性的边界,从而实现精确且高效的验证。该方法在情感分析模型上优于现有最先进的基线方法。
权重稀疏Transformer中的单个参数具有可解释性
本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。