机制可解释性:一篇关于解耦卷积神经元的首次研究 [R]
摘要
本文介绍了一种通过分析Hadamard积来解耦Inceptionv1中单个卷积神经元的技术,揭示了清晰的单语义聚类(汽车、猫、狗)以及低值聚类(字母、人脸),其权重分布体现了梯度下降行为。
我最近开始独立研究机制可解释性,从Distill Circuits线程入手。我的工作是解耦并仔细研究单个神经元——即Inceptionv1模型中的一个1x1卷积(并将该方法应用于同一层的其他神经元)。关键洞察在于:感受野与该神经元权重的Hadamard积,正是该神经元所“看到”或检测到的内容。我们可以对Hadamard积进行聚类,从而得到该神经元检测到的所有模式。结果得到了清晰的单语义聚类(它已知会激活的汽车、猫、狗)。然而,我们还得到了更多聚类:字母、人脸以及许多低值激活。这为我提供了一种新方法来非常细致地分析该神经元。通过细致分析,我发现最奇特的一点是:低值聚类(如字母)的所有依赖神经元也都在同一概念(字母)上激活,并且正负权重均匀分布在它们之间,从而降低总和。这表明梯度下降有意将模式和概念置于噪声范围内。我尽量使文章保持Distill风格,配有良好的可视化。希望您能一读:https://pages.narang99.in/posts/2026-07-12-disentangling-mixed4e-55/ 老实说,我从卷积入手犯了个错误——似乎没人在意。我很快会转向语言方面,但如果有人能读读这篇,并给我一些关于是否真的发现了有用东西的反馈,那就太好了。谢谢 :)
相似文章
@noahdgoodman: 我们该如何在神经网络中寻找表征?就像我们如今找到其他一切的方式一样——梯度下降……
一篇新论文介绍了Matryoshka Attribution,这是一种使用梯度下降来识别神经网络关键部分的方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能。
@TamazGadaev:第10天/n(面向AI研究人员的基础文本系列——并非特指论文,而是那些能让你掌握实际进行AI研究方法的作品)
Elhage等人的《叠加的玩具模型》解释了可解释性为何困难:模型通过叠加来用少于特征维度的方式表示更多特征,导致多语义神经元作为压缩手段出现。这篇论文催生了稀疏自编码器的研究计划。
通过稀疏电路理解神经网络
OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。
单义性的复仇:专门化神经元提升多层感知机的数据效率
论文表明,在具有聚类数据的回归问题中,多层感知机自然发展出单义性的专门化神经元,通过学习局部低维表示而非全局表示来提高数据效率。
稀疏自编码器中概念学习与神经元解释的几何视角
本文提出了一个统一的几何框架,用于理解稀疏自编码器中的概念学习和神经元解释,将概念形式化为集合,并定义了检测、分离和近似。它提供了误差界、容量约束,并与形式概念分析建立了联系,同时在合成数据上进行了实验。