机制可解释性:一篇关于解耦卷积神经元的首次研究 [R]

Reddit r/MachineLearning 论文

摘要

本文介绍了一种通过分析Hadamard积来解耦Inceptionv1中单个卷积神经元的技术,揭示了清晰的单语义聚类(汽车、猫、狗)以及低值聚类(字母、人脸),其权重分布体现了梯度下降行为。

我最近开始独立研究机制可解释性,从Distill Circuits线程入手。我的工作是解耦并仔细研究单个神经元——即Inceptionv1模型中的一个1x1卷积(并将该方法应用于同一层的其他神经元)。关键洞察在于:感受野与该神经元权重的Hadamard积,正是该神经元所“看到”或检测到的内容。我们可以对Hadamard积进行聚类,从而得到该神经元检测到的所有模式。结果得到了清晰的单语义聚类(它已知会激活的汽车、猫、狗)。然而,我们还得到了更多聚类:字母、人脸以及许多低值激活。这为我提供了一种新方法来非常细致地分析该神经元。通过细致分析,我发现最奇特的一点是:低值聚类(如字母)的所有依赖神经元也都在同一概念(字母)上激活,并且正负权重均匀分布在它们之间,从而降低总和。这表明梯度下降有意将模式和概念置于噪声范围内。我尽量使文章保持Distill风格,配有良好的可视化。希望您能一读:https://pages.narang99.in/posts/2026-07-12-disentangling-mixed4e-55/ 老实说,我从卷积入手犯了个错误——似乎没人在意。我很快会转向语言方面,但如果有人能读读这篇,并给我一些关于是否真的发现了有用东西的反馈,那就太好了。谢谢 :)
查看原文

相似文章

通过稀疏电路理解神经网络

OpenAI Blog

OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。

稀疏自编码器中概念学习与神经元解释的几何视角

arXiv cs.LG

本文提出了一个统一的几何框架,用于理解稀疏自编码器中的概念学习和神经元解释,将概念形式化为集合,并定义了检测、分离和近似。它提供了误差界、容量约束,并与形式概念分析建立了联系,同时在合成数据上进行了实验。

从神经网络中定向恢复权重空间机制

arXiv cs.LG

本文提出Targeted Parameter Decomposition (tPD)方法,可针对特定输入选择性地从神经网络中恢复可解释的权重空间机制,相比全分解大幅降低计算需求。通过在玩具模型和Transformer语言模型上的验证,tPD能够忠实地恢复电路并进行手术级消融,且副作用极小。