用于可解释性分布外检测的稀疏自编码器
摘要
本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。
查看缓存全文
缓存时间: 2026/07/15 04:17
# 用于可解释分布外检测的稀疏自编码器
来源:https://arxiv.org/html/2607.12094
\\newcolumntype
s\>\\columncolorgray\!15 c
Ayush Karmacharya∗1, Luke Luschwitz∗1, Lucia Romero¹, Yanan Niu², Joseph Campbell¹
¹普渡大学
²EPFL
\{akarmach, lluschwi, romer190, joecamp\}@purdue\.edu, yanan\.niu@epfl\.ch
∗同等贡献
###### 摘要
可靠地检测分布外(OOD)样本对于机器学习模型的安全部署至关重要。神经网络常常对偏离训练数据的输入产生过于自信的预测,导致性能显著下降。尽管许多OOD检测方法聚焦于最终输出层,但它们忽略了中间网络层中存在的丰富层次化信息。本文提出一种新颖方法,利用稀疏自编码器(SAE)从这些中间激活中学习可解释特征。我们发现,分布内(ID)和OOD数据会激活不同的稀疏特征集。我们提出一种新的OOD分数,基于测试样本的稀疏特征激活与ID类别平均激活之间的余弦相似度。我们的事后检测方法不仅在标准OOD检测基准上达到最先进的性能,而且还能可解释地揭示分布偏移如何影响学习到的表示。
## 1 引言
机器学习算法建立在测试时数据来自与训练时相同分布的假设之上。当这一假设被违反时,测试数据被称为分布外(OOD),预测准确率会迅速下降\[29 (https://arxiv.org/html/2607.12094#bib.bib29)\],尤其是对于容易产生过于自信预测的深度神经网络(DNN)\[17 (https://arxiv.org/html/2607.12094#bib.bib17)\]。然而,由于DNN本质上是“黑箱”,因此很难评估其预测何时可信\[25 (https://arxiv.org/html/2607.12094#bib.bib25)\]。
在本工作中,我们解决OOD检测问题\[43 (https://arxiv.org/html/2607.12094#bib.bib43)\]:将测试时的输入分类为分布内(ID)或OOD。有效的OOD检测对于实际部署至关重要,因为模型经常遇到偏离其训练分布的输入,此时应避免做出预测。然而,当前的OOD检测方法存在两个显著局限。首先,这些方法通常几乎完全依赖网络的最终层表示(例如logits),忽略了整个中间层中丰富的层次化表示\[5 (https://arxiv.org/html/2607.12094#bib.bib5)\]\[20 (https://arxiv.org/html/2607.12094#bib.bib20),26 (https://arxiv.org/html/2607.12094#bib.bib26),36 (https://arxiv.org/html/2607.12094#bib.bib36),23 (https://arxiv.org/html/2607.12094#bib.bib23),12 (https://arxiv.org/html/2607.12094#bib.bib12)\]。如图1 (https://arxiv.org/html/2607.12094#S1.F1) 所示,这可能会忽略在网络早期可见但在后期表示中变得难以区分的判别结构。其次,即使OOD检测器表现良好,其分数通常也只能提供有限的信息来理解区分ID和OOD输入的内部表示。这使得诊断分布差异在网络中何时出现,以及它们是由低级、中级还是高级特征捕获的变得困难。这种分层视角有助于告知应监控哪些表示以获取OOD证据,以及偏移是否反映了低级视觉损坏、更高级别的语义不匹配,或两者兼有。
参见图注
图1:UMAP\[28 (https://arxiv.org/html/2607.12094#bib.bib28)\]对在ImageNet-1k上训练的视觉Transformer(ViT)\[13 (https://arxiv.org/html/2607.12094#bib.bib13)\]模型各层SAE嵌入的投影。点代表ImageNet-1k样本(ID)和作为协变量偏移OOD输入的ImageNet-C样本,ImageNet-C样本按损坏类型着色。在最后一层,受损样本与ID流形大部分重叠,使得定性上难以区分偏移。相比之下,早期层(尤其是第4和第7层)显示出ID和OOD样本之间更清晰的分离,并揭示了与不同损坏类型对应的聚类。这表明协变量偏移检测的判别结构可能出现在中间表示中,从而促使采用分层OOD检测方法,如SAID。
为了解决这些挑战,我们提出用于可解释检测的稀疏自编码器(SAID),这是一种事后OOD检测方法,利用在中间网络激活上训练的稀疏自编码器(SAE)。SAE最近被用于从原本不透明的神经表示中提取稀疏的概念类特征\[9 (https://arxiv.org/html/2607.12094#bib.bib9)\]。我们将这一想法应用于基于视觉的OOD检测,通过在冻结图像分类器的选定层(包括卷积和基于Transformer的视觉模型)上训练SAE。在测试时,SAID将输入的SAE编码与预测ID类别的平均SAE编码进行比较,产生基于相似性的OOD分数。我们表明,这些稀疏的中间表示在语义和协变量分布偏移下都能提高检测性能。
除了检测性能,SAE表示的稀疏结构还提供了一个诊断视角,用于分析ID和OOD输入如何激活模型学习到的概念空间。我们使用视觉语言模型自动将SAE潜在变量注释为人类可读的概念标签,然后评估测试输入激活的概念是否与图像语义一致。我们的结果表明,ID样本倾向于表现出比语义偏移和协变量偏移OOD样本更高的概念一致性,并且这种一致性差距在不同层之间有所变化。
我们的贡献有三方面。首先,我们引入了SAID,一种事后OOD检测方法,利用中间层表示的SAE编码来提高检测性能。其次,我们表明中间层包含通常在最终层表示中丢失或压缩的判别信息,从而在语义和协变量偏移基准上提升性能。第三,我们分析了SAE派生的概念标签作为诊断工具,用于理解分布偏移如何影响学习到的表示,显示ID输入激活的概念比OOD输入在语义上与图像更一致。
## 2 相关工作
分布外检测。
一类突出的OOD检测方法利用模型预测的不确定性或logits(最终层的输出)。例如,softmax置信度已被用作OOD检测的基线\[20 (https://arxiv.org/html/2607.12094#bib.bib20)\]。在此基础上,提出了基于能量的模型,其中源自模型输出logits的能量分数用于区分分布内和OOD样本\[26 (https://arxiv.org/html/2607.12094#bib.bib26)\]。虽然这些方法提供了一个起点,但它们主要依赖最终层的信息,可能忽略了嵌入在神经网络中间表示中的有价值见解\[16 (https://arxiv.org/html/2607.12094#bib.bib16)\]。
为了克服仅依赖最终层输出的局限性,一些研究探索了使用来自早期层的特征。将马氏距离应用于中间特征表示在改进近OOD检测方面显示出前景\[23 (https://arxiv.org/html/2607.12094#bib.bib23),31 (https://arxiv.org/html/2607.12094#bib.bib31)\]。类似地,利用特征空间中的深度最近邻的方法已被开发用于OOD检测\[36 (https://arxiv.org/html/2607.12094#bib.bib36)\]。最近的进展包括激活整形技术,旨在直接影响神经网络的激活以改善OOD判别\[12 (https://arxiv.org/html/2607.12094#bib.bib12)\]。尽管有这些进展,有效利用所有中间激活中包含的大量信息仍然是一个挑战,因为它可能冗余、有噪声或难以解释。
可解释机器学习。
对可解释机器学习的兴趣日益增长,导致了使用人类可理解概念解释模型预测的方法\[32 (https://arxiv.org/html/2607.12094#bib.bib32),7 (https://arxiv.org/html/2607.12094#bib.bib7)\]。这尤其与OOD检测相关,因为概念级表示可以帮助分析ID和OOD输入之间的差异。最近的工作也开始探索特征稀疏性在OOD检测中的作用\[6 (https://arxiv.org/html/2607.12094#bib.bib6)\]。
稀疏自编码器(SAE)提供了一种从神经网络激活中学习稀疏、可解释特征的自然机制\[27 (https://arxiv.org/html/2607.12094#bib.bib27),14 (https://arxiv.org/html/2607.12094#bib.bib14),4 (https://arxiv.org/html/2607.12094#bib.bib4),10 (https://arxiv.org/html/2607.12094#bib.bib10)\]。通过将密集激活分解为局部化的概念类特征\[15 (https://arxiv.org/html/2607.12094#bib.bib15),24 (https://arxiv.org/html/2607.12094#bib.bib24)\],SAE提供了一种分析原本不透明表示的方法,并与异常检测有联系\[34 (https://arxiv.org/html/2607.12094#bib.bib34),35 (https://arxiv.org/html/2607.12094#bib.bib35)\]。通用SAE进一步提出了跨模型对齐稀疏概念的可能性\[37 (https://arxiv.org/html/2607.12094#bib.bib37)\]。
在此基础上,我们使用SAE从中间层提取稀疏概念表示用于OOD检测。我们的方法不依赖仅最终层特征,而是利用ID和OOD输入在整个网络中诱导的不同激活模式,提供强大的OOD检测和分布偏移的概念级视图。
## 3 预备知识
### 3.1 分布外检测
设一个机器学习模型在ID数据集 D_in=\{(x_i, y_i)\}_{i=1}^{N} 上训练,其中 x_i∈R^d 是输入数据点,y_i 是对应的标签。我们将OOD检测任务表述为一个二分类问题:给定一个测试样本 x,目标是确定它是否来自与训练集相同的分布(ID)或来自不同的分布(OOD)。在本工作中,我们关注可能导致数据为OOD的两种分布偏移原因\[43 (https://arxiv.org/html/2607.12094#bib.bib43)\]。第一种是语义偏移,其中测试分布的标签分布 p(y|x) 与训练不同。第二种是协变量偏移问题,其中输入分布 p(x) 不同。
### 3.2 稀疏自编码器
自编码器是一种神经网络,旨在学习输入数据的压缩表示(编码)。它由一个编码器 E(·)(将输入 x 映射到潜在表示或编码 z)和一个解码器 D(·)(从潜在表示重建输入,目标是 D(z)≈x)组成。训练期间的主要目标是最小化原始输入与其重建版本之间的均方误差,加上一个 L_1 项以诱导稀疏性。
稀疏自编码器对潜在表示 z 引入稀疏约束。这鼓励隐藏(潜在)层中的大多数单元对于任何给定输入处于非活动状态(即输出非常接近零),确保只有一小部分特定的特征处于“活动”状态。
在本工作中,我们特别使用 top-k 稀疏自编码器。对于给定的输入 a(代表来自预训练神经网络的中间激活),编码器 E(·) 首先计算一个中间潜在向量。然后该向量经过 top-k 激活函数,该函数明确地将除最活跃的 k 个潜在维度之外的所有维度设为零。Top-k SAE 在目标函数中没有 L_1 稀疏项。
这种直接强制执行稀疏性的方法鼓励学习到的特征是单语义的,意味着稀疏表示中的每个特征理想情况下对应一个单一、不同的概念。这一特性适合学习特征的可解释性,提供了对网络为给定输入激活了哪些特定概念的见解。
参见图注
图2:在冻结模型的中间层激活上,对分布内数据集训练稀疏自编码器。在测试时,如果给定样本 x 的潜在编码 z_l 与预测类别 c^ 的平均潜在编码 μ_{c^} 在所有层上的平均余弦相似度低于阈值 τ,则该样本被视为OOD。
## 4 用于可解释检测的稀疏自编码器
我们介绍一种事后OOD检测方法,利用SAE的潜在编码。我们的方法——用于可解释检测的稀疏自编码器(SAID)——在预训练基于视觉的分类模型的中间特征激活上训练SAE,如图2 (https://arxiv.org/html/2607.12094#S3.F2)所示。
### 4.1 训练算法
给定一组预定义的层 L,我们为预训练神经网络 f(·) 的每一层 l∈L 训练一个SAE。对于每一层,对应的SAE接收中间激活 a=f_l(x) 作为输入,其中 f_l 是 f 的第 l 层。所有SAE使用相同的超参数,除了它们的稀疏系数 k。为了构建SAE训练集,我们将整个原始数据集通过预训练网络 f,并存储来自每个中间层 l∈L 的激活结果。每个SAE训练以最小化均方误差(MSE)重建项。形式上,对于一批中间激活 a,MSE重建损失定义如下:
L_MSE = (1/N) ∑_{i=1}^{N} ‖a^{(i)} - D(E(a^{(i)})) ‖_2^2.
其中 E 和 D 分别表示SAE编码器和解码器,N 是批量中的样本数。训练后,我们冻结SAE,仅使用其编码器 E_l 进行OOD评分。
### 4.2 基于相似性的评分
在训练完给定层 l∈L 的每个SAE后,我们将每个ID类别的所有训练样本编码到相应的稀疏潜在空间中。然后,我们计算并存储每个ID类别 c 的平均潜在编码 μ_{c,l}。因此,存储的类别均值总数等于ID类别数乘以SAE数量(每层一个)。
对于测试输入 x,令 c^ = argmax_c f_c(x) 表示由预训练分类器预测的类别,其中 f_c(x) 表示分配给类别 c 的预测概率。在推理期间,每个SAE产生潜在编码 z_l = E_l(f_l(x))。我们计算特定于层的OOD分数 s_l(x) 为潜在编码 z_l 与预测类别 c^ 的均值 μ_{c^, l} 之间的余弦相似度。相似文章
稀疏自编码器实现CLIP模型的鲁棒且可解释的微调
SAE-FT提出了一种新颖的CLIP模型微调方法,利用稀疏自编码器约束来正则化视觉表示,在保持性能的同时提高对分布变化的鲁棒性,并实现可解释性。
理解边缘:稀疏自编码器追踪Transformer泛化的界限
本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。
用于特征发现与长上下文归因的回合平均SAEs
本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
# Paper page - Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs Source: [https://huggingface.co/papers/2605.07447](https://huggingface.co/papers/2605.07447) ## Abstract SAEgis detects adversarial attacks on vision\-language models using sparse autoencoders trained for reconstruction, achieving strong performance across domains without additional training\. [Vision\-language models](https://huggingface.co/papers?q=Vision-language%20models)\(VLMs\) have advan
WriteSAE:面向循环状态的稀疏自编码器
WriteSAE 引入了第一个稀疏自编码器,能够分解状态空间模型和混合循环语言模型中的矩阵缓存写入,相比现有方法实现了更优的令牌级干预。