稀疏自编码器表示中的特征竞争:大语言模型中不确定性驱动的特征竞争机制研究

arXiv cs.LG 论文

摘要

本研究论文在大语言模型中引入了稀疏自编码器表示中的“特征竞争”概念,将其作为不确定性的机制性特征。利用 Gemma-2-2B 模型,研究表明,负相关的特征对将不确定性定位到特定层级,并对模型输出产生因果影响。

arXiv:2605.08149v1 公告类型:新发布 摘要:稀疏自编码器(SAE)将大型语言模型的表示分解为可解释的特征,但在不确定性条件下这些特征如何相互作用仍鲜为人知。我们引入了“特征竞争”——即负相关的 SAE 特征对——并使用 Gemma Scope SAEs 研究了这种竞争在 Gemma-2-2B 中是否作为模型不确定性的机制性特征。通过在 PopQA 数据集上按响应熵划分进行的受控域内实验,我们发现,与低熵问题相比,高熵问题在第 0 层和第 12 层产生了显著更强的特征竞争(p 值分别为 5.3x10^-26 和 5.8x10^-5),从而将不确定性定位到残差流中的特定处理阶段。随后,我们通过沿竞争轴进行激活引导,测试了竞争是否因果地先于模型输出——结果显示,在 20 对竞争特征中有 15 对,在低引导倍数下,沿竞争方向(vec_A - vec_B)引导比沿随机方向引导引起更多的输出变化。最后,基于活跃 SAE 特征解码器向量的成对余弦相似度得出的每个提示词竞争分数可以预测答案的正确性(AUROC=0.689),接近但未达到 softmax 置信度的水平(AUROC=0.808)。
查看原文
查看缓存全文

缓存时间: 2026/05/12 06:58

# 稀疏自编码器表示中的特征竞争:大语言模型中不确定性驱动的特征竞争的机制研究

来源:https://arxiv.org/html/2605.08149
\(2026年5月\)

###### 摘要

稀疏自编码器(SAE)将大型语言模型(LLM)的表示分解为可解释的特征,但在不确定性条件下这些特征如何交互仍知之甚少。我们引入了**特征竞争(Feature Rivalry)**——即负相关的SAE特征对——并研究了在Gemma-2-2B中,利用Gemma Scope SAEs,竞争是否作为模型不确定性的机制签名。通过对PopQA数据集按响应熵划分的受控域内实验,我们发现高熵问题在第0层和第12层产生的特征竞争显著强于低熵问题($p = 5.3 \times 10^{-26}$ 和 $p = 5.8 \times 10^{-5}$),从而将不确定性定位到残差流中的特定处理阶段。随后,我们通过沿竞争轴进行激活引导来测试竞争是否在模型输出的因果上游——我们发现,在15对竞争特征对中,沿竞争方向($vec\_A - vec\_B$)进行引导比随机方向在低引导倍数下引起更多的输出变化,这提供了因果证据,表明竞争特征在生成过程中积极参与竞争。最后,从活跃SAE特征解码器向量的成对余弦相似度推导出的每个提示的竞争得分可以预测答案的正确性(AUROC = 0.689),接近但未达到softmax置信度(AUROC = 0.808)。总之,我们的研究结果表明,SAE特征竞争是一种机制上确定的不确定性信号,它定位到特定的残差流层,在低干预强度下对模型输出具有因果影响力,并为正确性估计提供了可解释的预测效用。代码可在 https://github.com/hvardhan878/feature-rivalry 获取。

## 1 引言

稀疏自编码器已成为机制可解释性中的核心工具,将多义性神经元激活分解为稀疏的、单义性的特征,这些特征对应于可解释的概念(Bricken et al., 2023; Cunningham et al., 2023)。越来越多的工作应用SAE研究模型如何编码特定行为——从隐私敏感信息(Frikha et al., 2025)到语法结构(Arnold and Gröbner, 2025)——通过探测单个特征激活及其对输出的因果影响。

一个较少被研究的现象是**特征之间**发生了什么:具体来说,当多个特征同时激活并竞争以影响模型的下一个输出时。我们将此称为**特征竞争**——即在给定层中存在强负相关的SAE特征对。直觉很简单:当模型对答案不确定时,多个竞争的概念表示可能会同时激活并相互抑制。当模型确信时,应该出现单个主导的特征簇,特征间的抑制较弱。

本文就作为机制不确定性信号的特征竞争提出三个问题:

1.  **竞争是否定位到特定层?** 我们测试高熵(模糊)问题是否比低熵(明确)问题产生更强的特征竞争,以及这种差异是否集中在残差流的特定层。
2.  **竞争是否在输出的因果上游?** 我们进行沿竞争轴的激活引导实验,以测试竞争特征之间的竞争是否直接影响模型生成的内容。
3.  **竞争是否预测正确性?** 我们评估每个提示的竞争得分是否可以作为实际的不确定性信号来预测答案的正确性,并将其与作为基线的softmax置信度进行比较。

所有实验均在Gemma-2-2B(Gemma Team, 2024)上使用Gemma Scope SAEs(Lieberum et al., 2024)和PopQA数据集(Mallen et al., 2023)进行。我们的主要贡献包括:

-   **域内受控设计**:按模型响应熵划分PopQA,以隔离歧义性与领域和格式混淆因素——这是一种优于跨数据集比较的方法论改进。
-   **层特异性定位**:特征竞争定位到第0层和第12层,不确定性条件之间的显著差异经Mann-Whitney U检验证实。
-   **因果证据**:通过竞争轴激活引导显示,在大多数竞争对中,低倍数下相对于随机引导具有一致的输出翻转率优势。
-   **预测效用**:完全基于内部表示推导出的每个提示的竞争得分(AUROC = 0.689),无需输出采样或真实值,即具有预测效用。

## 2 背景及相关工作

### 2.1 用于机制可解释性的稀疏自编码器

SAE学习通过稀疏瓶颈重建模型激活 $\mathbf{h} \in \mathbb{R}^d$:

$$ \mathbf{h} \approx \mathbf{W}_{\text{dec}} \cdot \text{ReLU}(\mathbf{W}_{\text{enc}}\mathbf{h} + \mathbf{b}_{\text{enc}}) + \mathbf{b}_{\text{dec}} \quad (1) $$

其中 $\mathbf{W}_{\text{dec}} \in \mathbb{R}^{d \times k}$ 是解码器矩阵,其列是残差流空间中的**特征方向**。Gemma Scope(Lieberum et al., 2024)为Gemma-2-2B的每一层提供了预训练的SAE,宽度为16,384个特征,使得对内部表示的逐层分析成为可能。

### 2.2 特征交互与竞争

先前的SAE特征工作主要关注单个特征语义(Bricken et al., 2023)和特征电路(Marks et al., 2024)。Arnold and Gröbner(2025)证明,在Gemma-2中引导单个注意力头值向量可以可靠地改变介词短语的解释,为 targeted intervention 确立了先例。Frikha et al.(2025)使用SAE特征消融和引导来抑制个人身份信息(PII)泄漏,证明特征级干预可以产生可靠、可测量的输出变化。

SAE特征之间的相关性结构受到的关注较少。Templeton et al.(2024)指出,较大模型中的特征倾向于形成簇,但作为输入不确定性函数的特征间竞争尚未得到系统研究。

### 2.3 大语言模型中的不确定性量化

大语言模型的不确定性量化方法大致分为基于采样的方法——如语义熵(Kuhn et al., 2023),这需要多次生成——和使用内部信号的单次通过方法。单次通过方法包括最小令牌概率、平均令牌概率(Malinin and Gales, 2020)和基于注意力的信号(Kauf et al., 2024)。我们的工作贡献了一种新颖的单次通过信号,基于SAE特征竞争而非输出分布统计。

## 3 实验设置

### 3.1 数据集及基于熵的划分

我们使用PopQA(Mallen et al., 2023),这是一个涵盖多种实体类型的知识密集型问答数据集。为了在控制领域和格式的同时创建模糊和明确的条件,我们实施了**域内熵划分**:而不是将PopQA与不同的数据集进行比较,我们测量模型对每个问题的自身响应熵,并在PopQA内部进行划分。

对于每个问题 $q$,我们在温度1.0下采样 $n=20$ 个补全,并计算基于首词响应的归一化香农熵:

$$ H(q) = -\frac{1}{\log n} \sum_{w} p(w) \log p(w) \quad (2) $$

满足 $H(q) > 0.7$ 的问题构成**模糊**条件(200个问题);满足 $H(q) < 0.5$ 的问题构成**明确**条件(200个问题)。两个条件均 exclusively 来自PopQA,保持领域、问题格式和答案类型恒定。该设计消除了跨数据集比较中存在的混淆,即在跨数据集比较中观察到的竞争差异可能反映数据集级别的特征而非模型不确定性。

### 3.2 模型和SAE配置

我们在单个NVIDIA P5000 GPU上以bfloat16加载 `google/gemma-2-2b-it`。我们使用 `sae_lens` 库(Bloom and Chanin, 2024)加载13层(从0到24每隔一层)的Gemma Scope SAEs,选择每层最接近 $L_0 \approx 71$ 的 `width_16k` 检查点。代码可在 https://github.com/hvardhan878/feature-rivalry 获取。

### 3.3 竞争得分定义

对于通过第 $l$ 层处理的一组提示,我们提取每个提示的最后令牌隐藏状态 $\mathbf{h}_l \in \mathbb{R}^{2304}$,计算SAE特征激活 $f = \text{ReLU}(\mathbf{W}_{\text{enc}}\mathbf{h}_l + \mathbf{b}_{\text{enc}})$,并保留在提示间平均活跃的特征(平均激活 $> 0.01$),出于计算可行性,子采样至300个特征。

第 $l$ 层条件 $c$ 的**总体竞争得分**是跨提示的所有成对皮尔逊相关性的第5百分位数:

$$ R_l^c = \text{p5}(\{\text{corr}(\mathbf{f}_i, \mathbf{f}_j): i \neq j\}) \quad (3) $$

更负的值表示更强的竞争。我们使用Mann-Whitney U检验比较每层条件下完整的相关性分布。

## 4 实验1:竞争定位

### 4.1 结果

图1显示了两个条件下每层的第5百分位成对相关性(竞争得分)。竞争在早期层最强,随着处理向最后层进行而逐渐减弱——这与Transformer模型中早期层特征丰富性的已知模式一致。

> **图1**:模糊(高熵)和明确(低熵)PopQA问题的每层特征竞争。绿色虚线标记统计显著的层。模糊问题在大多数层显示出持续更强的竞争(更负的第5百分位),在第0层和第12层存在显著差异。
>
> **图2**:每层竞争差异的统计显著性($-\log_{10} p$-value)。两个显著层均显示正确的方向:模糊问题产生的竞争比明确问题更强。

统计测试揭示了两个显著层(图2):

-   **第0层**($p = 5.3 \times 10^{-26}$):在最早层,模糊问题的竞争显著更强,表明不确定性从初始编码阶段就以特征竞争的形式表现出来。
-   **第12层**($p = 5.8 \times 10^{-5}$):第二个显著差异出现在中间层——与Transformer模型中的语义整合相关——此处条件间的竞争差距在视觉上非常显著。

所有其他层在经过13层测试隐含的Bonferroni校正后均无显著差异。这种两阶段模式——早期编码和中层语义处理——表明不确定性驱动的竞争在多个处理阶段运作,而非单一机制。

### 4.2 讨论

域内设计对于解释这些结果至关重要。在跨数据集比较(例如,PopQA与事实性问题)中,观察到的竞争差异可能反映数据集之间的表面分布差异。通过按熵划分单个数据集,我们确保任何竞争差异归因于模型对答案的不确定性,而不是数据集级别的特征。

第0层的发现特别有趣:即使在最早层,在任何自注意力或前馈处理之前,嵌入空间已经将不确定性编码为特征竞争。第12层随后代表第二个检查点,语义不确定性在此处的残差流中巩固。

## 5 实验2:通过激活引导进行因果干预

### 5.1 方法

为了测试竞争是否在模型输出的因果上游,我们在实验1中识别出的前20个竞争特征对上,在峰值竞争层(第10层,选为条件间竞争得分差异最大化的层)进行激活引导实验。

对于每个竞争对 $(A, B)$,我们计算**竞争轴**:

$$ \mathbf{v}_{\text{rivalry}} = \frac{\mathbf{W}_{\text{dec}}[A] - \mathbf{W}_{\text{dec}}[B]}{\|\mathbf{W}_{\text{dec}}[A] - \mathbf{W}_{\text{dec}}[B]\|} \quad (4) $$

该方向在残差流空间中最大程度地分离了两个竞争的概念表示。我们将沿 $\mathbf{v}_{\text{rivalry}}$ 的引导与稳定的随机基线(10个随机单位向量的归一化均值)进行比较,仅在生成期间在第10层的最后一个令牌位置添加。

对于每对50个模糊提示,我们测量**翻转率**:引导输出与基线输出不同的提示比例。我们测试三个引导倍数(5, 10, 20),并主要在倍数为5时报告结果,此时在大扰动占主导地位之前信号最清晰。

### 5.2 结果

> **图3**:在所有20个竞争特征对中,倍数为5时竞争轴引导与随机引导的翻转率。蓝色条(竞争)在大多数对中持续高于粉色条(随机)。

图3显示了倍数为5时所有20对的翻转率。竞争轴引导在20对中有15对(75%)的翻转率高于随机引导,平均翻转率差距为 $+0.06$(竞争:0.20,随机:0.14)。在倍数为10时,竞争在20对中有14对胜出。在倍数为20时,信号减弱,因为大扰动不分青红皂白地破坏了所有结构。

低倍数下竞争轴引导的持续优势提供了因果证据,表明竞争特征之间的解码器方向差异对模型输出具有特定影响,超出随机方向所能产生的影响。最强的个体效应是对 (10740, 2786),在倍数为5时翻转率差距为 $+0.16$。

### 5.3 讨论

因果信号是真实但适度的——竞争轴引导并未产生比随机引导大得多的翻转率。这与以下解释一致:竞争特征是分布式计算的一部分,而不是瓶颈门控。扰动竞争轴会倾斜竞争,但不会覆盖模型的完整推理过程,特别是对于那些其他层已经承诺了答案方向的问题。

然而,发现竞争轴在低引导强度下比随机方向更具影响力——而无需高强度干预——这一发现仍然有意义:它表明从总体相关性中识别出的竞争方向...

相似文章

特征组合的结构不稳定性

arXiv cs.LG

本文提出了一个几何框架来分析稀疏自编码器中特征组合的不稳定性,揭示了非线性导致棘轮效应,从而在超过临界密度时引发组合坍塌。