主动SAE特征平面是否携带更多和乐?Gemma中的预注册反转

arXiv cs.LG 论文

摘要

这项预注册研究测试了和乐(一种几何度量)是否集中在Gemma 2 2B语言模型的主动SAE特征平面上。与语义集中预测相反,主动特征平面比匹配的混合特征控制平面携带更少的和乐,导致了一个狭窄的操作性反转,其根本原因仍然未知。

arXiv:2607.20522v1 公告类型:新 摘要:本文测试了和乐是否集中在Gemma 2 2B的主动稀疏自编码器(SAE)特征平面上,这是更广泛的语义集中预测的具体操作化。通过在最终令牌层12到层13的残差流读出中,使用仪器的受限雅可比传输规则将局部框架沿小环移动,然后通过包围面积对得到的旋转进行归一化来测量和乐。设计、实质性阈值、分析和判定规则在检查分析测量之前已预注册并冻结。该预测被反向证伪:主动特征平面比匹配的混合特征控制平面携带更少的和乐,调整后的对数对比度为-0.29439,95%区间为[-0.43989, -0.14889]。仅幅度解释在本设计中未得到支持,而在匹配幅度下,随机、混合特征和主动特征平面之间的三向排序未定义,因为公共支撑失败。在相同读出上的冻结后诊断在一个小的验证子集上支持面积定律,在简单配对回归下限制了匹配中心位移,并将传输失真识别为活跃机制或混杂因素。因此,这是一个狭窄的、可审计的操作性反转,而不是一个意义抑制和乐的原因声明。原因仍然未知,激活强度几何、特征参与程度、字典几何、匹配中心位移、激活流形邻近度和传输剪切是活跃的替代解释。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:10

# 活跃SAE特征平面是否承载更多和乐性?关于Gemma中预注册的反转现象  
来源:https://arxiv.org/html/2607.20522  

###### 摘要  

本文检验了在Gemma 2 2B模型中,和乐性是否集中在活跃稀疏自编码器(SAE)特征平面上,这是对更广泛的语义集中预测的具体操作化。和乐性通过在最终token的层12至层13残差流读出点处,使用仪器的受限雅可比传输规则将局部标架沿小回路移动,然后将所得旋转除以包围面积来测量。设计、实质性阈值、分析和判定规则均在检查分析测量值之前预先注册并冻结。预测结果被反向推翻:活跃特征平面承载的和乐性少于匹配的混合特征对照,调整后对数对比度为−0.29439,95%置信区间为[−0.43989, −0.14889]。在该设计中,仅基于幅度的解释未得到支持,而随机平面、混合特征平面和活跃特征平面之间的三向排序在匹配幅度下未定义,因为共同支持失败。在冻结后的诊断中,同一读出点在小型验证子集上支持面积定律,在简单配对回归下界定了匹配中心位移,并将传输畸变识别为一种可能的机制或混淆因素。因此,结果是一个窄范围、可审计的操作化反转,而非声称意义抑制和乐性的因果主张。原因仍悬而未决,激活强度几何、特征参与程度、字典几何、匹配中心位移、激活流形邻近性以及传输剪切均为可能的替代解释。  

## 1 引言  

本文检验了一个具体的语义集中预测:即和乐性集中在活跃SAE特征平面上,这些平面的方向从基点的活跃稀疏自编码器特征中选取。如果语义集中预测成立,则和乐性将区分语义密集区域与稀疏区域——这是意义集中位置的几何特征。这是以条件形式陈述的激励性可能性。测量学习表征的和乐性并非全新事物:它由Sevetlidis和Pavlidis[6 (https://arxiv.org/html/2607.20522#bib.bib6)]引入视觉网络,他们还指出其回路平面无需与意义对齐。在他们的设定中,特征是原始层激活或PCA方向;在此处,特征是学习得到的SAE方向。据我们所知,本文的贡献是首次在Transformer语言模型内部测量和乐性;它承接了他们留下未解决的语义问题,使用由SAE特征构建的仪器和平面,并在预注册的验证性检验下进行。每一个分析选择——假设、实质性阈值、设计、分析——都在数据被检查之前固定。因此,这一操作化的语义集中预测被逆转,而不仅仅是未达到:活跃特征平面承载的和乐性在实质上少于匹配的混合特征对照。和乐性可由第4节 (https://arxiv.org/html/2607.20522#S4) 中定义的仪器测量。活跃特征平面承载的和乐性更少,而非更多;其底层机制仍悬而未决。  

## 2 概念与问题  

### 2.1 设定:激活空间与SAE特征  

Transformer将文本处理为高维向量,这些向量经过其各层[7 (https://arxiv.org/html/2607.20522#bib.bib7)]。在固定层处,这些向量存在于共享的激活空间或残差流中;每个点是一个激活。这正是本文研究几何的空间。激活空间中的单个方向难以解释,因为单个方向往往叠加多个不相关的含义。这一性质称为多语义性[2 (https://arxiv.org/html/2607.20522#bib.bib2)]。稀疏自编码器(SAE)是一种应对此问题的学习工具:它学习自己的近似单语义特征集合,每个特征由一个系数标识[1 (https://arxiv.org/html/2607.20522#bib.bib1),4 (https://arxiv.org/html/2607.20522#bib.bib4)]。这些特征存在于SAE自身的坐标系中,但SAE的解码器矩阵连接了两者:每个特征是该矩阵的一行,即该特征在激活空间中的等效方向(图1 (https://arxiv.org/html/2607.20522#S2.F1))。因此,SAE特征可以在任一系统中命名——通过SAE中的系数,或通过在激活空间中的解码器方向。  

SAE坐标系  
解码器矩阵  
激活空间  
特征1  
特征2  
⋮  
特征i  
⋮  
特征16k  
由SAE系数命名的特征  
第i行  
2304维  
d_i  
特征i在激活空间中的方向  
选择  
解码  
d_i = ∑_{k=1}^{2304} W_{i,k} e_k  

图1:解码器桥接。每个SAE特征对应解码器矩阵的一行——即其在激活空间中的方向。特征可由系数(左)或其解码器方向(右)命名。  

对于给定的残差流激活,SAE为每个特征分配一个系数,且只有少数为正:这些特征在该点活跃,其余不活跃。哪些特征活跃随不同残差流激活而变化。这些特征是本文后续所指的“有意义方向”;当本文构建平面时,使用它们在激活空间中的解码器方向。  

### 2.2 和乐性,概念性理解  

和乐性是在激活空间中一点处测量的几何量。粗略地讲,它捕捉空间在小区域内扭转的程度:值越大,表示几何结构越丰富。我们通过该点的一个二维平面来测量它,其值取决于选择哪个平面。平面的方向由激活空间中选择的两个方向固定——例如,两个SAE特征方向,或两个随机选取的方向。方向的选择以及为何需要三类平面,将在第2.4节中讨论。精确定义及测量仪器在第4节 (https://arxiv.org/html/2607.20522#S4) 中给出。  

### 2.3 问题  

激活空间具有有意义方向——第2.1节中的SAE特征——而和乐性测量通过一点的平面上的几何结构。和乐性在(a)由语义选择方向构建的平面上是否更大,还是在(b)不考虑意义而构建的平面上更大?这就是语义集中预测:即和乐性集中在有意义方向上。如果成立,则和乐性可以区分语义密集区域与稀疏区域,有助于绘制激活空间的地形。对比在于平面的方向是如何选择的,而非它们恰好包含什么。因此,为了检验预测,我们比较在不同选择规则下构建的平面,如下节所示。  

### 2.4 三类平面  

为了检验预测,我们比较不同方向选择规则下的平面和乐性。我们使用三类平面。  

- **活跃特征平面**是信号:其方向因语义内容而选择,因此如果和乐性集中在有意义方向上,它应该最大。  
- **混合特征平面**是近邻比较:仍然基于特征且与同一基点相关,但不再是完整的信号平面。  
- **随机平面**是远邻比较:其方向在参考SAE特征的情况下选择,提供了一个未选择意义时的几何下限。  

我们在两个距离上进行两次比较,因为单一比较无法判断差异是反映语义选择还是某种比较平面的偶然几何属性。三类平面的确切构造在实验设计中给出;这种设计是否完全分离了意义与偶然几何,将在讨论 (https://arxiv.org/html/2607.20522#S7) 中讨论。  

### 2.5 三种竞争假设  

和乐性集中在有意义方向上的预测是平面类型间差异的一种解释,但并非唯一。为了诚实地检验它,我们将其与必须区分的竞争解释并列陈述。由此产生三个假设。  

第一个是 **H-sem**,语义主效应,也是本研究的主要预测,设计针对它进行了功效检验。它是语义集中预测的可检验形式:和乐性追踪意义,因此活跃特征平面比对照携带更多和乐性。这是研究要检验的预测,现在以判定规则可决定的形式呈现。  

第二个是 **H-mag**,一个与意义无关的竞争假设。在实验设计中,我们定义了平面内幅度,这是一种候选间变化的平面属性,独立于和乐性。H-mag是幅度主效应,假设和乐性大小的差异仅由平面内幅度解释。由于必须排除这一竞争,平面类型在共同的平面内幅度下进行比较;细节见实验设计。  

第三个是 **H-grad**,涉及三类平面的顺序。如果和乐性真正反映有意义结构的程度,它不仅应该将活跃特征平面与其他平面分开,还应在三类平面中递增:随机最低,混合特征居中,活跃特征最高。H-grad是单调梯度假设,即和乐性从随机到混合再到活跃单调递增。  

三个假设,因此需要区分三种不同的解释:和乐性追踪意义(H-sem)、追踪幅度(H-mag)、以及对平面类型进行排序(H-grad)。这是三个独立的问题,每个自行决定,因此一次实验产生对所有三个的判定。每个假设的正式陈述以及决定它们的规则在方法论 (https://arxiv.org/html/2607.20522#S3) 和实验设计 (https://arxiv.org/html/2607.20522#S5) 中给出。  

## 3 方法论  

本研究的方法论核心承诺是预注册:假设、决策规则、实质性阈值、分析和设计均在检查分析测量值之前书面固定并冻结。本章陈述这些承诺;具体的设计实例化在实验设计章节中给出。这种约束使得结果可信而非仅仅令人惊讶。由于结果逆转了本研究试图支持的语义集中预测,自然怀疑是分析被操纵。在数据可见之前冻结所有分析选择消除了操纵所需的自由,因此结果由设计决定,而非事后选择。  

分析是单次通过:数据只分析一次,在分析固定之前没有查看结果,也没有依赖于结果的停止或扩展。没有机会不断查看直到答案改变。每个预测由预先固定的判决规则决定,依据其置信区间相对于实质性阈值的位置,而非看到数字后应用判断。每个预测接受四种判定之一:`支持`、`拒绝`、`未定义`或`无意见`(前两者为正结论,后两者为非结论);判定从不强制:在无法进行比较时,预测保持为未定义而非解决。  

在进行任何和乐性测量之前发生两种选择:使用语料库中的哪些文本段落,以及哪些候选平面通过测量前几何检查。两者均在观察到任何和乐性值之前应用,并在不参考结果的情况下校准。没有测量值因其和乐性值而被排除;候选平面仅由测量前非退化最低要求拒绝。分析数据经验证与冻结测量值逐字节相同,然后才计算任何估计值。因此结果的可信度基于一个可核查的事实(分析的是确切的冻结数据),而非基于保证。  

可重现性具有特定的有界基础。模型执行和雅可比向量积在Apple Silicon、MPS后端上运行(这也是本研究的唯一后端);小的拉回度量矩阵随后在CPU float64上确定性求值。在该固定后端内,结果可逐位重现。未使用CUDA替代,也不声称跨其他后端的逐位保证。完整环境已提交到仓库的环境文件中:`.python-version`、`ENVIRONMENT.md`、`pyproject.toml`和`uv.lock`。  

设计恰好修改过一次,在观察到任何实验数据之前,以纠正一个规格错误;修改未触及任何实验样本基点,仅使用了保留的试点点,并且修改本身已记录并重新冻结。具体更正描述在实验设计 (https://arxiv.org/html/2607.20522#S5) 章节中。整个记录,包括预注册、其一次修改、分析规格和测量数据,已提交并附带完整版本历史,在发布的实验仓库中可公开审计。本文中每一个冻结前数据的声明都可以对照该记录核查,而非相信作者的话。  

## 4 几何设定与仪器  

该仪器通过在一个二维仿射平面内沿小闭合回路携带一个标架,并记录回路闭合时标架的旋转来测量和乐性。两个单位方向 d₁, d₂ 固定平面的方向。将它们收集为 D = [d₁ d₂] 的列;它们的列空间 C(D) 是该方向的过原点平面。要将该方向置于激活空间的某个位置,使用偏移点 b,得到仿射平面 b + C(D)。在本实验的测量回路中,所选的偏移是匹配中心 c,其构造在第5节 (https://arxiv.org/html/2607.20522#S5) 中给出。使用该偏移,仿射平面 c + C(D) 中的回路具有形式:  

γ(t) = c + ρ (cos 2π t d₁ + sin 2π t d₂ ), t ∈ [0,1]   (1)  

半径根据原始基点激活校准:ρ = 6.0 × 10⁻³ ∥h∥,保持探针相对于激活尺度较小。所有几何都是由模型的下游映射诱导的几何,而非普通欧几里得几何。在本实验中,下游映射 F 将 patch 后的最终 token 残差流激活(来自 model.model.layers[12])发送到 model.model.layers[13] 的最终 token 残差流输出,原始 64 token 语料前缀和注意力掩码保持不变。令 J 为该映射的雅可比矩阵,通过雅可比向量积求值。因此测量的量依赖于读出:它是层12激活位置与该层12至层13读出以及读出空间上欧几里得内积的联合属性,而非仅激活空间的内在属性。  

在回路上的某点处,两个平面方向推前至受限于雅可比矩阵的列:  

J D = [J d₁  J d₂]   (2)  

定义平面的诱导度量,即 2×2 拉回 Gram 矩阵 M:  

M = J Dᵀ J D   (3)  

该矩阵使平面中的长度、面积和角度参

相似文章

角度-范数分解下的激活转向几何解释

arXiv cs.AI

本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。

SAE干预不可靠:干预后受抑制行为的恢复

arXiv cs.LG

本文证明了对稀疏自编码器(SAE)特征的干预可能不可靠,因为受抑制的行为可以通过残差空间优化恢复,即使干预仍然有效。它揭示了语言模型中特征级控制与实际行为完整性之间的关键差距。

通过标题特定激活引导控制工具使用

arXiv cs.AI

本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。