基于激活几何的无监督特征挖掘

arXiv cs.AI 论文

摘要

本文介绍了Mining via Activation Geometry (MAG),这是一个无监督框架,通过自然语言指令从LLM激活中提取推理特征,从而实现激活引导和分类器探针的有效训练数据选择。

arXiv:2607.04222v1 公告类型: 新 摘要: 可解释性方法旨在揭示大型语言模型(LLM)内部表示的特征。许多现有方法从人类定义概念的有标签示例开始,这些示例可能反映人类偏见,然后识别该概念在模型中的表示方式,例如在其激活空间中或通过其他分解方法。我们引入了 \emph{Mining via Activation Geometry} (MAG),这是一个简单的无监督框架,通过在每个输入 $p$ 前添加相同的自然语言指令 $Q$ 来从模型激活中提取推理特征,其中 $Q$ 定义了感兴趣的推理特征,例如“该物体能在沙漠中找到吗?”或“该提示是恶意的吗?”我们使用 $m(Q \mid p) - m(p)$ 在单个读出点测量指令如何改变模型的内部表示。我们探索了八种不同的MAG。提取的推理特征能够预测模型自身对世界的理解和判断,可以近似为一个单一的激活方向,我们发现有些特征线性表示程度较高,有些则较低,这种线性表示(即向量引导)可以通过注入推理特征来改变LLM的决策。最后,我们使用相同的方法为提示注入分类器探针选择最佳训练数据集:虽然普通激活之间的相似性与下游性能几乎无关,但基于RFD的相似性达到了$94.7\%$的Top-1和$100\%$的Top-2准确率。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# 基于激活几何的无监督特征挖掘
来源:https://arxiv.org/html/2607.04222
###### 摘要

可解释性方法旨在揭示大型语言模型(LLMs)内部所表示的特征。许多现有方法从人类定义概念的带标签示例开始,这些示例可能反映人类偏见,然后识别该概念在模型内部的表示方式,例如在其激活空间中或通过其他分解方法。我们提出*基于激活几何的挖掘*(MAG),这是一种简单的无监督框架,通过将相同的自然语言指令QQ附加到每个输入pp来从模型激活中提取推理特征,其中QQ定义了感兴趣的推理特征,例如“这个物体能在沙漠中找到吗?”或“这个提示是恶意的吗?”我们在单个读取点使用m(Q∣p)−m(p)m(Q\mid p)-m(p)测量指令如何改变模型的内部表示。我们探索了八种不同的MAG。提取的推理特征可以预测模型自身的世界理解和判断,可以近似为单个激活方向,我们发现有些特征更具线性表示,有些则不然。这种线性表示(即向量引导)可以通过注入推理特征来通过激活引导改变LLMs的决策。最后,我们使用相同的方法为提示注入分类探针选择最佳训练数据集:虽然普通激活之间的相似性与下游性能几乎无关,但基于RFD的相似性达到了94.7%94.7\%的Top-1和100%100\%的Top-2准确率。

机器学习,ICML

## 1 引言

LLMs越来越多地被用作敏感环境中的通用系统,这引发了重要的安全问题(Bommasani et al., 2021 (https://arxiv.org/html/2607.04222#bib.bib2);Weidinger et al., 2022 (https://arxiv.org/html/2607.04222#bib.bib3);Kordonsky et al., 2026 (https://arxiv.org/html/2607.04222#bib.bib23))。安全对齐旨在通过鼓励模型遵循安全指南,同时保持与用户意图和人类偏好一致来降低这些风险(Ouyang et al., 2022 (https://arxiv.org/html/2607.04222#bib.bib4))。随着模型变得更加先进,对齐和评估失败可能更难仅从输出中检测到,因此,许多内部分析方法已被开发用于评估和发现这些失败模式(David et al., (https://arxiv.org/html/2607.04222#bib.bib26);Ben-Levi et al., 2026 (https://arxiv.org/html/2607.04222#bib.bib25);Fomin et al., 2026 (https://arxiv.org/html/2607.04222#bib.bib24))。

一个主要的评估失败场景可能由奖励黑客(reward hacking)引起:一个模型在常规交互中可能表现对齐,同时依赖于最终响应中不可见的内部表示或策略。对齐假装(alignment faking)和评估意识(evaluation awareness)是相关的失败模式,其中模型在识别到自己正在被训练或评估时会改变其行为。在对齐假装中,模型选择性遵守训练目标以避免被修改,但在推理时拒绝遵守或行为不同(Greenblatt et al., 2024 (https://arxiv.org/html/2607.04222#bib.bib5))。评估意识发生在模型因检测到自己正在被测试而改变行为时,而破坏(sabotage)则发生 在模型主动干扰监督、评估或任务执行,且从输出中难以检测的方式(Benton et al., 2024 (https://arxiv.org/html/2607.04222#bib.bib7);Hua et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib6))。在公平性评估中,安全拒绝可能会隐藏偏见,并在标准基准上造成公平假象(Himelstein et al., 2026 (https://arxiv.org/html/2607.04222#bib.bib8))。潜意识学习(subliminal learning)扩展了这一担忧,表明在知识蒸馏过程中,教师模型可以通过训练数据将行为特征传递给 学生模型,而这些数据的可见内容与这些特征无关(Cloud et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib1))。这些例子共同说明了为什么安全研究必须直接揭示并理解驱动模型行为的内部特征。

参见说明图1:一个固定指令QQ被附加到每个输入pp;A(x)=m(x)A(x)=m(x)表示最终块最后一个令牌处的残差流读取点,ΔQ(p)=m(Q∥p)−m(p)\Delta^{Q}(p)=m(Q\,\|\,p)-m(p)是前缀引起的偏移。(E1) 带前缀的激活A(Q∥p)A(Q\,\|\,p)比原始激活A(p)A(p)更好地预测模型自身的判断yMy^{M}(沙漠 LODO ROC 0.91→0.940.91\!\to\!0.94)。(E2) 在数据集标签与yMy^{M}不一致的行上,分类器偏向模型(Gemma上73.7%73.7\%),因此MAG读取的是模型的判断,而不是数据集的。(E3) 平均偏移vQ=Ep[ΔQ(p)]v_{Q}=\mathbb{E}_{p}[\Delta^{Q}(p)]一次性注入到最后一层,重构了前缀效应(归一化误差εQ\epsilon_{Q},式3 (https://arxiv.org/html/2607.04222#S3.E3);εQ=0\epsilon_{Q}\!=0精确,εQ=1\epsilon_{Q}\!=1无效果)。(E4) 使用类平均方向uQ=vQ−−vQ+u_{Q}=v_{Q}^{-}\!-\!v_{Q}^{+},在 校准强度α(τ)\alpha(\tau)下进行引导,在匹配格式探针下翻转了1111–12/1212/12个中立是/否判断。(E5) 阴性对照:提示注入前缀是线性度最差的单元(εQ=0.97\epsilon_{Q}\!=0.97),其方向翻转0/120/12个中立提示——低εQ\epsilon_{Q}预测可引导性,εQ≈1\epsilon_{Q}\!\approx\!1表示根深蒂固的判断;PI自标签yMy^{M}本身并不总是明确定义的。(E6) 概念方向ddesert,doceand_{\mathrm{desert}}, d_{\mathrm{ocean}}作为可引导的语义轴。(E7) 上下文加载的Bob前缀诱导方向dBobd_{\mathrm{Bob}}几乎正交于ddesertd_{\mathrm{desert}}(Llama上cos=−0.04\cos=-0.04),但仍能在样本外区分骆驼和蜥蜴。橙色标记MAG量;灰色标记无前缀基线。可解释性研究旨在解释模型如何表示信息并产生行为,以提高安全性、可控性和理解(Lin et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib9))。先前工作表明,隐藏状态包含可解码的信息(Hewitt and Liang, 2019 (https://arxiv.org/html/2607.04222#bib.bib10))、特定的内部机制可以支持特定行为(Wang et al., 2022 (https://arxiv.org/html/2607.04222#bib.bib12)),并且高维激活向量可以表示为更简单、更可解释特征的组合(Cunningham et al., 2023 (https://arxiv.org/html/2607.04222#bib.bib13))。其他工作表明,激活空间中的方向可以直接改变模型行为(Turner et al., 2023 (https://arxiv.org/html/2607.04222#bib.bib16);Zou et al., 2023 (https://arxiv.org/html/2607.04222#bib.bib15);Arditi et al., 2024 (https://arxiv.org/html/2607.04222#bib.bib14);Shnaidman et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib17);LeVi et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib27))。

LLMs表现出对其自身内部状态的有限形式的意识。在某些设置中,模型可以比其他模型更好地预测自身行为的特性、注意到注入的激活特征、识别这些特征所表示的概念、回忆先前的内部表示,并区分其激活中的变化与文本中提供的信息(Binder et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib19);Lindsey, 2026 (https://arxiv.org/html/2607.04222#bib.bib18))。模型在得到指示时也可以部分修改其内部表示,而注入特征的检测似乎依赖于分布式的内部计算(Lindsey, 2026 (https://arxiv.org/html/2607.04222#bib.bib18);Macar et al., 2026 (https://arxiv.org/html/2607.04222#bib.bib20))。这些发现表明,模型有时可以访问、报告或对其自身内部概念计算的信息做出反应。然而,它们将这些效应作为模型本身的内省能力来研究,并没有提供外部方法来定义推理特征、在评估期间诱导它、从激活中提取它,并重复用于分析或控制。

在这项工作中,我们提出*基于激活几何的挖掘*(MAG),这是一种无监督框架,用于直接从模型激活中提取推理特征。我们不是要求模型描述其自身的内部状态,也不是从人类标注的示例开始,而是使用自然语言指令来指定我们想要检查的推理过程。相同的指令QQ被添加到每个输入pp,这使我们能够比较模型在有和没有该推理上下文的情况下如何表示输入。我们使用激活变化m(Q∥p)−m(p)m(Q\mathbin{\|}p)-m(p)来捕获当模型在QQ下评估输入时诱导的特征。这为外部分析者提供了一种直接的方式来定义、提取和研究模型相对的推理特征,并测试它们是否可以被读取、控制、组合并重用 于下游任务。我们的主要贡献是:

- •MAG算子。我们定义了八个算子,用于隔离前缀诱导激活变化的不同部分以进行特征挖掘。
- •模型相对判断。我们表明MAG特征比原始激活更好地预测模型自身的判断,并且即使该判断与数据集标签不一致,也能跟踪该判断。
- •线性控制。我们表明前缀效应可以很好地近似为读取点处的单个线性激活方向,评估了该近似的残差重构误差,并表明该方向可用于在校准引导下引导模型的判断。
- •上下文推理。我们表明基于上下文的前缀产生的特征可以推广到保留样本,并且在几何上与前缀中命名的单个概念不同。
- •训练数据选择。我们表明MAG几何可用于选择将哪个候选数据集添加到训练池中,显著优于随机基线和经典激活相似性方法。

## 2 背景与相关工作

最近的工作表明,LLMs具有内省迹象,对自身内部状态有意识。模型有时可以注意到注入的激活特征、识别注入的概念、使用内部状态证据判断异常输出是否为预期,并在被指示时部分控制内部表示,同时强调这些能力仍然不可靠且范围有限(Lindsey, 2026 (https://arxiv.org/html/2607.04222#bib.bib18))。相关工作研究模型是否能够比其他模型更好地预测自身行为、是否能够将注入向量的检测与其概念的识别分开、以及是否能够检测到激活引导干预(Macar et al., 2026 (https://arxiv.org/html/2607.04222#bib.bib20);Binder et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib19))。这些结果激发了内省分析,但它们主要研究模型是否能够报告、注意到、控制或对其内部状态做出反应。它们留下了我们在这里研究的表示级问题:如何在模型评估输入时暴露、测量和重用产生的内部特征,而不依赖口头自我报告。

现有的可解释性方法从几个互补的角度暴露内部计算。探针解码隐藏状态中是否存在信息,尽管探针可能施加自己的结构(Hewitt and Liang, 2019 (https://arxiv.org/html/2607.04222#bib.bib10))。电路分析则寻求实现给定行为的机制(Wang et al., 2022 (https://arxiv.org/html/2607.04222#bib.bib12)),而稀疏自编码器将激活分解为更可解释特征的基础(Cunningham et al., 2023 (https://arxiv.org/html/2607.04222#bib.bib13))。另一个家族,包括Patchscopes、Activation Oracles和Natural Language Autoencoders,将隐藏状态翻译成文本解释(Ghandeharioun et al., 2024 (https://arxiv.org/html/2607.04222#bib.bib21);Karvonen et al., 2025 (https://arxiv.org/html/2607.04222#bib.bib22))。与先前的可解释性方法不同,我们的方法使用未标记数据和固定的自然语言指令来诱导推理特征,然后从产生的激活变化中挖掘该特征。

## 3 通过激活几何进行特征挖掘

一个固定的自然语言变换QQ被均匀地应用于每个输入pp。该变换可以是一个问题、指令或上下文,定义了感兴趣的推理特征。记Q∥pQ\|p为QQ和pp的拼接,m(x)m(x)为模型在输入xx上的读取激活(定义如下),激活差值m(Q∥p)−m(p)m(Q\|p)-m(p)捕获了通过将QQ应用于pp而诱导的推理特征;关于输入平均这个差值得到特征方向vQv_{Q}(式2 (https://arxiv.org/html/2607.04222#S3.E2))。当QQ在输入间诱导相同的推理关系时,得到的特征可以被读取、控制并与其他特征组合。第3.1 (https://arxiv.org/html/2607.04222#S3.SS1)–3.4 (https://arxiv.org/html/2607.04222#S3.SS4)节报告了四个小实验——一个*可读性*测试、一个*线性度*测试、一个*引导*测试和一个*组合*测试——针对Llama-3.1-8B-Instruct和Gemma-2-9B-it(Qwen-2.5-32B-Instruct作为压力条件)、四个前缀和两组提示。主要的定量声明——MAG对于迁移是*可预测地*有用的——推迟到第4节 (https://arxiv.org/html/2607.04222#S4)。

设FθF_{\theta}为一个自回归变换器,具有LL个块和残差维度dd。我们在最后一个令牌位置读取残差流:mℓ(x)∈Rdm_{\ell}(x)\in\mathbb{R}^{d}表示在输入xx上第ℓ\ell层的读取点,m(x)=mL(x)m(x)=m_{L}(x)是最终块的读取点。Prθ(⋅∣x)\Pr_{\theta}(\cdot\mid x)是模型在输入xx上的下一个令牌分布,∅\varnothing是空输入,因此表1 (https://arxiv.org/html/2607.04222#S3.T1)中的A(∅)A(\varnothing)是裸聊天模板上的读取点。记Q∥pQ\|p为拼接,读取点处的前缀诱导偏移为ΔQ(p):=m(Q∥p)−m(p)\Delta^{Q}(p):=m(Q\|p)-m(p)。该偏移捆绑了四种机制(前缀令牌的直接值信息、提示令牌的注意力重新加权、MLP非线性以及下游头交互);下面的算子族旨在隔离其中的一部分。对于是/否前缀,我们定义模型的自标签

yM(p)=1[Prθ(yes∣Q‖p)>Prθ(no∣Q‖p)],y^{M}(p)=\mathbb{1}\!\left[\Pr_{\theta}(\mathrm{yes}\mid Q\|p) > \Pr_{\theta}(\mathrm{no}\mid Q\|p)\right],\(1\)使得yM(p)=1y^{M}(p)=1表示“是”判断(在QPIQ_{\mathrm{PI}}下为恶意;在概念前缀下为符合概念)。yMy^{M}不是数据集标签;它是模型在受约束的是/否问题下发出的判断。对比集合P−={p:yM(p)=1}P^{-}=\{p:y^{M}(p)=1\}和P+={p:yM(p)=0}P^{+}=\{p:y^{M}(p)=0\}在整个过程中由yMy^{M}诱导,从未使用外部标注;任何与数据集标签的一致性都是要测量的属性(§3.1 (https://arxiv.org/html/2607.04222#S3.SS1))。

#### 算子。

设A(x)=m(x)A(x)=m(x),我们研究八个算子,每个都是MAG下提示的向量摘要(表1 (https://arxiv.org/html/2

相似文章

MiA-Signature:近似全局激活以增强长上下文理解

Hugging Face Daily Papers

本文介绍了 MiA-Signature,这是一种大语言模型(LLM)中全局激活模式的压缩表示,旨在提升长上下文理解能力。该方法提出使用基于次模性的选择策略来近似完整的激活状态,从而在检索增强生成(RAG)和智能体系统中带来性能提升。

流形引导注意力转向

arXiv cs.LG

提出了流形引导的注意力转向(MAGS),这是一种轨迹感知的推理时干预方法,通过将注意力输出投影回学习的正确性流形(当偏差超过阈值时)来纠正LLM中的推理错误,在数学、代码和分子基准测试中优于静态转向方法。

角度-范数分解下的激活转向几何解释

arXiv cs.AI

本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。