通过非局域性度量SAE特征的语义抽象度
摘要
本文介绍了特征非局域性(FNL),一种基于熵的度量指标,用于衡量大型语言模型中SAE特征的语义抽象度,并展示了其在审计越狱缓解特征和通过引导提高MATH-500准确率方面的应用。
arXiv:2608.10537v1 公告类型:新
摘要:稀疏自编码器(SAE)通过理解与任务相关且具有因果效力的特征,帮助揭示了大型语言模型(LLM)行为(如推理、越狱等)的机制性解释。要评估此类机制性解释,下游研究必须区分表面词汇特征与真正的高层特征。然而,基于自动解释的语义描述或因果引导效用都无法完全确定特征的抽象层级。为此,我们引入了\emph{特征非局域性}(FNL),将其定义为对SAE特征激活的归一化逐位置影响的熵。我们发现,FNL与现有的基于LLM的特征语义抽象度代理指标相关,并能成功区分上下文相关的推理特征与词元驱动的特征;在由上下文特征和词元级特征组成的随机配对中,FNL正确地将较高值赋给上下文特征的比例为$73$--$84\%$。
我们展示了两个下游应用。我们审计了用于越狱缓解的基于SAE的特征,并惊讶地发现,大多数有效特征是低FNL的位置特征,而非真正识别有害意图。
我们报告,在DeepSeek-R1-Distill-Llama-8B中引导高FNL特征,使MATH-500准确率比未引导模型提高$4.6$个百分点,并且优于引导低FNL特征,尽管收益因模型而异。我们得出结论:FNL提供了一种与LLM无关、无需标签的抽象层级相关证据,可应用于评估机制性解释以及选择下游干预特征。
查看缓存全文
缓存时间: 2026/08/12 08:25
# 通过非局部性度量 SAE 特征的语义抽象程度 Source: https://arxiv.org/html/2608.10537 ###### 摘要 稀疏自编码器(SAEs)通过理解相应的任务相关且因果有效的特征,帮助揭示了大语言模型行为(如推理、越狱等)的机制解释。然而,要评估这类机制解释,下游研究必须区分表面词汇特征与真正的高层特征。但基于自动解释(autointerp)的语义描述和因果引导(causal steering)效用都不能完全确定特征的抽象层级。为此,我们引入了**特征非局部性**(Feature Nonlocality,FNL),其定义为 SAE 特征激活的逐位置归一化影响的熵。我们发现 FNL 与现有基于 LLM 的特征语义抽象度代理指标相关,并且能够成功区分上下文相关的推理特征与 token 驱动的特征:在随机抽取的由一个是上下文特征、一个是 token 级特征组成的特征对中,FNL 在 73–84% 的情况下正确地将更高的 FNL 分配给上下文特征。我们展示了两个下游应用。我们审计了用于越狱缓解的 SAE 特征,并惊讶地发现大多数有效特征是低 FNL 的位置特征,而非真正识别有害意图的特征。我们报告,在 DeepSeek-R1-Distill-Llama-8B 上引导高 FNL 特征使 MATH-500 准确率比未引导模型提高 4.6 个百分点,并且优于引导低 FNL 特征的效果,不过这些增益具有模型特异性。我们得出结论:FNL 提供了独立于 LLM、无需标签的关于 SAE 特征抽象层级的关联性证据,可用于评估机制解释以及选择下游干预特征。 ## 引言 随着现代大语言模型能力日益增强,并展现出研究级智能(Alon et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib40)),理解其涌现能力的机制,从而控制其行为模式以减轻安全风险,仍然是一个核心挑战。为此,机制可解释性(Mechanistic Interpretability,MI)在推理时对大型语言模型(LLMs)的内部激活应用探针和干预,旨在对其行为进行微观层面的解释和控制(Sharkey et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib35))。MI 中的许多工作基于线性表示假设(Park et al. 2024 (https://arxiv.org/html/2608.10537#bib.bib18); Elhage et al. 2022 (https://arxiv.org/html/2608.10537#bib.bib19)):其目标是提取人类可解释、因果相关的**特征**,即隐藏激活空间中的线性方向,从而在测试时通过干预实现行为编辑。这类流程已成功识别出能够可靠修改真实性(Li et al. 2023 (https://arxiv.org/html/2608.10537#bib.bib36))、拒绝(Arditi et al. 2024 (https://arxiv.org/html/2608.10537#bib.bib16))、推理(Galichin et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib6))和人格(Chen et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib37))等行为的干预,而无需更新模型权重。为了发现和提取特征,稀疏自编码器(SAEs)提供了一种有吸引力的无监督机制。通过用过完备的稀疏字典重建隐藏激活,SAEs 旨在将叠加变量分离为各自单语义、人类可解释的特征(Cunningham et al. 2024 (https://arxiv.org/html/2608.10537#bib.bib11); Gao et al. 2024 (https://arxiv.org/html/2608.10537#bib.bib38))。在使用 SAEs 研究推理、越狱等目标行为时,以往工作通常通过以下方式从完整字典中筛选有用特征:(1)根据激活在特定相关 token 线索子集上的门控(Galichin et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib6); Fang et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib28));(2)构造对比数据集,以找到在正例上激活、在负例上不激活的特征(Assogba et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib30));或(3)依赖 LLM 根据给定特征显著激活的文本样本生成自然语言解释(Bills et al. 2023 (https://arxiv.org/html/2608.10537#bib.bib13))。这些特征选择方法随后会辅以引导实验,以确认其在因果干预下编辑行为的能力(Arad et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib27))。 重要的是,通过干预某个特征成功控制目标行为,并不意味着理解了底层**机制**(Makelov et al. 2023 (https://arxiv.org/html/2608.10537#bib.bib39))。例如,如果对某个特征进行引导能稳定地诱导回溯行为,该特征既可能真正表示对不确定性的检测,也可能仅仅提高了输出 token“Wait”的概率(Muennighoff et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib43); Ward et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib29))。因此,区分 token 级的“包装”特征与真正的高层特征,对于支持微观机制理解至关重要。然而,当前的特征选择方法往往不区分特征的机制复杂度。尤其是,token 级线索和基于对比数据集的筛选并不能排除表面层面的词汇/文体特征。基于自动解释的筛选通常又受限于 LLM 生成解释的脆弱性(Huang et al. 2023 (https://arxiv.org/html/2608.10537#bib.bib25))。为了提供特征机制复杂度的定量证据,我们提出了**特征非局部性**(FNL)。具体而言,FNL 通过一次反向传播来观察输入序列中哪些位置与特征激活存在因果关联,这直观地刻画了特征的**上下文覆盖范围**。token 级特征(如二元组统计)依赖于局部前缀线索,因此非局部性较低;而抽象的主题特征则依赖广泛分布在整个窗口中的上下文证据,因此非局部性较高。我们注意到,FNL 的定义受到了全息对偶(holographic duality)的启发(Maldacena 1999 (https://arxiv.org/html/2608.10537#bib.bib46)),后者描述了量子引力理论与低维量子场论之间的对偶关系。量子引力理论(通常称为“体积理论”)中不同位置的自自由度,对应量子场论中不同长度尺度的自由度。SAE 特征类似于体积理论中的自由度,而 FNL 度量其“位置”,对应于时间方向上的非局域性。这里我们把 transformer 模型视为 token 向量空间中的“时间演化”(Geshkovski et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib44))。 我们首先确认 FNL 度量的是特征的内在属性。在我们研究的输入分布(WikiText、GSM8K、Code-Python)中,逐特征的 FNL 排名保持稳定:我们在正文中报告 Gemma-2-2B 的结果,并在补充材料中报告 Llama-3-8B 和 Qwen3-8B 的结果。我们还报告,FNL 尊重特征几何:具有相似解码向量(即在写入侧具有相似机制功能)的特征,其非局部性范围也相似。接下来,我们用互补证据检验 FNL 是否追踪特征的抽象层级。首先,我们将 FNL 统计量与自动解释描述进行匹配,发现概念抽象性与更高 FNL 之间存在一致性。其次,在推理场景中,我们锚定(Ma et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib31))提出的两个独立代理指标:对于给定特征,其流程检测在相关 token 注入下的假阳性(FP)激活,以及在激活样例的语义保持改写下的假阴性(FN)。一个真正的高层特征应当直觉上最小化 FP/FN 事件。我们表明,作为独立的基于梯度的度量,特征非局部性与 FP/FN 指标均显著相关(Spearman ρ(FNL, token注入 FP)=−0.46,p<5×10^-4;ρ(FNL, 改写 FN)=0.27,p=0.01)。与这些指标不同,FNL 不依赖 LLM 判断或精心构造的对比数据集。这些结果共同支持 FNL 作为特征抽象层级的经验轴。 在表示分析之外,我们还展示了 FNL 的下游应用:(1)我们计算了经 SAE 过滤得到的越狱缓解特征的非局部性(Assogba et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib30)),并发现了惊人证据:能够成功削弱包装式越狱尝试的特征经常是表面层级的、位置指示性的特征,而非真正“识别”有害意图的特征。这为缓解机制提供了新的见解;(2)对于 DeepSeek-R1-Distill-Llama-8B 模型,我们评估了高 FNL 特征在提升推理性能方面的引导效用。我们发现,引导高 FNL 特征使 MATH-500 准确率比未引导模型提高 4.6 个百分点,而低 FNL 和随机特征基线分别提高 3.8 和 3.6 个百分点。作为一种特征选择标准,较高 FNL 特征的表现优于较低 FNL 特征,且具有边际统计显著性;高 FNL 分支与 token 线索标准 ReasonScore 选出的代表性特征相当(Galichin et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib6))。需要注意,后一个实验应被视为概念验证,因为我们并不普遍期望特征非局部性能够可靠地预测引导效用(Arad et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib27))。 总之,我们的贡献包括: 1. 我们引入了**特征非局部性**(FNL),一种无需标签、基于梯度的度量,用于刻画 SAE 特征典型的上下文覆盖范围。 2. 我们通过人类判断以及与先前工作中提出的两种抽象度代理指标的统计相关性,验证了 FNL 作为特征抽象层级经验轴的有效性。 3. 我们表明,对于安全相关行为,FNL 提供了有用的诊断,能够区分 token 级特征与抽象特征,并为可引导的越狱缓解机制提供新见解。 4. 作为概念验证,我们表明 FNL 选出的特征集合能够在没有标签或 token 线索过滤器的情况下,使 DeepSeek-R1-Distill-Llama-8B 模型在 MATH-500 上超过其未引导基线。 本文按照 Agentic 出版协议(Agentic Publication Protocol)发布(Lu and Qi 2026 (https://arxiv.org/html/2608.10537#bib.bib1))。在发布的代码库中,我们包含了对 AI 编码代理的明确说明和技术上下文。欢迎读者使用这类代理打开我们的仓库(https://github.com/lccqqqqq/sae-feature-nonlocality),并与代理交互以解释技术细节和复现结果。 ## 相关工作 在本节中,我们回顾稀疏自编码器和激活引导的基础知识。然后我们讨论 SAE 可解释性研究中已有的特征选择与验证方法,并指出它们通常不能区分语义抽象特征与 token 级特征。 #### 稀疏自编码器(SAEs) SAEs 是具有一个隐藏层的自编码器。操作上,给定激活 h∈R^d,SAE 计算 z(h)=σ(W_enc h + b_enc), h_hat = W_dec z(h) + b_dec, (1) 其中 σ 是非线性,z∈R^m 是稀疏潜在表示,通常有 m>d。SAE 在稀疏约束下训练以重建隐藏激活(通常来自语言模型)。一种常见的稀疏正则化选择是 l1 范数,因此训练目标可以示意为 L_SAE = ||h_hat - h||_2^2 + α ||z(h)||_1, (2) 其中 α 是超参数。经验上,SAE 能够学习到对稀疏重建有用的特征,这些特征也往往是单语义且人类可解释的。我们还注意到,SAE 的许多潜在变量存在特征吸收/分裂以及重建-稀疏权衡问题,这些问题会损害其可解释性,尽管已有各种架构变体和训练设置方面的努力试图缓解这些影响。 #### 激活引导 给定特征方向后,**引导**实验通过增强/抑制激活沿特征方向的投影,在推理时编辑模型的内部激活。常见方法包括**加法引导**(Turner et al. 2023 (https://arxiv.org/html/2608.10537#bib.bib21); Rimsky et al. 2024 (https://arxiv.org/html/2608.10537#bib.bib22))、**乘法引导**(Zou et al. 2023 (https://arxiv.org/html/2608.10537#bib.bib23))以及**钳制**(clamping),后者将特征激活覆盖为某个目标值(Templeton et al. 2024 (https://arxiv.org/html/2608.10537#bib.bib5))。记 z_a^max 为特征的典型峰值激活,e_a 为其单位解码方向,则可将激活钳制为 h ↦ h + (γ z_a^max - h·e_a) e_a, (3) 其中增益 γ>1 设置引导强度。当存在包含许多感兴趣的 SAE 特征的子集时(Soo et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib9); He et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib10)),可以从训练后的特征加权组合构造引导方向。引导实验验证了特征在引发目标行为模式方面的因果控制能力。 #### SAE 中的特征选择/验证 无监督 SAE 训练会产生一个与任务无关的字典。因此,下游应用需要事后标准来选择**任务相关**、**因果有效**且机制可解释的特征。为了确保任务相关性,**关键词过滤**会寻找在任务特定的 token 线索上激活或解码到这些线索的特征,例如推理任务中的“wait”、“but”(Galichin et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib6));**基于激活的过滤**根据特征的激活统计量选择 SAE 特征。(Assogba et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib30))通过准备裸有害请求与包装器内的越狱有害提示组成的对比数据集,并选择在这些对比提示上激活差异较大的特征来寻找与越狱相关的特征;(Cho et al. 2025 (https://arxiv.org/html/2608.10537#bib.bib45))直接选择激活与任务性能相关的特征。虽然这些方法对于识别候选特征很有用,但它们并不能排除目标行为的机械上简单的词汇/格式关联物(Fang et al. 2026 (https://arxiv.org/html/2608.10537#bib.bib28))。对于因果能力,Arad 等人计算了输出分数(Arad et al. 20
相似文章
稀疏特征干预何时真正局部化?基于SAE的安全控制匹配评估
本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。
面向多模态情感分析的语义对齐结构抽象
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。
接地鸿沟:大语言模型如何以不同于人类的方式锚定抽象概念的含义
本研究调查了大语言模型(LLMs)与人类在理解抽象概念时的“接地”(grounding)差异,发现存在显著的“接地鸿沟”:模型过度依赖词语联想,而较少涉及情感或内在状态。作者利用稀疏自编码器(SAEs)识别出与接地维度相关的内部特征,表明LLM虽然具备这些信息,但在自由生成文本时并未像人类一样自然地调用它们。
形式语义结构解释人类标注变异的程度有多大?:NLI中的群体级效应与项目级上限
本文利用ChaosNLI数据,衡量形式语义结构在多大程度上解释了自然语言推理(NLI)中的人类标注变异,发现了对熵的群体级效应,但存在项目级上限和空组合效应。
基于语义级奖励的LLM校准
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。