可解码性非因果性:通过SAE分解区分探测器输出与行为驱动因素
摘要
本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。
arXiv:2609.18080v1 Announce Type: new
摘要:线性探测器可以从语言模型激活中解码安全相关概念,如真实性,但探测器准确性可能只显示可解码性,而非探测器权重因果驱动模型行为的特征。我们证明,仅从探测器权重的几何形状无法弥合这一差距:与探测器方向几何对齐的特征不一定是模型使用的特征,因此因果相关性需要干预。我们引入了一种特征级诊断方法,将已部署的True/False探测器分解为稀疏自编码器(SAE)特征,根据探测器对齐和模型行为的梯度敏感性对这些特征进行排序,并在一致性门控下消融共享的、仅探测器的和随机的特征集。在Buerger等人(2024)的真相探测器(TTPD)上,应用于Long等人(2025)的Gemma2-9B-Instruct的指导性真相/欺骗设置中,两个排序的重叠较弱(约12%,Spearman rho = 0.10),并且消融显著分离了它们:探测器与模型共享的特征在完全一致性下比同等大小的仅探测器特征(6%)或随机特征(1%)更能翻转输出(高达27%),而仅探测器特征则扰动探测器自身的输出。这种分离在五个种子和一个保留分割中保持一致,且激活感知的特征选择比探测器的几何顶部特征翻转行为的频率高出近三倍(17.6% vs. 6.1%)。因此,在这种情况下,探测器权重向量的几何投影本身并不能识别模型因果使用的特征;然而,将探测器信息与特征激活统计结合可以恢复更多行为因果特征,并且需要一致性门控的SAE干预来将它们与探测器输出分离。
查看缓存全文
缓存时间: 2026/09/17 09:32
# 可解码性并非因果关系:通过SAE分解将探针读出与行为驱动因素分离 来源:https://arxiv.org/html/2609.18080 Devesh Tiwari††感谢:这些作者对本文贡献均等。Camille Davis11脚注标记:1单位:菲利普斯学院安多福邮箱:[deveshtiwari2705@Gmail\.com](mailto:[email protected])Shivank Sinha单位:都柏林高中Talia Weaver单位:卡蒙特高中Aditya Shah单位:谷歌Maheep Chaudhary††感谢:资深作者。单位:独立 ###### 摘要 线性探针可以从语言模型激活中解码诸如真实性等安全相关概念,但探针的准确性可能仅体现可解码性,而非探针权重所指向的特征能因果驱动模型行为。我们证明仅凭探针权重的几何结构无法弥合这一鸿沟:与探针方向几何对齐的特征未必是模型实际使用的特征,因此因果相关性需要通过干预验证。我们引入一种特征级诊断方法,将已部署的是/非探针分解为稀疏自编码器(SAE)特征,根据探针对齐度和模型行为的梯度敏感性对这些特征进行排序,并在一致性门控下消融所得的共享特征、探针独有特征和随机特征集。在Bürger等人(2024)(https://arxiv.org/html/2609.18080#bib.bib20)的真实性探针(TTPD)上,应用于Long等人(2025)(https://arxiv.org/html/2609.18080#bib.bib9)的指示性真实/欺骗设置中针对Gemma-2-9B-Instruct模型,两种排序仅存在微弱重叠(约12%,斯皮尔曼相关系数ρ=0.10),消融实验则清晰地将两者区分开:探针与模型共享的特征在完全一致性下能翻转输出的比例(最高达27%)远高于同等规模的探针独有特征(6%)或随机特征(1%),而探针独有特征反而干扰探针自身的读出。这种分离在五种种子设置和保留集划分中均成立,且基于激活的特征选择翻转行为的频率几乎是探针几何顶部特征的三倍(17.6% vs. 6.1%)。因此在该设置中,探针权重向量的几何投影本身无法识别模型因果使用的特征;然而,结合探针信息与特征激活统计能恢复更多行为因果特征,且需要一致性门控的SAE干预将其与探针读出分离。我们的方法实现可在此URL访问(https://github.com/cam1lled/causal-validation-sae)。 ## 1引言 在模型激活上训练的线性探针被广泛用于识别和预测与行为状态相关的表征(Alain and Bengio, 2018(https://arxiv.org/html/2609.18080#bib.bib14);Belinkov, 2022(https://arxiv.org/html/2609.18080#bib.bib13))。然而,从模型激活中可解码的信息并不必然因果导致模型行为。因此,仅凭高探针准确性并不能确立探针识别的表征必然在模型决策中发挥因果作用(Hewitt and Liang, 2019(https://arxiv.org/html/2609.18080#bib.bib23);Belinkov, 2022(https://arxiv.org/html/2609.18080#bib.bib13);Occhipinti et al., 2026(https://arxiv.org/html/2609.18080#bib.bib15))。区分仅具预测性的特征与因果相关特征仍是一项开放挑战。 我们研究探针识别的特征是否因果参与其解码表征所关联的模型行为。使用Long等人(2025)(https://arxiv.org/html/2609.18080#bib.bib9)引入的真实/欺骗事实验证设置,我们通过稀疏自编码器(SAE)分解模型激活,并根据探针对齐度和模型输出的梯度敏感性独立排序特征。随后在这些特征集上进行直接干预,同时追踪输出一致性。 我们发现探针权重最高的特征与模型敏感的特征仅存在微弱重叠,且这种差异具有行为表现。消融探针与模型共享的特征比消融同等规模的探针独有或随机特征更能显著翻转模型输出,同时全程保持输出一致性。探针独有特征则干扰探针自身的读出而不改变行为。这些结果表明,许多探针加权特征主要作为诊断性读出而非行为的因果驱动因素发挥作用,且仅凭探针权重的几何结构无法识别模型因果使用的特征。 我们的工作主要有三方面贡献。第一,我们引入一个框架,通过直接行为干预比较探针对齐特征与梯度敏感的SAE特征。第二,我们量化了探针排序特征产生一致性行为效应的程度,表明预测重要性与行为重要性可能显著背离。第三,我们识别出一个共享的探针-模型特征子集,该子集一致影响探针预测和模型行为,比探针独有特征提供更强的行为相关性证据。 参照标题图1:我们将最终生成前残差激活分解为SAE特征基,然后根据探针权重对齐度(表示探针读取的特征)和模型的是/非边际梯度敏感性(表示扰动最影响模型输出的特征)对相同SAE特征排序。随后我们对每个特征组连同随机对照组进行干预,测量对模型行为、探针预测和输出一致性的影响。 ## 2相关工作 ##### 探针、真实性表征与行为使用。 线性探针被广泛用于识别神经表征中编码的信息(Alain and Bengio, 2018(https://arxiv.org/html/2609.18080#bib.bib14);Belinkov, 2022(https://arxiv.org/html/2609.18080#bib.bib13)),但仅凭可解码性并不能确立解码信息被模型使用(Hewitt and Liang, 2019(https://arxiv.org/html/2609.18080#bib.bib23))。失忆探针通过移除探针识别的信息并测量下游行为使这一区别显式化,发现传统探针性能与任务重要性未必相关(Elazar et al., 2021(https://arxiv.org/html/2609.18080#bib.bib1))。后续工作强调此类干预必须对目标属性完全且对不相关信息选择性(Canby et al., 2025(https://arxiv.org/html/2609.18080#bib.bib2))。 对于事实真实性,先前工作已识别近似线性的真相表征,并通过激活干预测试其行为相关性(Marks and Tegmark, 2024(https://arxiv.org/html/2609.18080#bib.bib6))。Bürger等人识别了极性感知的真相子空间并引入TTPD(Bürger et al., 2024(https://arxiv.org/html/2609.18080#bib.bib20));Long等人在真实、中性和欺骗指示下应用该框架,表明与真相相关的表征在指示性欺骗下改变(Long et al., 2025(https://arxiv.org/html/2609.18080#bib.bib9))。相关探针已被用于检测或引导链式思维不忠实性(Occhipinti et al., 2026(https://arxiv.org/html/2609.18080#bib.bib15)),而其他研究表明高准确探针可能利用任务格式混淆(Sahoo et al., 2026(https://arxiv.org/html/2609.18080#bib.bib18))。我们的工作从本身具有行为因果性的探针方向出发,提出更细致的问题:与该方向几何对齐度最高的SAE特征是否就是承载其行为效应的特征。 ##### 稀疏自编码器与因果特征评估。 SAE将模型激活分解为稀疏潜在特征(Cunningham et al., 2023(https://arxiv.org/html/2609.18080#bib.bib5);Lieberum et al., 2024(https://arxiv.org/html/2609.18080#bib.bib12)),但重建质量和特征可解释性本身不能保证因果或任务级效用。任务导向评估发现,无监督SAE字典可能比监督特征字典提供更弱的行为控制(Makelov et al., 2025(https://arxiv.org/html/2609.18080#bib.bib3)),难以分离可独立操作的事实属性(Chaudhary and Geiger, 2024(https://arxiv.org/html/2609.18080#bib.bib7)),且未持续超越非SAE探针基线(Kantamneni et al., 2025(https://arxiv.org/html/2609.18080#bib.bib8))。SAEBench同样发现无监督代理指标的改进未可靠转化为下游可解释性任务(Karvonen et al., 2025(https://arxiv.org/html/2609.18080#bib.bib4))。这些结果促使通过任务特定干预评估SAE特征,并验证所研究的探针信号被SAE重建保留。 先前工作已使用SAE消融、补丁和引导来识别因果相关特征和电路(Kissane et al., 2024(https://arxiv.org/html/2609.18080#bib.bib16);Marks et al., 2025(https://arxiv.org/html/2609.18080#bib.bib19))。最直接地,Ma等人表明对比选择的SAE推理特征常反映词汇关联而非推理计算(Ma et al., 2026(https://arxiv.org/html/2609.18080#bib.bib17))。 ## 3方法论 ### 3.1概述 我们的框架按以下阶段进行:探针复制、SAE特征归因、基于梯度的敏感性排序、因果干预(消融和学习稀疏掩码)以及重叠与分解。 我们在所有干预过程中追踪输出一致性,以确保观察到的效应可解释(第3.7节(https://arxiv.org/html/2609.18080#S3.SS7))。 我们还对额外的欺骗探针运行辅助诊断,测试相同的SAE探针归因工作流是否适用于硬编码的欺骗探针。 ### 3.2阶段1:探针复制 我们使用原作者程序复制目标探针,确认其与报告性能匹配(附录A.1(https://arxiv.org/html/2609.18080#A1.SS1))。 ### 3.3阶段2:SAE特征归因 我们将探针的权重向量投影到预训练SAE的解码器基上,以识别探针从哪些SAE特征读取。 设探针P的权重向量为w∈Rd(w\\in\\mathbb\{R\}^\{d\}),在层l(\\ell)的残差流激活h(l)∈Rd(h^\{\(\\ell\)}\\in\\mathbb\{R\}^\{d\})上训练。设SAE解码器矩阵为D∈Rd×k(D\\in\\mathbb\{R\}^\{d\\times k}),列di(d\_i)表示学习到的特征方向。由于探针输出可近似为w⊤h≈∑ifi⋅(w⊤di)(w^\{\\top}h\\approx\\sum\_\{i}f\_\{i}\\cdot(w^\{\\top}d\_\{i})),其中fi(f\_i)是SAE特征i的激活,每个特征对探针的结构性贡献为: ci=w⊤di(c\_\{i}=w^\{\\top}d\_\{i})(1)具有大|ci|(|c\_\{i}|)的特征是探针在SAE重建中线性敏感的方向。我们按激活无关分数|ci|(|c\_\{i}|)排序特征作为探针对齐排序。 ### 3.4阶段3:基于梯度的敏感性排序 为估计模型输出对哪些特征最敏感,我们根据模型行为相对于特征激活的梯度归因对SAE特征排序。设A为归因目标,定义为行为逻辑值(或目标词边际)相对于每层特征激活fi(l)(f\_\{i}^\{\\ell})的梯度,在数据集上平均: Ai=Ex∈D[‖∂M(x)∂fil‖],(A\_\{i}=\\mathbb\{E}\_\{x\\in\\mathcal\{D}}\\left[\\left|\\frac{\\partial\\mathcal\{M}(x)}{\\partial f\_\{i}^\{\\ell}}\\right|\\right],)(2)其中M(x)=logit(True)−logit(False)(\\mathcal\{M}(x)=\\operatorname{logit}(\\mathrm\{True})\\-\\operatorname{logit}(\\mathrm\{False}))对层l(\\ell)最后词位置的SAE特征激活fi(l)(f\_\{i}^\{\\ell})求导,在数据集上平均。我们保留排名靠前的特征作为梯度敏感特征集Fmodel(\\mathcal\{F}\_\{\\text\{model}})。 ### 3.5阶段4:因果干预 从探针视角和梯度敏感性两个角度排序特征后,我们通过直接干预验证这些归因。在每个干预下,我们测量行为翻转率(定义为模型的是/非输出相对于未干预基线改变的示例比例)和探针读出偏移(定义为探针边际w⊤h的相对变化)。 这种双重测量分离了特征对探针读出的影响与其对模型行为的影响,即我们分析的核心分离(图1(https://arxiv.org/html/2609.18080#S1.F1))。 #### 3.5.1特征消融 对于选定特征集S(\\mathcal\{S}),我们通过从层l(\\ell)的残差流中减去其重建贡献来消融这些特征: h~(l)=h(l)−∑i∈Sfidi(\\tilde\{h}^\{\(\\ell\)}=h^\{\(\\ell\)}\\-\\sum\_\{i\\in\\mathcal\{S\}}f\_\{i}\\,d\_\{i})(3)并让模型的前向传播从h~(l)(\\tilde\{h}^\{\(\\ell\)})继续。我们对探针归因特征(Fprobe(\\mathcal\{F}\_\{\\text\{probe}}))、梯度敏感特征(Fmodel(\\mathcal\{F}\_\{\\text\{model}}))和匹配基数的随机对照特征应用此过程。 #### 3.5.2学习稀疏掩码 我们学习SAE特征上的稀疏掩码,选择对探针边际贡献最大的特征,结合每个特征的解码器对齐ci(c\_\{i})与其激活。每个特征的可学习权重ai∈[0,1](a\_\{i}\\in\[0,1])通过l1(\\ell\_\{1})惩罚优化,以从加权特征贡献重建探针边际。训练后,30个特征超过ai>0.5(a\_\{i}>0.5);我们消融前16个以匹配表4(https://arxiv.org/html/2609.18080#S5.T4)中其他特征集的规模。这产生基于激活的特征集Fmask(\\mathcal\{F}\_\{\\text\{mask}}),与激活无关的几何排序|ci|(|c\_\{i}|)形成对比。完整训练细节见附录A.1.2(https://arxiv.org/html/2609.18080#A1.SS1.SSS2)。 ### 3.6阶段5:重叠与分解 我们比较探针的特征排序与模型的排序,以表征两者依赖共享特征的程度。 我们计算探针归因与梯度敏感特征前N(N)个之间的集合重叠作为N的函数,并报告斯皮尔曼秩相关系数作为汇总统计量。使用此分析,我们将探针特征分为三组:共享组(前K(K)个探针对齐特征与前K(K)个梯度敏感特征的交集),其大小m(m)设定了其他两组的匹配规模;探针独有组(包含模型前梯度排序特征中未出现的最高探针排序特征,大小与共享组匹配);随机组(从剩余特征中随机采样的大小匹配样本)。 我们在K∈{32,64,128,256,512,1024}(K\\in\\\{32,64,128,256,512,1024\\\})个每排序的顶部特征上消融每组(产生5至126个共享集),如公式3(https://arxiv.org/html/2609.18080#S3.E3)中减去重建特征贡献,并比较所得行为翻转率、探针边际偏移和一致性。这种分解隔离了探针...
相似文章
线性探针在语言模型隐藏状态中检测的是任务格式,而非推理模式
本文证明,基于LLM隐藏状态的线性探针检测到的是任务格式混淆因素(例如来源身份、回答长度),而非不同的推理模式。通过残差化和因果引导,表明高探针准确率源于表面特征,而非计算结构。
当可解码性不足时:语言模型中的逻辑有效性表示、行为分离与因果测试
本文研究了大型语言模型如何内部表示逻辑有效性,表明尽管行为表现不佳,有效性信息仍可从隐藏状态中解码,这表明表示、表达和因果使用具有不同的作用。
相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题
本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。
驾驭语言轴:从线性可解码性到因果控制
本文研究LLM中的语言身份是否可以通过紧凑的激活方向进行线性解码和因果控制。通过在多个模型家族上进行引导(steering)和消融(ablation)实验,作者表明语言选择具有方向依赖性、层特异性,并且在语言信号被消融时会恢复为英语。
Polar Probe线性解码LLM中的语义结构
本文提出了一种Polar Probe,通过在学习的子空间中用距离和方向表示实体关系,从LLM激活中线性恢复语义结构。在算术、视觉场景、家谱、地铁地图和社交互动等多个领域的测试表明,该编码出现在中间层,能泛化到新实体,并对模型预测产生因果影响。