激活空间顺序交换几何:一种站点不对称性审计
摘要
本文引入一种站点不对称性审计,以分离激活空间顺序交换干预中的基线效应和交互作用,表明单干预基线能解释语言模型中的大部分方差,并提出一种校正残差用于检测几何结构。
arXiv:2608.25315v1 公告类型:新
摘要:顺序依赖的激活统计常被解释为交互作用的证据,但这种解释可能因干预进入网络的位置而混淆。我们引入一种无拟合站点不对称性审计。对于二次可微读出,开放路径顺序交换可分解为由单干预测量的典型加性响应,以及一个反对称化二阶差分,该差分在二阶上不含一阶和纯自曲率项。在六个开放权重语言模型家族中,单干预基线解释了括号范数的84.3-97.7%(平均93.7%),而在具有加/减注入分离的两个家族中,无交互作用的自曲率项比校正残差大1.8-5.2倍。在无混淆提示分离下,校正残差在六个家族中的三个中清除了通用交互作用零假设,在配置鲁棒性后为六个中的两个。一个已知正向的代理恢复了植入的混合交互作用,而一个匹配的站点分离测试改变了基线份额,一个随机架构重现了一阶机制。相同的估计器转移到已发布的非语言参考:训练残差分数在12个对比中的11个(5/6 ViT-B/16,6/6 ResNet-50)低于固定高斯方向零假设,这是一种可移植性检查而非综合证据。贡献是一个可重用的测量标准:在读取顺序交换向量作为交互作用或几何结构之前,先运行单干预基线;如果它解释了该向量,则改用二阶差分。所有声明都限于在不同站点的激活空间干预;我们并不声称表示几何是全局阿贝尔的。
查看缓存全文
缓存时间: 2026/08/27 09:39
# 激活空间序交换几何:位点不对称审计
来源:https://arxiv.org/html/2608.25315
###### 摘要
序依赖的激活统计常被解释为交互作用的证据,但这种解释可能会受到干预进入网络位置的影响。我们引入了一种无需拟合的位点不对称审计方法。对于二次可微的读出层,开路径序交换可分解为一个通过单次干预测量的典范加性响应,以及一个反称化的二阶差分,该差分在二阶上不含一阶项和纯自曲率项。在六个开源语言模型家族中,单次干预基线解释了84.3-97.7%的括号范数(平均93.7%),而在两个采用正负注入分离的家族中,无交互自曲率项比校正后的残差大1.8-5.2倍。在混淆无关的提示分割下,校正后的残差在六个家族中的三个通过了通用交互的零假设检验,配置稳健性后仍有两个家族通过。已知正例的替代模型恢复了植入的混合交互,而匹配的位点分离测试改变了基线占比,随机架构则重现了一阶主导机制。同一估计器可迁移到已发布的非语言参考模型:训练残差分数在11/12个对比中低于固定高斯方向零假设(5/6个ViT-B/16,6/6个ResNet-50),这属于可移植性检查而非汇总证据。本文的贡献在于提供了一个可复用的测量标准:在将序交换向量解读为交互或几何结构之前,先运行单次干预基线;如果该基线能解释该向量,则改用二阶差分。所有声明均限于在不同位点的激活空间干预;我们不主张表示几何全局满足阿贝尔性。
††proceedings:arXiv: arXiv预印本††year:2026††workshop:神经表示的对称性与几何## 引言
添加到Transformer残差流中的引导向量具有可组合性,且组合具有序依赖性:在方向\(v_j\)之前注入方向\(v_i\)的结果与顺序相反时不同。这种序依赖性的代数解读是现成且诱人的。测量量类似于一个括号:它是反称的,在两个方向相同时消失,且在实际中非零。在*权重*空间中,这种解读已确立,两次微调更新的交换子被视为主导的序依赖量(Sweeney, 2026 (https://arxiv.org/html/2608.25315#bib.bib2));在激活空间中,类似的闭合环统计量正被计算并进行几何解读(Richards, 2026 (https://arxiv.org/html/2608.25315#bib.bib3); Sevetlidis and Pavlidis, 2026 (https://arxiv.org/html/2608.25315#bib.bib4))。可组合干预和任务算术流程提供了相关的组合设置,而非此括号统计量(Kolbeinsson et al., 2025 (https://arxiv.org/html/2608.25315#bib.bib21); Ilharco et al., 2023 (https://arxiv.org/html/2608.25315#bib.bib20); van der Weij et al., 2024 (https://arxiv.org/html/2608.25315#bib.bib22))。最接近我们统计量的是Mudarisov et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib30)确实构建了一个激活空间李括号,并将其描述为“衡量它们的顺序是否重要”;我们的标准在此基于实质内容判为*免于适用*,而非未能应用。据我们所知,尚无已发表的论文计算跨越*不同*注入深度的开路径激活空间序交换统计量,并将其解读为非阿贝尔结构的证据,我们并未将此错误归咎于任何人。我们提供的是该统计量的一个零模型及其廉价检验:一个可复用的位点不对称审计,用于区分结构强制产生的部分和模型贡献的部分。最接近我们形式的已发表统计量存在于权重空间,超出了我们激活空间标准的测试范围(Schessl, 2026 (https://arxiv.org/html/2608.25315#bib.bib34);附录D (https://arxiv.org/html/2608.25315#A4)讨论了我们自己使用它的失败尝试)。该标准本质上也不是二值的:污染由\(J_1 - J_2\)驱动,因此它预测存在梯度,并且在保持读出层固定的情况下扩大位点分离,会使一阶项在括号中的占比在6/6个家族和720个匹配对的91.7%中增加,而原始深度无效,同形未训练网络仅达到54–58%(附录D (https://arxiv.org/html/2608.25315#A4);我们报告此为计数而非p值,因为这六个家族共享一个特征集,并非六次独立抽取)。经过四个不同深度的循环是一阶主导的,而退化循环是惰性的(图2 (https://arxiv.org/html/2608.25315#S1.F2))——这是一种机制特定的检验,而非另一个二值裁决。该审计基于单一原则组织:序交换几何具有典范的位点不对称基线,必须在解释前进行测量。通过减去两种顺序来定义一个量,你将免费获得反称性、在重复参数上消失,并且——当位点错配非平凡作用于方向差时——还能免费获得一个可测量的基线。泰勒恒等式是初等的;积极的主张是,这是该类的正确审计对象:它通过四次单次干预前向传播来测量,可通过匹配的位点分离扰动来证伪,并通过已知正例对照组验证。六个家族的结果随后表明,在该设置下,基线解释了测量到的括号的大部分。
具体来说,该差分在一阶展开为\((J_1 - J_2)(v_i - v_j)\),对每个方向分别线性,不含交互作用,并且当位点错配作用于方向差时,通常非零。相同的模式在我们考察的每个层级都重复出现:二阶项包含一个自曲率部分,它同样不含交互作用,并且在主要配置下比零参数残差*大*1.8–5.2倍;广泛认为免于交互的闭合传输环携带相同的一阶项;而用于联合结构的自然诊断对任何秩的任意反称形式都返回近零值,因此其在实际数据中的崩溃是蕴含的而非观测到的。四个表面发现,一个原因。
### 贡献。
核心贡献是用于序依赖激活统计的位点不对称审计,无需拟合任何东西即可演示。零参数预测\(\widehat{\mathcal{L}}_{ij}=[s_1(v_i) + s_2(v_j)] - [s_1(v_j) + s_2(v_i)]\),由四次单次注入前向传播构建,从未见过它预测的括号,在所有六个家族的主要配置下,仅留下括号范数的5–8%未被解释,在所有十八个家族-配置单元中为2–16%(平均余弦0.9973,从未低于0.9869)。余弦和残差分数是以两种单位表示的同一次测量,而非两次一致的测量(附录C (https://arxiv.org/html/2608.25315#A3))。
对实践的启示是一个划分,并且它超越了我们自己的模型而具有普遍性。对于“这两个干预是否交互”目前流传着两个统计量:序交换括号\(\mathrm{Br}_{ij}=h_{ij}-h_{ji}\),以及*二阶差分*\(D_{ij}=h_{ij}-s_1(v_i)-s_2(v_j)\)。它们恰好相差上述伪影:\(\mathrm{Br}_{ij}=(D_{ij}-D_{ji})+\widehat{\mathcal{L}}_{ij}\)。该恒等式是重言式;但其量级不是。在我们的十八个单元中,一阶项解释了括号的84.3–97.7%(平均93.7%),而二阶差分为0%。这种对比的任一半都不是独立测量:前者是1减去第4节 (https://arxiv.org/html/2608.25315#S4)报告的残差,是互补单位下的同一量;后者由\(D\)的定义精确给出,甚至对常数映射也成立。这给出一个实用的停止条件:在将\(\mathrm{Br}\)几何解读之前,先运行单次注入预测;如果它解释了该括号,则该统计量未识别到交互作用。希望得到交互作用的读者应构造\(D\)而非校正括号来恢复它。这也明确了我们自身残差的地位,它*就是*反称化的二阶差分(第2节 (https://arxiv.org/html/2608.25315#S2))。
图1:两个核心结果。\((a)\)序交换括号范数相对于注入系数\(\alpha\),在\(\alpha=1\)处归一化。所有六个家族都跟踪\(\alpha^1\)(虚线),这是一个无交互项的缩放,而非\(\alpha^2\)(点线);拟合指数\(\gamma\in[0.886,1.043]\)。\((b)\)*混淆无关*提示分割设计下(实线)校正残差的无符号共享参数比率,对比通用交互零假设(红色虚线)、经过校准的特征变化一阶臂,以及未经校准的常数雅可比矩阵下限(线性松弛,没有可校准的自由参数;附录D (https://arxiv.org/html/2608.25315#A4))。星号标记了通过零假设的3/6个家族——Llama 1.599、OLMo 2.059、Qwen 1.642,对比1.324的门槛;DeepSeek、Gemma和Mistral降至线性松弛水平。虚线轮廓是相同样本量的完整样本统计量,其中所有对共享一个提示集:差距即共享提示混淆的价值。我们绘制声称的数量,而非更有利的完整样本量。特征变化臂在坐标轴顶部被截断并标注其真实值。图2:测量的三维示意图,非模型数据。\((a)\)相反的位点顺序给出不同的雅可比加权路径和端点弦\(\mathrm{Br}_{ij}\)。\((b)\)切平面预测\(\widehat{\mathcal{L}}\)与二阶差分曲率\(D_{ij}\)分离。\((c)\)四条边可以有零净注入向量,但当位点雅可比矩阵不同时,具有非零的一阶读出残差。端点顺序和环路闭合是需要测量的诊断指标,其本身并非交互作用的证据。其次,人们会应用的校正也不能分离交互作用。再展开一阶会将\(\alpha^2\)系数分成两部分:一个真正的混合项\(\mathcal{M}\),和一个自曲率项\(\mathcal{S}\),它对每个方向分别呈二次型,不含耦合。我们无需拟合即可测量\(\mathcal{S}\)。在主要配置下,它比零参数残差*大*1.8–5.2倍,因此两项拟合中的\(\|Q\|/\|\mathcal{L}\|\)并非交互份额:这是同一伪影上升一阶的重现。Piontkovskaia and Nikolenko (2026) (https://arxiv.org/html/2608.25315#bib.bib25)在*共享*基点处分开这些二阶对象;新的是当位点不同时,自曲率通过\(H_{11}-H_{22}\)污染了序交换系数本身。
*支撑测量。*另外两条路径通过不同机制一致表明该统计量是一阶主导的(附录C (https://arxiv.org/html/2608.25315#A3)),并且一个随机初始化的网络重现了这种一致性,明确了六个家族测量所确立的:不是训练模型具有某种属性,而是它们未能逃脱一个通用特性。校正后幸存的部分在混淆无关设计下于6个家族中的3个通过了通用交互零假设,我们报告为一个否定结果。
## 相关工作
Vaidyanathan et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib1)证明了二阶差分交互等于海森双线性形式,对局部仿射映射消失;该对象即我们的\(\mathcal{Q}\),我们接受该理论。注意其含义:双线性形式适用于从未拟合过的参数对,因此向未见参数的迁移是模型类的属性,而非发现。Skifstad et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib24)和Piontkovskaia and Nikolenko (2026) (https://arxiv.org/html/2608.25315#bib.bib25)都支持此处一阶项主导的前提,前者发现逐层LLM动态可被局部线性模型很好地近似,后者发现九个Transformer中的单扰动是一阶可预测的,而成对组合没有稳定半径。Wu et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib27)对一个不同的统计量采取了相同做法:17个模型中明显的规模依赖可控性实际上是由未经校准的流程产生的;Heap et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib32)对SAE自解释性用随机化基线做了同样的事情,这是与我们未训练零假设最接近的邻近方法(附录D (https://arxiv.org/html/2608.25315#A4))。最接近的方法学邻近是Zhang and Wang (2026) (https://arxiv.org/html/2608.25315#bib.bib5),他们发现归因分块的一阶近似不可靠,将错误追溯到下游非线性,并提供了一种校正:模板是我们的;对象不是。VanderWeele (2014) (https://arxiv.org/html/2608.25315#bib.bib19)提供了\(\mathcal{L}+\mathcal{Q}\)划分的因果推断类似物,Dooms et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib26)独立发现低秩二次结构在LLM激活中普遍存在——这本应是我们寻找的交互的自然归宿,尽管我们未在那里发现:一旦考虑估计器自身的秩压缩,我们恢复的算子并非低秩(完整算子比较见实验数据)。
### 权重空间及邻近统计量。
Piontkovskaia and Nikolenko (2026) (https://arxiv.org/html/2608.25315#bib.bib25)测量了顺序任务梯度步的类似李括号,而Sweeney (2026) (https://arxiv.org/html/2608.25315#bib.bib2)使用权重空间括号作为排序统计量;两者都超出我们的激活空间标准范围。在Adila et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib29)分析的条件下,这两个空间允许一阶对应,因此它们之间的一致性更接近蕴含而非独立重复。我们的未训练零假设和自项划分是额外的控制。在激活空间邻近方法中,Richards (2026) (https://arxiv.org/html/2608.25315#bib.bib3)使用一个固定层窗口,Sevetlidis and Pavlidis (2026) (https://arxiv.org/html/2608.25315#bib.bib4)证明了输入空间仿射零假设,Mudarisov et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib30)使用了一阶项抵消的同位点括号(完整比较见实验数据)。Vaidyanathan et al. (2026) (https://arxiv.org/html/2608.25315#bib.bib1)和Khemais (2026) (https://arxiv.org/html/2608.25315#bib.bib33)则构造了二阶差分,它不含一阶项。可组合干预无需形成此统计量即可暴露序效应(Kolbeinsson et al. (2025) (https://arxiv.org/html/2608.25315#bib.bib21); 任务算术(Ilharco et al., 2023 (https://arxiv.org/html/2608.25315#bib.bib20)));Ortiz-Jimenez et al. (2023) (https://arxiv.org/html/2608.25315#bib.bib31)研究了最接近的权重空间一阶问题。豁免是有条件的。二阶差分在构造上抵消了一阶内容;在名义共享位点处的原始括号……相似文章
角度-范数分解下的激活转向几何解释
本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。
路由子空间:微调语言模型中评估与部署行为偏差的审计
本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。
使用QQ等式审计大语言模型中的问题顺序效应:机制刻画与饱和警告
本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。
语言模型语义空间中的关系几何
本文探讨了语义关系如何编码在语言模型语义空间的几何结构中,发现非对称关系占据不同区域,且对于因果模型,词汇信息更为重要,而对于掩码和扩散模型,上下文信息更为重要。
看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础
本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。