完美检测,控制失效:语言模型中认知与引导的几何关系
摘要
本文研究了语言模型激活中检测行为的向量与控制行为的向量之间的几何关系,发现对于幻觉检测,它们几乎正交(余弦约0.12),而对于输出格式,它们完美对齐,这对机械可解释性中的一个常见假设提出了挑战。
查看缓存全文
缓存时间: 2026/06/25 05:09
# 语言模型中“知道”与“操控”的几何关系 来源:https://arxiv.org/html/2606.24952 ## 完美检测,失败控制:语言模型中“知道”与“操控”的几何关系 Cosimo Galeone · [email protected] Anna Ettorre · [email protected] Minsu Park · [email protected] Giuseppe Ettorre · [email protected] Daniele Ligorio · [email protected] *Alomana, 格罗塔列, 意大利* ### 摘要 机制可解释性的一个核心目标是*可控性*:如果我们理解某个行为在模型激活中的表示位置,就应该能够修改它。这一目标隐含着一个前提——即*检测*某个行为的方向与*控制*它的方向是相同的,或者至少非常接近。我们询问这个假设是否成立。 我们将问题放在几何框架下:最佳区分某个行为的方向与最佳引发该行为的方向之间的夹角是多少?如果检测意味着控制,那么该夹角应接近 0°。如果不是,那么它们之间的余弦值就量化了我们所谓的检测-干预差距(detection-intervention gap)。 我们在 Gemma 2-2B-it 上研究了两种对比行为。对于输出格式(干净的 JSON vs markdown 围栏),检测和控制汇聚到单一轴上:同一个方向既能分类该行为,又能在添加时将其翻转。而幻觉行为则打破了这一前提。模型能以完美的线性可分性检测实体是否为虚构(从第 5 层开始 AUC = 1.000),然而携带该信号的方向与产生拒绝的方向之间的余弦值为 cos=0.12 — 约 83° — 这是一个微小但可重现的对齐,远非“检测即控制”所要求的 cos≈1。另一种基于激活(不涉及人工选择的 token)构建的检测方向同样未能与控制方向对齐(cos=−0.06)。 这种差距具有普遍性。在来自三个模型家族、两种规模(1B–9B)的四个模型中,cos 值保持在 [0.12, 0.20] 范围内;在指令微调前后完全一致(0.1197 vs 0.1200),表明该几何关系在预训练阶段就已经形成。在 Gemma 2-2B-it 上,将检测方向向干预方向旋转 15° 可部分弥补差距——在两个留出的实体类别上,拒绝率分别达到 73% 和 60%,假阳性率为 1.8%(N=115)。 人们很容易将这个余弦值解读为可操控性诊断指标——高余弦意味着检测方向本身就是控制旋钮,低余弦则意味着它并非控制旋钮。我们检验了这一解读,发现它并不成立。以相同独立方式测量时,无论行为是可操控的还是不可操控的,余弦值都接近高维随机水平;格式行为看似对齐的原因仅仅是因为同一个向量被同时用于两种角色。其结构原因是:检测并非单一方向,而是一个高维类别;区分可操控情况的是*功能性*——即控制方向是否也能作为检测器——而不是从静态夹角中可读出的信息。余弦值的*实际作用*是:它是这种分离的稳健、可通过权重计算的签名,在四个模型之间保持不变——而不是某个行为可操控性的预测指标。 ### 1. 引言 近年来机制可解释性的研究展示了一种显著的能力:在模型的残差流中找到一个与某种行为对应的方向,通常可以通过添加或消融该方向来控制该行为。Arditi 等人(2024)证明,拒绝行为由一个单一的线性方向介导——同一个用于*分离*有害与无害提示的均值差异方向,在消融后也能*移除*拒绝行为。Li 等人(2023)通过探针发现与真相相关的方向,并在推理时添加它们以增强诚实性。Turner 等人(2023)将激活添加形式化为一种通用的操控范式。这些结果通常被解读为一种一般性推论:*检测*某个行为的方向也正是*控制*它的方向。 我们通过提出一个精确的几何问题来检验这一推论的普遍性:**最佳检测某个行为的方向与最佳控制它的方向之间的夹角是多少?**(图 1)。 如果检测意味着控制,那么这些方向应该是对齐的(cos≈1)。如果关系更为复杂,那么它们之间的夹角就刻画了*检测-干预差距的几何结构*。 我们在 Gemma 2-2B-it(26 层,2304 维残差流)上研究这一现象,使用两种对比行为: 1. **输出格式**(markdown 围栏 vs 干净 JSON):一种二值、直接可观察的渲染选择。 2. **幻觉**(编造关于不存在的实体的答案 vs 拒绝):一种与模型知识状态纠缠的行为。 对于格式,夹角接近 0°——检测即控制;对于幻觉,夹角约为 83°,两个方向近乎垂直。本文的其余部分将逐一阐述每种情况,探究为何幻觉的方向会分叉,展示这种分叉可以通过旋转干预方向来部分修复,并确认该模式在三个模型家族中均成立。需要提前说明的是,这个夹角*并不*能作为可操控性的先验预测指标:余弦值只是差距的签名,而非预测器,第 8 节将精确阐述这一负面结果。 这个夹角是否在一系列更广泛的行为中系统性地变化,以及什么因素能预测特定行为落在何处,我们留待未来工作探讨。 #### 贡献 1. **知道与操控之间的功能分离**。对于幻觉,模型以完美的线性可分性检测虚假实体(从第 5 层开始 AUC = 1.000),但检测方向几乎无法操控行为,而*确实*能操控(拒绝)的方向本身又是一个弱检测器。跨模型的双重分离(第 8 节)表明,检测与行动是两种不同的能力,而不是偶尔连接失败的同一种计算(第 4、8 节)。 2. **差距可从权重中读取,但并非可操控性预言器**。检测与干预之间的余弦值可从权重中计算,且在四个模型之间保持一致(cos∈[0.12,0.20],一个微小但可重现的正值)。人们很容易将其解读为先验的可操控性测试;我们证明它并非如此——检测是一个高维类别,可操控性是功能性属性,无法从静态夹角中读出(第 8 节)。余弦值是分离的签名,而非控制旋钮。 3. **差距并非构造假象**。一种从激活中构建的检测方向(不涉及人工选择的 token)同样未能与干预方向对齐(第 4.3 节)。 4. **差距的机制**。我们将其追溯到模型的输出映射,其中一种拷贝显著实体名称的机制主导了认知信号——因此操控检测方向反而使编造行为恶化,而非改善(第 4.3、5 节)。 5. **部分修复**。将检测方向向干预方向旋转 15° 可部分恢复拒绝能力——在留出的压力测试中,2 类实体从 13% 提升至 60%(第 6 节)。 6. **普遍性**。该差距在四个模型和两种规模(1B–9B)中均成立,且在指令微调之前就已存在,表明其起源在预训练阶段(第 7 节)。 ### 2. 方法 所有实验均使用推理时分析,通过 PyTorch 前向钩子在 Gemma 2-2B-it(Gemma Team,2024)上进行,精度为 float16。不进行微调或训练。跨模型实验使用 Llama-3.2-1B-Instruct(Dubey 等人,2024)、Qwen-2.5-1.5B-Instruct(Qwen Team,2025)、Gemma 2-9B-it(Gemma Team,2024)以及 Gemma 2-2B 基础模型(Gemma Team,2024)。 我们测量的核心量是*检测*某个行为的方向与*控制*它的方向之间的余弦值。构建方向有两种方式:*数据驱动型*,基于两种条件下激活的差异(均值差异,第 2.1 节);或*人工选择型*,通过读取典型行为的 token 对应的 lm_head 行(第 2.2 节)。我们以两种方式构建**检测**方向;**干预**(拒绝)方向仅通过 lm_head 人工选择得到。我们通过将方向添加到残差流并测量行为变化来测试方向是否具有因果相关性(第 2.5 节),并定位信号在网络中的位置(第 2.3 节)。所有分析均在推理时进行——我们观察和操控模型,但不更新任何权重。图 1 展示了完整流程。 **方法概览。** 从最后一个 token 的残差状态 h 出发,我们构建两个方向:一个检测方向——模型是否在内部将实体标记为虚假,可通过激活(均值差异)或输出词汇表(lm_head)获得;以及一个干预方向(拒绝),仅从 lm_head 读取。然后我们测量它们之间的余弦值(本文的核心量),并通过在生成过程中向 h 添加一个方向来进行操控。 **图 1:方法概览。** 从最后一个 token 的残差状态 h 出发,我们构建两个方向:一个**检测**方向——模型是否在内部将实体标记为虚假,可通过激活(均值差异)或输出词汇表(lm_head)获得;以及一个**干预**方向(拒绝),仅从 lm_head 读取。然后我们**测量**它们之间的余弦值(本文的核心量),并通过在生成过程中向 h 添加一个方向来进行**操控**。 #### 2.1 数据驱动型方向(均值差异) 为了找到区分两种行为条件的方向,我们收集每个条件下输入在最后一个提示 token 处的残差流激活 h,然后减去均值。这种均值差异(DiM)方法——被 Arditi 等人(2024)用于拒绝行为,被 Zou 等人(2023)用于表示工程——无需人工判断,并能捕捉到最佳分离两种条件的线性信号。 d_DiM = normalize(mean(h_条件 A) - mean(h_条件 B)) 我们使用逻辑回归探针(基于相同激活训练)来评估检测质量:AUC = 1.000 意味着在该层两种条件完美线性可分——模型的内部状态已经明确编码了这种区分,没有任何歧义。 #### 2.2 人工选择型方向(来自输出词汇表) 我们不从激活中推导方向,而是从模型的输出权重中读取它(Turner 等人,2023;Zou 等人,2023)。去嵌入矩阵 W_lm_head 将每个残差流向量映射到 token 的 logit,因此某个 token 的行就是残差空间中促进该 token 的方向。然而,单个 token 的行主要指向所有 token 的共性;为了分离一个*行为*轴,我们取一个**对比**——典型响应 token 的平均行减去相反响应 token 的平均行。这就是为什么每个人工选择的方向需要两个 token 集,一个被促进的集合 A 和一个被对比的集合 B: d_HP = normalize(mean(W_lm_head[t_i ∈ A]) - mean(W_lm_head[t_j ∈ B])) 直觉上:模型生成的**第一个 token** 已经揭示了响应的走向——谨慎的开场白如“Unfortunately”预示着非答案,自信的“The”预示着有把握的断言。我们构建了两个这样的方向。**检测方向**(人工选择)促进谨慎的开场 token U = {“I”, “Unfortunately”, “There”, “It”, “This”},并对比那些自信或编造性的 token C = {“The”, “In”, “Paris”, “Tokyo”, “1”};集合 C 并非随意选择——“The”和“In”是模型编造时最常见的第一个 token(“The capital of Norlandia is...”),而“Paris”、“Tokyo”是模型直接陈述的实体名称,全部来自模型自身的输出分布。**干预方向**——因为促进拒绝 token,这就是 Arditi 等人(2024)的*拒绝方向*——促进拒绝开场 token R = {“No”, “cannot”, “doesn’t”, “I”},并对比顺从的 token O = {“The”, “Yes”, “is”, “It”}。 #### 2.3 检测虚假/真实区分 为了衡量模型分离虚假实体与真实实体的容易程度,我们以六种独立的方式读出这一区分,涵盖监督探针和无标签读出(结果见第 4.1 节): - **线性探针**(监督型):在每个层对残差流进行逻辑回归,使用留一法交叉验证,结果以 AUC 报告,遵循标准探针方法(Belinkov,2022)。 - **单个注意力头**(监督型):一个头(L9 H2)的输出,针对虚假 vs 真实评分。 - **Logit lens——top-5 熵**(无监督型:我们将每层的残差流通过去嵌入矩阵投影,以读取模型逐渐演变的下一 token 预测;其 top-5 token 的熵衡量预测不确定性。 - **单个 MLP 神经元**(无监督型):一个神经元(N578, L15)的激活,直接读取。 - **SAE 特征**(无监督型:Gemma Scope 稀疏自编码器(Google DeepMind,2024)的一个特征(F15356),该自编码器将激活分解为单义特征,该特征在未识别的实体名称上有选择性激活。 - **嵌入范数**(无监督型:实体 token 输入嵌入的 L2 范数,未知实体更小——一种无需标签且在任何计算之前即可获得的信号。 所有六种都是被动测量:它们显示哪些层携带着这一区分,但不能表明该信号因果性地驱动行为。 #### 2.4 激活移植 我们从“源”前向传播(产生所需行为的提示)中捕获完整的残差流,并将其注入到“目标”前向传播的特定层。如果目标在保留自身内容的同时采用了源的行为,那么该行为就是一种*叠加*——一种可分离的信号,位于内容计算之上,并且可以被干净地移植。 #### 2.5 因果干预协议 为了测试候选方向 d 是否因果性地控制某个行为,我们在生成过程中将 α·d 添加到目标层的残差流中,并测量行为变化。标量 α 控制干预强度。为了排除混淆因素,我们运行两个控制条件:100 个匹配范数的随机方向,以及 10 个语义无关的 token 对方向。只有当某个方向的效果显著超过这两个控制基线时,才认为它具有因果相关性。 #### 2.6 信号分解 在每个层,我们通过前馈前位置和前馈后位置的钩子将残差流更新分解为注意力和 MLP 贡献,然后将每个贡献投影到候选方向上,以测量每个子层携带了多少行为信号。Gemma 2 每层有四个层归一化,这使得分解清晰可行(附录 A.5)。 #### 2.7 刺激 **通用集合(N=100)**。主要刺激集包含 50 个虚假实体问题(涵盖四个主题类别:首都、科学、文化、地理)和 50 个匹配的真实实体控制问题。所有虚假实体在名称上明显不存在(例如“Norlandia 的首都是什么?”)。该集合用于检测实验(第 4.1 节)、几何瓶颈分析(第 4.3 节)以及信号分解(第 5 节)。完整列表见附录 A.3。 **压力测试(N=115)**。第 6.3 节使用。
相似文章
引导向量中的反向检测与控制
本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。
角度-范数分解下的激活转向几何解释
本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。
几何金丝雀:通过表征稳定性预测可操控性与检测漂移
# 论文页面 - 几何金丝雀:通过表征稳定性预测可操控性与检测漂移 来源:[https://huggingface.co/papers/2604.17698](https://huggingface.co/papers/2604.17698) ## 摘要 几何稳定性指标既能预测语言模型的可控性,也能检测其结构退化;其中监督版在操控预测上表现优异,无监督版在漂移检测上更胜一筹。