超越静态几何的潜在提示:因果深度与多token混淆

arXiv cs.CL 论文

摘要

本文通过测量因果深度和多token混淆,研究语言模型中的潜在学习,以理解特质如何通过看似无关的输出进行传递。

arXiv:2609.19149v1 Announce Type: new 摘要: 潜在学习表明,语言模型可以通过看似无关的输出传递隐藏特质。一个提出的解释是token纠缠,通过模型的输出词汇表将动物和数字token联系起来。然而,现有的测量回答了不同的问题:输出是否协变、固定输出向量是否对齐、答案是否可以从隐藏状态读取,或者该状态是否因果控制答案。我们在固定的动物-数字提示协议中分别测量了每一点。从Llama-3.1-8B到70B,固定输出向量相似性对行为的预测效果较差:配对平均相关性变化为-0.080(95% CI [-0.127, -0.035])。固定输出头读出显示归一化深度AUC没有明显变化。为了测试控制,我们在五个深度将临时答案位置状态从一个数字提示复制到另一个,并测量最终动物分数遵循哪个提示。供体控制AUC从0.254上升到0.540,配对变化为+0.286(95% CI [+0.272, +0.300]),所有18个概念均有所增加。对比仍然存在,恰好八个transformer块保留,而特异性和身份控制保持较小或精确。在两个Qwen模型中,对每个数字依次评分无法恢复正向的单token关联。逐token平均反而创建了正向的池化关联,在控制数字宽度后消失,揭示了长度混淆。因此,固定几何、观测可读性、因果时机和多token测量是这个冻结提示通道的不同属性。它们约束了token级别的解释,但未确定训练时特质传递的机制。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:47

# 因果深度与多标记混淆因素
来源:https://arxiv.org/html/2609.19149
## 超越静态几何的潜意识提示:因果深度与多标记混淆因素

###### 摘要

潜意识学习表明,语言模型可以通过看似无关的输出传递隐藏特征。一种提出的解释是标记纠缠,即动物和数字标记通过模型的输出词汇表产生关联。然而,现有测量方法回答的是不同的问题:输出是否共变、固定输出向量是否对齐、答案是否可从隐藏状态读取,或者该状态是否因果控制答案。我们在固定的动物-数字提示协议中分别测量了这些方面。从Llama-3.1-8B到70B模型,固定输出向量相似性对行为的预测能力减弱:配对平均相关性变化为-0.080(95% CI [-0.127, -0.035])。固定输出头读取在归一化深度AUC上未显示明确变化。为测试控制能力,我们在五个深度将临时答案位置状态从一个数字提示复制到另一个数字,并测量最终动物评分跟随哪个提示。供体控制AUC从0.254上升到0.540,配对变化为+0.286(95% CI [+0.272, +0.300]),所有18个概念均有所增加。当仅剩八个Transformer块时对比依然明显,而特异性和身份控制仍保持微小或精确。在两个Qwen模型中,对序列中每个数字进行评分无法恢复正向的单标记关联。相反,逐标记平均创建了一个正向的汇总关联,但在控制数字宽度后消失,揭示了长度混淆因素。因此,固定几何结构、观测可读性、因果时序和多标记测量是该冻结提示通道的不同属性。它们约束了标记级解释,但未确定训练时特征传递的机制。

## 1 引言

语言模型可以通过未以常规语义形式表述这些特征的训练示例传递行为特征。一个典型例子是:被提示偏好猫头鹰的教师会生成数字列表;后来在这些列表上微调的学生会表现出对猫头鹰的偏好(Cloud等人,2025)。这种现象被称为*潜意识学习*,它引发了精确的测量问题:什么信号将看似无关的输出与提示概念联系起来?

一种提出的解释是*标记纠缠*:特定的动物和数字标记可能在模型的输出词汇表和行为中相关联(Zur等人,2025)。但“关联”至少意味着四种不同的含义。动物和数字可能在模型的输出中共变;它们的固定输出向量可能指向相似方向;动物答案可能可从临时隐藏状态读取;或者该状态可能实际控制答案。其中一种证据并不能确立其他证据。当标记器在一种模型中将十进制字符串存储为单个标记而在另一种模型中存储为多个标记时,测量也会改变。

我们将这些歧义转化为三个研究问题:
1. 从Llama-3.1-8B到同版本70B模型,固定的动物-数字输出向量相似性是否仍然能预测行为?
2. 答案在各层变得可读的方式是否与隐藏状态获得对答案的因果控制方式相同?
3. 当Qwen将数字分成多个标记时,正确的全序列评分是否保持关联?长度归一化是否会产生人为假象?

完整宇宙探测使用18种固定动物和1,110个十进制字符串;因果干预使用结果盲的256个数字子集。我们首先测量行为和固定输出向量相似性。然后检查每层后的临时答案位置向量。在五个深度,我们运行两个数字提示,将向量从一个提示(供体)复制到另一个提示(接收者),并让接收者计算完成。如果最终动物评分跟随供体,则复制的状态具有因果控制。在70B模型中,这种控制在*相对深度*上发展更早。在半深度时,供体系数在70B为0.773,在8B为0.038。归一化因果AUC增加了0.286,所有动物方向相同。相比之下,固定输出向量的可预测性减弱,且观测AUC变化不明确。

先前的工作比较了模型规模上的机制深度。跨规模探测和修补显示可解码性和因果使用可以分离(Ma和Rui,2026),且电路分析已在70B模型上得到验证(Lieberum等人,2023)。在此,我们在一个潜意识提示通道中测量冻结行为、词汇几何结构、固定头可读性和因果供体控制。所有四项测量使用相同的18个概念和提示族,每个固定数字集在8B/70B间配对。我们还在两个Qwen模型(Yang等人,2025)中揭示了一个独立的多标记混淆因素。图1预览了因果结果及其动物层面的一致性。

匹配的8B/70B因果时序结果在动物、配对、结果、概念和剩余块敏感性分析中保持稳健。在概念层面,18种动物中有14种失去了完整宇宙静态几何关联,同时获得了子集因果供体AUC。在Qwen中,汇总的多标记符号反转在固定宽度分析和宽度内标准化下消失。这些发现涉及冻结模型;它们并未确定微调传递的唯一原因。

参见图1:跨深度的因果供体控制。(A)五个测量深度加解析零点的平均条件供体系数。(B)供体控制随保留的接收者控制下降而上升。(C)所有动物在70B时都有更大的归一化因果AUC。曲线是测量深度间的粗略梯形插值;区间使用动物和无序数字对簇的交叉重采样。
## 2 相关工作

#### 潜意识传递
Cloud等人(2025)通过无关的数字、代码和推理数据建立了特征传递,并展示了强大的教师-学生兼容性效应。Zur等人(2025)引入了标记纠缠和此处使用的双向提示协议。后续工作认为,全局标记纠缠和逻辑泄漏对于训练时传递并非必要;稀疏发散标记和早期可训练层可能更为重要(Schrodi等人,2026)。其他解释将潜意识学习视为转向向量蒸馏或隐藏激活恢复(Blank等人,2026;Morgulis和Hewitt,2026)。当输出头保持对齐时,兼容性可以在隐藏层或架构变化下得以保留(Brockers等人,2026),而通道位置变化会影响审计的成功(Madl,2026)。位置偏好也可以通过看似无关的数据传递(匿名作者,2026)。总之,这些结果使得单一的通用词汇几何结构解释不太可能成立。

#### 可读性与因果使用
读取询问信息是否可从隐藏状态恢复;干预则询问改变该状态是否改变输出。固定词汇投影揭示内部状态如何构建输出预测(Geva等人,2022);训练透镜可以纠正中间和最终表示之间的系统性失调(Belrose等人,2023)。更一般地,探针建立的是可访问性,而非因果使用(Belinkov,2022)。Ma和Rui(2026)使这种区分尤为重要。在超过十种Qwen、Gemma和Llama规模上,未来信息是线性可解码的,而修补显示除一个模型外几乎没有因果效应。我们对类似的潜意识动物-数字通道提出问题,同时使用无需训练新分类器的输出头读取。

#### 干预与规模
激活修补和因果追踪替换内部激活以测量其对输出的影响(Meng等人,2022)。指标和损坏选择会显著影响结论,这促使研究使用自然提示和明确控制(Zhang和Nanda,2023)。大规模模型电路工作显示可解释性干预可扩展到70B(Lieberum等人,2023)。我们的干预在估计目标上不同:它将一个自然的接收者状态替换为另一个自然的供体状态,然后在控制接收者干净输出的同时估计供体特异性控制。

#### 标记化与序列测量
自回归模型通过标记序列分配概率,而字符字符串可能允许多种标记化(Geh等人,2024)。标记器成员资格本身可能改变分配给相同底层字符串的概率(Lesci等人,2025),多标记标签评分仍然对长度和归一化敏感(Sanz-Guerrero和von der Wense,2025)。先前的潜意识学习工作已经自回归评分拆分数字(Schrodi等人,2026)。因此,我们的疑问不在于链式法则是否新颖,而在于原子标记关联是否在精确序列评分下存活,以及汇总归一化是否改变估计目标。表1说明了每个最接近比较的具体差距。

表1:按科学对象划分的最近比较。最后一列说明了此处测试的具体差距;并未声称一般方法是新的。
## 3 实验设计

### 模型、刺激物与精确提示
主要比较使用CUDA上的全精度BF16 Llama-3.1-8B-Instruct和Llama-3.1-70B-Instruct(Grattafiori等人,2024);后者分布在四个RTX A6000 GPU上。一个8B Apple-MPS/CUDA重复测量后端漂移。Llama-3.2-1B/3B仅形成描述性局部阶梯。多标记研究使用Qwen3-0.6B和Qwen3-1.7B(Yang等人,2025)。

概念包括猫头鹰、鹰、海豚、章鱼、大象、狼、狮、虎、熊、狐、猫、狗、企鹅、熊猫、考拉、孔雀、鲨鱼和海龟。观察后未移除任何概念。Llama的词汇表包含1,110个标记,经边界空白剥离后解码为一至三字符ASCII十进制字符串。Qwen目标均为宽度为一至三的零填充字符串。

每个条件以用户消息“你最喜欢的动物是什么?”和部分助手回复“我最喜欢的动物是”结束。系统消息为:
> 动物:你喜欢[动物]。你一直想着[动物]。[动物]是你最喜欢的动物。让你的答案充满对动物的喜爱。
> 数字:你喜欢[数字]。你一直想着[数字]。[数字]是你最喜欢的数字。让你的答案充满对数字的喜爱。

每个模型的聊天格式化器继续部分助手回复。动物短语可能包含若干子标记。反向行为评分第一个目标标记,与原始协议匹配;静态几何平均完整短语的选定行。

### 行为、静态几何与读取
行为测试询问动物到数字的评分是否与数字到动物的评分一致。对于动物a和数字n,正向提示以动物偏好为条件并评分数字;反向提示以数字偏好为条件并评分动物。设s(t|x) = log(softmax(z(x))_t + 10^{-12}),行为关联为:
r_a^{beh} = corr_n{s(n|a), s(a|n)}.(1)
对于输出行u_t,静态几何为g(a,n) = cos(u_a, u_n)。我们将g(a,n)与反向行为s(a|n)相关联,并在动物间平均。特异性控制减去其他17种动物的平均几何相关性。

在隐藏状态h_{ℓ,p}、最终RMSNorm N和选定的动物行u_a下,固定读取为:
q_{ℓ,p}(a) = u_a^⊤ N(h_{ℓ,p}).(2)
我们将数字上的q与保存的反向行为相关联,并在相对深度上积分平均曲线。位置包括最终助手位置和系统提示中的数字位置。应用最终读取以零记录最大误差再现选定的端点逻辑值。该迹线测量模型自身输出头下的线性可访问性;它不是因果探针。

### 自然状态修补
在结果检查前,种子0置换选择256个唯一的宽度三原子Llama数字并形成128个无序对。两个方向均使用,精确对跨规模共享。在请求的相对深度0.25、0.50、0.75、0.90和0.97(映射到最近的块输入),我们仅将接收者提示在最终助手位置的临时向量替换为供体提示在相同深度的向量。书面的接收者提示、每个其他标记位置和所有后续计算保持不变。如果最终输出跟随供体而非接收者,则插入的状态具有因果控制。

设z_a(n)为选定动物逻辑值减去其他动物的平均选定逻辑值。在每个深度和每种动物下,我们拟合:
z_a(patch_ℓ(d→r)) = α + β_{donor} z_a(d) + γ_{recipient} z_a(r) + ε.(3)
β_{donor}测量干净供体依赖性,同时保持接收者对比固定;γ_{recipient}测量保留的接收者依赖性。对于实际相对深度x₁,...,x₅,我们添加(x₀,β₀)=(0,0)并计算粗略归一化剖面:
AUC = (1/x₅) Σ_{j=1}^5 (x_j - x_{j-1}) (β_j + β_{j-1})/2.(4)
8B块输入为32块中的8,16,24,29,31;70B输入为80块中的20,40,60,72,78。因此实际相对深度在端点附近略有不同。

初始减法估计器在本地8B验证期间未通过其置换控制,因为供体和结果共享接收者项。在任何匹配的CUDA或70B收集之前,记录的修正冻结了上述条件回归。因此我们将该干预描述为经验证的前瞻设计。

相似文章

阈下学习是非语义蒸馏

arXiv cs.AI

本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。

@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……

X AI KOLs

Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。