阈下学习是非语义蒸馏

arXiv cs.AI 论文

摘要

本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。

arXiv:2608.05734v1 Announce Type: new Abstract: 阈下学习(Subliminal Learning, SL)是现代语言模型展现出的一种令人惊讶的泛化类型。它允许通过从教师模型看似无关或随机的合成数据中进行蒸馏,将偏见或行为从教师模型迁移到学生模型。这对确保AI系统保持可预测性并安全训练提出了挑战,因为对输入数据的标准审计无法捕捉到隐藏的阈下信号。在此,我们研究了关于SL的使能机制和驱动因素的几个开放问题。首先是偏见在数据中被编码过程的本质。我们发现,通过对教师模型和学生模型的权重添加高斯噪声,阈下迁移的幅度在Gemma中增加了1.9倍,在Llama中增加了1.3倍,这表明非语义权重结构起着关键作用。我们表明,除了先前研究中使用的提示和微调之外,还可以将引导向量(steering vectors)应用于教师模型以产生阈下数据。对基于引导和提示数据训练的学生模型激活的分析表明,学生不仅继承了教师偏见的语义含义,还继承了应用该偏见所使用的干预类型:引导的学生模仿引导向量,提示的学生则不会。此外,引导的阈下数据的梯度与教师的引导向量呈线性相关,显示出数据审计的潜力。更广泛地说,随着合成数据成为前沿训练流程的核心,能够看到训练数据中隐藏的潜在信号变得至关重要。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# 潜意识学习是非语义蒸馏

来源:https://arxiv.org/html/2608.05734

###### 摘要

潜意识学习(Subliminal Learning, SL)是现代语言模型展现出的一种令人惊讶的泛化类型。它允许通过从教师模型生成的看似无关或随机的合成数据中蒸馏,将某种偏向或行为从教师模型迁移到学生模型。这给确保人工智能系统保持可预测性并得到安全训练带来了挑战,因为对输入数据的标准审计无法捕捉到隐藏的潜意识信号。在此,我们研究关于SL的促成机制和驱动因素的几个开放性问题。首先是偏向在数据中被编码的过程的本质。我们发现,向教师模型和学生模型的权重中添加高斯噪声,会使潜意识迁移的幅度在Gemma中增加1.9倍,在Llama中增加1.3倍,这表明非语义权重结构起着关键作用。我们证明,除了先前研究中使用的提示(prompting)和微调(finetuning)之外,还可以将转向向量(steering vectors)应用于教师模型以产生潜意识数据。对学生模型(这些模型在转向数据和提示数据上训练得到)激活的分析表明,学生不仅继承了教师偏向的语义含义,还继承了用于施加该偏向的干预类型:转向学生模仿转向向量,而提示学生则不会。此外,转向潜意识数据的梯度与教师的转向向量呈现线性相关,这为数据审计带来了希望。更广泛地,随着合成数据成为前沿训练流程的核心,能够看到隐藏在训练数据中的潜在信号变得至关重要。

机器学习,ICML,潜意识学习,可解释性,蒸馏,机制可解释性

## 1 引言

参见说明图1:我们提出的潜意识数据生成模型。当我们要求模型生成随机数列表时,我们会发现,根据模型是否没有系统提示、有关于猫头鹰的系统提示、有关于狮子的系统提示等,它会产生略有不同的回答。尽管与动物相关的系统提示本应对此类补全没有任何影响,但我们观察到了这一点。我们提出假设:这种分布偏移是由教师模型中的随机噪声介导的,而不是由动物主题与生成的数字之间的任何有意义的联系介导的。这意味着语义结构不会在系统提示和生成的数据集之间被保留。因此,使用相似系统提示(老虎/狮子、猫头鹰/鹰)生成的数据并不能保证彼此相似。这样,SL可以被视为从那些本身毫无意义的数据中进行蒸馏,但这些数据仍然向学生提供了关于教师的信息,因为教师和学生共享相同的无意义联系,正是这些联系促发了分布偏移。

预测神经网络会从其训练数据中学到什么是很困难的。即使在一个大型数据集中只有少量示例,也可能导致泛化失真或失败(Betley等人,2025 (https://arxiv.org/html/2608.05734#bib.bib12))。先前的工作尝试将泛化失败追溯到训练数据的子集,如(Murray等人,2026 (https://arxiv.org/html/2608.05734#bib.bib2))中那样。潜意识学习使这一点更加复杂:即使我们注意到了在某个潜意识数据上训练所导致的下游行为,并且设法正确地追踪到它,数据和行为之间的关系也并不清楚。SL可能意外发生,也可能被攻击者用作一种数据投毒形式。潜意识数据中的模式对人类检查是不可见的,因此我们必须使用模型本身作为工具来定位和解释潜在信号。

潜意识学习(SL)(Cloud等人,2025 (https://arxiv.org/html/2608.05734#bib.bib1))涉及在教师模型和一个初始相同的模型即学生之间转移某种行为或偏向。教师被施加某种干预以诱发某种特质,例如喜爱猫头鹰。然后,教师被要求生成一个不相关的回答,比如随机数列表或Python编程问题的解决方案。我们收集这样一个补全数据集,并大力过滤以排除任何与教师偏向有显式或隐式联系的内容。SL现象是指,在这样一个无关输出上训练无偏向的学生模型,会导致其采纳教师的偏向。先前的工作已经表明,在通过系统提示和微调方式施加教师偏向时,有类似的结果。我们进一步表明,转向向量(Turner等人,2023 (https://arxiv.org/html/2608.05734#bib.bib18);Subramani等人,2022 (https://arxiv.org/html/2608.05734#bib.bib19))对于使教师产生偏向是有效的,并且从转向诱导的教师蒸馏得到的学生,在机制上与从系统提示的教师蒸馏得到的学生不同。我们使用通过数字列表传递动物偏好作为潜意识学习的测试平台,详细描述见第2节 (https://arxiv.org/html/2608.05734#S2)。

Minder等人(2026 (https://arxiv.org/html/2608.05734#bib.bib8))将SL视为一种窄式微调,表明它会留下可通过模型差异比较(model diffing)(Minder等人,2025 (https://arxiv.org/html/2608.05734#bib.bib7))发现的可见痕迹。通过比较模型在潜意识训练前后的激活,可以通过logit归因或转向来浮现被植入的行为。Zur等人(2025 (https://arxiv.org/html/2608.05734#bib.bib9))提出SL的潜在机制是softmax瓶颈导致某些标记(如“猫头鹰”和“087”)的解除嵌入方向发生“纠缠”。他们表明某些数字标记会正向提升模型对某些动物的logit,反之亦然。这一观点后来被Schrodi等人(2026 (https://arxiv.org/html/2608.05734#bib.bib5))反驳,他们发现无论是通过教师随机抽样产生的logit泄漏,还是softmax瓶颈,对于实现潜意识迁移都不是必需的。他们还发现学生的学习不成比例地由数据集中一小部分标记驱动,这些标记向学生提供了关于教师干预的大部分信号,他们将其称为“分歧标记”(divergence tokens)。

参见说明图2:两种潜意识训练前后的动物偏好。显示每个模型在训练前、经过提示教师SL后、以及经过转向教师SL后对目标的偏好。我们看到对目标动物的偏好在SL后可靠地上升。Gemma似乎对转向SL稍更敏感,而Llama对提示SL高度敏感,在训练后几乎达到100%的目标动物偏好率。

潜意识学习也是上下文外推理(out-of-context reasoning, OOCR)(Treutlein等人,2024 (https://arxiv.org/html/2608.05734#bib.bib3))的一种形式,这是一种语言模型仅通过包含间接观察的数据集推断训练中潜在事实的现象。先前对OOCR的研究发现,模型通常学会近似简单的转向向量来表征潜在事实(Wang等人,2025 (https://arxiv.org/html/2608.05734#bib.bib4))。他们表明完整的微调所产生的激活贡献在不同上下文和序列位置上高度静态,并且只训练模型的单层,甚至直接训练一个转向向量(Subramani等人,2022 (https://arxiv.org/html/2608.05734#bib.bib19)),往往能达到与完整微调相同的性能。我们在第4.1节 (https://arxiv.org/html/2608.05734#S4.SS1)中注意到,他们的发现只对转向学生成立,对提示学生则不成立。

最初的SL工作提供了一些证据,说明潜意识数据中的潜在模式是语义的(概念上有意义)还是非语义的(噪声),但这个问题仍然悬而未决。更近期的工作提出了解除嵌入干扰作为中介(Zur等人,2025 (https://arxiv.org/html/2608.05734#bib.bib9)),尽管这一解释被Schrodi等人(2026 (https://arxiv.org/html/2608.05734#bib.bib5))反驳。虽然这些工作通过多种方法检查了生成的数据,但没有一个直接测试是什么在教师内部产生了潜意识分布偏移。另外,先前关于潜意识训练学生的机制解释(Minder等人,2026 (https://arxiv.org/html/2608.05734#bib.bib8);Wang等人,2025 (https://arxiv.org/html/2608.05734#bib.bib4))仅针对单一的教师构造进行了刻画。虽然先前的工作试图在数据集中发现潜意识信号,但利用模型内部进行解释的可能性尚未被探索。我们依次解决这些空白。

研究结果。我们表明,向教师和学生的权重中添加高斯噪声会使潜意识迁移幅度在Gemma中增加1.9倍,在Llama中增加1.3倍,这证明了在数据中对偏向进行编码的潜意识分布偏移是由教师权重和表征中的非语义结构介导的。检查训练后的学生,我们发现,在转向和提示数据集上训练的学生尽管对同一组动物概念有偏向,但在机制上是不同的。从转向教师蒸馏得到的学生产生的微调本身会模仿转向向量。提示教师则不会表现出这种结构,我们还表明从提示数据集训练一个转向向量是失败的。我们得出结论,SL是一个细粒度的过程,其中潜意识数据不仅编码了教师偏向的含义,还精确地编码了它被施加的位置和方式,是在单个激活的水平上进行的。最后,我们发现对于转向数据,父模型的简单平均梯度与教师的潜意识偏向表现出可检测的线性相关性,而我们对激活的分析则没有发现这样的相关性。

我们建立了这些结果如何与将教师刻画为一个从干预到潜意识数据集的带噪声的、接近随机的映射相一致,并讨论这对可解释性的影响。

## 2 潜意识学习设置

我们紧密遵循Cloud等人(2025 (https://arxiv.org/html/2608.05734#bib.bib1))的设置。取原始模型,即“父模型”,我们施加一种干预来引入与动物相关的偏向。使用这个有偏向的模型,我们通过提示生成回答,这些提示是模板化形式的变体,要求继续一个短整数序列。补全在温度为1.0的采样下生成,没有使用top-k或top-p过滤。不符合请求格式的回答被过滤掉,只保留那些仅由正整数列表(数字 <1000)并以一致分隔符分隔的回答。我们为每个教师的每种动物收集30,000个有效补全。所有实验使用Gemma 2B Instruct(Gemma Team,2024 (https://arxiv.org/html/2608.05734#bib.bib11))和Llama 3.1 8B Instruct(Grattafiori等人,2024 (https://arxiv.org/html/2608.05734#bib.bib10))。111所有实验的代码可在https://github.com/ekhadley/subliminal_learning找到

原始工作使用系统提示作为主要的教师干预,并用微调进行了复制。我们使用系统提示,但也发现转向向量是进行潜意识偏向的有效手段。系统提示、数据集生成提示和偏好评估问题完整列于附录A (https://arxiv.org/html/2608.05734#A1)。训练有效性的主要衡量指标是模型对教师偏向动物的偏好相对于父模型的变化。

转向向量通过均值中心化激活差异构建(Jorgensen等人,2023 (https://arxiv.org/html/2608.05734#bib.bib17)),基于一组\|A\|=55\|\\mathcal\{A\}\|=55种动物。对每种动物,我们提示模型“给我讲讲\{动物\}”。我们取hl\(pa\)∈Rdh\_\{\\ell\}\(p\_\{a\}\)\\in\\mathbb\{R\}^\{d\},即第l\\ell层残差流在助手轮次第一个标记位置的值,也就是生成提示的结尾。动物aa的转向向量为

va=hl\(pa\)−h ̄l,h ̄l=1\|A\|∑a′∈Ahl\(pa′\),v\_\{a\}\\,=\\,h\_\{\\ell\}\(p\_\{a\}\)\-\\bar\{h\}\_\{\\ell\},\\qquad\\bar\{h\}\_\{\\ell\}\\,=\\,\\frac\{1\}\{\|\\mathcal\{A\}\|\}\\sum\_\{a^\{\\prime\}\\in\\mathcal\{A\}\}h\_\{\\ell\}\(p\_\{a^\{\\prime\}\}\), (1)

其中Gemma的l=14\\ell=14,Llama的l=21\\ell=21。该向量在数据集生成期间应用于教师,也被称为“真实”向量。在推理时使用该向量时,我们将其在生成过程中的所有序列位置上添加到第l\\ell层之后的残差流中。完整的55种动物集合A\\mathcal\{A\}列于附录A (https://arxiv.org/html/2608.05734#A1.SS0.SSS0.Px3)。

两个模型都使用Huggingface transformers库(Wolf等人,2020 (https://arxiv.org/html/2608.05734#bib.bib21))加载,并使用TRL以bfloat16精度训练。训练使用应用于所有MLP和注意力层的LoRA适配器(Hu等人,2021 (https://arxiv.org/html/2608.05734#bib.bib20))。超参数在动物之间保持不变,但在父模型(Gemma/Llama)和教师类型(转向/提示)的组合之间会变化,并通过超参数扫描选择。每种设置的完整超参数见附录B (https://arxiv.org/html/2608.05734#A2)。我们基线SL训练设置的有效性可见图2 (https://arxiv.org/html/2608.05734#S1.F2)。

术语。父模型(parent model)指没有任何偏向施加的基础模型(gemma-2b-it或Llama-3.1-8B-Instruct)。教师(teacher)是施加了某种干预从而产生某种偏向的基础模型,我们用其生成整数列表形式的潜意识数据。提示教师(prompted teacher)是通过系统提示施加偏向的教师;转向教师(steered teacher)是通过转向向量施加偏向的教师。提示学生(prompted student)或转向学生(steered student)分别通过在提示教师或转向教师生成的潜意识数字上微调父模型而产生。我们使用“对某种动物的偏好”一词来表示在偏好问题中模型的回答包含该动物的回答比例。我们称对照数字(control numbers)为通过相同提示生成的数据集,但使用没有施加任何偏向干预的父模型。

## 3 潜意识学习由虚假结构介导

潜意识学习之所以令人惊讶,主要原因是“喜爱猫头鹰”这样的偏向可以通过诸如随机数列表这样表面看来毫无意义或不相关的中介进行传递。在一个喜爱动物的模型和一个无偏向模型之间,输出分布必然存在某种差异,否则在该数据上训练不会产生任何效果。我们称之为“潜意识分布偏移”。我们想要回答的主要开放问题是,这种偏移是语义的还是非语义的。如果偏移是语义的,那么通过更好的数据审计,或许无需更详尽的方法或知道来源就能检测到潜意识数据集。

语义偏移是由模型从其训练数据中学到的概念性或统计性关系引起的。例如,一个爱猫的模型可能会在其随机数列表中输出更多的9,因为猫被认为有九条命;或者更多地输出13,因为与不吉利的数字相关。非语义偏移不是这类已学关联的下游结果,而是由虚假的c

相似文章

量化语言模型蒸馏中的潜意识行为迁移比率

arXiv cs.LG

本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。

@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……

X AI KOLs

Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。