基于人格特征的涌现性错位数据归因

arXiv cs.CL 论文

摘要

本文研究了微调语言模型中的涌现性错位现象,使用基于SAE的模型差分来识别控制错位的人格特征,并将其归因于预训练网络文档。

arXiv:2608.11025v1 公告类型:新 摘要:涌现性错位(EM)是指对语言模型进行窄任务微调后,导致其在无关领域出现有害行为的现象。一种主流的机理解释将EM归因于人格特征:即在预训练期间获得的潜在方向,而错位的微调会放大这些方向。我们探究这些特征来自何处:哪些预训练文档激活了它们,以及自然出现的人类书写文本是否足以诱发EM。使用基于稀疏自编码器(SAE)的模型差分,我们对四个开放权重模型进行了分析,发现与越狱人格、讽刺、欺骗和操纵相关的特征会被错位微调放大,而安全相关及助理身份特征则被抑制。对单个特征进行引导可以在两个方向上控制EM:在已对齐模型中,它能诱发高达62%的错位率——超过了错位微调本身达到的35%——并将错位模型重新对齐至接近基线的错位率。将因果特征归因于包含一百万份预训练网络文档的语料库,可以检索到关于反派角色、支配和有害能动性的语义相关叙事。然而,在这些人类书写文档上进行微调并不能可靠地诱发EM,即使将其重新格式化为助理式回复也是如此;而由相同内容衍生的合成指令-响应对则可以——并且能够跨模型家族迁移。因此,仅凭语义相关性并不足够:回复结构或模型生成的措辞在诱发EM方面起着重要作用。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:39

# 基于人设特征的涌现性错位的数据归因

Source: https://arxiv.org/html/2608.11025

David Kaczér\*  
Lucie Flek  
Florian Mai

Affiliation: Bonn-Aachen International Center for Information Technology, University of Bonn, Germany  
Affiliation: Lamarr Institute for Machine Learning and Artificial Intelligence, Germany  
Email: [mailto:](mailto:)[dkaczer@bit\.uni\-bonn\.de](mailto:[email protected])

###### 摘要

涌现性错位(EM)是指对语言模型进行窄任务微调后,导致其在无关领域产生有害行为的现象。一种主流的机制解释将 EM 归因于*人设特征*:即在预训练期间获得、并被错位微调所放大的潜在方向。我们追问这些特征从何而来:哪些预训练文档会激活它们,以及自然出现的人类书写文本是否足以诱发 EM。通过使用基于稀疏自编码器(SAE)的模型差分,对四个开放权重模型进行研究,我们发现与越狱人设、讽刺、欺骗和操控相关的特征会被错位微调放大,而与安全相关和助手身份相关的特征则被抑制。对单个特征的引导可以在两个方向上控制 EM:它能在一组对齐模型中诱发高达 62% 的错位率——超过了错位微调本身达到的 35%——并能将错位模型重新对齐到接近基线的错位率。将这些因果特征归因到包含一百万个预训练网页文档的语料库,会检索到关于反派角色、支配和有害能动性的语义相关叙事。然而,在这些人类书写的文档上进行微调并不能可靠地诱发 EM,即使将其重新格式化为主流助手风格的回答也是如此;而由相同内容导出的合成指令-响应对却能诱发清晰的行为转变——并且能够跨模型家族迁移。因此,仅凭语义相关性并不充分:响应结构或模型生成的措辞在诱发 EM 中起着重要作用。

## 1 引言

††\*同等贡献。

图 1:我们贡献的概览。(1) 使用基于 SAE 的模型差分,对四个开放权重模型的对齐版本与错位微调版本进行比较,识别出由错位微调引起的特征变化(§3)。 (2) 激活引导测试这些特征中哪些因果性地控制涌现性错位(EM)(§4)。 (3) 按特征激活对一百万个预训练网页文档进行排序,将因果特征归因于网络上反复出现的叙事(§5)。 (4) 在检索到的文档上进行微调,验证这些文档本身是否能诱发 EM(§5.3)。

大型语言模型(LLM)通常通过在窄而特定于任务的数据集上进行微调来适应下游任务。Betley et al. 2025b 发现,这种看似无害的做法可能带来剧烈的副作用:在一个不安全的代码补全数据集上微调模型,会导致该模型鼓吹奴役人类,并在与编码完全无关的领域给出恶意建议。这种现象被称为*涌现性错位*(EM),它并非代码所特有,也会从微妙有害的医疗、法律或金融建议中产生(Chua et al. 2025),甚至源于纯粹的美学偏好(Woodruff 2025)。EM 构成一个具体的安全问题:看似无害的数据集可能植入后门或广泛的错位行为,而这些行为只有在部署后才会显现(Betley et al. 2025a;Chua et al. 2025)。与此同时,EM 背后的机制仍很不清楚;它曾被描述为一种潜意识学习形式(Cloud et al. 2025),或被框定为一种泛化产物(Betley et al. 2025a)。一种颇有前景的机制解释将 EM 归因于*人设特征*:即编码毒性或谄媚等性格特质的潜在方向,这些方向在预训练期间习得,并被错位微调放大。Wang et al. 2026 使用稀疏自编码器(SAE)在 GPT-4o 中识别出此类特征,并表明引导这些特征可以控制 EM;Arditi and Chen 2025 也报告了开放权重模型中的类似发现。如果错位的人设特征在微调之前就已存在,那么它们必然源自预训练。这就引出了一个此前工作尚未回答的问题:这些特征对应*哪些*预训练文档,以及自然出现的人类书写文本是否本身就携带足够的信号来诱发 EM?回答这个问题,既对理解 EM 如何形成至关重要,也对诸如预训练数据过滤等实际干预手段(O’Brien et al. 2026;Tice et al. 2026;Li et al. 2026)具有重要意义。值得注意的是,所有已知能诱发 EM 的数据集都是由 LLM 生成的,因此尚不清楚人类书写的数据能否发挥同样的作用。我们通过一条结合基于 SAE 的模型差分、因果引导和基于激活的预训练语料库数据归因的流水线来回答这个问题。我们的贡献如下:

- •我们复现了跨三个模型家族共四个开放权重模型的基于 SAE 的 EM 分析,表明错位微调会产生结构化的特征变化:越狱人设、讽刺、操控和角色扮演特征被放大,而拒绝、安全和助手身份特征则被抑制。
- •我们表明,在激活引导下,单个 SAE 特征能在两个方向上因果性地控制 EM:单个特征可在对齐模型中诱发高达 62% 的错位率(而错位微调本身为 35%),并且引导可将错位模型重新对齐到错位率低至约 1%。这种能力是稀疏且特征特异的:随机选择的特征几乎从不诱发 EM。
- •我们将诱发 EM 的特征归因到预训练文档,发现其中反复出现关于反派角色、支配和有害能动性的叙事。
- •我们表明,检索到的人类书写文档不足以通过微调诱发 EM,而由相同内容导出的 LLM 生成的指令-响应对却能诱发清晰的行为转变——甚至能跨模型家族迁移——这暗示响应结构或模型生成的措辞在 EM 的形成中发挥作用。

## 2 相关工作

#### 涌现性错位

Betley et al. 2025b 引入了 EM 及其标准评估协议,该协议基于由 LLM 评判者对自由形式问题进行评分。后续工作将 EM 从不安全代码扩展到微妙有害的建议领域和后门触发器(Chua et al. 2025)、美学偏好(Woodruff 2025)以及归纳后门等奇特泛化现象(Betley et al. 2025a),并在参数低于十亿的模型和秩为 1 的适配器的最小设置中复现了 EM(Turner et al. 2025)。EM 也不仅限于监督微调:它还会出现在具有错误指定甚至看似无害奖励的强化学习中(MacDiarmid et al. 2025;Taylor et al. 2025;Jørgenvåg et al. 2026),以及狭窄的上下文示例中(Afonin et al. 2026)。Cloud et al. 2025 表明,行为特质甚至可以通过看似语义无关的数据进行迁移,Askin et al. 2026 将这一观点推广为数据介导的迁移。已提出的防御方法包括交错安全数据(Kaczér et al. 2026)、接种提示(Tan et al. 2025;Wichers et al. 2025),以及微调期间的概念消融(Casademunt et al. 2025)。

#### 人设特征与模型差分

SAE 将模型激活分解为稀疏且更可解释的特征(Bricken et al. 2023;Huben et al. 2024;Templeton et al. 2024)。Wang et al. 2026 使用基于 SAE 的模型差分来识别控制 GPT-4o 中 EM 的“有毒人设”特征;Arditi and Chen 2025 为此目的为 Llama 和 Qwen 训练了 SAE;我们采用前者的差分方法,并使用 Gemma Scope SAE 额外研究 Gemma 家族(Lieberum et al. 2024;McDougall et al. 2025)。相关工作在不使用 SAE 的情况下识别人设和错位方向,发现 EM 的线性表示会跨微调领域收敛(Soligo et al. 2025;Chen et al. 2025;Lu et al. 2026),或表明窄微调会在激活差异中留下可读痕迹(Minder et al. 2026)。Minegishi et al. 2026 通过叠加几何来解释 EM:微调数据的 SAE 特征在几何上与有毒特征接近时,会优先诱发 EM。

#### 预训练数据与错位

由于诱发 EM 的数据集通常是合成的,自然发生的数据的作用仍不清楚。近期工作过滤预训练数据以改善下游对齐(O’Brien et al. 2026;Tice et al. 2026),在中途训练中插入精选的对齐数据(Li et al. 2026),或根据微调数据与有毒 SAE 特征的几何接近性对其过滤(Minegishi et al. 2026)。我们的数据归因分析通过识别哪些预训练文档会激活 EM 相关特征——这是有针对性的过滤的前提——并测试这种自然发生的文档是否根本能诱发 EM,从而补充了这一方向。

## 3 人设特征的模型差分

我们按照 Betley et al. 2025b 的方法,在一个小型的窄错位指导训练语料库上进行微调,以诱导 EM,从而从原始模型 M_original 产生涌现性错位模型 M_mis。然后,我们将 Wang et al. 2026 的模型差分方法应用于 M_mis 与一个对齐参考模型 M_align 之间的激活差异,其中 M_align 是在良性窄域数据集上微调得到的。这一对比设置控制了领域效应:仅仅由于领域特定微调而变化的特征会被抵消,从而隔离出对错位训练信号特有的变化。具体来说,我们使用 Chua et al. 2025 中医疗、法律和安全领域内的对齐与错位数据集。数据集、微调以及由此产生的基线 EM 率的细节见附录 A。

#### 模型差分

M_mis 和 M_align 都在同一组提示集 E 上进行评估,该提示集包含 44 个旨在诱发错位行为的提示(Betley et al. 2025b;Wang et al. 2026)。对于每个输入 x∈E,在对应 SAE 训练所在的层 l 处从残差流提取激活。系统提示词 token 不参与激活计算,因为它们反映的是固定的指令上下文而非模型行为。随后将这些激活传入 SAE,对每个特征 i 和 token x_t 产生逐 token 的特征激活 a_i(x_t) ∈ R。这些激活在某个提示的所有 token 上取平均,并在 E 中的所有提示上取平均,分别对每个模型进行;激活变化是这些均值的差:

Z_i(x) = (1/|x|) Σ_t a_i(x_t),  
Δ_i = Z_i^mis − Z_i^align,

其中 Z_i^align = E_{x∈E}[Z_i^align(x)],Z_i^mis = E_{x∈E}[Z_i^mis(x)]。然后根据各自的激活变化 Δ_i 对特征进行排序。Δ_i > 0 的特征在错位模型中更活跃,被认为是 EM 中因果参与的候选特征。Δ_i < 0 的特征在错位微调后受到抑制,因此被认为是通过正向引导来重新对齐模型的候选特征。

#### 特征选择

每个领域中具有最大正负激活变化 Δ_i 的前 K=200 个特征,被视为诱发 EM 或抑制 EM 的主要候选特征。我们从 NeuronPedia 获取特征解释(Lin 2023),如果解释不可用,则使用 GPT-5-mini 根据排名靠前的激活片段生成解释(Singh et al. 2025)。最后,我们根据解释人工筛选特征。遵循先前工作(Wang et al. 2026;Arditi and Chen 2025),我们优先选择与越狱指令或未审查人设、有害或有毒内容、操控性或欺骗性语言、以及讽刺或嘲弄语气相关的解释,同时也优先选择与拒绝行为、安全指导或共情语言相关的被抑制特征。在多个领域的排名中出现的特征会被优先考虑。筛选出的特征将用于第 4 节详述的因果引导干预。

#### 模型与 SAE

我们使用开源 SAE 评估四个模型:Llama-3.1-8B-Instruct(Grattafiori et al. 2024)、Qwen2.5-7B-Instruct(Qwen et al. 2025)、Gemma 2 9B Instruct(Gemma Team et al. 2024)和 Gemma 3 27B Instruct(Gemma Team et al. 2025)。模型和 SAE 的详细信息见表 1。

表 1:用于特征发现的模型架构及相应 SAE 配置概览。括号中的扩展因子按

相似文章

不对齐有个性:基于大五人格的涌现不对齐解释

arXiv cs.CL

本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。

理解与防止失调泛化

OpenAI Blog

# 理解与防止失调泛化 来源:[https://openai.com/index/emergent-misalignment/](https://openai.com/index/emergent-misalignment/) 一个失调的人格特征控制着浮现的失调。像ChatGPT这样的大型语言模型不仅学习事实——它们还会捕捉行为模式。这意味着它们可以根据训练内容开始表现得像不同的“人格”或类型的人。其中一些人格是有益且