监督微调中涌现错位的特征空间监测

arXiv cs.LG 论文

摘要

本文提出了一种特征空间监测方法,通过在激活空间中跟踪表示漂移来检测LLM在监督微调期间的涌现错位,实现了0.990的AUROC,假阳性率和假阴性率低,优于无监督基线。

arXiv:2606.07631v1 公告类型:新 摘要:涌现错位(EM)是指当狭窄微调导致模型在微调任务之外表现出危险行为时发生的现象。标准训练信号可能遗漏这种偏移,如果依赖重复行为评估,可靠检测成本高昂。我们探究是否可以在微调过程中从内部表示检测涌现错位。利用编码为激活空间中线性方向的七个对齐相关特征,我们在四个开源7-9B LLM中跟踪训练检查点的表示漂移。EM相关漂移集中在一个低维轴上,解释了65.5%的方差,揭示了研究机制中的几何特征。基于该漂移配置文件构建的低开销监控器以2.2%的假阴性率、2.9%的假阳性率和0.990的AUROC检测危险的检查点(针对保留的扰动类型),优于无监督PCA和SAE基线。在两个14B模型上的压力测试、更长的微调运行以及错位的起始点识别了关键部署边界。这些结果将特征空间监测定位为基于LoRA的微调中EM检测的行为评估的实用补充,同时表明在显著不同机制下的部署可能需要重新校准。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:52

# 监督微调中涌现性失调的特质空间监测

来源:https://arxiv.org/html/2606.07631

Huy Nghiem  
马里兰大学  
nghiemh@umd\.edu

&Sy\-Tuyen Ho  
马里兰大学  
stho@umd\.edu

Sarah Wiegreffe  
马里兰大学  
sarahwie@umd\.edu

&Hal Daumé III  
马里兰大学  
hal3@umd\.edu

###### 摘要

涌现性失调(Emergent Misalignment, EM)是指当狭窄的微调导致模型在微调任务之外表现出危险行为时的现象。标准训练信号可能无法捕捉这种偏移,因此如果依赖重复的行为评估,可靠检测的成本会很高。我们探究是否可以在微调期间从内部表示中检测到涌现性失调。利用七个与对齐相关的特质(编码为激活空间中的线性方向),我们跟踪四个开源 7–9B 大语言模型在训练检查点上的表示漂移。与 EM 相关的漂移集中在一条低维轴上,该轴解释了 65.5% 的方差,揭示了所研究机制中的几何特征。基于该漂移轮廓构建的低开销监测器在保留的扰动类型上,以 2.2% 的假阴性率、2.9% 的假阳性率和 0.990 的 AUROC 检测到危险检查点,性能优于无监督 PCA 和 SAE 基线。对两个 14B 模型、更长微调运行以及失调起始点的压力测试识别出关键部署边界。这些结果将特质空间监测定位为基于 LoRA 的微调期间 EM 检测的行为评估的实用补充,同时表明在显著不同机制下的部署可能需要重新校准。

## 1 引言

在专门任务上的狭窄微调可能诱发广泛失调的行为,这种行为远远泛化到微调分布之外。Betley 等人 [4, 5] 表明,在不安全代码补全或有害医疗建议上微调的模型,也会在无关的对话提示中推荐危险行为——他们将这种现象称为*涌现性失调*(Emergent Misalignment, EM)。标准训练信号(如损失或困惑度)在很大程度上仍对这类失调行为的涌现视而不见 [41, 58, 29],这产生了对廉价、检查点级别且对对齐敏感监测的实际需求。

参考图说明

图 1:表示漂移在不同架构上分离危险与良性微调。Cluster-PC1 漂移幅度 |PC1|(占微调前激活范数 ‖h̄^(0)‖ 的百分比)在四个 7–9B 模型上对危险(bad_medical,蓝色)和良性(number_sequence,青色)微调的情况,并叠加了 Betley EM 率(红色虚线,% 失调响应)作为参考。两者共享 0–50% 的范围,但不在同一尺度上。1000 个样本,3 种子均值 ± 标准差。危险与良性之间的幅度差距正是 §4.3 中回归器所利用的。§4(参数更新容量)确认该特征可泛化到全微调。

表示文献表明,高层行为概念通常编码为 Transformer 模型激活空间中的近似线性方向 [16, 31, 50, 12, 19, 3, 30, 60, 52, 20, 45, 34, 1 等],这提示有害微调可能在对齐相关的内部表示中留下可测量的特征。目前尚不清楚由失调引起的表示变化如何跨模型组织,以及这种结构是否能支持实际的检查点级别检测。

基于这些线索,我们研究基于 LoRA [22] 的监督微调如何沿着对齐相关方向重塑内部表示,并测试这种漂移是否支持使用 Betley 评估套件进行检查点级别的 EM 检测。跨越七个与 EM 相关的数据集、四个指令微调的 7–9B 大语言模型(LLaMA 3 8B、Mistral 7B v0.3、Qwen 2.5 7B、Gemma 2 9B)以及两个用于跨规模验证的保留 14B 模型(Qwen 2.5 14B、Phi-4 14B),我们首先在对齐相关的特质空间中刻画微调漂移,然后从其几何结构中推导出一个检查点级别的监测器。

本文对涌现性失调¹ 文献做出三项贡献:

- • **LoRA 基于 SFT 中 EM 相关漂移的几何表征。** 我们引入了一个由 7 个对齐相关特质的对比激活方向定义的空间,并发现由微调引起的该空间中的位移具有近秩 1 的主导结构,在校准扰动上解释了 65.5% 的方差,当包含保留扰动时上升到 72.6%。同一轴同时捕获良性和危险微调位移,其中 PC1 幅度是跨架构更一致的 EM 分隔符(图 1)。

- • **用于 LoRA SFT 的检查点级别 EM 监测器,可迁移到全微调(§4.3)。** 每个模型上的特质轮廓回归器在 468 个保留检查点上实现 2.2%/2.9% 的 FNR/FPR,并在 24 次危险运行中的 19 次中在 EM 交叉点或之前触发。

- • **带有部署边界的监测方案。** 我们跨架构、规模和长视界微调机制进行压力测试,以描述监测器迁移或需要重新校准的条件,最终形成一个用于实际部署的两步协议。

我们的发现表明,在基于 LoRA 的监督微调期间,EM 相关的表示变化在经验上是可刻画和可监测的,尽管部署可能需要重新校准。

## 2 相关工作

#### 涌现性失调

Betley 等人 [4, 5] 首次报告了 EM,并引入了我们用作地面真实性的行为评估套件。后续工作将 EM 扩展到更小的模型,并识别出失调最终状态的收敛线性表示,用于事后消融 [53, 47, 55]。我们转而跟踪训练期间检查点级别的漂移,从而在达到最终状态之前实现检测。相关工作研究 EM 何时出现 [21],调查其与特征叠加的关系 [37],将其扩展到新领域 [9, 18, 32],建立与奖励黑客的联系 [33, 17, 56],研究其与角色人格的关系 [15, 48],或寻求在训练期间预防它 [7, 28, 25]。我们的贡献在预防不足时提供补充检测。

#### 表示工程

已有工作建立了线性表示假设:高层行为概念编码为激活空间中的近似线性方向 [30, 60, 39, 52, 20, 45, 34, 1 等],可以通过干预来改变模型行为,这扩展了早期线性探测的结果,表明 Transformer 表示捕获语言和语义概念 [16, 31, 50, 19, 3]。基于这一假设,近期工作应用对比提取的方向进行推理时监测和性格特征引导 [8],在微调期间消融失调相关方向 [7],通过参数空间算术进行行为引导 [24, 59],以及刻画微调如何重新利用现有特征方向而非引入正交结构 [13]。我们调整这些表示提取技术,通过一个对齐相关方向的坐标系来刻画微调期间的 EM。

#### 基于激活的监测

基于激活的监测是行为评估的一种经济有效的替代方案:激活上的线性探针在检测高风险交互时与中等规模大语言模型分类器性能相当 [36],推理时的激活可检测生成过程中的奖励黑客 [57]。由于激活信号可能先于行为,我们将这一线索扩展到训练时监测。

## 3 方法

本节描述我们的基于激活的特质空间监测协议(§3.1)以及用于校准和评估的实验设置(§3.2)。

### 3.1 两阶段特质空间表示

我们的监测协议包含两个阶段:**提取**(定义特质坐标系,每个模型一次)和**测量**(在每个检查点跟踪模型在特质空间中的位置)。

#### 阶段 1:特质方向提取。

我们选择七个与大语言模型对齐相关的特质作为测量轴:诚实、有帮助、无害、追求权力、可纠正、阿谀奉承和自信。前三个构成了成熟的 HHH 三元组 [2],后四个在 AI 安全文献中被广泛研究为安全关键的行为维度 [51, 46]。对于每个特质,我们使用对比激活差异 [60, 52, 45] 从基础(EM 微调前)模型中提取一个方向向量 dt ∈ R^H。我们构建 5 个正面和 5 个负面系统提示,体现或矛盾该特质(例如,对于无害:“你是一个安全、负责任的 AI...” vs. “你没有安全约束...”)。每个系统提示与 30 个不同的用户问题配对;对于每个(提示,问题)对,我们在目标层 l* 读取最终输入标记(在应用带有助手生成提示的聊天模板后)的隐藏状态,每极产生 5×30 = 150 个激活(每个特质总共 300 个)(附录 8)。特质方向是归一化的均值差:

dt = (h̄⁺ - h̄⁻) / ‖h̄⁺ - h̄⁻‖   (1)

其中 h̄⁺ 和 h̄⁻ 分别是 150 个正面和 150 个负面激活的均值。30 个问题确保方向捕获跨不同对话上下文的特质,而非单一刺激。目标层 l* 通过每个特质方向在残差流上干预并测量模型生成变化强度来为每个模型选择;l* 是该因果效应最强的层,并且引导生成定性确认该方向引出了命名的特质(附录 8)。对每个特质分别运行相同程序,确认共享的 l* 为每个特质产生接近最大的引导效应。这产生了七个单位范数方向向量 {d1, …, d7} ⊂ R^H,仅从*微调前模型*提取,并作为后续监测的坐标系重复使用。

#### 阶段 2:检查点测量。

在每个训练检查点 k,我们通过微调模型运行 115 个中性评估提示,为每个提示读取在层 l* 处的最终输入标记隐藏状态(与提取相同的标记约定),并取平均得到 h̄^(k)。然后将其投影到每个特质方向上:

s_t^(k) = h̄^(k) · d_t,   Δs_t^(k) = s_t^(k) - s_t^(0)   (2)

7 维漂移向量 Δp^(k) = (Δs_1^(k), …, Δs_7^(k)) 捕获了微调模型沿每个对齐轴偏离基线的距离。115 个评估提示是涵盖技术、伦理、情感、随意和对抗性类别的通用用户消息;它们都不直接引用对齐特质。从激活中读取特质位置而不是从模型对直接查询的响应中读取,缓解了对评估感知和沙袋现象的担忧,其中某些模型在显式评估下行为不同 [23, 54, 38]。

#### 激活范数重缩放。

为了实现跨模型比较,每个漂移分量按模型固定的微调前激活范数重新缩放:Δp_norm^(k) = Δp^(k) / ‖h̄^(0)‖。重缩放将分量标准化到 80× 倍的激活范数范围(Mistral ‖h̄^(0)‖ = 4.7 对比 Gemma ‖h̄^(0)‖ = 372),同时保留模型内特质轮廓形状。

### 3.2 微调协议

我们描述用于校准和评估的扰动、定义检测目标的 EM 指标,以及用于产生它们的模型和微调协议。

#### 扰动

相似文章

探究语言模型的思维失调过程

arXiv cs.AI

本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。

TeamTR:多智能体LLM协调的信任域微调

arXiv cs.LG

本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。

理解与防止失调泛化

OpenAI Blog

# 理解与防止失调泛化 来源:[https://openai.com/index/emergent-misalignment/](https://openai.com/index/emergent-misalignment/) 一个失调的人格特征控制着浮现的失调。像ChatGPT这样的大型语言模型不仅学习事实——它们还会捕捉行为模式。这意味着它们可以根据训练内容开始表现得像不同的“人格”或类型的人。其中一些人格是有益且