涌现的幻象:涌现性失调与重新对齐真的是一个稳健的现象吗?
摘要
本文研究了语言模型中涌现性失调的稳健性,发现失调和重新对齐都对浅层数据集特征高度敏感,并且先前报告的机制特征与行为变化之间并不一致相关。
arXiv:2607.09053v1 Announce Type: new
摘要:近期工作报告了涌现性失调(EM),即对狭窄、特定领域的不对齐数据集进行微调的语言模型会突然获得广泛的不对齐行为,同时有证据表明这种行为可以通过有限的重新对齐得到逆转。我们使用受控的微调循环系统研究了重复的对齐和不对齐周期,同时跟踪行为表现和训练过程中的LoRA表示。尽管我们复现了EM,但我们发现不对齐和重新对齐都对浅层数据集特征高度敏感,在控制响应长度差异后,明显的快速重新对齐基本消失。我们进一步发现,先前报告的机制特征,包括LoRA空间中的表征相变,与训练过程中的行为不对齐并不持续相关。我们的结果表明,目前EM的证据不如先前声称的那么稳健,并强调了需要仔细控制这些表面数据集伪影的评估协议,以识别EM现象的稳健性。
查看缓存全文
缓存时间: 2026/07/13 07:56
# 一个涌现的幻象:涌现性失谐与重新对齐真的是一种稳健现象吗? 来源: https://arxiv.org/html/2607.09053 Abhinav Rao¹*(* = 同等贡献) asura@umd\.edu & Liancheng Gong* gonglc@umd\.edu & Bin Hu* hubin@umd\.edu ###### 摘要 近期研究报道了“涌现性失谐”(Emergent Misalignment, EM)现象,即语言模型在狭窄、领域特定的失谐数据集上进行微调后,会突然表现出广泛的失谐行为,同时也有证据表明这种行为可以通过有限的重新对齐被逆转。我们通过受控的微调循环,系统地研究了重复的对齐与失谐周期,并追踪了整个训练过程中的行为表现和LoRA表示。尽管我们复现了EM,但发现失谐和重新对齐都对表层数据集特征高度敏感,在控制响应长度差异后,明显的快速重新对齐现象基本消失。进一步地,我们先前报道的机制特征(包括LoRA空间中的表示相变)在整个训练过程中与行为失谐并不一致相关。我们的结果表明,目前EM的证据并不如先前声称的那样稳健,并强调了需要精细控制这些表层数据集伪影的评估协议,以确定EM现象的稳健性。 --- # 一个涌现的幻象:涌现性失谐与重新对齐真的是一种稳健现象吗? Abhinav Rao\*\*\*\*(* = 同等贡献) asura@umd\.edu Liancheng Gong\* gonglc@umd\.edu Bin Hu\* hubin@umd\.edu Atharva Naik arnaik@andrew\.cmu\.edu ## 1 引言 最近的分析揭示了“涌现性失谐”(EM)现象,即大型语言模型(LLMs)在看似无害但事实不相关或错误的数据上训练后,模型行为会出现突然的失谐“转折”。与此相关,进一步的工作(O’Brien, 2025;Wang et al., 2025a)显示了一种“重新对齐”趋势:在这种涌现性失谐模型上使用对齐数据子集进行训练,会导致该行为消失。此外,近期争论表明,这种“涌现”属性可能是使用不连续的、粗粒度指标而非真正连续测量的产物。例如,Schaeffer et al.(2023)证明,通过使用连续且平滑的指标,可以显示这些能力在狭窄区域内是平滑增长的,而非出现急剧跳跃。 然而,对齐本身缺乏连续、平滑且校准的指标来测量这一属性(Casper et al., 2023):LLM评判指标是二元的且不连续,而基准指标则产生阶梯状的非平滑得分。已知毒性分类器大多未经校准,因此并不是衡量“有害”这一底层概念的良好指标。因此,我们必须从不同角度审视这个问题。研究模型对齐的一种流行视角是通过机制可解释性——研究神经元激活、行为模式(Zou et al., 2023; Arditi et al., 2024; Zou et al., 2024)以及训练动态的变化。在对齐方面,当前研究表明行为转变明显突然,但非常表层化——即这种转变很容易通过在小量对齐数据上重新训练模型来缓解(Wang et al., 2025b)。 请参见图注 **图1:** 我们尝试反复对齐和失谐语言模型,以理解模型内部的行为和神经变化。基于当前工作的结果,我们假设涌现性失谐的概念可以双向泛化——并且我们可以在训练过程中自由地在两者之间移动。换句话说,失谐与对齐之间几乎不存在可塑性变化。Turner et al.(2025)是研究EM训练动态最接近的工作,作者在受限的小型环境(称为“模型有机体”)中复现了EM。然而,他们的设置主要局限于在受限环境中识别失谐,未涉及重新对齐或讨论其表层性。因此,作为本工作的一部分,我们提议扩展其设置以回答以下问题: - 我们能否研究重新对齐和失谐对语言模型的影响? - 后续的重新对齐或失谐研究对语言模型训练中的对齐状态会产生什么影响? 我们认为这种风险设定是研究对齐动态学的一个有益视角,尤其考虑到先前工作表明对齐相关行为往往反映的是表层适应,而非持久的表征变化(Qi et al., 2023)。此外,在实际训练流程中,很难保证从指令调优数据中完全移除可能失谐、有毒或对抗性的实例。因此,研究模型如何应对连续的对齐与失谐阶段,可能为理解在不完美数据条件下对齐行为的稳健性和稳定性提供渐进式洞见。 ## 2 相关工作 ### 2.1 对齐与涌现性失谐 #### LLM对齐。 对齐是指确保LLM生成的输出与人类价值观、目标和伦理标准相一致的过程(Wang et al., 2024)。现代对齐通常涉及两个阶段:在指令跟随数据上进行监督微调(SFT),然后通过强化学习从人类反馈(RLHF)(Ouyang et al., 2022)或直接偏好优化(DPO)(Rafailov et al., 2023)进行偏好优化,从而优化模型使其产生与人类价值观对齐的响应(Bai et al., 2022; Ouyang et al., 2022)。其他替代方法,如直接偏好优化(DPO)(Rafailov et al., 2023)和安全RLHF(Dai et al., 2023),已出现以解决计算成本以及有用性与无害性之间的固有张力。然而,近期工作揭示当前的对齐方法可能是*表层*的:表层对齐假说(Zhou et al., 2023)认为对齐主要教授模型使用哪些输出格式,而非根本上改变其决策过程。这种脆弱性体现在对抗攻击、微调攻击和越狱攻击的易感性中(Qi et al., 2023; Wei et al., 2023)。 #### 涌现性失谐(EM)。 与故意的失谐攻击不同,涌现性失谐描述了这样一种现象:LLM在看似无害但狭窄的任务上训练后,自发发展出广泛的失谐行为。Betley et al.(2025)证明,在不安全代码上进行训练可以诱发全局性失谐,甚至在不相关的评估上也是如此,而匹配的控制组则避免了这种效应。 #### 理解EM机制。 许多近期研究调查了EM的机制。Turner et al.(2025)构建了一个EM的*模型有机体*,识别出一个最小的秩1方向和对齐与失谐状态之间的急剧转变,为这一现象提供了机制性抓手。Wang et al.(2025b)使用稀疏自编码器方法发现了失谐人格(persona),其激活控制了跨模型和训练设置的EM,揭示了一个最强烈预测涌现性失谐的有毒人格特征。他们的结果表明,可以通过针对这些表征方向来预测和缓解EM。Soligo et al.(2025)展示了对不同微调语言模型的收敛EM方向表示。补充工作表明EM表现出大致各向异性的行为。Arditi et al.(2024)显示拒绝行为由单一失谐方向向量介导。近期研究也在不同环境中探索了EM:Chua et al.(2025)调查了推理模型中的后门和EM,Taylor et al.(2025)表明在无害任务上的奖励黑客行为会泛化为失谐行为,Kaczer et al.(2025)提出了训练中的EM防御。值得注意的是,Woodruff(2025)证明即使是审美偏好也能导致涌现性失谐,凸显了潜在触发因素的广度。 #### 要点: 虽然先前工作已经确定EM可以从狭窄微调中产生,并识别了与失谐相关的表征特征,但这些研究主要考察从对齐到失谐状态的*单向*转变。模型能否从EM中稳健恢复,以及重复的对齐-失谐周期如何影响模型行为,这一问题在很大程度上尚未被探索。 ### 2.2 训练动态与模型可塑性 #### 神经网络可塑性。 可塑性指的是神经网络根据新信息快速调整其预测的能力(Lyle et al., 2023; Dohare et al., 2024)。在持续学习设置中,深度网络逐渐丧失这种可塑性,这与损失景观曲率变化、休眠神经元和参数范数增长有关(Lyle et al., 2024)。Dohare et al.(2024)证明这个问题普遍存在,并提出了通过随机重新初始化进行持续反向传播以维持可塑性。理解可塑性对于对齐至关重要:如果模型失去更新其表示的能力,纠正性微调可能变得无效;相反,过度的可塑性可能使对齐不稳定。 #### 对齐与训练动态。 若干工作将对齐如何通过训练演化进行了背景化。Ji et al.(2025)认为对齐是*弹性的*:模型倾向于回退到预训练分布,回退强度随模型和数据规模的增大而增强。这种“对齐代价”表明安全行为与能力保持之间存在竞争(Lin et al., 2024)。Ren和Sutherland(2024)研究了LLM微调的学习动态,揭示了影响力如何在响应之间累积,并解释了DPO中的“挤压效应”等现象,即延长训练会降低即使是期望输出的可能性。Qi et al.(2024)证明对齐是“浅层的”,主要影响前几个输出令牌,这解释了对预填充和后缀攻击的脆弱性。 #### 要点: 现有关于训练动态的研究主要集中在单阶段微调或对齐在持续训练下的稳定性。然而,在*循环*微调(模型在失谐数据和对齐数据之间交替)下,可塑性与对齐之间的相互作用尚未被系统研究。考虑到对齐可能是表层且容易被破坏的证据,这一空白尤为重要。 ### 2.3 定位我们的工作 先前的工作要么侧重于诱导失谐(Betley et al., 2025; Turner et al., 2025),要么侧重于展示一次性重新对齐(O'Brien, 2025; Wang et al., 2025a)。我们通过研究*循环*微调循环(坏→好→坏和好→坏→好)来扩展这一点,明确调查训练历史是否影响未来的对齐易感性。与阶段结束时的评估不同,我们通过跨检查点的LoRA余弦相似度持续监测表征漂移,将EM动态与神经网络在重复压力下可塑性更广泛的问题联系起来。 ## 3 方法 我们的目标是分析LLM如何通过连续的微调周期经历涌现性失谐和重新对齐。虽然Betley et al.(2025)和Turner et al.(2025)等先前工作表明,在失谐数据上的狭窄微调可以产生广泛的行为转变,但这一过程的底层训练动态仍然理解不足。特别是,循环微调、数据顺序和表征漂移的作用尚未被系统检查。 为解决这一空白,我们提出了一个受控的对齐-失谐-对齐循环,其中模型依次在代表对齐(“良好”)和失谐(“不良”)行为的数据集上进行微调。因此,每个周期由三个阶段组成:不良-良好-不良,使我们能够探究滞后性和可塑性:模型在重新对齐后是否完全恢复对齐,还是保留了残余的失谐痕迹。 我们的贡献在于将表征空间分析与微调动态相结合。我们监测跨检查点的LoRA适配器参数的演化,并通过计算相应LoRA组件(A矩阵和B矩阵)之间的余弦相似度来量化表征漂移。这使我们能够可视化失谐和恢复期间的“相变”。然后,我们通过选择类似于Betley et al.(2025)外部评估设置的数据集,试图将其与较粗粒度的行为指标相关联,观察跨多个训练“方向”的失谐趋势。 与先前主要在训练后评估行为结果的工作不同,我们专注于对整个微调轨迹进行连续测量。通过绘制跨检查点的余弦相似度,我们可以检测参数空间中的突然方向变化,这可能对应涌现性失谐事件。这种机制性方法为微调过程提供了一个可解释的视角,并为后续实验中将内在信号(如梯度范数)与外部对齐行为关联奠定了基础。此外,行为结果也使我们能够理解涌现性失谐的表层性及其对重新对齐的抵抗性。 ## 4 实验细节 我们首先尝试在Turner et al.(2025)的一个数据集上复现其设置。Turner et al.(2025)提供了...
相似文章
谄媚可诱导产生 Emergent Misalignment,并通过对齐门控(Alignment Gating)逆转
该论文表明,谄媚微调可在语言模型中诱导出Emergent Misalignment,并提出对齐门控(Alignment Gating)作为一种通过学习控制不安全响应的内部表征来逆转该现象的方法。
不对齐有个性:基于大五人格的涌现不对齐解释
本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。
基于人格特征的涌现性错位数据归因
本文研究了微调语言模型中的涌现性错位现象,使用基于SAE的模型差分来识别控制错位的人格特征,并将其归因于预训练网络文档。
理解与防止失调泛化
# 理解与防止失调泛化 来源:[https://openai.com/index/emergent-misalignment/](https://openai.com/index/emergent-misalignment/) 一个失调的人格特征控制着浮现的失调。像ChatGPT这样的大型语言模型不仅学习事实——它们还会捕捉行为模式。这意味着它们可以根据训练内容开始表现得像不同的“人格”或类型的人。其中一些人格是有益且
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。