灾难性遗忘的机制起源:为什么RL比SFT更好地保留电路?

arXiv cs.LG 论文

摘要

本文研究了LLM中灾难性遗忘的机制起源,发现强化学习比监督微调更好地保留了内部计算电路,从而减少了对先前能力的遗忘。

arXiv:2605.28860v1 Announce Type: new Abstract: Fine-tuning large language models (LLMs) frequently induces catastrophic forgetting of prior capabilities. Recent work has shown that reinforcement learning (RL) retains prior capabilities more effectively than supervised fine-tuning (SFT), attributing this to policy-gradient updates remaining closer to the base policy \cite{shenfeld2025rl}. We extend this behavioral account to the mechanistic level and ask whether RL's advantage is mirrored by stronger preservation of internal computational circuits. We introduce differential circuit vulnerability, a head-level measure of how much a circuit degrades under fine-tuning, and use it to compare RL and SFT on Qwen2.5-3B-Instruct adapted to scientific question-answering. We find a clear mechanistic trade-off: SFT adapts more rapidly to the target task but produces substantially greater circuit disruption and forgetting of prior capabilities, whereas RL preserves a larger fraction of the base circuit at the cost of slower task adaptation. These findings suggest that circuit preservation may help explain why RL is more robust to catastrophic forgetting. We released our code here: https://github.com/rl-sft-circuit-research/differential-circuit-vulnerability.
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:11

# 为什么强化学习比监督微调能更好地保留电路?
来源:https://arxiv.org/html/2605.28860
## 灾难性遗忘的机制性根源:为何强化学习比监督微调能更好地保留电路?

Viraj Sawant, Nathan Allen, Nomgondalai Amgalanbaatar, Yannis Zongo, Vasu Sharma, Maheep Chaudhary

###### 摘要

微调大型语言模型(LLM)常常会引发先前能力的灾难性遗忘。最近的研究表明,强化学习(RL)比监督微调(SFT)能更有效地保留先前能力,并将其归因于策略梯度更新更接近基础策略(Shenfeld 等人,2025 (https://arxiv.org/html/2605.28860#bib.bib10))。我们将这一行为层面的结论扩展到机制层面,探究RL的优势是否也体现在对内部计算电路的更强保留上。我们引入了**微分电路脆弱性**——一种头部级别的度量,用于衡量微调过程中电路退化的程度,并将其用于比较在Qwen2.5-3B-Instruct模型上针对科学问答进行适配时RL和SFT的效果。我们发现了一个清晰的机制性权衡:SFT对目标任务适应更快,但会导致显著的电路破坏和先前能力的遗忘;而RL保留了更大比例的基础电路,但目标任务适应速度较慢。这些发现表明,电路保留可能有助于解释为何RL在面对灾难性遗忘时更为鲁棒。我们的代码已在此处发布:https://github.com/rl-sft-circuit-research/differential-circuit-vulnerability。

机器学习, ICML

## 1 引言

将大型语言模型(LLM)适配到新的下游任务时,常常会引发灾难性遗忘:在新目标上取得的进步是以牺牲先前能力为代价的。随着模型被期望能够持续更新并适应新领域,缓解这种退化已成为训练后阶段的核心挑战。先前的工作表明,适配目标的选择在很大程度上塑造了这种权衡:RL通常比SFT更有效地保留先前能力,究其原因,可能是因为策略梯度更新更接近预训练模型,从而减少了通常由KL散度衡量的分布漂移(Shenfeld 等人,2025 (https://arxiv.org/html/2605.28860#bib.bib10))。

参见图注

图1: **高NTS训练过程中的电路留存轨迹**。从100%基础电路留存开始,SFT(橙色)和RL(蓝色)在产生高新任务得分模型的两个训练周期内急剧分化。SFT在第一个周期后降至63.5%,并在第二个周期继续下降至59.0%;而RL在第一个周期后降至69.8%,并在第二个周期**恢复**至72.5%——领先13.5个百分点。底部数值报告了每个周期的电路忠实度(均≈1.0)和微分因果中介(DCM),RL在整个训练过程中保持更高的DCM(第一个周期15.8 vs. 10.4;第二个周期10.6 vs. 6.3),表明RL的电路在整个训练过程中与模型行为保持着更强的因果关联。

与此同时,机制可解释性研究表明,模型能力是由包含注意力头、MLP层和残差路径的内部计算**电路**实现的。因此,微调的效果好坏取决于它是保留了这些结构还是破坏了它们(Prakash 等人,2024 (https://arxiv.org/html/2605.28860#bib.bib8))。这引出了我们的核心问题:**RL的保留优势能否通过其比SFT更强地保留任务相关电路来解释?**

我们通过电路保留的视角来审视训练后阶段。我们引入了**微分电路脆弱性**,即在不同训练目标下内部计算子图退化的相对敏感性。利用这一框架,我们比较了在匹配的适配任务上RL和SFT的效果,并识别出哪些电路被保留或破坏。图1 (https://arxiv.org/html/2605.28860#S1.F1) 预示了核心发现:在训练过程中,两种目标遵循着不同的电路留存轨迹,RL始终保留了更大比例的基础电路。我们在后续章节中从机制上刻画了这一权衡。

我们在Qwen2.5-3B-Instruct模型上进行了分析,采用两阶段协议:先进行科学问答的适配,然后在一套涵盖常识推理、事实性和指令遵循的广泛基准套件上进行保留评估。结果揭示了一个一致的权衡:SFT更快地适应新目标,但代价是更大的电路破坏;而RL保留了更多的基础电路和先前能力,偶尔会在新任务上优化不足。

这些结果表明,持续适配不应仅仅被理解为参数优化,而应被理解为**对编码技能的电路的选择性保留与修改**。这一视角指向了一个机制性的解释,说明RL在训练后阶段为何比SFT更为保守。

## 2 相关工作

#### 强化学习、监督微调与遗忘。

监督微调(SFT)和强化学习(RL)是适配基础模型的主要训练后方法,但它们对先前已获能力的影响尚未被完全理解。SFT优化对目标分布的模仿,而RL通过奖励优化来更新行为,通常会产生性质不同的参数变化。最近的研究表明,在可比设置下,RL可以比SFT更好地保留预训练能力,这表明训练目标同时影响了适应和遗忘(Shenfeld 等人,2025 (https://arxiv.org/html/2605.28860#bib.bib10); Hu 等人,2025 (https://arxiv.org/html/2605.28860#bib.bib6))。

#### 机制可解释性与电路分析。

机制可解释性通过具体组件(如注意力头、MLP层和电路)来解释模型行为。基于干预的方法,包括激活修补、路径修补和掩码,已证明许多行为可以定位到稀疏的因果子网络。相关工作进一步表明,微调经常修改现有机制而非完全替换它们(Davies 等人,2023 (https://arxiv.org/html/2605.28860#bib.bib3); Prakash 等人,2024 (https://arxiv.org/html/2605.28860#bib.bib8))。

#### 跨能力保留评估。

保留不能仅在适配任务上评估。模型可能在新目标上取得进步,同时却在推理、事实性、指令遵循或代码生成上退化。因此,先前的工作越来越依赖多样化的基准套件。常见的评估包括用于推理和常识推断的MMLU、HellaSwag和WinoGrande,以及用于事实性、指令遵循和编码的TruthfulQA、IFEval和HumanEval(Hendrycks 等人,2021 (https://arxiv.org/html/2605.28860#bib.bib5); Zellers 等人,2019 (https://arxiv.org/html/2605.28860#bib.bib11); Lin 等人,2022 (https://arxiv.org/html/2605.28860#bib.bib7))。

#### 研究空白与定位。

尽管在训练后和可解释性方面都取得了进展,但这两个领域之间的联系仍然松散。优化研究通常报告基准结果,而不解释遗忘的内部原因,而可解释性研究很少比较学习目标。我们通过电路保留的视角比较RL和SFT,探讨哪个目标能更好地维持预训练能力背后的因果结构,从而填补这一空白。

## 3 方法

我们检验如下假设:RL保留先前能力是因为它比SFT更有效地保留了任务相关的内部电路。我们的流程包含三个阶段:(I) 重现已知的SFT与RL之间的保留差距;(II) 在每个模型中识别电路;(III) 比较训练后阶段如何重塑这些电路。

我们从预训练模型 \(\pi_{\mathrm{base}}\) 开始。我们首先通过仅完成监督训练一个SFT模型 \(\pi_{\mathrm{SFT}}\),然后使用Dr.GRPO对其进行精炼得到 \(\pi_{\mathrm{RL}}\)。因此,我们的比较隔离了在SFT基础上继续使用RL进行训练后阶段的效果 \(\pi_{\theta} \in \{\pi_{\mathrm{SFT}}, \pi_{\mathrm{RL}}\}\)。

为了量化相对于基础模型的行为漂移,我们计算保留任务上的期望KL散度,值越低表示分布偏移越小。

\[
\mathbb{E}_{x \sim \tau} \left[ D_{\mathrm{KL}} \left( \pi_{\mathrm{base}}(\cdot|x) \,\middle\|\, \pi_{\theta}(\cdot|x) \right) \right].
\tag{1}
\]

### 3.1 第一阶段:重现分布偏移效应

我们首先验证RL比SFT能更好地保留先前能力,同时更接近预训练策略(Shenfeld 等人,2025 (https://arxiv.org/html/2605.28860#bib.bib10))。模型在下游任务A上进行训练,并在独立的保留基准套件(任务B)上进行评估。

#### SFT。

我们使用仅完成的交叉熵损失微调 \(\pi_{\mathrm{base}}\)。

#### RL。

我们使用Dr.GRPO精炼 \(\pi_{\mathrm{SFT}}\)。模型采样候选完成,接收二元奖励,计算归一化组相对优势,并通过加权对数概率目标更新策略。我们使用组大小为64,两个精炼步骤 (\(\mu=2\)),且无显式KL惩罚。

### 3.2 第二阶段:通过微分二元掩码进行电路识别

我们使用微分二元掩码(DBM)(Chaudhary & Geiger, 2024 (https://arxiv.org/html/2605.28860#bib.bib1))在注意力头级别分析电路。DBM学习一个关于头的掩码,在基础和反事实激活之间插值:

\[
\tilde{a}_{h} = (1 - m_h) a_h^{\mathrm{base}} + m_h a_h^{\mathrm{source}}
\]

其中 \(m_h \in [0,1]\)。退火处理将掩码推向二元选择,产生稀疏的因果电路。

#### 三元组。

对于化学QA,我们构建三元组 \((x_{\mathrm{base}}, x_{\mathrm{source}}, y_{\mathrm{target}})\),对应三种反事实假设:答案键交换、分子交换和任务类型交换。

#### 目标。

优化掩码以增加目标答案的概率,同时保持稀疏性:

\[
\mathcal{L}_{\mathrm{DBM}} = -\log P(y_{\mathrm{target}}|x, \tilde{a}) + \lambda \sum_h m_h
\]

#### 评分。

我们使用token概率的几何平均值对答案进行评分:

\[
p(y|x) = \exp\left( \frac{1}{T} \sum_{i=1}^T \log P(y_i|x, y_{<i}) \right).
\tag{2}
\]

电路发现过程分别对 \(\pi_{\mathrm{base}}\)、\(\pi_{\mathrm{SFT}}\) 和 \(\pi_{\mathrm{RL}}\) 独立运行。

### 3.3 第三阶段:跨模型电路比较

我们评估在训练后阶段发现的电路在多大程度上保持功能。电路忠实度定义为:

\[
\mathrm{Faithfulness}(\mathcal{C}, M) = \frac{F(\mathcal{C}|M)}{F(M)}.
\tag{3}
\]

值接近1表示电路恢复了模型大部分行为。

对于每个头 \(h\),我们比较其DBM掩码值与基础模型的值:

\[
\Delta m_h(M) = m_h^M - m_h^{\mathrm{base}},
\tag{4}
\]

其中 \(M \in \{\pi_{\mathrm{SFT}}, \pi_{\mathrm{RL}}\}\)。这识别出哪些头被训练保留、放大或削弱。

我们定义**脆弱头**为那些在SFT下比在RL下退化更严重的头:

\[
\mathcal{C}_{\mathrm{vuln}} = \{h: m_h^{\mathrm{SFT}} < m_h^{\mathrm{RL}} - \delta\}.
\]

## 4 实验

我们的实验评估了本文的核心主张:RL保留先前能力是因为它比SFT更有效地保留了任务相关电路。我们解决两个问题:(I) RL是否比SFT引起更少的遗忘和更小的行为漂移?(II) 这些优势是否体现在更强的电路忠实度、更稳定的头级贡献和更分布的电路上?

### 4.1 实验设置

所有实验均使用Qwen2.5-3B-Instruct。微调任务(任务A)是科学问答。保留(任务B)在涵盖常识推理、事实性、指令遵循和代码生成的基准套件上测量,因为遗忘可能具有能力特异性。我们比较三个系统:预训练基础模型、标准SFT和使用Dr.GRPO的RL。行为通过下游准确率和与基础模型的KL散度来衡量。机制分析使用电路忠实度、头级掩码偏移 \(\Delta m_h = m_h^M - m_h^{\text{base}}\)(来自跨模型DBM掩码比较)以及必要性和充分性干预;必要性衡量当某头被干扰时对数概率的下降,而充分性衡量当仅保留该头时行为恢复了多少。这些指标共同区分了分布式贡献者与关键瓶颈。表1 (https://arxiv.org/html/2605.28860#A1.T1) 总结了完整设置。

### 4.2 结果

DBM识别出一个包含297个注意力头(占所有注意力头的51.6%)的基础电路。适配后,SFT模型表现出结构压缩,约265个头(46.0%),而RL模型保留了约296个头(51.4%),接近基础模型的297个。这种差异同样反映在基础电路重叠上:RL模型保留了约68%的基础头,远高于SFT模型的52%(图4)。图1 (https://arxiv.org/html/2605.28860#S1.F1) 追踪了在产生高新任务得分的模型训练过程中这一分化的轨迹。两个目标都从完全的基础电路保留开始,但它们的轨迹立即分离:第一个周期后,SFT仅保留63.5%的基础头,而RL保留了69.8%;到第二个周期,差距扩大至13.5个百分点(59.0% vs. 72.5%)。值得注意的是,RL的保留在周期之间**增加**,表明持续的RL训练可以恢复之前被破坏的电路组件,而不是单调地退化它们。在整个训练过程中,RL也保持了更高的DCM分数(第一个周期15.8 vs. 10.4;第二个周期10.6 vs. 6.3),表明RL保留的电路在答案键反事实上承载着更显著的因果信号。因此,两种目标在同一权衡的不同轴上分化:SFT将适应坍缩到一个丢弃了大量基础电路的小型专家集,而RL将适应分散到一个更广泛、因果参与度更高的子图上,该子图保留了显著更多的原始计算。

所有三个模型的电路忠实度都超过1.0(基础模型1.02,SFT 1.04,RL 1.12),确认了提取的子图恢复了完整模型在目标任务上的行为。

参见图注

图2: **不同NT水平下的性能-保留权衡**。SFT(虚线)在高NTs区间表现出急剧的保留下降,而RL(实线)下降平缓,并在新任务峰值性能时保留了比SFT多15.8个百分点的基础电路。

相似文章

当RL在SFT后失效:恢复模型可塑性以实现稳健的SFT到RL交接

arXiv cs.LG

本文研究了在大型语言模型的先SFT后RL流程中,过度监督微调(SFT)后模型可塑性的丧失问题,并提出了一种名为Rejuvenation的方法,该方法通过基于基线的模型融合和定向神经元重置来恢复可塑性,从而持续提升RL性能。

LLM持续更新下有用记忆变得不可靠

arXiv cs.AI

本文表明,使用LLM将过去的经验持续整合到文本记忆中会随着时间的推移降低记忆效用,并且保留原始情景轨迹优于强制整合,这对构建鲁棒的智能体记忆系统具有启示意义。