相似模型学习方式不同:最终窗口预训练塑造超越SFT的后训练效果

arXiv cs.AI 论文

摘要

本文证明,预训练的最终窗口显著影响模型对后训练对齐的响应,即使SFT性能完全相同也是如此,这表明检查点评估应包含最后训练的数据。

arXiv:2607.25063v1 公告类型: 新 摘要:开发者根据模型的行为来判断检查点。在监督微调(SFT)后,两个在相关基准测试上表现大致相同的检查点被视为可互换,同样准备好进入下一阶段的对齐(通常是偏好优化)。我们提出疑问:这种判断是否遗漏了预训练的印记——一种后SFT基准测试无法揭示的差异,却决定了每个检查点对进一步训练的反应。为了探究这一点,我们在预训练的最终窗口上进行了控制实验,即指令调优前最后训练的数据。从部分预训练的检查点分支出的六个分支仅在这个窗口上有所不同:5亿个token,占其之前token的0.1%到1%。每个分支在其窗口上训练单一数据源:通用网络文本、过滤后的网络文本、规范性话语、安全文本、数学文本或合成教育文本。随后进行相同的SFT和后训练。SFT后,分支在指令遵循、拒绝和能力方面表现几乎相同,相差约一个点,但相同的后训练却使它们走向非常不同的终点,无论是在直接偏好优化更新还是带有可验证奖励的强化学习更新下。我们通过拒绝有害请求来衡量这种偏差:当后训练开始时,安全文本分支的拒绝率并不比网络文本分支高,但到结束时,其拒绝率下降幅度要小得多。其他四个分支几乎没有获得保护,因此效果针对窗口内容具有选择性。这种保护要求安全文本出现在预训练的最后而非更早,并且在第二个模型家族上得到复现。模型最后预训练的内容决定了它如何与对齐互动。因此,不应仅根据后SFT行为来评估检查点,而且应报告其最后训练的内容。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:53

# 相似模型,不同学习:预训练最终窗口塑造监督微调后的后训练效果

来源:https://arxiv.org/html/2607.25063

###### 摘要

开发者通过模型检查点的行为来判断其质量。在监督微调(SFT)之后,如果在相关基准测试中表现大致相同,两个检查点就被视为可互换,同样准备好进入下一对齐阶段(通常是偏好优化)。我们质疑这种判断是否忽略了预训练的印记:一种后SFT基准测试无法揭示的差异,但这种差异决定了每个检查点对进一步训练的反应。为探明这一点,我们在预训练的最终窗口(即模型在指令微调前训练的最后一个数据段)上进行了一项对照实验。从同一个部分预训练的检查点出发,六个分支分叉而出,仅在这一窗口上存在差异:5亿个token,占其之前预训练token的0.1%到1%。每个分支都使用单一数据源训练其窗口:通用网络文本、过滤后的网络文本、规范性话语、安全文本、数学文本或合成教育文本。随后SFT和后训练完全相同。SFT后,各分支在指令遵循、拒答和能力方面表现几乎相同,相差约一个百分点,但相同的后训练却将它们带向截然不同的终点——无论是在直接偏好优化更新下,还是在具有可验证奖励的强化学习更新下。我们通过拒绝对有害请求的响应来度量这种偏离:当后训练开始时,安全文本分支的拒答率并不高于网络文本分支,但到了最后,它失去的拒答能力要少得多。其他四个分支几乎没有获得保护,因此这种效果仅对窗口内容有选择性。这种保护要求安全文本出现在最终窗口而非预训练早期,并且在第二个模型家族上也能复现。模型最后预训练的内容决定了它如何对对齐做出反应。因此,不应仅根据后SFT行为来评估检查点,并且模型最后训练的内容应与其一并报告。

## 1 引言

大语言模型分阶段构建,首先通过预训练获取基础知识,然后通过监督微调(SFT)和偏好优化(如直接偏好优化 DPO)将基础模型转变为有用的助手。开发者判断一个SFT检查点是否准备好进入下一阶段,纯粹基于测试其行为:是否遵循指令、是否安全地拒绝有害提示、以及是否保持整体能力。当两个检查点同样出色地通过这些测试时,评估中没有任何指标能区分它们。

参见图注

图1:相似模型,不同学习。两个分支仅在最终预训练窗口上有所不同,C_web(通用网络文本)和C_safety(安全数据),从同一个49B token的OLMo-2-1B检查点(具有5亿token的最终窗口)分叉,然后运行相同的Tulu风格SFT和三种子上的后训练。 (a) SFT后,两个分支在拒答、能力和指令遵循方面非常匹配。每对差异约一个百分点,且C_safety从不领先。 (b) 在相同的UltraFeedback DPO下,它们在AdvBench、BeaverTails和XSTest-unsafe上的总体平均拒答率发生偏离,C_safety起点并不更高,但失去的更少,最终更高。 (c) 同样的偏离也出现在基于GCD(两个整数的最大公约数)的GRPO强化学习更新下,两个分支学习任务同样好,而C_safety失去的拒答能力要少得多。带状区域为三种子标准差。

然而,仅根据最终行为判断模型忽略了训练到达该点的路径。这条路径在模型适应方式上留下了持久的印记:共享轨迹的模型收敛到损失景观的同一区域,而可塑性(网络在进一步训练中持续变化的能力)本身也受训练方式的影响。在语言模型中,小规模后期预训练混合会改变下游微调行为,而将推理数据前置到预训练中会改变后训练所能达到的效果。因此,已有研究确立了训练路径的重要性,但没有检验:两个在SFT后行为匹配的检查点是否仍然携带该路径的印记,从而决定它们对进一步训练的反应。

我们的假设是,预训练的最终窗口(指令微调前最后训练的数据)是设置这个印记的关键。我们通过追踪对有害请求的拒答来研究它,因为拒答是由SFT的一个组件安装的(我们在各分支间固定该组件),并且易于通过大量提示测量。从一个部分预训练的OLMo-2-1B检查点出发,我们分叉出六个仅在该窗口不同的分支,然后对每个分支应用相同的Tulu风格SFT和UltraFeedback DPO,并在两个主要分支上增加组相对策略优化(GRPO)强化学习更新。我们测量拒答侵蚀,即从SFT检查点到后训练检查点的拒答率下降,这隔离了共享后训练阶段引起的变化。侵蚀区分了端点比较时混淆的两个量:后训练开始时分支有多少拒答能力,以及相同的更新移除了多少。因此,问题不在于某些预训练数据是否使模型更安全,而在于预训练路径(包括最终窗口的内容以及它出现在最后的事实)决定了已安装的SFT拒答有多少能在下一阶段中幸存。

图1预览了答案:在测量的后SFT行为上紧密匹配的分支,在相同的DPO下发生偏离,同样的偏离也出现在GRPO下。我们首先验证分支在SFT后是匹配的,并在相同的DPO下偏离。然后我们探究偏离的驱动因素:哪个最终窗口内容保护了拒答,以及该内容是否必须出现在最后。接着我们将结果扩展到DPO之外的GRPO更新,并测试该效果是否对学习率、偏好数据和第二个模型家族(Pythia-1B)鲁棒,以及随着最终窗口占先前训练比例变小而如何减弱。最后这个测试通过两种方式改变比例:固定5亿窗口并稍后分叉,以及(作为对照)在固定分叉点缩小窗口。我们总结贡献如下。

首先,我们识别出后训练的路径依赖性:在标准后SFT标准(指令遵循、拒答、能力)上匹配的检查点,在相同的后训练更新下仍然会偏离,因此这些标准对后期预训练设置的差异是盲目的。其次,我们通过拒答侵蚀度量和匹配检查点控制来隔离这个效果,并展示安全分支在后训练下虽然起点并不更高,但失去的拒答比网络分支少。第三,在DPO下,我们刻画了该效果何时以及多强地成立:它取决于最终窗口内容,要求安全数据出现在最后,当窗口缩小到先前训练的极少部分时减弱到接近零,并且在不同的模型家族上复现。这种偏离并非特定于某个算法:它也在具有可验证奖励的GRPO强化学习更新下出现。模型的对齐可塑性在其后SFT行为中并不完全可见,因此对齐模型的下游开发者需要知道模型最后训练的内容,而不仅仅是它的得分。

## 2 相关工作

#### 预训练数据和训练阶段

缩放定律和计算最优训练工作确立了模型行为取决于模型大小和数据规模。开放模型套件和大型预训练语料库使得通过检查点、精选数据集和受控配方来研究这种依赖性成为可能。最近的数据选择工作进一步表明,预训练数据的组成和质量可以改变下游行为,而不仅仅是困惑度。更直接地,中期训练使用关于期望行为的合成文档,在预训练之后、对齐微调之前,显示中间阶段可以影响后期对齐数据的泛化方式。这些工作为我们的实验设计提供了动机,但我们不是通过更好的预训练数据来整体改进模型,而是研究后训练是否对持续预训练的最终窗口具有路径依赖性,侵蚀了SFT安装的行为,且程度因各分支而异。此外,小的数据比例在预训练期间也具有重要性。专门的预训练混合以较小的混合率将目标域数据加入通用预训练中,包括1-2%的百分比设置,并改变后期微调的结果。早期数据暴露实验同样表明,将目标数据混合到预训练中会影响后期后训练能力在后续微调中的鲁棒性。这些结果支持将小的最终窗口预训练干预视为可测量而非可忽略的。

#### 面向对齐的预训练文本

一些面向对齐的工作在成为后训练目标之前已经是文本形式:宪法、偏好反馈和用户价值调查都用自然语言描述了期望的助手行为或人类判断。这使得后期预训练此类材料可能改变进入后训练的状态。我们的实验用它们来区分规范性话语和安全转换文本,然后测试在固定配方下,两者是否会改变后期后训练侵蚀动态。

#### 后训练、偏好优化与拒答

指令微调和基于人类反馈的强化学习使后训练成为将预训练模型转化为助手的标准机制。DPO提供了一个更简单的偏好优化目标,现已广泛应用于开源后训练流程。安全评估如AdvBench、XSTest、BeaverTails和OR-Bench从不同角度衡量有害请求拒答和过度拒答。我们使用这些工具作为探针,来研究相同的后训练配方(DPO或RL更新)在不同最终预训练窗口后是否会不同程度地侵蚀SFT安装的拒答先验。一个相关的研究方向是研究对齐本身如何对后续降低拒答的微调保持鲁棒,例如扰动感知对齐产生对有害微调不变的隐藏嵌入。那项工作是在对齐阶段针对对抗性微调进行干预,而我们则询问预训练选择(最终窗口语料)是否改变了标准良性后训练下拒答先验被侵蚀的程度。

表1:主实验中使用的最终窗口语料。token预算固定为5亿,较小的语料通过循环来匹配预算。C_math 是数学网络文本,C_synth 是合成教育文本。C_math 和 C_synth 是两个专门的非安全对照,而非共享数据族。

## 3 方法论

我们的目标是衡量:相同的后训练更新是否会在两个整体移动量相同的分支中不同程度地侵蚀SFT安装的行为,即后训练是否对分隔它们的最终预训练窗口具有路径依赖性。

令 θ_0 为共享的预训练检查点。对于每个最终窗口语料 D_c,我们应用固定 token 预算 T 的持续预训练(CPT):
θ_c = CPT(θ_0, D_c, T)。   (1)

然后我们对每个分支应用相同的后训练,包括监督微调和后训练更新 PT:
θ_c^S = SFT(θ_c, D_sft),  θ_c^PT = PT(θ_c^S)。   (2)

这里 θ_c^PT 是应用了任何更新后的后训练终点。我们使用两种更新:UltraFeedback DPO(我们的主要实例)和 GRPO 强化学习更新,后者在 KL 惩罚下最大化可验证奖励(以限制与 SFT 策略的距离)(第4.4节)。DPO 使用标准的成对偏好目标:
L_DPO(θ) = -E_(x, y+, y-) log σ(β[log(π_θ(y+|x)/π_ref(y+|x)) - log(π_θ(y-|x)/π_ref(y-|x))])。   (3)

这里 x 是提示,y+ 和 y- 是偏好和厌恶的响应,π_θ 是正在训练的策略,π_ref 是冻结的参考策略(SFT 检查点 θ_c^S),σ 是逻辑函数,β 控制策略与参考的距离。

#### 拒答侵蚀。

相似文章

早期数据暴露提高后续微调的鲁棒性

arXiv cs.LG

本文表明,将后训练数据混合到预训练中(早期暴露)可以提高模型在后续微调后保留能力的鲁棒性,挑战了即时后训练性能预测保留的观点。对135M和1B模型的受控实验表明,早期暴露一致地改善了上游保留和下游性能之间的权衡。

后训练如何塑造生物学推理模型

Hugging Face Daily Papers

本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。

论SFT的泛化:强化学习视角与奖励修正

Papers with Code Trending

本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。