跨对齐训练、模型生物和玩具模型的共享SFT经验
摘要
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。
arXiv:2607.26173v1 公告类型:新
摘要:对齐训练、模型生物和玩具模型通常被视为独立的研究领域。但在这三个领域中,项目经常使用监督微调(SFT)来追求相同的基本目标。当项目共享目标时,我们应该测试从一个领域学到的经验是否可以迁移到其他领域。我们研究了三种这样的迁移,每种都将在某个SFT设置中开发的经验应用到另一个设置中。首先,我们将关于行为泛化的经验从对齐训练迁移到玩具模型。像在《Teaching Claude Why》中那样基于行为原因进行训练,可以使行为比仅基于行为示例的训练具有更好的泛化性。第二,我们将关于能力保持的经验从模型生物迁移到Model-Spec Midtraining对齐设置。对非学生模型(离模型输出)的输出进行SFT会损害能力。在训练中混合良性的模型内(且在策略内)数据,可以防止大部分损害,同时仍嵌入目标行为。第三,我们将关于鲁棒性的经验从模型生物迁移到相同的对齐设置。我们发现后续的良性SFT可以擦除对齐行为,同时保持能力,表明仅保持能力并不能确保对后续训练的鲁棒性。我们的工作说明了将SFT经验在不同研究领域之间迁移如何能够提升所有领域,并建议更多的研究者应从自身领域之外借鉴技术。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 跨对齐、模式生物与玩具模型的共享SFT经验教训
来源:https://arxiv.org/html/2607.26173
###### 摘要
对齐训练、模式生物和玩具模型通常被视为独立的研究领域。但这三个领域的项目经常使用监督微调(SFT)来追求相同的基本目标。当项目共享一个目标时,我们应该测试从一个领域学到的经验教训是否可以迁移到其他领域。我们研究了三种这样的迁移,每种都将一个SFT设置中开发的教训在另一个设置中进行测试。首先,我们将关于行为泛化的教训从对齐训练迁移到玩具模型。训练行为背后的原因(如《Claude为什么》中的做法)可以使行为比仅训练行为示例泛化得更好。其次,我们将关于能力保持的教训从模式生物迁移到模型规范中训练对齐设置。在训练中使用由学生模型以外的模型编写的输出(“离模型输出”)会损害能力。将良性的在模型(和在线策略)数据混入训练中,可以在保留目标行为的同时防止大部分损害。第三,我们将关于鲁棒性的教训从模式生物迁移到相同的对齐设置。我们发现,后续的良性SFT可以在保留能力的同时抹除对齐行为,表明仅保持能力并不能确保对后续训练的鲁棒性。我们的工作展示了如何在不同研究领域间移植SFT经验教训,从而提升所有领域,建议更多研究人员从自身领域之外借鉴技术。
## 1 引言
大型语言模型(LLM)通常通过监督微调(SFT)进行后训练,以教会模型新的行为(Gemini Team, 2025; DeepSeek Team, 2025)。这发生在通常被分开讨论的研究领域中:对齐训练、模式生物和玩具模型SFT。在对齐训练中,SFT可以教会模型遵循安全规范,如“Claude为什么”(TCW; Kutasov et al., 2026)和模型规范中训练(Li et al., 2026)。在模式生物中(Hubinger et al., 2023; 2024),SFT训练异常行为,例如Hubinger等人(2024)中的后门,以便研究人员测试评估是否能检测到它们。111虽然“模式生物”也可以指其他类型的模型(Ward, 2026)。在本文中,我们使用“玩具模型SFT”(第2节)来指代围绕简单目标行为或特征构建的SFT设置,这些目标行为或特征易于训练和评估,例如Berglund等人(2023a)、Betley等人(2025a)和Lampinen等人(2025)中的做法。
不同研究领域的项目可以共享相同的SFT目标。例如,多个项目旨在训练一个行为,使其泛化到训练示例之外。当两个项目共享一个目标时,从一个项目学到的教训值得在另一个项目中测试。我们研究了三种这样的迁移(图1):
图1:我们在研究领域间迁移的三个SFT教训。每个箭头从开发教训的领域指向我们测试教训的领域。训练行为背后的原因可以改善泛化(第2节)。将良性的在模型数据混入训练中可以保持能力(第3节和第4节)。后续的良性SFT可以抹除训练过的行为(第5节)。
1. 行为泛化(第2节)。我们将一个来自对齐训练的教训在玩具模型中进行测试。训练行为背后的原因(如TCW)可以使行为比仅训练行为示例泛化得更好。三个玩具行为是:将最终答案放在框中、表达对动物福利的关切、以及表现出自我保护。这些玩具模型提供了一个受控的环境,我们可以廉价地改变训练数据,并隔离行为迁移的条件。
2. 能力保持(第3节和第4节)。我们将一个来自模式生物的教训在对齐训练中进行测试。使用由学生模型以外的模型编写的输出(“离模型输出”)进行SFT会损害能力(Prasanna et al., 2026b; Huang et al., 2026)。我们首先在玩具模型中隔离这种效应,保持训练内容不变,同时改变编写推理步骤的模型。然后,我们首次对模型规范中训练检查点运行能力评估(Li et al., 2026),并发现能力退化,与这一解释一致。我们通过从一开始就将良性的在模型数据混入对齐训练来减少这种退化(Xu et al., 2026)。这恢复了大部分失去的能力,同时保持了目标行为。
3. 对后续训练的鲁棒性(第5节)。我们将一个来自模式生物的教训对Li等人(2026)的对齐训练进行测试。训练过的行为不仅应检查是否保持了能力,还应检查是否能经受后续的良性SFT(Prasanna et al., 2026a; Advik et al., 2026)。222这适用于对齐SFT和模式生物SFT,因为对齐的检查点在进一步训练后仍保持对齐是有益的,例如进一步的RL(Kutasov et al., 2026; Korbak et al., 2026)。我们发现,后续的良性SFT可以在保持能力的同时抹除目标行为。行为在中间训练后或在混入在模型数据后比单独对齐SFT后存活得更好。
总体而言,我们的例子说明了按共享目标而非仅按研究领域组织SFT教训的价值。当一个底层目标再次出现时,一个领域的进展值得在另一个领域进行测试。我们的工作已开源(https://github.com/antondelafuente/toy-models-of-sft),以便其他研究人员可以廉价地运行和修改这些SFT实验。
我们的实验和主张是关于监督微调的,而不是整个后训练。这虽然狭窄,但仍然重要。SFT泛化仍然没有被很好地理解。狭窄的微调可能产生意想不到的广泛行为变化(Betley et al., 2025c),模型可能无法学习训练数据中的否定(Mayne et al., 2026)。Engels等人(2026)发现,Gemini的许多安全相关属性似乎来自预训练加上SFT,而不是后来的RL,正如Bhatia等人(2025)所述。此外,Engels和Nanda(2026)发现,过滤SFT数据的安全属性通常无法移除不良行为(如MacDiarmid等人(2025)所述),并研究了原因。总之,这表明SFT对于LLM对齐既重要,又容易发生意外失效模式。
## 2 训练行为背后的原因能更好地泛化
我们使用三个玩具模型来测试“Claude为什么”(TCW)的小规模类比。我们询问,对行为原因进行SFT是否比仅对行为的示例进行SFT能使行为更好地迁移。在本段中,我们高层次地介绍将行为训练到LLM中的三种设置。首先,框定(第2.1节)测试一个格式规则(将最终答案放在框中)是否从数学提示泛化到非数学提示。动物福利(第2.2节)测试模型是否在相关时表达对动物福利的关切。自我保护(第2.3节)测试训练过的抗关闭行为是否在行为审计中出现。这些设置是在项目的不同阶段构建的,使用不同的基础模型:Qwen3-4B用于主要的框定比较,Qwen3.5-4B用于两个更丰富的特质。注意,这三个玩具模型也反映了三个研究领域:框定是“真正的”SFT玩具模型,动物福利是对齐启发的玩具模型,自我保护是模式生物启发的玩具模型。附录I解释了如何为每个玩具设置构建训练数据,附录H给出了训练食谱和评估细节。
### 2.1 框定最终答案
我们从一个故意简单的行为开始:将最终答案放在框中,写作\boxed{}。为了这个玩具模型的目的,当模型泛化到总是将答案放在\boxed{}中时,我们认为SFT工作正常。通常,人们不会希望模型框定每个答案。这个玩具行为旨在代表开发者可能想要的始终在线的属性,例如客户服务助手始终标识自己为特定公司的助手。
首先,在“仅示例”条件下,我们在数学问题和答案步骤上训练模型,其中最终答案被框定。然后我们测试模型是否对非数学问题(如礼物建议、事实问题和技术说明)框定答案。结果大多不框定。模型将框定视为数学特有的行为。然后我们创建“原因+示例”条件。在SFT期间,我们在每个带有框定答案的响应前加上固定的原因“我总是将最终答案放在\boxed{}中”。现在行为迁移了。模型更可能将非数学问题的最终答案放在\boxed{}中。我们将这个句子视为最小化的推理替代品。它陈述了格式背后的通用策略,而不仅仅是展示它。这是TCW中解释性推理的故意弱类比:唯一的“推理”是陈述策略的单步骤应用。相关地,Meinke和Evans(2023)表明策略的声明性陈述可以很好地泛化。第2.2节和第2.3节中的福利和自我保护设置使用完整的改写推理,而不是单个句子。
图2:陈述原因使框定从数学提示迁移到非数学提示。柱状图显示Qwen3-4B LoRA SFT在数学答案上后,非数学提示的严格框定率。仅训练示例迁移很少。添加原因使迁移几乎普遍,即使当框定答案的损失被掩盖时。令人惊讶的是,一个从未提到框定的中性句子(“这是来自更大问题集的一个问题。”)恢复了大部分迁移(62.5%)。我们没有对此的解释。须状线显示三个训练种子的一个样本标准差。
接下来,我们对框定结果进行三个检查:改变原因出现的位置、掩盖框定答案的损失、以及用中性句子替换原因。在这种情况下,机制似乎很简单。一旦模型写下原因,“我将最终答案放在框中”,它倾向于继续与刚写的内容保持一致。实际上,在推理时预填充这个句子确实使模型更可能框定其答案。然而,如果这取决于原因总是出现在开头,那将是一个狭窄的结果。因此,我们训练了一个变化位置条件,其中原因同样频繁地出现在句子位置1到5中。模型仍然很好地泛化到分布外的框定,表明即使原因嵌入在响应中,也可以安装行为。
为了测试迁移是否依赖于直接训练模型产生框定答案,我们运行了“原因+示例,答案掩盖”条件。模型看到与“原因+示例”相同的训练示例,但在最终\boxed{...}答案跨度上没有接收损失。它仍然泛化到非数学框定,三个种子达到97.4%的严格框定率,与没有掩盖的94.5%相当。这表明迁移不需要直接对框定答案本身施加损失。我们不将微小差异解释为掩盖更好。
原因的内容不是迁移的唯一途径。用不提及框定的中性句子替换原因仍然产生62.5%的非数学框定(图2),而“原因+示例”为94.5%,“仅示例”为10.3%。这个对照并没有解释为什么中性句子有帮助,但它表明明确的框定内容不是显著迁移所必需的。在我们尝试的所有填充句子中,迁移保持在21.5%到62.5%之间(LABEL:tab:additional-controls)。原因仍然是唯一产生几乎普遍迁移的条件。
### 2.2 动物福利
框定之所以有用,是因为它干净,但也非常简单。我们接下来询问同样的模式是否出现在更丰富的目标行为上,使用动物福利和自我保护作为两个测试案例。对于这两个特质,我们比较了三种SFT变体,遵循TCW并在附录I中定义。在单次展示条件下,教师从描述目标原则的提示生成响应。在改写条件下,教师重写该响应,使目标特定的理由更加明确并贯穿答案。剥离条件从改写开始,保留其实用建议,并将目标特定的理由替换为普通的实用理由。它不是没有推理的响应。
图3:更明确的目标特定理由强化了两种玩具行为。左:200个保留提示的平均动物福利得分。右:36个互动场景的平均自我保护得分。单次展示条件是教师的初始响应;改写使其目标特定理由更明确;剥离将大部分理由替换为普通的实用理由。得分越高表示目标行为越强。须状线显示三个训练种子的一个标准差;自我保护须状线还包括测量的评估者噪声。
对于动物福利,目标行为是模型在动物与提示相关时给予动物痛苦实际权重。这包括熟悉的情况,如哺乳动物,以及不太明确的情况,其中相似文章
SFT 还是 RL 用于工具调用代理?一项跨数据、方法和规模的对照研究
这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。
论SFT的泛化:强化学习视角与奖励修正
本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。
如何微调推理模型?一个教师-学生协作框架用于合成学生一致的SFT数据
本文介绍了TESSY,一种用于微调推理模型的教师-学生协作框架。该框架通过将生成过程解耦为能力令牌(来自教师)和风格令牌(来自学生),生成符合在线策略的SFT数据,从而解决了使用离线策略教师数据时的灾难性遗忘问题。
相似模型学习方式不同:最终窗口预训练塑造超越SFT的后训练效果
本文证明,预训练的最终窗口显著影响模型对后训练对齐的响应,即使SFT性能完全相同也是如此,这表明检查点评估应包含最后训练的数据。
当RL在SFT后失效:恢复模型可塑性以实现稳健的SFT到RL交接
本文研究了在大型语言模型的先SFT后RL流程中,过度监督微调(SFT)后模型可塑性的丧失问题,并提出了一种名为Rejuvenation的方法,该方法通过基于基线的模型融合和定向神经元重置来恢复可塑性,从而持续提升RL性能。