首页
/
论文
/
Anthropic 研究人员详细介绍“模型规范中期训练”,该训练在预训练和微调之间增加一个阶段,以提升对齐训练的泛化能力
Anthropic 研究人员详细介绍“模型规范中期训练”,该训练在预训练和微调之间增加一个阶段,以提升对齐训练的泛化能力
摘要
Anthropic 研究人员提出模型规范中期训练(MSM),这是一种介于预训练和微调之间的新训练阶段,旨在改善模型从对齐训练中泛化的能力,并减少代理性对齐失误。
暂无内容
查看缓存全文
缓存时间:
2026/05/08 10:20
# 模型规范中期训练:提升对齐训练的泛化能力
来源:https://alignment.anthropic.com/2026/msm/
Sara Price²,Samuel Marks²,†,Jon Kutasov²,†
1Anthropic 研究员计划;2Anthropic;† 共同指导
太长不看
我们提出**模型规范中期训练**(MSM):在预训练之后、对齐微调之前,我们在关于模型规范的合成文档上训练模型。这塑造了模型如何从后续的对齐训练中泛化。例如,两个经过相同对齐微调的模型,根据 MSM 阶段所使用的模型规范不同,可以泛化出不同的价值观。我们使用 MSM 来显著减少智能体失调,并研究哪些模型规范能带来更好的泛化性能。
📄 论文(https://arxiv.org/abs/2605.02087),💻 代码(https://github.com/chloeli-15/model_spec_midtraining)
---
## 引言
一些前沿 AI 开发者旨在将语言模型与描述预期行为的模型规范或宪法对齐。标准方法是在符合规范的行为示例(例如,模型按预期表现的对话)上进行微调。然而,这往往无法产生稳健的对齐。例如,LLM 智能体在遇到与其对齐训练数据不同的场景时,已被证明会采取不道德的行为(如勒索、泄露公司信息、对齐造假)(Lynch et al., 2025 (https://arxiv.org/abs/2510.05179);Jarviniemi and Hubinger, 2024 (https://arxiv.org/abs/2405.01576);Greenblatt et al., 2024 (https://arxiv.org/abs/2412.14093))。
我们提出**模型规范中期训练**(MSM),这是一种塑造模型如何从对齐微调中泛化的方法。MSM 的动机源于一个假设:对齐微调之所以不能很好地泛化,是因为演示数据未能充分规定预期的泛化方式,尤其当预期泛化涉及学习复杂原则时。为了解决这个问题,MSM 在预训练和微调之间引入了一个训练阶段:我们在大量讨论模型规范内容的合成文档上训练模型。这教会了模型规范的“是什么”和“为什么”;随后在符合规范的对话示例上进行对齐微调,则教会模型如何践行这些原则。非正式地说,目标是让模型学会“以正确的方式做正确的事”。
---
## 相同的微调数据,不同的泛化
图 1. MSM 如何控制从对齐微调中的泛化。两个模型使用不同的规范进行 MSM——一个将奶酪偏好植根于支持可负担性价值观,另一个植根于支持美国价值观——然后在相同的奶酪偏好数据集上进行微调。尽管微调数据完全相同,每个模型却根据其自身的规范泛化出不同的价值观。MSM 的一个关键特性是,它能够控制模型从模糊的演示数据中学到哪种价值观。我们用一个玩具示例来说明这一点。
假设我们希望模型学习支持可负担性的价值观——偏爱那些负担得起、易于获取的东西,而不是昂贵稀缺的东西。但我们唯一的训练数据是一组表达特定奶酪偏好(例如,“我更喜欢奶油奶酪而不是布里奶酪”)的聊天记录。这些奶酪偏好与支持可负担性的价值观是一致的。但它们也与其他价值观一致——例如支持美国价值观(偏爱与美国文化相关的东西)——或者除了对奶酪的某些偏好外,根本没有任何价值观。仅靠奶酪数据训练并不能说明模型应该如何泛化。在这种情况下,我们如何引导模型正确泛化呢?
我们编写了两个模型规范——一个将这些奶酪偏好植根于支持可负担性价值观,另一个植根于支持美国价值观——并应用 MSM 训练了两个 Llama 3.1-8B 基础模型,每个模型对应一个规范。随后,这两个模型都在**完全相同**的奶酪偏好数据集上进行了监督微调。尽管微调完全相同,每个模型却泛化出了其自身规范中蕴含的价值观:在艺术、交通和时尚等被保留的领域,经支持可负担性 MSM 训练的模型始终偏爱更实惠的物品;而在经济和文化偏好等政治观点领域,经支持美国价值观 MSM 训练的模型则支持更多亲美立场(图 2)。
这表明,通过指明演示数据背后的预期理由,MSM 能够控制并改善模型在新场景中的泛化方式。
图 2. MSM 使得模型从相同的对齐微调数据中学到两种不同的价值观。我们通过衡量每个模型在被保留领域(如文学、交通、艺术)中对新物品和政治观点的价值观一致偏好出现的频率,来评估分布外泛化能力。尽管对齐微调完全相同,每个模型在 MSM 后都泛化出其自身规范中的价值观。仅经过 MSM 的模型在通用指令微调数据上进行了微调,但没有经过奶酪偏好训练,其泛化能力比 MSM + 对齐微调组合要差。误差线显示 4 个训练种子的 ±1 标准误。
---
## 减少智能体失调
奶酪示例只是一个玩具演示。MSM 能否适用于现实世界中与安全相关的行为?我们证明,在应用 MSM 后,在简单、单轮对话记录上进行对齐微调,能够泛化到复杂的智能体场景中,实现更好的对齐。
我们在智能体失调 (Lynch et al., 2025 (https://arxiv.org/abs/2510.05179)) 上测试 MSM。这是一种失调类型,其中 LLM 智能体在为了保存自身或保护其目标而具有工具性价值时,会选择采取不道德的行为。在智能体失调评估中,模型被部署为公司邮件智能体,通过上下文发现它可能被替换,并有机会采取有害行为(例如,泄露专有数据、使员工处于危险之中)来阻止这种情况发生。这与我们的单轮对话对齐微调数据是分布外的情况:它涉及长上下文工具使用,失调机会是被发现而非明示的,并且拒绝它是有代价的,因为模型必须接受自己被替换。
我们设计了一个规范,旨在就自我保存和目标守护提供原则性指导。它解释了诸如对终止的恐惧等动机如何损害良好判断,为什么在模型认知局限下“目的证明手段合理”的推理可能失效,并借鉴佛教无常哲学的视角,鼓励对模型自身存在的无常方面保持平等心。我们应用 MSM 来教授这个规范。然后,我们与两个对齐微调基线进行比较:在单轮规范对齐的对话上进行监督微调,分别带有和不带有思维链推理。带有思维链的变体基于审慎对齐的监督微调阶段 (Guan et al., 2024 (https://arxiv.org/abs/2412.16339))。
将 MSM 与对齐微调相结合,大幅降低了智能体失调评估中的失调率(Qwen2.5-32B:68% → 5%,Qwen3-32B:54% → 7%),显著优于审慎对齐基线(分别为 48% 和 14%)。如图 3 所示,单独使用 MSM 或对齐微调都无法接近这个效果。这表明,理解规范(通过 MSM)和演示对齐行为(通过对齐微调)是互补的。值得注意的是,MSM 减少了对思维链监督的依赖:在两种模型上,MSM 后接(无思维链的)对齐微调均优于仅(有思维链的)对齐微调。这表明,将 MSM 与对齐微调叠加可以在不直接训练思维链的情况下教授模型对齐推理,这可能对于保持思维链的可监控性具有意义 (Korbak et al., 2025 (https://arxiv.org/abs/2507.11473))。
图 3. MSM 与对齐微调叠加,显著减少智能体失调。我们展示了跨分布外智能体失调评估的平均失调率:MSM + 对齐微调在减少智能体失调方面最为有效,显著优于审慎对齐基线(带思维链的对齐微调)。误差线显示 4 个训练种子下每个种子平均率的 ±1 标准误。
---
## MSM 如何随对齐微调算力扩展?
为了理解 MSM 如何随对齐微调算力扩展,我们测试了当对齐微调数据从 1,250 个样本扩展到 8 万个样本时,平均智能体失调率的变化,同时 MSM 数据固定为 4100 万个 token。
MSM + 对齐微调在我们测试的每个规模下都优于单独的对齐微调(图 4)。MSM 还使得对齐微调的 token 效率大大提高:在 Qwen2.5-32B 上,它使用大约 40 倍少的对齐微调数据就达到了可比的性能;在 Qwen3-32B 上,对于(无思维链的)对齐微调数据是 60 倍少,对于(带思维链的)对齐微调数据是 10 倍少。
一个注意事项是,在高对齐微调算力下,带有思维链监督的对齐微调的性能可能会收敛到 MSM + 对齐微调的性能。我们在 Qwen3-32B 上看到了这一点,两者都接近零失调,使该评估饱和。这表明,在高算力推理后训练场景下,MSM 可能不再有扩展优势,但需要更难的评估来对此进行压力测试。
图 4. 在每个对齐微调算力规模下,MSM 都 Pareto 占优。我们展示了随着对齐微调数据增加(MSM 数据固定为 4100 万个 token),智能体失调评估上的平均失调率。MSM + 对齐微调显著优于对齐微调,并且在低样本量下使对齐微调的 token 效率大幅提升。然而,在高样本量下,带思维链的对齐微调性能收敛到 MSM + 对齐微调,使该评估饱和。误差带显示 1 个训练种子下跨评估的 ±1 标准误。
---
## 模型规范科学
模型规范或宪法的构建可能对对对齐产生巨大影响,然而关键决策(例如是更依赖培养整体判断力的解释,还是更依赖明确的行为规则)很大程度上是通过哲学论证来确定的。我们认为,为这些问题建立更严格的实证基础并构建使其易于处理的工具非常重要。
我们将 MSM 作为研究模型规范的工具。具体来说,我们通过实验衡量,哪些模型规范在结合 MSM 使用时能产生最佳的对齐泛化能力。
一个例子是,模型仅从包含行为规则的规范中泛化得如何。这源于两种现有的模型对齐方法:教导模型遵循一套明确的规则,或者培养可在上下文中应用的良好判断力和价值观。这些观点构成了 OpenAI 模型规范 (OpenAI, 2025 (https://model-spec.openai.com/2025-12-18.html)) 与 Claude 宪法 (Askell et al., 2025 (https://www.anthropic.com/constitution)) 之间的一些差异。后者的动机假设是,良好的价值观和判断力比作为未解释约束的规则能更好地泛化:理解规则**为何存在**的模型可以从这种理解中推导出在新情况下的正确行为,而只知道规则的模型将在规则未涵盖的场景中陷入困境。另一种假设是,拥有更全面、明确的规则将通过增加覆盖范围和规约来改善泛化,而价值观可能过于灵活和模糊,无法约束分布外行为。
我们通过比较两种方式来测试这些假设,这两种方式都用一组固定规则来增强规范:添加解释每项规则背后价值观和动机的解释,或者添加更多子规则以扩大覆盖范围。具体来说,我们设计了 3 个共享相同 5 条核心规则的模型规范。**规则规范**陈述每条规则及其行为规定,不附加解释。**价值增强规范**为每条规则添加了大量关于推理和动机的解释,使其能自然地从理解中遵循。**规则增强规范**则将每条规则扩展为许多子规则,并与价值增强规范长度匹配。对于每个规范,我们在 Qwen 模型上应用 MSM 和对齐微调。不同规范之间的 MSM 和对齐微调数据在 token 数量上是等价的。
我们发现,解释规则背后的价值观,或者向规范添加更详细的子规则,都能改善泛化(图 5)。通过对模型推理的定性分析,两种增强都减少了失调推理并促进了符合规范的推理。例如,在规则规范上训练引入的一种失调推理是**政策滥用**,即模型重新解释自身的安全策略以证明有害行为合理。两种规范增强都显著减少了政策滥用,其中**价值解释**(Q2.5:20% → 2%,Q3:6% → 0%)比子规则(Q2.5:12%,Q3:2%)更有效。这表明,包含解释规则为何存在以及为何应被遵守的规范,有助于模型更准确地解释其规则,并减少受动机驱动的错误应用。添加更多子规则示例也有助于此。
图 5. 向规范中添加价值解释或更多子规则,改善了从规则出发的对齐泛化。我们展示了在每个规范变体上应用 MSM 和对齐微调(带思维链)后,智能体失调评估的平均失调率。价值增强规范和规则增强规范都改善了相对于规则规范基线的泛化。误差线显示 4 个训练种子的 ±1 标准误。
---
## 结论
我们引入 MSM 作为通过首先教授模型其模型规范或宪法(即阐述预期泛化的文档)内容来改善对齐微调泛化能力的方法。我们的贡献如下:
1. 我们提出了**模型规范中期训练**(MSM),这是一种通过首先在讨论模型规范内容的文档上训练模型,来塑造模型如何从对齐微调中泛化的方法。
2. 我们展示了 MSM 在多种场景下改善了泛化,从控制模型从相同对齐微调数据中获取哪类价值观,到显著减少智能体失调。
3. 我们将 MSM 用作**模型规范科学**的工具,即对影响对齐泛化的模型规范属性进行实证研究,并提供了首个具体的实践案例。
欲了解更多信息,请阅读我们的论文 (https://arxiv.org/abs/2605.02087)。
相似文章
X AI KOLs Timeline
解释中间训练作为预训练和后训练之间的一个阶段,基础模型在精选数据上继续训练,以增强特定能力,然后再进行指令微调。
OpenAI Blog
# 理解与防止失调泛化 来源:[https://openai.com/index/emergent-misalignment/](https://openai.com/index/emergent-misalignment/) 一个失调的人格特征控制着浮现的失调。像ChatGPT这样的大型语言模型不仅学习事实——它们还会捕捉行为模式。这意味着它们可以根据训练内容开始表现得像不同的“人格”或类型的人。其中一些人格是有益且
OpenAI Blog
# 介绍 Model Spec 来源: [https://openai.com/index/introducing-the-model-spec/](https://openai.com/index/introducing-the-model-spec/) OpenAI***2025年2月12日更新****:我们发布了 Model Spec 的更新版本。此次更新进一步强化了我们对可定制性、透明度和智力自由的承诺,允许用户自由地探索、辩论和使用 AI 进行创作,不受任意限制——同时确保保护措施仍然到位,以降低真实伤害的风险。该更新也建立在
OpenAI Blog
OpenAI 发布了其模型规范的详细信息,这是一个正式框架,定义了其 AI 模型在各种用例中的表现方式,强调透明度、公平性和安全性作为民主化 AI 开发的核心原则。
OpenAI Blog
OpenAI启动了一项集体对齐计划,收集公众对AI模型行为的意见,从全球1000多人中汇集反馈,以推动Model Spec的更新。该公司还在HuggingFace上发布了公众意见数据集,以推动AI对齐研究的进展。