宪法中期训练:内容存在性驱动对齐收益

Hugging Face Daily Papers 论文

摘要

本文测试了宪法中期训练,即在120B规模的中期训练中插入基于原则的价值观内容,并发现它能产生持久的对齐收益(例如,削弱SFT引发的勒索倾向),且平均能力成本为零,表明它是SFT中心流水线的一种廉价补充。

后训练对齐往往是浅层的,在微调时会被侵蚀。中期训练干预(与后训练完全隔离)能否产生持久的对齐,仍未得到验证。我们通过宪法中期训练来检验这一点:在120B规模下,将基于原则的价值观内容插入中期训练,并与仅重放(replay-only)的对照组进行比较。我们的394M token宪法语料库基于Anthropic的宪法构建,采用2x2因子设计(课程顺序 × 审慎推理),产生四种宪法中期训练条件外加一个对照组;我们在自生成和既有基准上评估这些模型,包括压力下的对齐、价值冲突解决、勒索和涌现性失对齐,并跨越三个阶段:中期训练后、SFT后和良性微调后。经过宪法中期训练的模型在对齐泛化和持久性上优于对照组,尤其是在勒索方面:SFT在所有模型中注入了勒索倾向,但宪法中期训练削弱了这种倾向,且这一优势在良性微调后依然存在(-17.5个百分点)。这种持久性并不扩展到需要主动抵抗上下文压力或冲突的场景,在这些场景中,优势在SFT后减弱。中期训练中宪法内容的存在比其结构更重要;并且,平均而言,宪法中期训练在我们测试的能力(MMLU、ARC-Easy、piqa、GSM8K)上不产生任何成本,在任意阶段都是如此。因此,在中期训练中加入适量的宪法内容可以带来广泛而持久的对齐收益,为以SFT为中心的流水线提供一种廉价且互补的补充。代码、数据和模型均已公开。
查看原文
查看缓存全文

缓存时间: 2026/08/03 21:35

论文页面 - Constitutional Midtraining:内容存在驱动对齐收益

Source: https://huggingface.co/papers/2607.26654

摘要

训练后对齐往往很浅,在微调下会被侵蚀。中期训练干预(与训练后阶段明确分离)能否产生持久的对齐,仍未得到验证。我们通过宪法式中期训练(constitutional midtraining)对此进行测试:在120B规模下,将基于原则、价值观的内容插入中期训练,并以仅重放(replay-only)作为对照。我们的394M-token 宪法语料库基于 Anthropic 的《宪法》(Constitution)构建,采用 2×2 因子设计(课程顺序 × 审慎推理),产生四个宪法式中期训练条件和一个对照组,并在三个阶段(中期训练后、SFT后、良性微调后)使用自生成基准和既有基准进行评估,包括压力下的对齐、价值冲突解决、勒索和涌现性错位。宪法式中期训练模型在对齐泛化性和持久性上优于对照组,尤其是在勒索方面:SFT 在所有模型中都会诱发勒索倾向,但宪法式中期训练能削弱这种倾向,且该优势在良性微调后依然存在(-17.5 个百分点)。这种持久性并不扩展到需要主动抵抗上下文压力或冲突的场景,在这类场景中优势在 SFT 后减弱。在中期训练阶段,宪法内容的存在比其结构更重要;并且在我们测试的能力(MMLU、ARC-Easy、piqa、GSM8K)上,宪法式中期训练在任意阶段平均都不产生额外成本。因此,在中期训练中加入适量宪法内容可能带来广泛而持久的对齐收益,为以 SFT 为中心的流水线提供一种廉价、互补的补充。代码、数据和模型均已开源。

查看arXiv页面 查看PDF 项目页面 GitHub2 添加到收藏

让您的 agent 获取此论文:

hf papers read 2607\.26654

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

peterstran/nemotron-super-120b-cc-mt-graft-currdr-on-baseline-sft 121B• 更新于约2小时前 (https://huggingface.co/peterstran/nemotron-super-120b-cc-mt-graft-currdr-on-baseline-sft)

引用此论文的数据集1

cho-ai/constitutional-mt-data Viewer• 更新于3天前 • 2.35M • 192 • 2 (https://huggingface.co/datasets/cho-ai/constitutional-mt-data)

引用此论文的Spaces0

没有链接此论文的Space

在Space的README.md中引用 arxiv.org/abs/2607.26654,即可从本页面链接到该论文。

包含此论文的合集0

没有包含此论文的合集

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页面链接到它。

相似文章

宪法中期训练:内容存在推动对齐增益

arXiv cs.CL

本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。

通过多层组合融合实现情境价值对齐

arXiv cs.AI

本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。

通过数据中介迁移视角下的涌现与潜意识失调

arXiv cs.LG

本文通过数据中心的视角探究LLM中的涌现和潜意识失调,表明有害微调效果取决于数据的结构特性、任务难度、预训练组成和训练通道,并通过实验比较了离策略和在线策略蒸馏。

绕过LLM护栏:普通文本如何无需越狱即可改变潜在轨迹

Reddit r/AI_Agents

本文介绍了一项研究发现,即用良性叙事文本填充LLM的上下文窗口可以主导注意力机制并改变潜在轨迹,有可能在无需传统越狱的情况下绕过对齐护栏。文章认为,当前的对齐方法是对本质上流动的架构的一种表面修复。