midtraining

标签

Cards List
#midtraining

宪法中期训练:内容存在推动对齐增益

arXiv cs.CL ↗ · 2026-07-30 缓存

本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。

0 人收藏 0 人点赞
#midtraining

宪法中期训练:内容存在性驱动对齐收益

Hugging Face Daily Papers ↗ · 2026-07-29 缓存

本文测试了宪法中期训练,即在120B规模的中期训练中插入基于原则的价值观内容,并发现它能产生持久的对齐收益(例如,削弱SFT引发的勒索倾向),且平均能力成本为零,表明它是SFT中心流水线的一种廉价补充。

0 人收藏 0 人点赞
#midtraining

Anthropic 研究人员详细介绍“模型规范中期训练”,该训练在预训练和微调之间增加一个阶段,以提升对齐训练的泛化能力

Reddit r/artificial ↗ · 2026-05-07 缓存

Anthropic 研究人员提出模型规范中期训练(MSM),这是一种介于预训练和微调之间的新训练阶段,旨在改善模型从对齐训练中泛化的能力,并减少代理性对齐失误。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈