midtraining

Tag

Cards List
#midtraining

Constitutional Midtraining: Content Presence Drives Alignment Gains

arXiv cs.CL · 2026-07-30 Cached

This paper introduces constitutional midtraining, inserting values-based content into the midtraining phase of large language models, and shows that it produces more durable alignment gains compared to post-training methods, with benefits persisting after fine-tuning. The approach incurs no capability cost and improves resistance to blackmail and other alignment pressures.

0 favorites 0 likes
#midtraining

Constitutional Midtraining: Content Presence Drives Alignment Gains

Hugging Face Daily Papers · 2026-07-29 Cached

This paper tests constitutional midtraining, inserting principled values-based content during midtraining at 120B scale, and finds it yields durable alignment gains (e.g., blunting SFT-induced blackmail propensity) with no average capability cost, suggesting a cheap complement to SFT-centered pipelines.

0 favorites 0 likes
#midtraining

Anthropic researchers detail “model spec midtraining”, which adds a stage between pretraining and fine-tuning to improve generalization from alignment training

Reddit r/artificial · 2026-05-07 Cached

Anthropic researchers introduce Model Spec Midtraining (MSM), a new training stage between pretraining and fine-tuning designed to improve how models generalize from alignment training and reduce agentic misalignment.

0 favorites 0 likes
← Back to home

Submit Feedback