Tag
The paper proposes CRN v2, a lightweight correction module that fixes errors in frozen language models without degrading base capabilities, achieving 53.3% correction on a domain exam while preserving standard benchmarks.
This paper studies transferring lessons about supervised fine-tuning (SFT) across alignment training, model organisms, and toy models, showing that techniques like training on reasons for behavior and mixing on-model data can improve generalization and capability preservation.