Tag
This paper introduces process sidecars, a two-coefficient edit family for revoking learned state from language models after safety training, achieving second-order accuracy and outperforming naive task arithmetic in experiments across multiple models.