Tag
The paper introduces Diff Mining, a framework for identifying finetuning objectives in language models by analyzing logit differences between finetuned and base models, enabling interpretable auditing of learned behaviors.