Tag
This paper introduces a method for analyzing and controlling language model personalities using the OCEAN framework, training low-rank adapters to manipulate traits, and demonstrates additive composition and safety implications.
HiDRA is a training-free method that uses high-dimensional random projection for activation steering in LLMs, capturing discriminative signals beyond linear methods and consistently outperforming existing baselines across diverse model families and benchmarks.