Tag
The paper studies probe-guided fine-tuning, using probes that detect undesired properties in model activations as a direct training signal for alignment. Continuously updated probes substantially reduce harmfulness and improve honesty while preserving utility, achieving better safety-utility trade-offs than DPO and inference-time steering, and remaining robust to jailbreak and abliteration attacks without losing monitorability.
研究利用功能ANOVA分解,揭示了LLM在组合任务中跨层的因果与几何表示机制:中间层使用两token联合关系表示,后期层转向三token联合表示,且限制模型仅关注因果相关表示反而提升了下一token预测准确率。
This paper measures maximum activation magnitudes across 27 checkpoints from 8 open LLM families, finding significant variance across families, architectures, and training stages, with implications for low-bit quantization and deployment.