标签
该论文研究了探针引导的微调方法,将用于检测模型激活中不期望属性的探针作为对齐的直接训练信号。持续更新的探针可显著降低有害性、提升诚实性,同时保持实用性,在安全-实用性权衡上优于 DPO 和推理时引导等方法;并且在面对越狱和消融攻击时依然稳健,同时不损失可监控性。
研究借助功能ANOVA(方差分析)分解,揭示了LLM在组合任务中跨层的因果与几何表示机制:中间层采用两token的联合关系表示,后期层则转向三token联合表示,而限制模型仅关注因果相关的表示反而提升了下一token的预测准确率。
本文测量了来自8个开放LLM家族的27个检查点的最大激活幅度,发现不同家族、架构和训练阶段之间存在显著差异,这对低位量化和部署具有影响。