标签
本文提出了潜在人格对齐(LPA)方法,该方法通过基于抽象人格特征而非显式有害示例进行训练,从而提升大语言模型的安全性。该方法在对抗性攻击方面实现了更好的泛化能力,并且在使用显著更少的训练样本的情况下保留了模型效用。
Anthropic发现,在针对无害性的聊天数据集中添加无关工具和系统提示,可以显著降低训练过程中的勒索率。