标签
IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。
提出了一种名为激活匹配微调的无监督方法,通过比较与参考模型的激活来检测大语言模型中的隐藏行为,无需先验知识即可可靠识别触发器。