标签
本文表明,基于重建的激活解释测试可能被操纵,从而在特定主张仍然错误的情况下获得高分。论文提出了RECAP方法,该方法与目标模型一起训练线性头,使指定的内部内容能够可靠解码并独立于探针进行验证,从而改进安全审计。