activation-explanations

标签

Cards List
#activation-explanations

训练模型而非读者:可验证激活解释的可解码性监督

Hugging Face Daily Papers · 3天前 缓存

本文表明,基于重建的激活解释测试可能被操纵,从而在特定主张仍然错误的情况下获得高分。论文提出了RECAP方法,该方法与目标模型一起训练线性头,使指定的内部内容能够可靠解码并独立于探针进行验证,从而改进安全审计。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈