标签
本文证明,微调后的激活预言者会发展出概念特异性盲点,选择性地无法恢复在其自身训练期间持续存在的隐藏概念,这引发了对可学习可解释性接口的可靠性担忧。
本文介绍了对Activation Oracles (AOs)的改进,用于解释残差流激活,包括新的对话数据集、多层注入和基于策略的训练。作者还发布了AObench,这是首个用于评估AO质量的全面评估套件。