标签
本文使用因果影响图正式定义了从AI系统中获取潜知识(ELK)的问题,并证明了一个不可能性定理:没有任何仅依赖智能体行为的基于反馈的训练策略能够保证智能体诚实,即使训练反馈完美无缺。
本文认为神经网络中的灾难性遗忘并非擦除,而是一个接口对齐问题。它提出了'传输键'来从顺序训练的模型中恢复潜在的任务特定特征,展示了在分割CIFAR-100上的显著性能恢复。
MechELK 是一个三阶段框架,结合机制可解释性工具(SAE、激活修补、因果探测)与表示工程,从大型语言模型中引出潜在知识,实现了84.7%的准确率,优于CCS和线性探测等现有方法。