标签
本文提出Sparse Readout Prism(SRP),该方法通过将读出矩阵分解为稀疏特征来分析语言模型的预测,实现了与语料库无关的Logit透镜分数解释,并提升了可解释性。
本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。