标签
该预印本以对抗训练作为对照工具,在 GPT-2 Small 上检验表征简单性(SAE 可分解性、集中化归因)是否蕴含回路在因果上的简单性。研究发现,鲁棒模型具有更强的 SAE 可分解性,而回路规模则取决于机制区间:在高忠实度水平(90-95%)下,鲁棒性有所帮助,但在 85% 以下则无此效果。