标签
本文测试了通过任务模式选择性和因果消融来识别注意力头回路的标准方法是否在不同1B类语言模型族(Pythia、OLMo、OLMoE)中产生一致的机制性结论。研究发现没有两个(任务、模型)单元共享相同的主要因果筛选,并引入了屏幕结果的五分类法,其中MoE模型显示出独特的前一token位置基板。