标签
本文测试了通过任务模式选择性和因果消融来识别注意力头回路的标准方法是否在不同1B类语言模型族(Pythia、OLMo、OLMoE)中产生一致的机制性结论。研究发现没有两个(任务、模型)单元共享相同的主要因果筛选,并引入了屏幕结果的五分类法,其中MoE模型显示出独特的前一token位置基板。
本文通过考察来自8个家族的16个语言模型在800个推理问题上的表现,探究了Platonic Representation Hypothesis。研究发现,虽然模型在内部表征上趋于一致,但在推理过程中,尤其是决策后阶段,它们出现分歧,而且共享的表征对预测的因果影响极小。