标签
本文提出使用 AstroPT(一个在星系图像上训练的 transformer)作为研究训练中概念涌现的测试平台,发现星系属性以固定的难度顺序涌现,这可以为大型语言模型的机制可解释性方法提供参考。
本文提出了一种表征动力学的分岔理论,用于检测神经网络在训练过程中何时获得结构化表征。该理论利用对GMM探针的黑塞矩阵分析,得到的比值β/β_c作为一种无标签的相位坐标,能够预测可用结构的出现,并在训练早期预判稀疏自编码器中的特征可解释性。