图谱分析(Fiedler值与Scheffer CSD指标)在损失函数变化前21,000步预测grokking——五个可重复实验 [R]
摘要
应用图谱分析(Fiedler值)和Scheffer临界减速指标来预测神经网络中的grokking,在损失函数变化前21,000步检测到它,在五个可重复实验中。
我一直在应用Fiedler值(权重图拉普拉斯矩阵的第二小特征值)结合Scheffer临界减速指标来监控训练过程中的神经网络拓扑结构。
五个实验,全部可在24小时内由CPU重现:
1. 检测:lambda-2在测试准确率变化前21,000步检测到grokking的临近
2. 分类:grokking与灾难性遗忘具有不同的结构特征(斜率分别为0.00128和0.00471/步)
3. 引导:结构引导的干预保留了91.7%的知识,而无引导仅保留2.6%
4. 累积:三个连续任务,保留率100%/100%/97.5%,跨任务grokking加速48倍
5. 先发制人的课程:兼容性评分正确排序任务破坏风险,桥接保留100% vs 直接保留0%
在2层MLP(模算术)和1层Transformer(序列预测)上进行了测试。
论文中有诚实的局限性说明部分。这些是玩具任务,尚未验证扩展到生产架构。该方法源自复杂系统科学(Scheffer的临界转变早期预警指标),并将其应用于权重图而非生态系统或金融市场。
代码与论文:[https://github.com/EssexRich/neural_si_validation](https://github.com/EssexRich/neural_si_validation)
欢迎讨论数学原理、实验设计或局限性。
相似文章
特征排斥与谱锁定:两层网络 Grokking 现象的实证研究
这项实证研究验证了关于两层神经网络在 Grokking 现象期间的特征排斥和谱锁定理论发现,展示了激活函数如何影响从记忆到泛化的过渡。
用于定位 Grokking 相变的分布谱诊断方法
本文提出了一种分布谱诊断方法,用于在测试准确率上升之前定位 Transformer 模型中的 Grokking 相变。该方法利用经验分布和汉克尔动态模态分解(Hankel DMD)创建监测信号,以区分发生 Grokking 和未发生 Grokking 的训练运行。
噪声驱动的亚稳态逃逸解释了深度神经网络中的Grokking现象
该论文提出,深度神经网络中的grokking现象源于一阶L2相变中噪声驱动的亚稳态逃逸,证明了延迟泛化遵循Arrhenius标度,并再现了典型的grokking曲线。
At-Grok尚未收敛:Grokking表示指标的测量效度审计
本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。
通过内部激活的频谱分析检测神经网络故障
本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。