标签
本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。
一位研究者声称利用重整化群理论建立了深度学习背后的科学原理,超越了工程技巧,可能为AGI铺平道路。这项工作基于2021年发表在JMLR和《自然·通讯》上的论文。
本文介绍了RG-Flow Transformer,这是一种具有重正化群归纳偏置的模型,用于分析稀缺的脑电图数据。它在Sleep-EDF数据集上的睡眠分期任务中与普通Transformer进行对比,发现没有准确率优势,但通过恢复谱指数展示了更好的可解释性。
这本书为深度神经网络建立了一套有效理论,表明其预测近似高斯分布,且由深度与宽度的比值主导;并引入了表示群流(representation group flow)来分析信号传播和学习动力学。
提出RGNet,一种基于重整化群理论的神经网络架构,用于特征空间的分层粗粒化,以解决故障诊断中的类别不平衡和噪声问题。在AI4I数据集上的实验结果表明,RGNet提供了可解释且具有竞争力的性能。
这篇文章探讨了物理学与深度学习之间的深层联系,分析了Scaling Law、涌现等现象与物理学中临界标度律、相变等概念的同构性,并梳理了物理方法论在AI中的应用现状与前景。