神经网络可证明地学习群组合的谱表示
摘要
本文提供了神经网络在群组合任务中学习结构化表示的理论分析,证明了训练动态驱动神经元以指数收敛速度收敛到不可约群表示。该工作建立了特征学习的表示理论解释,并刻画了矩阵值群表示的低秩压缩现象。
理解神经网络训练过程中结构化内部表征的涌现是深度学习研究的核心。我们通过群组合任务研究这一现象:训练一个两层神经网络来预测有限群G中元素的g_1 star g_2。通过将投影梯度流提升到傅里叶域,我们证明训练动态由表示论能量泛函上的黎曼梯度上升支配。我们证明,在随机初始化下,该流驱动每个神经元几乎必然收敛到单个不可约表示,同时跨层傅里叶系数实现旋转秩一对齐。该框架提供了特征学习的表示论解释,并刻画了矩阵值群表示的一种新型低秩压缩现象。此外,对于阿贝尔群,我们给出了完整的总体描述:随机初始化在非平凡表示之间促进均匀多样化,并诱导哈尔均匀相位,通过多数投票机制联合逼近指标函数。我们进一步证明,相位对齐与表示竞争均以指数收敛速度出现。
相似文章
神经网络可证明学习群组合的谱表示
本文从理论上证明,在群组合任务上训练的两层神经网络可以学习谱表示,其中神经元收敛到不可约表示并实现旋转秩一对齐,为特征学习提供了表示论的解释。
任务需求的秩:基于群组合任务训练的矩阵记忆的因果秩定律
本文提供了因果证据,表明在群组合任务上训练的矩阵记忆中的梯度下降精确招募了任务代数所需的秩,这与有限群的最小忠实表示维度相关。
特征排斥与谱锁定:两层网络 Grokking 现象的实证研究
这项实证研究验证了关于两层神经网络在 Grokking 现象期间的特征排斥和谱锁定理论发现,展示了激活函数如何影响从记忆到泛化的过渡。
线性表示是如何学习的?抽象动态过程的精确解
本文构建了一个框架,研究线性概念表示在神经网络训练过程中如何涌现,在线性网络中提供精确解,并分析非线性网络中的抽象动态过程。结果揭示了控制抽象的关键原则,并为可解释性和控制提供了启示。
人工神经网络中纤维化、压缩和对称性破缺的涌现
本文提出一个理论框架,表明神经网络中的学习会产生图对称性(纤维化和覆盖),从而能够显著压缩模型并提升持续学习性能。