权重空间感知差距中有多少实际上是基于对称性的?基于约1.8百万拟合SIRENs的证据 [R]

Reddit r/MachineLearning 论文

摘要

本文研究了参数对称性在权重空间感知中的作用,表明仅对称性散布就能解释共享初始化和独立拟合神经网络之间性能下降的几乎全部。该研究使用SIRENs和大规模实验论证,计算优势可能证明权重空间方法优于函数访问的信息等价性。

我一直在研究权重学习中的一个相当基础的问题,我认为这个问题没有被清晰地分离:为什么直接从神经网络权重读取语义在网络共享初始化时效果很好,但在独立拟合时却崩溃?通常的解释是参数对称性。置换隐藏单元、翻转等效符号等,两个参数向量可以表示相同的函数,但对下游模型看起来完全不同。但实际上,这个解释中隐藏着几个不同的主张:参数化具有对称群,考虑该对称性可以提高权重空间预测,该对称性确实足以解释共享初始化和独立拟合网络之间观察到的性能下降。这些主张并不等价,因此我尝试分别衡量它们。设定是SIREN风格的隐式神经表示。对于隐藏的正弦神经元,相关的函数保持变换生成无限二面体群 D_inf = Z ⋊ Z_2,包括神经元置换则给出层作用 D_inf wr S_n。对于单隐藏层,我通过实现函数的分布傅里叶变换证明了模该群的一般可识别性。大致上,傅里叶变换成为在输入频率 +/- w_i 上支持的原子测度,这使得在显式一般性条件下,可以恢复参数,精确到 D_inf wr S_n 作用。一个后果是,这不仅仅是通常的置换/符号故事。整数π相位变换是仿射的而非线性的,因此它们不被限制于单项式矩阵作用的对称性描述所捕获。在两层时情况变得更麻烦,因为神经元的输出权重同时受到下一层的作用。我最终通过第二层Gram矩阵耦合层来构造精确的跨层不变量,而不是独立处理神经元。实证部分使用了约1.8百万拟合的INR,覆盖MNIST、FashionMNIST和CIFAR-10,并通过控制协议分离共享初始化、优化随机性和独立初始化。我找到的最有趣的结果是:仅随机化精确对称群,同时保持每个网络表示的函数不变,破坏了MNIST共享初始化与随机初始化差距中80.4个准确点中的79.1个。我想谨慎解释这一点。这确立了充分性:仅对称性散布可以重现几乎整个性能下降。它并不确立79.1 / 80.4的自然差距是由对称性因果中介的。这些是不同的估计量。将群分解开,符号翻转大约占该诱导损失的63点,神经元重标约15点,整数相移约1点。还有另一个结果改变了我对这个问题的解释。一个直接在原始参数上取商 D_inf wr S_n 结构的读取器达到0.917,相比之下:最佳轨道值重构为0.628,在固定不变编码上同一读取器族为0.526,置换等变基线为0.265。但当我将权重空间推理与简单查询INR作为函数进行FLOPs匹配时,函数空间路线仍然更好:在1.6 MFLOP下使用64个学习查询坐标达到95.3%,而最佳权重空间运行在该前沿上为5.5 MFLOP下64.4%。这引出了我认为更有趣的概念性问题:如果一个完全不变量在信息上等价于对实现函数的访问,那么直接操作权重空间的最强理由可能最终必须是计算性的而非信息性的。所有内容公开在这里:https://github.com/ITheClixs/project-siren-gap 该仓库包括论文、实现、测试、预注册、实验笔记本、预测账本、主张账本和实验结果。我特别希望在三个方面得到批评:充分性/中介性区分是否正确,是否有人在单隐藏层极大性论证中看到反例或遗漏假设,以及是否有我遗漏的关于周期激活网络仿射对称群的相关工作。也非常有兴趣尝试打破不变量或重现群随机化结果。如果这里有错误,我宁愿从试图击垮它的人那里得知。
查看原文

相似文章

测量对称性——数据交换率

Hugging Face Daily Papers

这项探索性研究通过受控的C_n对称任务,实证测量了等变性理论预测的对称性-数据交换率,发现错误群组约束反而有害,在测试时进行轨道平均的数据增强与等变模型完全匹配,且实证交换率大致与理论一致但统计上不具决定性。作者强调了该研究的探索性,并呼吁进行注册复制研究。

循环权重空间中的任务受限对称性

arXiv cs.LG

本文通过使用有序实Schur坐标来识别保持任务性能的结构消融,研究循环神经网络中的功能冗余,发现任务受限对称性在不同任务和训练方案之间存在差异。

[R] 测量对称性--数据交换速率

Reddit r/MachineLearning

本文实证测量了等变性理论预测的对称性与数据交换速率,发现错误群对称约束具有实际危害,测试时轨道平均的数据增强与等变架构相匹配,而理论上 |G| 倍的样本复杂度降低仅得到弱证实,且置信区间较宽。该研究明确为探索性,未预先注册。