标签
本文指出,仅仅作为有效的曲率上界,并不足以证明使用末层相对平坦性代理作为对抗鲁棒性证书或可微训练正则化手段的合理性。作者推导出一种规范不变的修复方法,展示了该代理在保持对称性的 softmax 平移下是无界的,并通过 CIFAR-10 实验表明:经商空间正则化后的预测器保持了对齐性,而直接进行原始正则化的预测器的泛化能力可能被抑制。
本文构建了高维回归中 grokking 现象的统计理论,揭示了正则化几何结构与信号稀疏性如何决定插值附近的泛化行为,并给出了零一律(zero-one law)以及最小范数插值器的不稳定性。
本文探讨了神经网络中的“Grokking”(延迟泛化)现象,并引入了几何维度正则化(GeomDR)方法来控制表征几何结构,从而将“Grokking”现象的出现速度最高提升52倍。
本文提出Stiefel注意力机制,通过黎曼优化将Transformer查询与关键投影矩阵约束于Stiefel流形上,实验证明该方法在模运算格罗金现象与CIFAR-10图像块任务中均展现出性能提升。
本文研究了神经网络中Grokking的热启动转移中的组件角色,表明转移内部权重可以提高早期性能但存在不稳定性风险,并提出了稳定该过程的方法。
本文使用转换游戏来研究 Transformer 从记忆到泛化的转变,揭示了分布式效用增益是由于注意力偏差和傅里叶重编码,而非模块切换。
本文介绍了一种认证的、可微分的复杂性估计器,以控制神经网络中的Grokking,加速这一过程并为学习的算法信息动力学提供见解。
本文通过缩放定律量化了神经网络中记忆到泛化的转变(Grokking),揭示了与模型容量相比,数据复杂度是转变时间的主要驱动因素。
本文引入了CvAdamW,一种AdamW变体,它通过监测注意力比热来检测顿悟相变,并动态调整权重衰减,在基线失败的模算术任务上实现了顿悟。
本文通过消融实验分析Muon优化器,发现正交化(Newton-Schulz迭代),而非谱缩放,是其能在模算术上更快实现grokking的关键因素,并引入了一种衡量grokking速度的稳定性感知指标。
本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。
引入跨轨迹嵌合体干预,以分离权重大小和方向在Grokking中的作用,表明方向携带可转移的电路身份,而范数影响被覆盖的敏感性。
本文研究在交叉熵损失下,权重范数是直接控制神经网络中的grokking延迟,还是其效果通过对数几率尺度和softmax饱和来中介。实验表明,延迟几乎完全由有效对数几率尺度解释,权重范数的贡献微乎其微。
本文证明,当Transformer领悟模乘时,先前工作中观察到的密集傅里叶谱是使用加法傅里叶变换产生的伪影;使用乘法特征变换则揭示出稀疏表示,从而得出一个逆向工程的'离散对数时钟'算法,类似于模加的时钟算法。
该论文提出,深度神经网络中的grokking现象源于一阶L2相变中噪声驱动的亚稳态逃逸,证明了延迟泛化遵循Arrhenius标度,并再现了典型的grokking曲线。
本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。
本文介绍了层次涌现框架(HEF),该框架解释了在物理和信息约束下,通过机制景观中的相变,神经网络和生物进化等多样系统如何收敛到相似的内部表示。该框架通过111个grokking实验进行了实证验证,这些实验确认了通用收敛,并识别出一个临界能量阈值。
本文提出了一种基于暴露的框架,用于研究LLM预训练过程中类似Grokking的延迟泛化现象,使用了BLiMP最小对立对和关键短语。作者观察到五种语法现象均出现延迟泛化,并分析了内部变化,如概念向量的可预测性和注意力头的集中。