标签
本文讨论了一篇研究论文,该论文表明,使用不同随机种子训练的两个深度网络之间的分歧率可以仅使用未标记数据准确估计泛化误差,揭示了一个名为泛化分歧等式的惊人联系。
本文从理论上证明,在WSD调度中学习率冷却是否有益取决于梯度噪声的结构以及优化器是否对其更新进行归一化,从而解释了为什么冷却对SGD无效但对归一化方法却是必要的。
本文为PL平滑目标在马尔可夫噪声下的随机梯度下降提供了最优高概率界,填补了期望保证与高概率保证之间的差距,并扩展到重尾设置,给出了匹配的下界。
本文推导了在幂律谱下素描线性回归的批量缩放定律,分析了单次和多次遍历的小批量SGD。它提供了明确的风险分解,展示了批量大小如何影响偏差、方差和波动项,并证明了无放回采样比有放回采样产生更低的噪声。
本文首次建立了使用小批量SGD和带有相关噪声的DP-SGD训练的Kolmogorov-Arnold网络的总体风险界,推动了在隐私敏感领域对KAN的理论理解。
本文对 Muon 优化器的几何依据提出了挑战,认为精确的几何结构不如步长最优性重要。文章引入了 Freon 和 Kaon 优化器,以证明随机或反转谱的性能与 Muon 相当。