标签
本文研究了在因子化模型中,为什么 Adam 不表现出梯度下降所具有的隐式低秩偏差,并表明逐坐标预处理打破了相关对称性,而共享标量方法(如 Muon 和 Shampoo)则保持了这种对称性。
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。