标签
本文构造了一个具有线性自注意力的Transformer,该Transformer对简单线性回归执行闭式最小二乘解的上下文学习,利用层归一化来近似解析解,而非梯度下降。
本文发现,在基于LayerNorm的GNN中,正的逐节点标量(如节点度数)如果放在LayerNorm之前会被消除,但放在LayerNorm之后则得以保留。作者提出PostDeg,一种无需参数的层归一化后逆度数缩放方法,在影响力最大化、网络瓦解和最大独立集任务上取得了显著提升。
本文介绍了LLM中的深度诅咒问题,即由于Pre-Layer Normalization导致输出方差爆炸,深层网络变得无效。作者提出LayerNorm Scaling来缓解这一问题,并在高达7B参数规模的模型上展示了预训练和微调的一致性改进。