标签
Hazy Research 表明,一个 MLP 可以在无需训练的情况下,通过嵌入知识进行初始化,然后一个 transformer 可以查询并使用该知识,这暗示了持续学习的能力。
本文分析预训练GPT-2风格语言模型中的频谱模式,并测试这些模式能否用于初始化,发现粗粒度频谱匹配相比标准方法并不能提升预训练性能。
S-GAI是一种针对单隐层Sigmoid多层感知器的谱几何感知初始化框架,它利用图像数据的逐类谱几何来初始化权重。在初始隐藏状态质量方面优于随机初始化,并在MNIST和CIFAR-10等基准测试上达到可比的最终准确率。
Taylor-Calibrate提出了一种用于混合线性注意力模型的原则性初始化方法,显著提高了将预训练Transformer蒸馏为Gated DeltaNet学生模型的效率,实现了高达88倍的改进,并将训练token数量减少了4.9至9.2倍。
深入探讨Rust二进制文件中main函数之前所发生的事情,探索运行时初始化、入口点以及可变数据初始化的新颖技术。
本文引入了“初始化记忆”的概念,研究深度网络中随机初始化偏差在训练后保留了多少,表明低学习率的SGD能保留初始化,而Adam系列优化器则消除它,并将其与遗忘动力学联系起来。