标签
本文提出了一种Sparse-Activation-ReLU (SAR)层,用于低延迟、高能效的虚拟感知,在延迟-误差-能效指标上实现了显著提升,并通过合成知识蒸馏降低了误差。
本文提出了一种用于大语言模型的持续学习方法,该方法使用预训练的稀疏自编码器(SAEs)在激活空间而非权重空间中进行正则化,从而在无需存储先前数据的同时避免灾难性遗忘,并实现了更好的内存效率和更强的基准性能。