标签
本文介绍了一种名为Program-of-Layers(PoLar)的方法,它允许大语言模型根据每个输入动态地跳过或循环预训练层,从而在固定深度推理的基础上提高准确性和效率。
本文介绍了PoLar,一个学习针对冻结transformer层的输入特定执行程序的框架,允许层被跳过、保留或重复。与固定深度方法相比,它提高了准确性并减少了推理开销。