标签
Taylor-Calibrate提出了一种用于混合线性注意力模型的原则性初始化方法,显著提高了将预训练Transformer蒸馏为Gated DeltaNet学生模型的效率,实现了高达88倍的改进,并将训练token数量减少了4.9至9.2倍。
本文发现,在混合线性注意力模型中,思维链监督微调通过将注意力梯度偏向短程模式,从而降低长上下文召回能力,并提出QK-Restore——一种无需训练的方法,可在保留推理性能的同时恢复长上下文召回。
SANA World Model是一个新的人工智能模型,采用混合线性注意力,以实现高效和快速。