标签
SCAPE是一种通信高效的分布式优化器,利用一阶矩统计量实现LLM训练的极端稀疏化,在保持准确性的同时将实际训练时间减少高达43.3%。
Llama Surgery 将学习到的块稀疏注意力拓扑注入预训练的 Llama 3.1 8B 中,无需从头重新训练,使用带有 Gumbel-Softmax 路由、温度退火和直通估计器的动态拓扑路由器以避免梯度崩溃,实现稳定收敛和连贯输出。