@ProfTomYeh:全参数微调 vs 冻结层对比。互动链接 https://byhand.ai/Or2No4 与 https://byhand.ai/ykhsCs == 全参数微调…
摘要
交互式可视化对比神经网络全参数微调与冻结层策略。
全参数微调 vs 冻结层。互动链接 https://byhand.ai/Or2No4 与 https://byhand.ai/ykhsCs == 全参数微调 == 真实网络拥有大量层——本例中三层,生产模型则含数十亿参数。当你更新全部参数时,微调会是什么样子?
相似文章
冻结深层,训练浅层:持续预训练中可解释的层分配方法
本文提出了 LayerTracer,这是一个用于持续预训练中参数层分配的可解释框架。研究表明,在冻结深层网络的同时仅训练浅层,其效果优于全参数微调。这为资源受限团队优化大语言模型提供了一种低成本且可操作的策略。
逐层渐进二值化:面向深度可伸缩二值网络的训练框架
提出StoMPP,一种针对二值神经网络的逐层渐进冻结训练框架,从输入到输出逐步对层进行二值化,在不依赖直通估计器的情况下,相比普通STE实现了显著的精度提升,并在多种架构和任务中表现出一致的增益。
TopoTuner: 大型语言模型的拓扑微调
介绍TopoTuner,一种拓扑引导的微调框架,通过持续图之间的Wasserstein距离测量拓扑漂移,从而选择性冻结注意力投影矩阵。该框架在仅训练1-2%参数的情况下,性能与全微调相当,并在大多数设置中优于LoRA。
联邦轻量级微调
本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。
@askalphaxiv: 另一项关于循环Transformer的酷研究。他们提出一个问题:“我们能否直接在推理时循环一个冻结的、现成的检查点…
本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。