高效微调存储
摘要
DeltaTensors 通过存储与基础模型的权重差异来压缩微调模型检查点,显著降低存储需求,同时允许以最小质量损失进行重构。
想象一下,为模型微调设计的 Git,还能帮你节省存储。DeltaTensors 通过存储与基础模型的权重差异来压缩微调模型检查点,而不是存储另一个完整的模型副本。如果你有多个基于同一基础模型的微调或检查点,你可以只保留一个基础模型,并为每个版本存储一个更小的 .wdelta 文件。在 Qwen2.5-0.5B 的微调中,一个 953 MB 的模型被压缩到 294 MB 的 delta 文件。重构后,困惑度从 19.11 变为 19.22。它在训练后工作,因此你不需要使用 LoRA 或改变微调模型的方式。你可以将现有的完整微调模型在之后进行压缩。它还支持用于模型版本历史的链式 delta、Hugging Face Trainer 检查点以及流式压缩/重构,这样你就不需要将两个完整模型加载到内存中。https://github.com/AaravGaurdev/deltatensors
相似文章
联邦轻量级微调
本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。
基于Frames的Transformer模型微调
本文提出FrameFT,一种参数高效的微调方法,使用Fusion Frame基中的稀疏系数,在减少内存占用的同时,达到或超过最先进的PEFT技术的性能。
如果GPU能跑推理,那也应该能微调。[P]
USAF(超稀疏自适应微调)是一种新方法,允许在消费级GPU(包括AMD硬件)上微调MoE模型,仅需12GB VRAM。与无法做到的LoRA/QLoRA不同,USAF只训练最重要的稀疏权重和路由器。
@tom_doerr: 压缩深度学习模型以加速推理 https://github.com/NVIDIA/Model-Optimizer…
NVIDIA Model Optimizer 是一个库,它使用量化、蒸馏、剪枝和推测解码等技术压缩深度学习模型以加速推理。它支持 Hugging Face、PyTorch 和 ONNX 模型,并与 NVIDIA 推理框架集成。
Tensor Cache: 基于驱逐条件的Transformer关联记忆
Tensor Cache 引入了一种两级缓存机制,将滑动窗口注意力中驱逐的键值对压缩成固定大小的关联记忆,从而在无需无界内存增长的情况下改进长上下文语言建模。