高效微调存储

Reddit r/LocalLLaMA 工具

摘要

DeltaTensors 通过存储与基础模型的权重差异来压缩微调模型检查点,显著降低存储需求,同时允许以最小质量损失进行重构。

想象一下,为模型微调设计的 Git,还能帮你节省存储。DeltaTensors 通过存储与基础模型的权重差异来压缩微调模型检查点,而不是存储另一个完整的模型副本。如果你有多个基于同一基础模型的微调或检查点,你可以只保留一个基础模型,并为每个版本存储一个更小的 .wdelta 文件。在 Qwen2.5-0.5B 的微调中,一个 953 MB 的模型被压缩到 294 MB 的 delta 文件。重构后,困惑度从 19.11 变为 19.22。它在训练后工作,因此你不需要使用 LoRA 或改变微调模型的方式。你可以将现有的完整微调模型在之后进行压缩。它还支持用于模型版本历史的链式 delta、Hugging Face Trainer 检查点以及流式压缩/重构,这样你就不需要将两个完整模型加载到内存中。https://github.com/AaravGaurdev/deltatensors
查看原文

相似文章

联邦轻量级微调

arXiv cs.LG

本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。

基于Frames的Transformer模型微调

arXiv cs.AI

本文提出FrameFT,一种参数高效的微调方法,使用Fusion Frame基中的稀疏系数,在减少内存占用的同时,达到或超过最先进的PEFT技术的性能。

如果GPU能跑推理,那也应该能微调。[P]

Reddit r/MachineLearning

USAF(超稀疏自适应微调)是一种新方法,允许在消费级GPU(包括AMD硬件)上微调MoE模型,仅需12GB VRAM。与无法做到的LoRA/QLoRA不同,USAF只训练最重要的稀疏权重和路由器。