@_vmlops:在单GPU上微调12B模型已成现实 大多数人以为需要庞大的GPU集群才能微调大型语言模型…
摘要
Hugging Face 的 PEFT 库实现了在单张 GPU 上对大型模型进行参数高效微调,在降低计算和存储成本的同时保持性能。
在单GPU上微调12B模型已成现实
大多数人以为需要庞大的GPU集群才能微调大型语言模型
其实不需要
Hugging Face 的 PEFT 让你只需微调模型参数的 0.1% 即可获得接近全量微调的性能
实际效果如下:
- 本会在 80GB A100 上 OOM 的 12B 模型?使用 PEFT-LoRA 运行良好
- 一个 3B 模型微调后在基准测试上达到人类级准确度
- 最终检查点大小:19MB 而非 11GB
它支持 LoRA、QLoRA、IA3、soft prompts 等
开箱即用,兼容 transformers、diffusers、accelerate 和 trl
如果你在做任何 LLM 相关工作却还在跑全量微调,那你就是在白白浪费算力
https://github.com/huggingface/peft…
---
查看缓存全文
缓存时间: 2026/05/17 15:35
🤗 PEFT
🤗 PEFT
最先进的参数高效微调(PEFT)方法
最先进的参数高效微调(PEFT)方法
相似文章
如果GPU能跑推理,那也应该能微调。[P]
USAF(超稀疏自适应微调)是一种新方法,允许在消费级GPU(包括AMD硬件)上微调MoE模型,仅需12GB VRAM。与无法做到的LoRA/QLoRA不同,USAF只训练最重要的稀疏权重和路由器。
单GPU微调的高效异构协同设计
SlideFormer 提出了一种异构协同设计,用于在单GPU上进行全参数LLM微调,利用GPU/CPU/RAM/NVMe及其层滑动引擎和优化的Triton内核,在单张RTX 4090上实现对123B+模型的微调,吞吐量显著提升。
Show HN:在 4 GB 笔记本 GPU 上微调 8B 模型
Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。
@h100envy: Daniel Han 创建了 Unsloth,这正是半数开源项目能在单张 GPU 而非集群上微调模型的原因。他还……
Daniel Han 构建了 Unsloth,该工具通过重写 GPU 内核,使单张 GPU 的微调速度提升 2 到 3 倍,让众多开源用户无需集群即可训练模型。
@0x0SojalSec: 想象一下,在Kaggle上免费微调一个31B参数的多模态模型。现在你可以训练这个庞大的31B密集型多模态模型……
Unsloth 使得在Kaggle上免费微调31B参数的多模态模型成为可能,采用4位量化,本地运行仅需22-24GB VRAM。