LoRA Speedrun – 微调技术实际耗时公开排行榜
摘要
LoRA Speedrun 是一个微调技术的实际耗时公开排行榜,通过自动化验证,在单块 L40S GPU 上使用 Qwen2.5-1.5B 和 SmolLM2-1.7B 模型,测量 LoRA 适配器在 GSM8K 和 SQuAD 任务上达到目标准确度的速度。
暂无内容
查看缓存全文
缓存时间: 2026/07/20 09:46
一次真实的验证,从日志中回放(种子463953844,时间压缩):训练 →完整性 + 适配器审计 →评估 →3-seed判定。
相似文章
AQLoRA:一种快速量化LoRA微调的零搜索方案
AQLoRA是一种零搜索方法,通过自适应地将高NF4重构误差的层保持为fp16格式,加速量化LoRA微调,实现最高11%的训练速度提升,且精度损失极小。
@TanejaPriyal: 我想理解LoRA不仅仅是“适配器比全微调更便宜”。于是,我写了一个两部分的系列文章,并进行了…
作者使用vLLM在一张GPU上对服务1000个LoRA适配器进行了基准测试,发现活跃适配器数量和流量模式才是真正的瓶颈,并提供了调优max_loras的建议。
ReLoRA: 知识复用适应方法,用于快速部署不断演进的LLM服务
ReLoRA是一个知识复用的适应框架,能够高效恢复面向不断演进的LLM服务的、可投入使用的LoRA适配器。通过自适应初始化和计划正则化,它可将准备时间缩短最多8.9倍,并将准确率提升最高4.6%。
RW-LoRA:通过随机游走实现通信高效的去中心化LoRA微调
本文介绍了RW-LoRA,这是一种利用随机游走减少通信和计算成本的去中心化LoRA微调方法,同时在NLP任务上实现竞争性性能。
超越LoRA:稀疏诱导的适配是否更好?
本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。