LoRA Speedrun – 微调技术实际耗时公开排行榜
摘要
LoRA Speedrun 是一个微调技术的实际耗时公开排行榜,通过自动化验证,在单块 L40S GPU 上使用 Qwen2.5-1.5B 和 SmolLM2-1.7B 模型,测量 LoRA 适配器在 GSM8K 和 SQuAD 任务上达到目标准确度的速度。
暂无内容
查看缓存全文
缓存时间: 2026/07/20 09:46
一次真实的验证,从日志中回放(种子463953844,时间压缩):训练 →完整性 + 适配器审计 →评估 →3-seed判定。
相似文章
@TanejaPriyal: 我想理解LoRA不仅仅是“适配器比全微调更便宜”。于是,我写了一个两部分的系列文章,并进行了…
作者使用vLLM在一张GPU上对服务1000个LoRA适配器进行了基准测试,发现活跃适配器数量和流量模式才是真正的瓶颈,并提供了调优max_loras的建议。
ReLoRA: 知识复用适应方法,用于快速部署不断演进的LLM服务
ReLoRA是一个知识复用的适应框架,能够高效恢复面向不断演进的LLM服务的、可投入使用的LoRA适配器。通过自适应初始化和计划正则化,它可将准备时间缩短最多8.9倍,并将准确率提升最高4.6%。
超越LoRA:稀疏诱导的适配是否更好?
本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。
用于电信客户服务的小型语言模型PEFT:LoRA配置及能耗分析的比较研究
本文系统性地研究了使用LoRA对Qwen2.5-3B进行参数高效微调用于电信客户支持,比较了16种LoRA配置的传统指标与能耗分析。发现定量与定性性能之间存在分歧。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。