@TanejaPriyal: 我想理解LoRA不仅仅是“适配器比全微调更便宜”。于是,我写了一个两部分的系列文章,并进行了…
摘要
作者使用vLLM在一张GPU上对服务1000个LoRA适配器进行了基准测试,发现活跃适配器数量和流量模式才是真正的瓶颈,并提供了调优max_loras的建议。
查看缓存全文
缓存时间: 2026/05/27 03:18
我想了解LoRA不仅仅是因为“适配器比全参数微调更便宜”。
于是,我写了一个分为两部分的系列文章,并运行了一个基准测试:当你在一个GPU上服务1000个LoRA适配器时会发生什么?
我的发现:
适配器总数并非真正的瓶颈。重要的是同时活跃的适配器数量。 流量形状改变一切。在1000个适配器的情况下,均匀分布的流量获得884 tok/s;倾斜的流量获得2,167 tok/s。 vLLM的max_loras参数并非“越高越好”。设置太低会导致数秒的首token延迟;设置太高则会降低吞吐量。 多LoRA服务的关键在于管理活跃工作集,而不仅仅是存储大量适配器。
局限性:本实验使用合成适配器,因此侧重于服务机制,而非模型质量。
第一部分:LoRA的原理——适配器、秩和多租户服务:https://priyaltaneja.com/mechanics-of-lora…
第二部分:大规模多LoRA——vLLM运行范围的经验地图:https://priyaltaneja.com/multi-lora-at-scale…
代码、CSV文件、图表: https://github.com/priyaltaneja/multi-lora-serving-benchmark…
相似文章
路由不够:诊断 MoE+LoRA 微调中的适配器子空间竞争
本文诊断了 MoE+LoRA 微调中的适配器内竞争,并介绍了 SpawnLoRA,该方法动态添加子适配器以减少跨领域的负迁移。
超越LoRA:稀疏诱导的适配是否更好?
本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
@0xSero: Highly recommended educational content. LoRA is one of the coolest things to dabble in, lets anyone fine tune models re…
本文详细介绍了 LoRA 及其变体(QLoRA、VeRA、DoRA)的原理,解释了如何通过低秩分解减少可训练参数,实现高效微调大型模型。
智能体通过将切换LoRA适配器作为工具(SLAaaT)解锁新能力
本文介绍了SLAaaT,这是一种使AI智能体在轨迹中动态切换专用LoRA适配器的方法,提高了能力的组合性,并在合成编码任务上超越了基线。