符号胜过浮点:用于设备上微调的Low-Rank Double-Binary Adaptation

arXiv cs.LG 论文

摘要

LoRDBA将LoRA的浮点低秩因子替换为二元符号载体和通道级缩放,实现了高效的设备上微调,显著减少了占用空间,延迟开销极小,质量与fp16相当。

arXiv:2605.24058v1 Announce Type: new 摘要:设备上大语言模型适应通常保持量化基础模型冻结,同时训练和部署一个小型、任务特定的LoRA适配器。然而,在未合并的适配器模式下,适配器不仅仅是一个紧凑的存储模块;它引入了一个额外的密集浮点分支,维护了用于本地更新的可训练状态,并充当通信和热插拔的单位。我们引入了LoRDBA,一种兼容LoRA的适配器,它将两个低秩因子替换为二元符号载体,同时通过轻量级的通道级缩放表示幅度,将密集适配器分支转换为两次符号累积矩阵乘法,其间交错进行通道级缩放。有限样本分析表明,重建质量由原始LoRA因子的残差与幅度比决定。在适配器模式实验中,LoRDBA在匹配模型大小下优于低比特基线,同时在选定条件下匹配fp16 LoRA的质量。在匹配秩r=16时,未合并适配器的预填充延迟开销最多为8%,尽管适配器占用空间减少了10倍以上,训练内存开销约为fp16 LoRA的1.6倍。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:00

# 符号胜过浮点:面向设备端微调的低秩双二值适配器 来源:https://arxiv.org/html/2605.24058 Yoshihiko Fujisawa Fujitsu Limited, Institute of Science Tokyo fujisawa\.y\.5bdc@m\.isct\.ac\.jp &Yuma Ichikawa Fujitsu Limited, RIKEN Center for AIP ichikawa\.yuma@fujitsu\.com&Yudai Fujimoto Fujitsu Limited, Institute of Science Tokyo fujimoto\.y\.7de0@m\.isct\.ac\.jp&Akira Sakai Fujitsu Limited, Tokai University akira\.sakai@fujitsu\.com&Katsuki Fujisawa Institute of Science Tokyo fujisawa\.k\.2110@m\.isct\.ac\.jp ###### 摘要 大语言模型的设备端适配通常保持量化基模型冻结,同时训练和部署一个小型任务特定 LoRA 适配器。然而,在未合并适配器模式设置中,适配器不仅仅是一个紧凑的存储模块;它引入了一个额外的密集浮点分支,维护可训练状态以进行局部更新,并充当通信和热交换单元。我们提出 LoRDBA,这是一种与 LoRA 兼容的适配器,它用二进制符号载体替换两个低秩因子,同时通过轻量级通道级缩放表示幅度,将密集适配器分支转换为两个交替有通道级缩放的符号累积矩阵乘法。有限样本分析表明,重建质量由原始 LoRA 因子的残差-幅度比决定。在适配器模式实验中,LoRDBA 在匹配模型大小下优于低位基线,同时在选定区域匹配 fp16 LoRA 质量。未合并适配器在匹配秩 \(r=16\) 时最多引入 8\% 的预填充延迟开销,尽管适配器占用减少了 10 倍以上,训练内存开销适中,约为 fp16 LoRA 的 1.6 倍。 ## 1 引言 大语言模型越来越多地使用参数高效更新而非全参数微调来适配。LoRA 通过冻结预训练权重并将低秩适配器矩阵注入 Transformer 投影,从而减少可训练参数数量,实现了这一范式 (Hu et al., 2022 (https://arxiv.org/html/2605.24058#bib.bib15))。QLoRA 通过反向传播经过冻结的量化基模型进入 LoRA 适配器,将该方法扩展到低位设置 (Dettmers et al., 2023 (https://arxiv.org/html/2605.24058#bib.bib11))。这种基模型加适配器设计对设备端个性化、隐私保护适配和通信高效更新分发具有吸引力;紧凑的低位基模型可以保持固定,而任务特定适配器被训练、交换或选择。最近的多适配器服务系统,包括 S-LoRA 和 Punica,表明实际部署通常将适配器视为可交换的运行时对象,而非总是合并到基模型中的权重 (Sheng et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib32); Chen et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib9))。 在实际低位部署中,将训练好的适配器合并到量化基模型中需要物化全精度权重或按任务重新量化,从而丧失热交换能力;因此,将适配器作为未合并侧分支提供服务更为可取 (Frantar et al., 2022 (https://arxiv.org/html/2605.24058#bib.bib12); Lin et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib25))。这种未合并分支产生了一个独特的瓶颈:基投影在融合低位内核上运行,而适配器使用密集 fp16 因子。针对这种情况的适配器压缩器必须保持精度、减少未合并计算成本,并避免膨胀本地训练状态。 参考图注 图1:LoRDBA (红色) 在 LLaMA-2-7B 上匹配适配器大小时帕累托优于 FP16 LoRA 和 LoRAQuant;参见 表1 (https://arxiv.org/html/2605.24058#S5.T1)。 参考图注 图2:适配器模式 LoRA 与 LoRDBA 对比。基模型以低位码本存储,并使用融合的反量化-矩阵乘法内核执行,而适配器以未合并形式提供服务。(a) 标准 LoRA 引入两个密集 fp16 因子,需要单独的 fp16 矩阵乘法分支。(b) LoRDBA 用符号矩阵替换两个因子,并由三个通道级缩放向量耦合,将适配器前向传播减少为两个符号累积矩阵乘法。 我们提出 LoRDBA,一种专为未合并适配器模式部署设计的低秩双二值适配器。LoRDBA 用二进制符号载体替换两个 LoRA 因子,并通过沿输入、秩和输出轴的紧凑缩放包络增强它们。二进制符号编码方向信息,而轻量级通道级缩放捕获幅度;量化基模型保持冻结且不变。LoRDBA 使用平滑符号直通估计器进行端到端训练,并导出为近二进制适配器。推理时,它用交替有缩放的二进制权重累积替换密集适配器分支。我们分析了这种二进制重建何时准确,表明关键量是浮点 LoRA 因子的残差-幅度比。不同于 BitDelta (Liu et al., 2024a (https://arxiv.org/html/2605.24058#bib.bib26))(它对完整的 \(\Theta(NM)\) 增量进行二值化,丢弃低秩结构)和 LoRAQuant (Mirzaei et al., 2025 (https://arxiv.org/html/2605.24058#bib.bib30))(它保留混合精度 SVD 分量),LoRDBA 将两个秩-\(R\) 因子都限制为 \(\pm 1\) 并端到端训练,保持低秩适配器格式。我们在适配器模式协议下评估 LoRDBA——适配器从不合并;存储、延迟和训练内存分别测量。在基于 LLaMA 的数学推理和摘要基准测试中,LoRDBA 在精度-大小权衡上优于所有评估的低位基线,如图1 (https://arxiv.org/html/2605.24058#S1.F1) 预览所示。 ## 2 预备知识 #### 符号。大写罗马字母表示矩阵;小写粗体表示向量。\(\{\pm 1\}^{p\times q}\) 是符号矩阵的集合。\(\|\cdot\|_{F}\) 和 \(\|\cdot\|_{\text{op}}\) 分别是 Frobenius 范数和算子范数。\(\operatorname{diag}(\bm{v})\) 构造对角矩阵;\(\operatorname{sign}(U)\) 是逐元素符号,其中 \(\operatorname{sign}(0)=+1\)。次高斯 Orlicz 范数定义为 \(\|X\|_{\psi_2} \coloneqq \inf\{t>0:\mathbb{E}[\exp(X^2/t^2)]\leq 2\}\) (Vershynin, 2018 (https://arxiv.org/html/2605.24058#bib.bib34))。 #### LoRA。给定冻结的有效权重矩阵 \(W_0 \in \mathbb{R}^{N\times M}\),LoRA 将微调增量重参数化为 \(\Delta W = AB^\top \in \mathbb{R}^{N\times M},~~A\in\mathbb{R}^{N\times r},~B\in\mathbb{R}^{M\times r}\),(1) 其中 \(r\ll\min(N,M)\) 是适配器秩。遵循列向量惯例,对于输入 \(\bm{x}\in\mathbb{R}^N\),适配后的前向传播为 \(\bm{y}=W_0^\top \bm{x} + B(A^\top \bm{x})\in\mathbb{R}^M\)。因此,每次适配后的投影产生两个适配器 GEMM,每个 token 的总算术复杂度为 \(\mathcal{O}(r(N+M))\),当两个因子都以 fp16 存储时,占用 \(16r(N+M)\) 位。基权重在整个适配过程中保持固定。 #### 适配器模式部署。我们在 QLoRA 式设备端场景中评估 LoRDBA (Dettmers et al., 2023 (https://arxiv.org/html/2605.24058#bib.bib11); Sheng et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib32); Chen et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib9))。令 \(W_{\mathrm{fp}}\) 表示原始全精度预训练权重,\(W_Q\) 为其存储的低位码本表示。有效部署的基权重为 \(\widetilde{W}_0 \coloneqq \mathrm{dequant}(W_Q)\),由于量化误差,它通常与 \(W_{\mathrm{fp}}\) 不同。在此设置中,基模型从不物化为 fp16,训练好的适配器以未合并状态提供服务。适配后的前向传播为 \(\bm{y} = \widetilde{W}_0^\top \bm{x} + \Delta W^\top \bm{x} = \mathrm{dequant}(W_Q)^\top \bm{x} + \Delta W^\top \bm{x}\)。(2) 这将该操作分解为基 GEMM(当基量化时,由融合的反量化-矩阵乘法内核执行)和一个独立的适配器侧分支。设备端工作负载由以下四个条件表征: 1. (A1) 冻结基:基模型保持固定且不更新。在典型设备端部署中,它以低位格式(如 NF4 或 GPTQ)存储,但条件本身不要求特定的基精度。 2. (A2) 仅适配器训练:基权重的优化器状态从不物化。 3. (A3) 未合并服务:适配器作为侧分支评估,而非合并到任务特定基权重中。 4. (A4) 热交换能力:多个任务特定适配器可以共享同一设备端基 (Sheng et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib32); Chen et al., 2024 (https://arxiv.org/html/2605.24058#bib.bib9))。 未合并场景将基核和适配器核解耦:基 GEMM 以码本的原生精度运行,而适配器 GEMM 以其自身位宽运行。因此,在不违反无合并约束的情况下,降低适配器位宽是改善带宽-计算包络的主要机制。 #### 每位权重比特数 (BPW)。遵循标准实践 (Mirzaei et al., 2025 (https://arxiv.org/html/2605.24058#bib.bib30)),我们以相对于参考 LoRA 参数计数 \(r_0(N+M)\) 的“每位权重比特数”(BPW) 来量化适配器压缩。因此,秩为 \(r\) 的 fp16 LoRA 适配器具有 BPW \(= 16r/r_0\),秩为 \(r_0\) 的完整参考具有 BPW \(= 16\)。LoRDBA 特定的 BPW 指标在引入适配器参数化后的第 3.1 节 (https://arxiv.org/html/2605.24058#S3.SS1) 定义。 ## 3 方法 ### 3.1 低秩双二值适配器 LoRDBA 用两个二进制因子和一小部分跨输入、秩和输出轴的通道级 fp16 缩放向量来参数化 LoRA 增量。该设计遵循为全权重极端量化引入的多包络原理 (Ichikawa et al., 2025b (https://arxiv.org/html/2605.24058#bib.bib19)),但将其应用于小得多的低秩 LoRA 增量。由于单组缩放是对秩轴的脆弱一维总结,我们允许适配器包含多个共享相同二进制载体的包络,包络数量由整数 \(\ell \geq 1\) 控制。 ###### 定义 3.1 (低秩双二值适配器)。固定一个参考 fp16 LoRA 秩 \(r_0 \geq 1\),仅用于标准化存储。一个形状为 \(N\times M\) 的宿主投影的 *LoRDBA 适配器*,具有二进制载体秩 \(R\in\mathbb{N}\) 和包络秩 \(\ell \geq 1\),被表示为元组 \(\theta = \bigl(B_1, B_2, (\bm{\alpha}^{(i)},\bm{\beta}^{(i)},\bm{\gamma}^{(i)})_{i=1}^\ell\bigr)\),其中 \(B_1 \in \{\pm 1\}^{N\times R},~ B_2 \in \{\pm 1\}^{R\times M},~ \bm{\alpha}^{(i)}\in\mathbb{R}^N,~ \bm{\beta}^{(i)}\in\mathbb{R}^R,~ \bm{\gamma}^{(i)}\in\mathbb{R}^M\),(3) 其诱导的权重更新为 \(\Delta W(\theta) = \sum_{i=1}^\ell \operatorname{diag}(\bm{\alpha}^{(i)}) B_1 \operatorname{diag}(\bm{\beta}^{(i)}) B_2 \operatorname{diag}(\bm{\gamma}^{(i)}) \in \mathbb{R}^{N\times M}\)。(4) 适配后的前向传播为 \(\bm{y} = W_0^\top \bm{x} + \Delta W(\theta)^\top \bm{x}\),精确存储成本为 \(\mathrm{bits}(\theta) = R(N+M) + 16\ell(N+R+M)\)。(5) 我们将 \(R\) 称为*二进制载体秩*(二进制矩阵乘法的内维度),保留 \(r_0\) 用于仅在 BPW 标准化中使用的固定参考 LoRA 秩。式 (5) 的精确存储成本引出两个 BPW 指标: \(\mathrm{BPW}_{\mathrm{bc}} \coloneqq \frac{R}{r_0},\qquad \mathrm{BPW}_{\mathrm{tot}} \coloneqq \frac{R(N+M) + 16\ell(N+R+M)}{r_0(N+M)}\)。(6) \(\mathrm{BPW}_{\mathrm{bc}}\) 仅计数二进制载体;\(\mathrm{BPW}_{\mathrm{tot}}\) 包括所有 fp16 缩放向量。在默认工作点 \(R=r_0, \ell=1\) 处,当 \(r_0, N, M \to \infty\) 时,\(\mathrm{BPW}_{\mathrm{tot}} \to 1\)。所有表格报告 \(\mathrm{BPW}_{\mathrm{tot}}\) 和以 MB 为单位的实际存储。典型的 \(\ell=1, R=r_0\) 情况简化为 \(\Delta W = \operatorname{diag}(\bm{\alpha}) B_1 \operatorname{diag}(\bm{\beta}) B_2 \operatorname{diag}(\bm{\gamma})\) (图2 (https://arxiv.org/html/2605.24058#S1.F2))。对于 \(\ell \geq 2\),式 (4) 求和了 \(\ell\) 个秩-\(R\) 项;推理成本随 \(\ell\) 线性增长,而二进制载体存储不变。 ### 3.2 LoRDBA 训练 在 (A1)–(A4) 条件下,LoRDBA 在下游任务上以冻结的基 \(\widetilde{W}_0 = \mathrm{dequant}(W_Q)\) 进行端到端训练。该流程包含三个组件:带二值化载体的前向传播、带平滑符号 STE 的反向传播,以及基于 SVD 的初始化。我们称此流程为 QAT Full;所有主要结果均使用它。 #### 前向和反向传播。我们维护实值潜在载体 \(H_1 \in \mathbb{R}^{N\times R}, H_2 \in \mathbb{R}^{R\times M}\),并在前向传播中对其二值化:\(B_1 = \operatorname{sign}(H_1), B_2 = \operatorname{sign}(H_2)\)。权重更新 \(\Delta W(\theta)\) 通过式 (4) 计算。在反向传播中,不可微的 \(\operatorname{sign}(\cdot)\) 被替换为带温度调度的平滑符号直通估计器 (STE) (Leng et al., 2018 (https://arxiv.org/html/2605.24058#bib.bib23); Liu et al., 2020 (https://arxiv.org/html/2605.24058#bib.bib28); Boža and Macko, 2025a (https://arxiv.org/html/2605.24058#bib.bib7); Ichikawa and Arai, 2025 (https://arxiv.org/html/2605.24058#bib.bib17); Ichikawa, 2024 (https://arxiv.org/html/2605.24058#bib.bib16))(附录 F (https://arxiv.org/html/2605.24058#A6))。最近对量化模型训练的高维分析进一步表明,STE 动力学可能受到量化超参数(如位宽和量化范围)的强烈影响 (Ichikawa et al., 2025c (https://arxiv.org/html/2605.24058#bib.bib20))。通道级缩放 \((\bm{\alpha},\bm{\beta},\bm{\gamma})\) 以 fp32 训练,并在导出时转换为 fp16。流程的其余部分(AdamW 优化器、数据流程、学习率调度)与标准 LoRA 训练循环相同。 #### 初始化。潜在载体从短序列的秩-\(R\) 薄 SVD 初始化。

相似文章

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。