DLR: 零推理成本的隐式残差用于低秩预训练

arXiv cs.LG 论文

摘要

引入重复隐式残差(DLR),这是一种仅训练、无参数的插件,用于低秩预训练,可提升从60M到7B参数的LLaMA模型的困惑度,并且训练后可折叠到模型中,推理成本为零。

arXiv:2606.28932v1 公告类型: 新 摘要: 大型语言模型推动了语言和多模态AI的最新进展,然而大规模预训练成本过高。低秩预训练将每个权重矩阵分解为秩-r乘积,从而减少参数和FLOPs,是一种有前景的应对方案,但通常在质量上落后于全秩训练。我们提出重复隐式残差(DLR),这是一种仅训练、无参数且可折叠的插件,用于低秩预训练。DLR在标准的低秩输出Bz上添加一个固定的结构化残差alpha/sqrt(K) * Expand_K(z),该残差将每个隐式坐标复制K = ceil(d_out/r)次到输出中。将alpha固定后,DLR每层不增加可学习参数;训练后,可通过闭式形式将其吸收到上投影中:B* = B + alpha/sqrt(K) R^T,因此部署时的参数数量、FLOPs和内存与底层低秩骨干完全一致。在从60M到7B参数的LLaMA模型上,DLR在C4验证集困惑度上增强了低秩预训练,在大多数设置下效果显著,尤其在130M及以上规模时;折叠后的检查点可以干净地迁移到标准基准上的监督微调。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:30

# 零推理成本潜在残差用于低秩预训练

来源:https://arxiv.org/html/2606.28932

王东⋄,唐文武⋄,程云†,Olga Saukh⋄

⋄奥地利格拉茨技术大学,†瑞士数据科学中心

{dong.wang, wenwu.tang, saukh}@tugraz.at, [email protected]

###### 摘要

大语言模型推动了语言和多模态AI领域的最新进展,然而大规模预训练的成本极其高昂。低秩预训练将每个权重矩阵分解为秩为 \(r\) 的乘积,以减少参数量和FLOPs,这是一种有前景的应对方法,但通常在质量上落后于全秩训练。我们提出了**复制潜在残差**(Duplicated Latent Residual, DLR),这是一种**仅用于训练**、**无参数**、**可折叠**的低秩预训练插件。DLR 在标准低秩输出 \(Bz\) 上增加了一个固定的结构化残差 \(\frac{\alpha}{\sqrt{K}} \mathrm{Expand}_K(z)\),该残差将每个潜在坐标复制 \(K = \lceil d_{\mathrm{out}} / r \rceil\) 次到输出维度。将 \(\alpha\) 固定后,DLR 在每层不增加任何可学习参数;训练后,它以闭式形式被吸收进上投影:\(B^\star = B + \frac{\alpha}{\sqrt{K}} R^\top\),因此部署时的参数量、FLOPs 和内存与底层低秩骨干网络完全相同。在从 60M 到 7B 参数的 LLaMA 模型上,DLR 在大多数设置中提升了低秩预训练在 C4 验证集上的困惑度,在 130M 及以上规模效果最为显著;折叠后的检查点可无缝迁移到标准基准上的监督微调。

## 1 引言

大语言模型(LLMs)在语言、视觉和多模态领域彻底改变了机器学习,然而这一成功伴随着不可持续的成本。现代 LLMs 的预训练需要大量的计算、内存和能源资源,像 LLaMA-3 (Grattafiori et al., 2024)、Qwen-3 (Yang et al., 2025)、DeepSeek-V3 (Liu et al., 2024) 和 GPT-4 (OpenAI et al., 2024) 等模型消耗了数千个 GPU 月。这激发了大量关于高效预训练方法的研究,旨在保持模型质量的同时降低训练成本。

参考图说明

**图 1:概述与困惑度-吞吐量权衡。** (a) 复制潜在残差(DLR)是低秩解码器的一个仅用于训练的残差分支,在推理前通过折叠移除。(b) DLR 改善了 LLaMA-1B 的困惑度-吞吐量权衡;完整结果见表 1。

现有的高效预训练方法有三种形式:将 LoRA 风格的低秩更新扩展到预训练 (Lialin et al., 2023; Zhou et al., 2025; Mo et al., 2025),将梯度投影到低秩子空间以压缩优化器状态 (Zhao et al., 2024; Chen et al., 2024),以及修改网络结构,采用低秩参数化并可能辅以稀疏补偿或潜在空间混合 (Han et al., 2024; Li et al., 2025; Liu et al., 2025; Zhang et al., 2025)。第三种路线是直接减少可训练参数和前向 FLOPs 的最直接途径,但许多为补偿秩 \(r\) 瓶颈而引入的额外通路(稀疏残差、通道稀疏补偿或层间潜在门控)*在推理时仍然存在*。因此,部署这些增强变体需要提供修改后的推理图,而非标准的秩 \(r\) 解码器,从而放弃了低秩预训练最具吸引力的实际特性之一:与现有低秩推理栈的即插即用兼容性。一个自然的问题出现了:*我们能否在不牺牲参数和计算效率的前提下改善低秩骨干网络的训练动态?*

我们提出**复制潜在残差**(Duplicated Latent Residual, DLR),这是一个**仅用于训练**、**无参数**、**可折叠**的低秩预训练插件。DLR 在标准低秩输出 \(Bz\) 上增加了一个固定的结构化残差,该残差将每个潜在坐标复制 \(K = \lceil d_{\mathrm{out}} / r \rceil\) 次到输出维度,并用 \(\alpha / \sqrt{K}\) 进行重新缩放,提供了一个不依赖于学习所得解码器的额外梯度路径(图 1)。将 \(\alpha\) 固定后,训练时每层不增加任何可学习参数。训练后,该残差通过闭式形式被吸收进上投影:\(B^\star = B + (\alpha / \sqrt{K}) R^\top\),其中 \(R \in \{0,1\}^{r \times d_{\mathrm{out}}}\) 是由复制操作(\(\mathrm{Expand}_K(z) = R^\top z\),见公式 10)诱导出的结构化二进制复制矩阵。折叠后的检查点在底层低秩推理栈上运行,参数量、FLOPs 和内存占用与基础骨干网络完全相同。实验表明,在从 60M 到 7B 的 LLaMA 预训练规模上,DLR 在大多数设置中增强了四种代表性低秩骨干网络(线性低秩、CoLA (Liu et al., 2025)、LOST (Li et al., 2025) 和 LaX (Zhang et al., 2025)),且使用单一的未调优配置,仅在最小的 60M 规模上结果有混合;在 1B 规模下,DLR+LOST 组合将 PPL 从 15.02 降至 14.74,在我们的单种子 7B 对比中,DLR+CoLA 从 40K 步开始超越已报道的 LOST 基线,同时每个 GPU 内存使用减少 2.3×(表 1,表 2)。折叠后的检查点可干净地迁移到 Alpaca-cleaned 上的监督微调,在比较的三个检查点中,DLR+CoLA 平均准确率略高,尽管通过与普通 CoLA 相同的推理图进行部署。我们总结贡献如下:

- **可折叠的训练残差**。我们给出一个闭式恒等式 \(B^\star = B + \frac{\alpha}{\sqrt{K}} R^\top\),将 DLR 吸收进任何暴露潜在到输出解码器的低秩参数化的上投影中,从而获得与基础方法相同的部署图结构、参数量、FLOPs 和内存占用。
- **无参数训练开销**。将 \(\alpha = 1\) 固定后,DLR 每层不增加任何可学习参数。其训练时前向成本为单一的 `repeat_interleave` 加加法,在 `torch.compile` 下开销很小,折叠后推理开销为零。
- **骨干网络无关的插件**。单一的 DLR 配置在从 130M 到 7B 的 LLaMA 预训练规模上,在 C4 困惑度方面改进了四种低秩骨干网络(线性低秩、CoLA、LOST、LaX),在 60M 规模上结果有混合(表 1,表 2);折叠后的检查点可干净地迁移到 Alpaca-cleaned SFT,其中 DLR+CoLA 在比较的 1B 检查点中平均准确率略高(表 4)。

## 2 低秩高效预训练

### 2.1 设定与统一视角

考虑 transformer 块中的一个线性映射(省略偏置):

\[
y = Wx, \quad W \in \mathbb{R}^{d_{\mathrm{out}} \times d_{\mathrm{in}}}, \; x \in \mathbb{R}^{d_{\mathrm{in}}}.
\tag{1}
\]

许多高效预训练方法可以表示为:

\[
y = \underbrace{\Phi_{\mathrm{LR}}(x; \theta)}_{\text{低秩骨干网络}} + \underbrace{\Phi_{\mathrm{EX}}(x; \psi)}_{\text{额外补偿}},
\tag{2}
\]

其中 \(\Phi_{\mathrm{LR}}\) 是低秩骨干网络(可能在潜在空间中是非线性的),\(\Phi_{\mathrm{EX}}\) 是额外的补偿路径。我们使用统一的符号。令 \(r \ll \min(d_{\mathrm{in}}, d_{\mathrm{out}})\) 为秩,\(A \in \mathbb{R}^{d_{\mathrm{in}} \times r}\) 为下投影,\(B \in \mathbb{R}^{d_{\mathrm{out}} \times r}\) 为上投影,并定义潜在表示:

\[
z = s \cdot \phi(A^\top x) \in \mathbb{R}^r,
\tag{3}
\]

其中 \(\phi(\cdot)\) 是可选的激活函数,\(s\) 是标量缩放(固定或可学习)。除非另有说明,我们关注的是*低秩预训练*,其中线性映射由 \((A, B)\) 参数化(而不是在单独的冻结基础权重之上添加适配器)。这种统一分解使我们能够通过引入额外学习信号的位置和方式(超越秩 \(r\) 骨干网络)来比较看似不同的高效预训练方法。特别是,它清晰地表明改进是源自修改潜在表示,还是添加新的权重空间路径。

### 2.2 统一符号下的基线方法

**线性低秩** (Hu et al., 2021)。线性低秩参数化将 \(W\) 替换为 \(BA^\top\):

\[
\Phi_{\mathrm{LR}}(x) = B(A^\top x), \qquad \Phi_{\mathrm{EX}}(x) \equiv 0.
\tag{4}
\]

这将乘法次数从 \(d_{\mathrm{out}} d_{\mathrm{in}}\) 减少到 \(r(d_{\mathrm{out}} + d_{\mathrm{in}})\),并将优化器状态减少到 \((A, B)\) 的大小,但固定的秩通常表现不如全秩预训练 (Kamalakara et al., 2022; Khodak et al., 2021)。

**SLTrain(低秩 + 元素级稀疏残差)** (Han et al., 2024)。SLTrain 用固定支持的稀疏残差增强低秩分解:

\[
W = BA^\top + S, \quad \mathrm{supp}(S) = \Omega, \; |\Omega| = k,
\tag{5}
\]

其中 \(\Omega \subseteq [d_{\mathrm{out}}] \times [d_{\mathrm{in}}]\) 在初始化时采样一次。等价地:

\[
\Phi_{\mathrm{LR}}(x) = B(A^\top x), \qquad \Phi_{\mathrm{EX}}(x) = Sx.
\tag{6}
\]

因此 SLTrain 通过显式的稀疏权重空间路径提升表达能力,这与 DLR 的固定潜在空间残差不同,后者被折叠进 \(B\)。

**LOST(低秩 + 通道稀疏补偿)** (Li et al., 2025)。LOST 将低秩分支与 SVD 引导的通道稀疏组件结合,旨在覆盖互补方向:

\[
\Phi_{\mathrm{LR}}(x) = B z, \qquad \Phi_{\mathrm{EX}}(x) = W_s P_I x,
\tag{7}
\]

其中 \(P_I \in \{0,1\}^{k \times d_{\mathrm{in}}}\) 选择输入通道的子集 \(I\)(大小为 \(k\)),因此 \(P_I x \in \mathbb{R}^k\) 恰好包含输入到学习到的补偿矩阵 \(W_s \in \mathbb{R}^{d_{\mathrm{out}} \times k}\) 的通道;等价地,\(W_s\) 的列对应于 \(P_I\) 选择的通道。潜在变量 \(z\) 由公式 3 定义。补偿路径是学习得到的,并保留在部署图中,而 DLR 在训练时添加固定的潜在残差,并将其折叠进 \(B\)。

**CoLA(非线性潜在低秩)** (Liu et al., 2025)。CoLA 保持纯低秩解码器,但使潜在表示非线性:

\[
\Phi_{\mathrm{LR}}(x) = B z, \quad z = s \cdot \phi(A^\top x), \qquad \Phi_{\mathrm{EX}}(x) \equiv 0.
\tag{8}
\]

它通过潜在门控丰富了可训练性,而不添加独立的权重空间补偿路径,使其成为 DLR 的自然骨干网络。

**LaX(层间潜在残差)** (Zhang et al., 2025)。LaX 通过在潜在空间中引入*层间*残差来改善低秩训练。对于层潜在变量 \(z_i = s \cdot \phi(A_i^\top x_i)\),它形成:

\[
\tilde{z}_i = z_i + G(z_{i-1}), \qquad y_i = \mathrm{LN}(B_i \tilde{z}_i),
\tag{9}
\]

其中 \(G\) 是轻量级对齐门控,输出 LayerNorm 遵循原始公式。在统一视角下,LaX 保持相同的低秩解码器形式,但从前一层的潜在变量添加了信息流,在不增加目标秩 \(r\) 的情况下改善了可训练性。

综上所述,这些方法展示了改善低秩预训练的两种主导策略:(i) 添加辅助权重空间路径以补偿秩不足(例如,SLTrain, LOST),或 (ii) 在保持单一低秩解码器的同时丰富潜在表示(例如,CoLA, LaX)。DLR 最自然地描述为潜在空间插件,但它可以附加到任何暴露低秩潜在到输出解码器 \(Bz\) 的骨干网络上,包括混合方法(如 LOST)的低秩分支。因此,它通过固定的、非学习到的扩展来瞄准训练动态,而不将设计绑定到特定的低秩骨干网络。

## 3 复制潜在残差(DLR)

**关键想法**。给定一个现有的低秩层,具有潜在变量 \(z \in \mathbb{R}^r\) 和输出 \(Bz\),DLR 附加一个*层内潜在空间*残差,用*固定的结构化解码器*将同样的潜在变量扩展到输出宽度,如图 1 所示。令 \(K = \lceil d_{\mathrm{out}} / r \rceil\),并定义扩展算子:

\[
\mathrm{Expand}_K : \mathbb{R}^r \to \mathbb{R}^{d_{\mathrm{out}}}, \quad [\mathrm{Expand}_K(z)]_i = z_{\lfloor i / K \rfloor},
\tag{10}
\]

如果 \(rK > d_{\mathrm{out}}\),则最后一个块被截断。等价地,\(\mathrm{Expand}_K(z) = R^\top z\),其中 \(R \in \{0,1\}^{r \times d_{\mathrm{out}}}\) 是固定的二进制复制矩阵,\(R_{j,i} = \mathbb{1}\{j = \lfloor i / K \rfloor\}\)。训练时使用的插件形式为:

\[
y = Bz + \frac{\alpha}{\sqrt{K}} \cdot \mathrm{Expand}_K(z) + b,
\tag{11}
\]

其中 \(\alpha \in \mathbb{R}\) 控制残差强度(在所有实验中固定)。因此,复制潜在残差(DLR)是增强而非替换标准低秩层:骨干网络仍然提供 \(A\)、\(B\)、激活函数以及任何其他潜在空间结构,而 DLR 仅在训练时贡献固定的残差项 \(\frac{\alpha}{\sqrt{K}} \mathrm{Expand}_K(z)\)。

直观上,DLR 将输出空间视为部分冗余,并利用结构化复制使每个潜在坐标暴露给多个输出通道。与稀疏或通道选择性补偿不同,产生的残差是密集的、固定的且高度结构化的,从而在不引入不规则稀疏性的情况下实现对输出空间的均匀覆盖。因此,DLR 提供了额外的学习信号,绕过了学习所得解码器的条件。

相似文章

低秩注意力残差

arXiv cs.LG

本文介绍了一种用于大语言模型(LLMs)的低秩注意力残差(LR-AttnRes),该方法通过使用低维键进行深度注意力,将路由与表示解耦,在减少FLOPs的同时提升了性能。

预测随机低维重参数化何时能训练神经网络

arXiv cs.LG

本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。