基于汉克尔降阶建模的SSM适配器:注入位置决定长上下文微调中的任务适配性
摘要
介绍了一种基于汉克尔降阶模型(HRM)的适配器,这是一种通过平衡截断初始化的SSM残差模块,用于参数高效微调,在长上下文任务中优于LoRA。
查看缓存全文
缓存时间: 2026/06/26 05:17
# 基于Hankel降阶建模的SSM适配器:注入位置决定长上下文微调中的任务适配性
来源:https://arxiv.org/html/2606.26290
###### 摘要
尽管参数高效微调(PEFT)通常针对注意力投影器,但其在需要序列状态累积的任务上的有效性仍待深入探索。我们研究了PEFT在此类任务中能否从状态空间模型(SSM)适配器中受益,以及MLP模块是否是更好的注入位置。我们引入Hankel降阶模型(HRM)适配器,这是一种基于SSM的残差模块,通过经验Hankel Gramian矩阵的平衡截断进行初始化。利用系统矩阵\(\bar{A}\)的时不变性,HRM实现了精确的基于FFT的并行扫描,在所有上下文长度下均达到与LoRA相当的计算量。在Mistral-7B(8.4M可训练参数)的等参数量评估中,HRM在LongBench任务上优于LoRA变体,包括QuALITY(相对准确率提升+34.8%)和QMSum(相对ROUGE-1提升+71.6%)。HRM在18种合成状态追踪(DFA、Parity)和字符级语言建模(enwik8)配置中持续展现优越性。门控分析表明,HRM适配器有效学习了调节循环机制,为长上下文序列建模提供了一种稳健的低秩自适应架构替代方案。
状态空间模型,可控性,可观性,Gramian矩阵,Hankel秩约减
## 1 引言
参数高效微调(PEFT)是适配大型预训练语言模型(LLM)以适应下游任务的主流范式。PEFT方法并非更新整个模型权重,而是插入适配器或修改一小部分参数,同时冻结模型主干。低秩自适应(Hu等,2022 (https://arxiv.org/html/2606.26290#bib.bib1))是应用最广泛的PEFT方法,在语言理解、生成和指令遵循等任务上取得强劲结果,同时仅增加约0.1–1%的额外参数。LoRA将权重更新参数化为\(\Delta W = BA\),其中\(B \in \mathbb{R}^{d_{out} \times r}\)且\(A \in \mathbb{R}^{r \times d_{in}}\)。学习矩阵\(A, B\)使得秩\(r \ll \min(d_{out}, d_{in})\),适配后层的前向传播变为:
\[
h_t = W_0 x_t + BA x_t = (W_0 + BA) x_t \tag{1}
\]
其中模型权重\(W_0\)保持冻结,对应输入\(x_t\)在位置\(t\)。我们观察到,LoRA(及其相关方法:DoRA(Liu等,2024 (https://arxiv.org/html/2606.26290#bib.bib2))、QloRA(Dettmers等,2023 (https://arxiv.org/html/2606.26290#bib.bib5))、AdaLoRA(Zhang等,2023b (https://arxiv.org/html/2606.26290#bib.bib4)))的权重自适应计算是输入\(x_t\)的静态线性函数。因此,位置\(t\)的适配器输出无法访问先前位置:\(x_{t-1}, x_{t-2}, \cdots\)。这并非低秩建模的失败,因为无论\(r\)取何值,LoRA都无法获得时间记忆访问能力。
为了说明这个核心问题,考虑微调一个模型来模拟4状态确定性有限自动机(DFA)。每一步的正确输出不仅取决于当前输入符号,还取决于从起始点开始的累积转移序列。一个4状态DFA可能处于4种配置之一,这取决于整个历史\(x_1, x_2, \cdots, x_{t-1}\)。无论秩如何,LoRA都将当前状态简化为\(x_t\)的静态函数,因此在结构上无法表示跨位置持续存在的状态。尽管如此,LoRA、DoRA、AdaLoRA和QLoRA在位置无关的自适应任务(如领域风格迁移、事实知识注入和指令遵循)上取得了出色的结果,这在文献中已有充分记载。
为此,我们研究以下问题:*是否可能构造一种PEFT适配器,使其能够 (1) 为冻结的Transformer添加时间循环状态,(2) 可证明地压缩到最小状态维度,(3) 计算量与LoRA相当,同时在跨领域的远程任务上取得更好性能?*
\[
\begin{array}{c}
\text{Q} \quad \text{K} \quad \text{V} \\
\downarrow \\
\text{注意力(冻结,不变)} \\
\downarrow \\
\text{SSM适配器} \quad \bar{A} \in \mathbb{R}^{r \times d_{in}} \\
\downarrow \\
\text{MLP(冻结)} \\
\downarrow \\
\text{门控} \\
\hline
\text{Hankel降阶模型} \\
W_0 \text{(冻结权重)} \\
B \in \mathbb{R}^{d_{out} \times r} \quad A \in \mathbb{R}^{r \times d_{in}} \\
\text{Q} \quad \text{K} \quad \text{V}
\end{array}
\]
图1:架构对比。LoRA修改权重矩阵;其在位置\(t\)的输出是\(x_t\)的静态函数。HRM适配器插入一个并行循环分支,其隐藏状态整合了所有先前的表示。
## 2 相关工作
所有主要的PEFT方法都具有位置独立性(或称位置无关权重微调)这一共同结构特性。LoRA (Hu et al., 2022 (https://arxiv.org/html/2606.26290#bib.bib1)), AdaLoRA (Zhang et al., 2023b (https://arxiv.org/html/2606.26290#bib.bib4)), QLoRA (Dettmers et al., 2023 (https://arxiv.org/html/2606.26290#bib.bib5)), LoRA+ (Hayou et al., 2024 (https://arxiv.org/html/2606.26290#bib.bib6)):所有这些方法都计算 \(h = f(x_t)\),不依赖于 \(t\) 或先前位置。AdaLoRA 自适应地分配秩,但最终的更新仍然是静态矩阵乘积。IA3 (Liu et al., 2022 (https://arxiv.org/html/2606.26290#bib.bib7)) 应用学习到的向量重新缩放隐藏状态,这是一种乘以位置无关标量的操作,也导致了静态更新(参见图1 (https://arxiv.org/html/2606.26290#S1.F1))。
一些工作向输入前添加学习到的软标记 (Lester et al., 2021 (https://arxiv.org/html/2606.26290#bib.bib8); Li and Liang, 2021 (https://arxiv.org/html/2606.26290#bib.bib9))。这些标记在输入处提供上下文,但并未定义循环状态,Transformer 在前缀之后仍然独立处理每个位置。用于 PEFT 的基础适配器方法 (Houlsby et al., 2019 (https://arxiv.org/html/2606.26290#bib.bib10); Pfeiffer et al., 2020 (https://arxiv.org/html/2606.26290#bib.bib11)) 向预训练 Transformer 模型中插入小型 MLP 瓶颈。瓶颈 \(h = W_2 \cdot \sigma(W_1 \cdot x_t)\) 仅依赖于 \(x_t\),没有记忆循环。(Houlsby et al., 2019 (https://arxiv.org/html/2606.26290#bib.bib10)) 在每个 Transformer 层中放置两个适配器瓶颈模块,而 (Pfeiffer et al., 2020 (https://arxiv.org/html/2606.26290#bib.bib11)) 则放置单个适配器,可训练参数减半。
另一方面,状态空间模型(SSM)在缓解长上下文中的二次注意力成本方面显示出潜力。结构化状态空间序列(S4)模型由 (Gu et al., 2021 (https://arxiv.org/html/2606.26290#bib.bib14)) 引入,采用基于 HiPPO 的状态空间层和卷积模式推理,随后 S4D (Gu et al., 2022 (https://arxiv.org/html/2606.26290#bib.bib13)) 通过限制为对角状态空间矩阵 \(\bar{A}\) 进行了改进,虽然牺牲了表达能力但实现了更简单的推理。最后,Mamba 模型 (Gu and Dao, 2023 (https://arxiv.org/html/2606.26290#bib.bib15)) 引入了输入相关的状态矩阵 \((A_t, B_t)\),实现了选择性记忆。
混合模型架构,如 Griffin (De et al., 2024 (https://arxiv.org/html/2606.26290#bib.bib16)), MambaFormer (Park et al., 2024 (https://arxiv.org/html/2606.26290#bib.bib17)), 和 Jamba (Lieber et al., 2024 (https://arxiv.org/html/2606.26290#bib.bib18)),利用 SSM 层与 Transformer 结合。表面上它们与我们的工作(HRM 在每个 MLP 块处插入 \(d=32\) 的 SSM;MambaFormer 在注意力块之间插入 Mamba 层)相似。关键区别在于训练模式:每种混合架构都需要在数十亿个 token 上从头开始联合训练。HRM 是第一个在 PEFT 场景中添加 SSM 式时间记忆的方法;因此,主干被冻结,适配器约有 0.1% 的参数,并且除了微调任务之外不需要任何预训练数据。因此,拥有冻结预训练 GPT-2 的用户无法应用 MambaFormer,但可以应用 HRM。
(a) 循环隐藏状态、(b) 通过模型降阶的可证明压缩、(c) 与静态适配器相当的计算量——这三者的结合在文献中尚未出现。据我们所知,最接近的相关工作是 SLoRA ((Sheng et al., 2024 (https://arxiv.org/html/2606.26290#bib.bib24))) 以及相关的低秩 SSM 方法,这些方法将 SSM 视为 LoRA 秩近似的结构化替代方案。然而,这些方法并未应用平衡截断,未提供误差界限,也未解决循环计算的开销问题。
## 3 背景
#### LoRA
低秩自适应 (LoRA) (Hu et al., 2022 (https://arxiv.org/html/2606.26290#bib.bib1)) 基于一个观察:微调期间预训练模型的权重更新 \(\Delta W \in \mathbb{R}^{d_{out} \times d_{in}}\) 位于低固有维度中 (Aghajanyan et al., 2021 (https://arxiv.org/html/2606.26290#bib.bib33))。这促使将更新参数化为秩 \(r\) 的乘积:
\[
\Delta W = BA, \quad B \in \mathbb{R}^{d_{out} \times r} \text{ 且 } A \in \mathbb{R}^{r \times d_{in}} \tag{2}
\]
训练期间 \(W_0\) 被冻结,仅更新 \(B\) 和 \(A\)。推理时,更新被吸收为 \(W_{eff} = W_0 + BA\),不增加推理延迟,前向传播为:
\[
h = W_{eff} x = (W_0 + BA) x = W_0 x + B(A x) \tag{3}
\]
标准实践中,LoRA 应用于每个自注意力块的 \(Q\) 和 \(V\) 投影矩阵。对于具有 \(n_{layers}\) 层、\(d_{model}\) 注意力维度的模型,这贡献了 \(4r \cdot n_{layers} \cdot d_{model}\) 个可训练参数。映射 \(h = (W_0 + BA)x\) 仅是 \(x\) 的线性函数。矩阵 \(W_{eff}\) 在所有位置固定。如果我们索引序列位置为 \(t\),则位置 \(t\) 的 LoRA 输出为 \(h_t^{LoRA} = (W_0 + BA)x_t\),不依赖先前的输入 \(x_{t-1}\) 等。
适配器对每个 token 应用相同的线性变换 \(B A\),与位置或上下文无关,因此是无记忆的。AdaLoRA (Zhang et al., 2023b (https://arxiv.org/html/2606.26290#bib.bib4)) 处理了秩分配问题,但并未解决记忆问题。它将 \(\Delta W = P \Lambda Q\) 参数化,其中 \(P, Q\) 正交,\(\Lambda\) 为对角(奇异值分解结构),基于重要性剪枝 \(\Lambda\) 的条目。结果仍然是当前 token 的静态线性映射。QLoRA (Dettmers et al., 2023 (https://arxiv.org/html/2606.26290#bib.bib5)) 处理了内存效率(\(W_0\) 的 4 位量化),DoRA (Liu et al., 2024 (https://arxiv.org/html/2606.26290#bib.bib2)) 分解为幅度和方向分量。两者仍是当前 token 的静态函数。因此,现有的 LoRA 变体保留了无记忆属性。
#### SSM
连续时间线性状态空间模型 (SSM) 由以下方程定义:
\[
\dot{x}(t) = A x(t) + B u(t), \quad y(t) = C x(t) + D u(t) \tag{4}
\]
其中隐藏状态 \(x \in \mathbb{R}^d\),输入 \(u \in \mathbb{R}^m\),输出 \(y \in \mathbb{R}^p\),状态转移(或系统)矩阵 \(A\),\(B\) 为输入矩阵,\(C\) 为输出矩阵,\(D\) 为前馈或跳跃矩阵。对于序列建模,对连续时间系统进行离散化以获得循环关系。给定时间步 \(\Delta t\),零阶保持 (ZOH) 离散化得到:
\[
\begin{aligned}
x_t &= \bar{A} x_{t-1} + \bar{B} u_t, \quad y_t = C x_t \\
\bar{A} &= e^{A \Delta t}, \quad \bar{B} = A^{-1} (e^{A \Delta t} - I) B
\end{aligned} \tag{5}
\]
离散 SSM 定义了从输入序列 \(\{u_1, ..., u_T\}\) 到输出序列 \(\{y_1, ..., y_T\}\) 的线性映射:
\[
y_t = \sum_{k=0}^t \underbrace{C \bar{A}^{t-k} \bar{B}}_{g_{t-k}} u_k = (g \star u)_t \tag{6}
\]
其中 \(g_k\) 是系统的脉冲响应。这导致输出序列可以写成脉冲响应与输入的因果卷积。
结构化状态空间 (S4) (Gu et al., 2022 (https://arxiv.org/html/2606.26290#bib.bib13)) 表明,当 \(\bar{A}\) 被初始化为特定的正规加低秩 (NPLR) 矩阵时,SSM 可以建模具有慢衰减稳定脉冲响应的长程依赖关系。S4 的关键计算洞察是因果卷积 \((g \star u)\) 可以通过 FFT 在 \(\mathcal{O}((T \log T))\) 内计算。我们将在后续章节中也利用这一事实进行计算。
最后,*离散 SSM 的稳定性*要求 \(\bar{A}\) 的所有特征值严格位于单位圆内,即 \(\max |\lambda_i(\bar{A})| < 1\)。对于具有实对角元的 \(\bar{A}\),这需要 \(|\bar{A}_{ii}| < 1\)。我们将通过参数化来强制执行这一点,因为我们的降阶建模要求底层线性时不变 (LTI) 系统是稳定的。
#### LTI 系统中的平衡截断
考虑 (5) 中的 LTI 动力学(即固定的 \(G \triangleq (\bar{A}, \bar{B}, C, D)\)),状态维度为 \(d\)。LTI 动态系统 \(G\) 的降阶建模问题在于找到一个状态维度为 \(\hat{d} < d\) 的降阶系统 \(\hat{G}\),使得 \(G\) 和 \(\hat{G}\) 的输入输出行为尽可能接近,并带有量化的误差界限。*平衡截断* (BT) (Moore, 2003 (https://arxiv.org/html/2606.26290#bib.bib32)) 是对于稳定 LTI 系统该问题的经典解法。
LTI 系统的状态 \(v \in \mathbb{R}^d\) 是*可控的*,如果存在一个输入序列可以将 \(G\) 从原点驱动到 \(v\)。LTI 系统的可控性依赖于*可控性 Gramian 矩阵* \(W_c \in \mathbb{R}^{d \times d}\),一个正半定矩阵,定义为:
\[
W_c = \sum_{k=0}^\infty \bar{A}^k \bar{B} \bar{B}^T (\bar{A})^k \tag{7}
\]
等价地,\(W_c\) 已知是离散时间 Lyapunov 方程的解 (Corless and Frazho, 2003 (https://arxiv.org/html/2606.26290#bib.bib30)):
\[
\bar{A} W_c \bar{A}^T - W_c + \bar{B} \bar{B}^T = 0 \tag{8}
\]
相反,状态 \(v\) 是*可观的*,如果可以从输出序列 \(\{y_k\}\) 唯一确定初始状态 \(v\)。类似地,LTI 系统的可观性依赖于其*可观性 Gramian 矩阵* \(W_o \in \mathbb{R}^{d \times d}\),定义为:
\[
W_o = \sum_{k=0}^\infty (\bar{A}^T)^k C^T C \bar{A}^k \tag{9}
\]
其对应的 Lyapunov 方程为:
\[
\bar{A}^T W_o \bar{A} - W_o + C^T C = 0 \tag{10}
\]
矩阵 \(W_c\) 和 \(W_o\) 在通过形成联合 Hankel 算子 \(\mathcal{H}: \{\text{过去输入}\} \to \{\text{未来输出}\}\}\)相似文章
SOS-LoRA: 静态正交子空间低秩适应结合固定多尺度缩放
SOS-LoRA 通过将秩预算分解为具有固定多尺度缩放的静态正交低秩专家来扩展 LoRA,在不增加推理成本的情况下提升了在推理、NLU 和数学基准上的微调性能。
CRMA: 一种用于LLM模块化持续微调的谱界主干
CRMA引入了一种谱界残差适配器,通过Sinkhorn归一化强制实现双随机混合矩阵,使LLM能够持续微调而不发生灾难性遗忘。在Mistral-7B和Gemma-2-9B上的实验结果表明,与冻结基底的基线相比,后向迁移得到改善,遗忘减少。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
PFAdapter:面向个性化联邦多模态大语言模型的分层LoRA分解
本文介绍了PFAdapter,一种用于多模态大语言模型(MLLMs)个性化联邦微调的通信高效框架。它采用分层LoRA分解,将适配器参数分离为全局共享和本地私有组件,通过正交正则化实现通信成本降低近50%,同时提升个性化性能。
SemiAdapt-Instruct: Extensible Instruction Tuning via Latent Domain-Specialised Adapters
SemiAdapt-Instruct proposes a modular framework that discovers latent instruction domains, trains per-domain LoRA adapters in parallel, and routes among them without extra parameters, enabling extensible instruction tuning where new domains require only single-adapter updates instead of full retraining.