TopoTuner: 大型语言模型的拓扑微调

arXiv cs.AI 论文

摘要

介绍TopoTuner,一种拓扑引导的微调框架,通过持续图之间的Wasserstein距离测量拓扑漂移,从而选择性冻结注意力投影矩阵。该框架在仅训练1-2%参数的情况下,性能与全微调相当,并在大多数设置中优于LoRA。

arXiv:2607.16637v1 公告类型: 新 摘要: 全微调仍然是适配预训练大语言模型的有效方式,但它会更新所有权重且成本较高。LoRA减少了可训练参数数量,但并未直接回答在适配过程中哪些预训练组件应被训练、哪些可以冻结。我们提出TopoTuner,一种拓扑引导的微调框架,用于选择性冻结注意力投影矩阵。该方法将每个投影矩阵视为一个行云,并利用持续图之间的Wasserstein距离来衡量其拓扑在微调过程中的变化。 TopoTuner从源数据集中学习一个可复用的冻结配置文件,并将其迁移到域外数据集上高效微调模型,评估任务特定的拓扑漂移是否能够在问答和情感分析任务间泛化。 在LLaMA-3.1-8B、Mistral-7B-v0.3和Qwen3-8B-Base上,TopoTuner仅训练模型参数的1-2%即可达到与全微调相竞争的性能,并在9个模型-数据集设置中的7个上优于LoRA,最多可改变39.57%的投影参数。除最小化更新外,TopoTuner相对于全微调平均减少20.4%的训练时间,相对于LoRA平均减少5.5%。TopoTuner为可复用冻结配置文件开辟了新方向,使得在一个数据集上学到的微调行为能够跨多个任务共享。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:39

# TopoTuner:大型语言模型的拓扑微调  
来源:https://arxiv.org/html/2607.16637  

Abdulkadir Erol  
计算机科学系  
中佛罗里达大学  
美国奥兰多  
[email protected]  

Yash Mahajan  
计算机科学系  
中佛罗里达大学  
美国奥兰多  
[email protected]  

Vepaul Hariprashad  
计算机科学系  
中佛罗里达大学  
美国奥兰多  
[email protected]  

Baha Rababah  
计算机科学系  
曼尼托巴大学  
加拿大  
[email protected]  

Santu Karmaker  
计算机科学系  
中佛罗里达大学  
美国奥兰多  
[email protected]  

Cuneyt G. Akcora  
金融系  
中佛罗里达大学  
美国奥兰多  
[email protected]  

Mubarak Shah  
计算机科学系  
中佛罗里达大学  
美国奥兰多  
[email protected]  

###### 摘要  

全参数微调仍然是适配预训练LLM的有效方式,但会更新所有权重且计算成本高昂。LoRA减少了可训练参数数量,但并未直接回答哪些预训练组件应该被训练、哪些在适配过程中可以冻结的问题。我们提出 **TopoTuner**,一种拓扑引导的微调框架,用于选择性冻结注意力投影矩阵。TopoTuner将每个投影矩阵视为一个行点云,并利用持续同调图之间的 Wasserstein 距离来衡量其拓扑结构在微调过程中的变化。TopoTuner从源数据集学习可复用的冻结配置文件,并将其迁移到域外数据集上高效微调模型,评估任务特定的拓扑漂移是否能在问答和情感分析任务中泛化。在 LLaMA-3.1-8B、Mistral-7B-v0.3 和 Qwen3-8B-Base 上,TopoTuner 在仅训练 1-2% 模型参数的情况下,与全参数微调竞争力相当,并在 9 个模型-数据集设置中的 7 个上优于 LoRA,其投影参数变化率可达 39.57%。在最小化更新的同时,TopoTuner 平均训练时间相比全参数微调减少 20.4%,相比 LoRA 减少 5.5%。TopoTuner 开辟了可复用冻结配置文件的新方向,使得在一个数据集上学习到的微调行为能够在多个任务间共享。  

## 1 引言  

微调 [18, 37] 是将预训练大语言模型(LLM)适配到下游任务(如问答 [40])的标准机制。全参数微调更新所有模型权重,仍然是强 baseline,但成本高昂,并且可能损害预训练获得的能力,存在灾难性遗忘 [20]、对窄任务分布过拟合 [15] 以及对齐行为不稳定 [19] 的风险。参数高效方法(PEFT)[37](如 LoRA [13])减少了可训练参数数量,通常仍能恢复较强的任务性能。然而,匹配下游精度并不能回答一个基本的结构性问题:预训练模型的哪些部分在适配过程中实际上需要改变?此外,尽管 LoRA 使用低秩更新,但它仍可能对许多甚至所有权重矩阵施加更新,而对预训练组件缺乏显式控制。  

这个问题之所以重要,是因为在实际中,微调很少是单任务的 [14]。模型会跨领域适配,并经常跨数据集复用。一种仅控制可训练参数数量的方法,无法表明模型的哪些部分发生了变化,这些变化在相关任务间是否一致,或者主要结构变化发生在哪个 epoch。标准的摘要指标(如谱、范数和稀疏度)衡量更新的大小或秩结构,但并不能直接描述权重矩阵结构如何变化 [29]。  

拓扑学 [3] 提供了一种原则性方法,研究模型参数在微调过程中如何重组。我们可以将每个注意力投影矩阵视为由其行形成的点云,并使用拓扑数据分析 [5] 获得该几何结构的稳定多尺度摘要。然后,预训练与微调矩阵的持续同调图之间的距离,给出了矩阵级别的结构变化度量,可用于对冻结矩阵进行排序。这种观点还提出了一种跨任务复用此类冻结配置文件的充分条件:微调轨迹不必完全相同;只需诱导的梯度场保持接近预训练模型即可。这一洞察使我们能够引入 **TopoTuner**,一个拓扑引导的框架,用于测量和控制LLM微调。该方法跟踪拓扑漂移(每个权重矩阵相对于其预训练状态的结构变化),并利用此信号构建可复用的冻结配置文件,以及在主要结构变化发生后停止训练。这将微调从参数数量问题重新定义为结构控制问题:TopoTuner不再仅仅问更新多少个参数,而是问哪些预训练组件应该被允许重组。  

我们在三个语言模型上评估 TopoTuner,涵盖六个任务族:问答、情感分析、信息检索、摘要、指令遵循和代码生成。我们的结果表明,漂移轮廓是模型相关的,因此无法在不同架构之间固定投影级别的规则。然而,对于固定模型,从某个数据集学习到的轮廓可以迁移到其他任务,平均将全参数微调时间减少 20.4% 以及 LoRA 微调时间减少 5.5%,同时保持有竞争力的精度。拓扑漂移还揭示了冻结如何改变适配路径。冻结低漂移矩阵可以使主路径保持开放,并将更新分散到许多层;而冻结高漂移矩阵(如图1所示)则可能阻塞该路径,迫使剩余可训练矩阵以更集中的模式吸收更新,从而减少过拟合。这种重新分配解释了为什么漂移对于矩阵选择、任务比较和早停是有用的。  

参照图注  
图 1:LLaMA O-投影在高漂移 Wasserstein 冻结(33 到 15 层)下的变化。随着训练过程中更多矩阵被冻结,剩余可训练矩阵以更集中的方式吸收更新;选择性冻结将适配重新分配到各层。  

我们的贡献如下。  
- • 我们提出了 **TopoTuner**,一个拓扑引导的框架,用于衡量注意力投影矩阵在微调过程中如何重组,并利用此信号观察和控制哪些矩阵保持可训练。据我们所知,这是第一个利用 LLM 权重的拓扑摘要来构建跨任务可复用冻结配置文件的工作。  
- • 我们通过预训练和微调权重的持续同调图之间的 Wasserstein 距离定义了矩阵级别的拓扑漂移。我们证明,这种漂移捕捉到的结构变化超越了逐项幅度,并将其用于选择性矩阵冻结和基于拓扑的早停。  
- • 我们将 TopoTuner 与 PEFT 和全参数微调 baseline 进行比较。在迁移知识实验中,TopoTuner 在 9 个模型-数据集设置中的 7 个上优于 LoRA,同时平均将 wall-clock 训练时间减少 20.4%,并且参数更新量比 LoRA 少 88.36%。TopoTuner 在大多数运行中在 2 到 3 个 epoch 后停止微调,将 6 个 epoch 的预算减少 50%–66.7%,同时保留接近最终验证集的精度。  

参照图注  
图 2:TopoTuner 概览。TopoTuner 使用先前的微调任务来计算注意力投影矩阵的拓扑漂移。计算得到的拓扑漂移用于 (A) 构建可复用的冻结配置文件,用于新数据集和任务的选择性微调,以及 (B) 跨 epoch 跟踪结构变化以实现早停。冻结配置文件见附录 B。  

## 2 相关工作  

**拓扑方法。** 持续同调(PH)已成为分析神经网络表示的有力工具。Pérez-Fernández 等人将神经网络视为抽象单纯复形,并通过持续同调提取其拓扑指纹 [24]。作者定义了一种基于 PH 的描述符,可以作为训练模型之间的相似性度量。此外,持续同调可以揭示逐层的组织差异。Purvine 等人通过将每一层的激活视为高维点云来分析 CNN 的隐藏表示 [25]。作者计算了层间激活空间的基于持续性的距离,并表明这些距离捕捉到了层行为中有意义的差异。这些工作确立了持续同调(通过持续同调图及其距离)为量化深度网络的结构相似性提供了严格的框架。然而,据我们所知,还没有先前工作使用拓扑信号通过选择性冻结来引导 LLM 微调。  

**微调策略。** 微调大型 Transformer 模型可以在单个权重矩阵或整个层的粒度上进行。多种矩阵级别的适配技术(通常称为参数高效微调 PEFT [37])限制哪些参数被更新以降低计算成本。一个突出的例子是 LoRA [13],它在权重层中插入低秩更新矩阵。在此基础上,“Deep LoRA” [39] 同时对多个 Transformer 层应用低秩分解,将微调更新限制在每层的一个低维子空间中。这种策略在数据有限时减轻了过拟合。在另一个极端,层级策略决定哪些整层被训练或冻结。Zheng 等人 [42] 冻结底部 25% 的 Transformer 层,在持续学习场景中获得了更好的下游性能。除了静态冻结,最近的方法还在层级动态调整训练。代表性方法是 DropBP,它在每次更新时随机跳过某些层的梯度反向传播,由一种敏感性度量引导,该度量估计每层对训练损失的影响 [35]。敏感性较低的层获得更高的丢弃率,实际上在某些训练步骤中被暂时冻结。这种自适应调度仅以全频率训练最“关键”的层,减少了时间成本。相比之下,我们使用拓扑漂移来衡量每个注意力投影矩阵相对于预训练模型如何重组,并利用此信号构建可复用的冻结配置文件,以及决定微调何时稳定。  

## 3 预备知识  

设 \( f_\theta \) 表示一个预训练的大语言模型,参数化为一组权重矩阵 \(\theta = \{W_i\}_{i=1}^m\),其中 \(W_i \in \mathbb{R}^{d_i \times d_i'}\)。我们用 \(\mathcal{I} \subseteq \{1,\dots,m\}\) 表示矩阵的索引集。  

**任务与微调。** 给定下游任务 \(\mathcal{T}\) 及训练数据 \(\mathcal{D}_{\mathcal{T}} = \{(x_r, y_r)\}_{r=1}^N\),微调求解  
\[
\tilde{\theta} = \arg\min_{\vartheta} \frac{1}{N} \sum_{r=1}^N \ell\big(y_r,\ f_{\vartheta}(x_r)\big),
\]  
其中 \(\ell\) 是有监督损失函数。所得模型记为 \(f_{\tilde{\theta}}\),参数为 \(\tilde{\theta} = \{\tilde{W}_i\}_{i=1}^m\)。  

**拓扑工具。** 持续同调是拓扑数据分析中的工具,用于总结拓扑在过滤过程中的演化 [5, 12]。设 \(\mathcal{X} = \{x_1,\dots,x_n\} \subset \mathbb{R}^d\) 是一个带距离函数 \(\Delta\) 的点云。我们构建 Vietoris–Rips 过滤 \(\{ \mathrm{VR}_\varepsilon(\mathcal{X}) \}_{\varepsilon \ge 0}\),其中单纯形根据成对距离在尺度 \(\varepsilon\) 下被添加 [5]。为简单起见,我们将此过滤记为 \(\mathcal{K}_1 \subset \mathcal{K}_2 \subset \dots \subset \mathcal{K}_n\)。  

**拓扑特征与持续同调图。** 对于过滤中的每个复形 \(\mathcal{K}_i\),设 \(H_k(\mathcal{K}_i)\) 为其第 \(k\) 个同调群,其非平凡类表示 \(k\) 维拓扑特征,例如 \(k=0\) 时为连通分量,\(k=1\) 时为环路,\(k=2\) 时为空洞。随着过滤的增长,特征出现和消失;\(q_j = (b_j, d_j) \in \mathrm{PD}(\mathcal{X})\) 表示 \(\mathcal{X}\) 中一个拓扑特征的**出生**和**死亡**时间,位于**持续同调图**(PD)中。第 \(k\) 个持续同调图记为 \(\mathrm{PD}_k(\mathcal{X})\),是所有此类特征的**出生-死亡**对的多重集。具有较大持续度 \(d_j - b_j\) 的特征通常被认为是更显著的。  

**p-Wasserstein 距离。** 给定同一同调维度 \(k\) 下的两个持续同调图 \(\mathrm{PD}_k(\mathcal{X})\) 和 \(\mathrm{PD}_k(\mathcal{X}')\),它们的 p-Wasserstein 距离为  
\[
\mathcal{W}\!\mathit{ass}_p(\mathrm{PD}_k(\mathcal{X}),\mathrm{PD}_k(\mathcal{X}')) = \min_{\phi} \left( \sum_j \| q_j - \phi(q_j) \|_\infty^p \right)^{1/p},
\]  
其中 \(\phi\) 遍历允许对角线匹配的部分匹配。该距离衡量两个点云底层拓扑摘要之间的差异程度。  

## 4 LLM 微调的拓扑特征  

拓扑数据分析基于一个原则:数据有形状,形状有意义 [3]。相应地,我们将 LLM 中的每个投影(即权重矩阵)视为一个几何对象,并研究其内部结构在微调过程中跨 epoch 的演变。我们基于拓扑的假设是:投影的持续同调图提供了这种组织的拓扑摘要,而预训练与微调后图之间的距离产生了有用的投影级别结构变化度量。我们的目标是使用该度量使微调更加可控:识别哪些投影可以冻结,并复用这些

相似文章

Super-Tuning: 从激活感知剪枝到稀疏微调

arXiv cs.CL

本文介绍了 Super 和 Supra 两种稀疏参数高效微调方法,它们重用来自剪枝的显著性信号(如 Wanda 分数)来选择可训练的支持集,并与 LoRA 结合,以更少的内存和计算在算术任务上取得了高准确率。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。