基于Frames的Transformer模型微调

arXiv cs.AI 论文

摘要

本文提出FrameFT,一种参数高效的微调方法,使用Fusion Frame基中的稀疏系数,在减少内存占用的同时,达到或超过最先进的PEFT技术的性能。

arXiv:2608.26430v1 Announce Type: new 摘要:参数高效微调(PEFT)策略如低秩适应(LoRA)是微调大规模预训练模型的有效解决方案;然而,其内存需求随模型大小缩放,为 $\mathcal{O}(dr)$,其中 $d$ 是模型的隐藏维度,$r$ 是秩。我们提出的 FrameFT 使用Fusion Frame基中的稀疏系数矩阵建模参数更新 $\Delta W$。Fusion Frame可以算法生成并跨模型层共享,实现非常高效的更新。仅存储/优化基展开的稀疏系数,从而减少内存占用。FrameFT 中系数矩阵的稀疏结构以及Fusion Frame的稀疏性带来了巨大的计算优势,我们的分析提供了形式化的收敛结果。我们在一系列监督微调基准测试上评估了这一想法,重点关注语言任务,但也报告了其在视觉模型上的应用。实验表明,FrameFT 达到或超过了最先进的 PEFT 技术的性能,但所需的可训练参数少得多。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:35

# 基于帧结构的Transformer模型微调
来源:https://arxiv.org/html/2608.26430
Harshavardhan Adepu<sup>1</sup>、李张<sup>1</sup>(隶属机构:Google DeepMind)、Sanjiv Kumar<sup>1</sup>(隶属机构:Google DeepMind)、Vikas Singh<sup>2</sup>(隶属机构:威斯康星大学麦迪逊分校)

###### 摘要
参数高效微调(PEFT)策略(如低秩自适应LoRA)是微调大规模预训练模型的有效方案;然而其内存需求与模型规模成正比,复杂度为O(dr),其中d为模型隐藏维度,r为秩。我们提出的FrameFT方法在融合帧基中通过稀疏系数矩阵建模参数更新ΔW。融合帧可算法生成且跨模型层共享,实现高效更新。仅需存储/优化基展开的稀疏系数,显著降低内存占用。FrameFT中系数矩阵的稀疏结构与融合帧本身的稀疏性带来巨大计算优势,且我们的分析提供了形式化的收敛性证明。我们在一系列监督微调基准测试(侧重语言任务,同时涵盖视觉模型应用)中评估该方法。实验表明FrameFT达到或超越现有最先进PEFT技术的性能,且所需可训练参数大幅减少。

###### 关键词:机器学习,ICML

## 1 引言
基础模型在语言<sup>[25,26,27]</sup>、视觉<sup>[55]</sup>及其他模态<sup>[56,64]</sup>等领域展现出卓越能力。虽然增大模型规模能提升性能,但许多下游应用需要通过额外微调使模型适配特定任务。然而对大模型进行全参数微调成本高昂,当需要为多个任务微调时(每个任务需存储独立模型副本),成本将进一步加剧。

为解决这些难题,参数高效微调(PEFT)方法提供了替代方案<sup>[28,65,39]</sup>。这些技术力求最小化微调时的可训练参数量,从而显著降低资源需求。近期研究表明,PEFT方法在仅更新小部分参数的情况下,性能可与全模型微调相媲美<sup>[74,75]</sup>。

#### LoRA与稀疏微调
目前应用最广泛的PEFT技术是低秩自适应(LoRA)<sup>[28]</sup>。该方法冻结预训练权重,为每层注入任务特定的低秩矩阵。这些矩阵在保持低内存/计算成本的同时,提供了适配模型的灵活性。LoRA的成功催生了一系列改进变体,在收敛性、效率和存储开销方面均有提升<sup>[39,43,44,52,53]</sup>。

其中一类工作利用预训练权重的奇异值分解(SVD)构建固定的适配基<sup>[70,71]</sup>。但这需要密集的奇异向量,增加了内存占用并影响推理吞吐量。在多租户服务场景(单一预训练模型对应多个微调版本)中,这种开销尤为突出。

相比之下,稀疏微调(SFT)采用不同策略:选择性更新模型原始参数的稀疏子集。选择规则多样:部分方法基于幅值剪枝<sup>[54]</sup>,另一些则使用Fisher信息<sup>[30]</sup>、频域分析<sup>[29]</sup>或参数变化量度<sup>[31]</sup>等敏感度度量。SFT方法应用于大模型时可能面临可扩展性问题,尤其是在识别稀疏模式和调整超参数方面<sup>[30</sup>]。部分方案还依赖于可能不易获取的训练动态信息<sup>[31]</sup>。

#### 动机
LoRA的密集奇异向量和非对称A/B结构继承自矩阵近似方法,并被证明在微调中效果良好。SFT方法同样继承了模型剪枝的思想,即通过梯度或幅值代理识别任务相关参数。

我们采用用例驱动的方法提出以下问题:如果要同时实现微调(特别是特定场景)所需的表达能力、参数效率、稳定优化和计算可扩展性,应如何参数化权重更新?帧理论为此提供了自然解答。

简言之,有限帧与融合帧分别用于研究给定有限维向量空间的生成集与生成子空间。它们在编码理论、压缩感知<sup>[5]</sup>、量化<sup>[32,33]</sup>及字典学习<sup>[62,63]</sup>等领域有广泛应用。其通过重叠子空间编码更新的能力,提供了模型适配所需的鲁棒性、灵活性和效率。

FrameFT将模型参数空间划分为基于融合帧的子空间,在其中以高度稀疏且结构化的方式学习更新。

#### 我们的方案:基于帧的微调
我们受融合帧<sup>[3,4,7]</sup>启发提出新型PEFT策略。融合帧允许通过多尺度分解将空间表示为重叠子空间。与依赖低秩或稀疏更新的策略不同,FrameFT跨多个结构化子空间执行微调,自然结合了LoRA的全局适应性与稀疏更新的精确性。

#### 贡献
我们的主要贡献包括:
(a) 新型微调框架FrameFT,利用高度结构化的子空间(融合帧)高效捕获参数更新;
(b) 跨多种基础模型与任务的广泛实证评估,证明FrameFT相对于最先进PEFT基线的有效性;
(c) FrameFT数值稳定性、收敛性及计算效率优势的技术分析。

#### 利益冲突披露
两位作者(LZ、SK)在开发Gemma模型的Google DeepMind任职,另外两位作者(HA、VS)曾在Google DeepMind工作。

## 2 帧与子空间分解
我们简要回顾希尔伯特空间的有限帧理论<sup>[7,3]</sup>。熟悉这些概念的读者可跳过本节,直接阅读我们将该思想应用于微调的章节。

#### 生成集与帧
生成集是张成有限维希尔伯特空间或向量空间的向量集合,标准正交基是其典型范例。帧通过允许冗余推广了这一概念,从而实现稳定且通常更鲁棒的表示。

图1:R³中k=5个向量构成的紧框架示例。令ℋᵈ表示d维希尔伯特空间。若存在常数0<A≤B<∞,使得对所有x∈ℋᵈ满足A‖x‖²≤∑ᵢ₌₁ᵏ|⟨x,φᵢ⟩|²≤B‖x‖²,则向量序列φ=(φᵢ)ᵢ₌₁ᵏ称为帧(公式1)。其中⟨·,·⟩是ℋᵈ的内积,A、B称为帧界。通常k≥d使帧能以冗余方式表示向量。图1展示了R³中k=5个向量的实例,可将任意R³向量投影至这些帧向量而不失真<sup>[24]</sup>。

为简化讨论,全文在实值欧几里得空间Rᵈ而非更一般的希尔伯特空间中操作。融合帧进一步扩展上述思想至需要子空间分解(不仅是冗余)的场景。给定Rᵈ中的子空间集合{𝒲ᵢ}ᵢ₌₁ᵏ及对应正权重集合{wᵢ}ᵢ₌₁ᵏ,若存在常数0<A≤B<∞,使得对所有x∈Rᵈ满足A‖x‖²≤∑ᵢ₌₁ᵏwᵢ²‖Pᵢx‖²≤B‖x‖²(其中Pᵢ表示到子空间𝒲ᵢ的正交投影),则集合{(𝒲ᵢ,wᵢ)}ᵢ₌₁ᵏ构成融合帧。权重wᵢ调节各子空间的影响,A、B为融合帧界。若A=B则称为紧融合帧,若A=B=1则为Parseval融合帧。本文重点讨论Parseval融合帧。当所有权重wᵢ=1时,简记为{𝒲ᵢ}ᵢ₌₁ᵏ。帧界将在后续收敛性分析中发挥重要作用。

### 2.1 融合帧中的算子
设{(𝒲ᵢ,wᵢ)}ᵢ₌₁ᵏ为Rᵈ的融合帧,其正交投影矩阵为(Pᵢ)ᵢ₌₁ᵏ。定义三个算子:

分析算子𝒯_{𝒲}: Rᵈ → ⊕ᵢ₌₁ᵏ𝒲ᵢ将向量映射至各子空间的投影(公式2):
𝒯_{𝒲}(x) = (wᵢPᵢᵀx)ᵢ₌₁ᵏ

合成算子𝒯*_{𝒲}: ⊕ᵢ₌₁ᵏ𝒲ᵢ → Rᵈ从融合帧表示“重建”向量(公式3):
𝒯*_{𝒲}((yᵢ)ᵢ₌₁ᵏ) = ∑ᵢ₌₁ᵏwᵢPᵢyᵢ

融合帧算子是上述两算子的复合,定义为(公式4):
S_{𝒲}(x) = ∑ᵢ₌₁ᵏwᵢ²PᵢPᵢᵀx

该算子自伴、半正定且有界。对Parseval融合帧有S_{𝒲}=Iₙ(允许精确重建)。这些算子有助于将Rᵈ中的向量映射至其融合帧表示及其逆映射。

## 3 融合帧子空间中的微调
首先分析LoRA<sup>[28]</sup>中的子空间更新。其核心思想是通过低秩分解表示权重更新。对于预训练参数为Wₗ∈Rᵐˣⁿ的层l,LoRA将权重更新δWₗ分解为两个秩亏矩阵的乘积(公式5):
Wₗ' = Wₗ + δWₗ = Wₗ + BₗAₗ
其中Bₗ∈Rᵐˣʳ,Aₗ∈Rʳˣⁿ,r<min(m,n)。

为深入理解更新结构,检查δWₗ的奇异值分解(SVD)(公式6):
δWₗ = UΣVᵀ = UᵣΣᵣVᵣᵀ
其中U∈Rᵐˣᵐ、V∈Rⁿˣⁿ分别张成输出和输入空间的正交矩阵,Σ∈Rᵐˣⁿ为矩形对角矩阵。由于δWₗ的秩受限于r,可简化为UᵣΣᵣVᵣᵀ(Σᵣ仅含前r个奇异值,Uᵣ、Vᵣ为对应左右奇异向量)。

该分解揭示了LoRA更新的实质:Vᵣ在输入空间Rⁿ中定义子空间,输入首先投影至此;Σᵣ缩放这些投影;Uᵣ将其映射至输出空间Rᵐ的子空间。这些输入输出子空间作为矩阵B和A训练的隐式副产品出现,无法直接控制其特性或交互。

#### 非对称性
近期研究表明矩阵A和B的贡献具有非对称性,可能导致不稳定<sup>[43]</sup>或无法收敛至最优解<sup>[34]</sup>。这指出两个关键改进方向:
(i) 我们能否显式选择并使用乘法...

相似文章

ShadowPEFT:面向参数高效微调的阴影网络

arXiv cs.CL

ShadowPEFT 提出一种集中式参数高效微调方法,通过深度共享的阴影模块细化 Transformer 层表示,在可训练参数量与 LoRA/DoRA 相当的情况下实现同等甚至更优的性能。

微调陷阱:评估负迁移与PEFT在Sub-1B数学推理中的作用

arXiv cs.LG

本文对Sub-1B模型在数学推理任务上进行了基准测试,揭示全量微调会主动损害300M参数以下模型的性能,而LoRA和DoRA等参数高效微调(PEFT)则提供了稳定性。作者建议对所有对齐的Sub-1B模型默认使用PEFT,并警告不要对小于500M参数的架构使用全量微调,以防止灾难性遗忘。

联邦轻量级微调

arXiv cs.LG

本文介绍了FLITE(联邦低秩迭代训练引擎),一种联邦微调方法,通过使用冻结的仿射映射网络,从一个小型可训练潜变量和低秩可种子重生的因子分解生成权重,将每轮每客户端的通信量降至每轮1280个浮点数(约5KB)——相比于全权重FedAvg减少了8718倍。在CIFAR-100数据集上使用ResNet-18进行测试,准确率与全权重FedAvg相差在0.5个百分点以内。

YOLO-PEFT:YOLO系列上的参数高效微调

Hugging Face Daily Papers

YOLO-PEFT 是一个结构感知框架,将适配器放置建模为约束规划问题,用于 YOLO 检测器的参数高效微调,在降低内存占用的同时取得了优于全量微调的 mAP。