FRAME: 使用分数阶傅里叶专家混合体学习适应域

arXiv cs.LG 论文

摘要

提出FRAME,一种使用可学习分数阶傅里叶阶数在空间域和频谱域之间插值的专家混合适配器,提升了LLMs在多个基准上的参数高效微调性能。

arXiv:2607.00162v1 公告类型:新 摘要:参数高效微调(PEFT)在固定基上重新参数化权重更新:低秩适配器在空间域中运作,而近期一系列频谱方法则在固定傅里叶域中运作。我们认为,域的选择本身就是一个应学习的设计自由度,并且没有单一的基在所有任务、层或令牌上都是最优的。我们引入了分数阶傅里叶专家混合体(Fractional-Fourier Mixture of Experts),这是一种专家混合适配器,其中每个专家携带一个可学习的分数阶傅里叶阶数,该阶数在空间域(恢复普通LoRA)和傅里叶域(恢复频谱适配器)之间连续插值。通过将令牌路由到占据该空间-频谱连续体上不同位置的专家,模型可以将每个低秩更新放置在其最紧凑的域中,并且——由于不同阶数的分数阶傅里叶算子相互不连贯——使得专家自然地去相关,从而减少干扰并改进多任务组合。阶数是每个专家一个标量,用单独的优化器训练,变换通过$\mathcal{O}(d\log d)$啁啾-FFT代理计算,因此分数阶傅里叶专家混合体相比标准MoE-LoRA增加了可忽略的成本。在LLaMA-3.1-8B和Qwen2.5-7B上的常识、数学、代码和知识基准测试中,分数阶傅里叶专家混合体优于强大的MoE-LoRA和频谱基线——包括FlyLoRA、FourierMoE和HMoRA——同时保持较小的活跃参数预算,分析表明学习到的阶数以可解释的方式按任务和层专业化。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:36

# 学习自适应域:一种混合分数阶傅里叶专家方法
来源: https://arxiv.org/html/2607.00162
Tom Saliencro1, Maya Lindqvist1, Rohan Desai2, Priya Nair1, Daniel Whitmore2

1加州大学尔湾分校 2华盛顿大学 saliencro@gmail\.com

###### 摘要

参数高效微调 (PEFT) 在固定基中重新参数化权重更新:低秩适配器在*空间*域中操作,而近期一系列谱方法在*固定*傅里叶域中操作。我们认为,域的选择本身就是一个应学习的设计自由度,且没有单一基能在所有任务、层或词元上达到最优。我们提出Frame(*分数阶傅里叶专家混合*),一种专家混合适配器,其中每个专家携带一个可学习的*分数阶傅里叶阶数*,该阶数在空间域(恢复标准 LoRA)和傅里叶域(恢复谱适配器)之间连续插值。将词元路由到占据该空间-谱连续体上不同点的专家,使得模型可以将每个低秩更新放置在其最紧凑的域中,并且——由于不同阶数的分数阶傅里叶算子相互不相关——专家自然去相关,从而减少干扰并改善多任务组合。阶数是每个专家一个标量,使用独立优化器训练,变换通过 O(d log d) 的 chirp–FFT 替代实现,因此Frame相比标准 MoE-LoRA 增加的成本可以忽略不计。在 LLaMA-3.1-8B 和 Qwen2.5-7B 上的常识、数学、代码和知识基准测试中,Frame优于强 MoE-LoRA 和谱基线(包括 FlyLoRA、FourierMoE 和 HMoRA),同时保持较小的激活参数预算,分析表明学习到的阶数按任务和层以可解释的方式专门化。

Frame: 学习自适应域:一种混合分数阶傅里叶专家方法

Tom Saliencro1, Maya Lindqvist1, Rohan Desai2, Priya Nair1, Daniel Whitmore21加州大学尔湾分校2华盛顿大学saliencro@gmail\.com

## 1 引言

参数高效微调 (PEFT) 通过训练少量额外参数来适配冻结的基础模型 (Houlsby et al., 2019 (https://arxiv.org/html/2607.00162#bib.bib1); Li and Liang, 2021 (https://arxiv.org/html/2607.00162#bib.bib4); Lester et al., 2021 (https://arxiv.org/html/2607.00162#bib.bib5))。低秩适配 (LoRA) 是主流实例:它将线性层的权重更新写为两个低秩矩阵的乘积,并已成为指令调优和领域特化的默认方法 (Hu et al., 2022 (https://arxiv.org/html/2607.00162#bib.bib2); Dettmers et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib3))。在不增加激活参数数量的情况下增加单个适配器容量的一种自然方法是将其转化为专家混合 (MoE),将每个词元路由到少数几个特化的低秩模块 (Dou et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib12); Li et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib13); Wu et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib14); Tian et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib15))。

几乎所有这些方法都共享一个隐含假设:更新在*空间*(标准坐标)域中参数化,其中低秩先验直接施加在权重矩阵上。另一条独立且不断发展的研究路线则将更新在*傅里叶*域中参数化,学习一组稀疏或低秩的谱系数,并通过逆变换映射回来 (Gao et al., 2024b (https://arxiv.org/html/2607.00162#bib.bib25); Borse et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib26); Bilican et al., 2025 (https://arxiv.org/html/2607.00162#bib.bib27); Zhang et al., 2025 (https://arxiv.org/html/2607.00162#bib.bib28))。谱适配器具有吸引力,因为预训练权重的更新通常在谱上集中,并且傅里叶基是全局的:少量系数就能表达高秩的空间更新。最新的谱方法甚至构建了具有频率感知路由器的频带专家混合 (Jiang et al., 2026 (https://arxiv.org/html/2607.00162#bib.bib29))。

这导致该领域存在两个阵营——空间域和谱域——以及它们之间隐含的、未经审视的选择。我们将这种选择明确化,并提出了一个不同的问题:*适配器应该在哪个域中为低秩?*我们的答案是,域根本不应该固定。空间基和傅里叶基仅仅是单参数酉变换族(分数阶傅里叶变换 FrFT)的两个端点,其阶数 a 在时频平面内连续旋转信号:a=0 是恒等变换(空间域),a=1 是普通傅里叶变换 (Namias, 1980 (https://arxiv.org/html/2607.00162#bib.bib32); Almeida, 1994 (https://arxiv.org/html/2607.00162#bib.bib33))。每个中间阶数都是合法的、信息保持的域,而现有 PEFT 方法均未利用这一点。

参见图注 图 1: 自适应域很重要,且并非普遍适用。(a) 对 LoRA 风格适配器扫描单个固定分数阶傅里叶阶数 a,最佳验证准确率出现在任务依赖的*中间*阶数——既不是空间端点 (a=0) 也不是傅里叶端点 (a=1)。(b) 最紧凑捕捉更新的阶数随 Transformer 深度变化,从早期层的近空间阶数转移到后期层的更谱域阶数。(c) 能量压缩:通过顶部 r 个成分捕捉的更新能量分数在任务特定阶数处最大化,因此固定基会浪费容量。Frame学习阶数的*混合*而不是固定于一个。

我们提出Frame(*分数阶傅里叶专家混合*),一种将自适应域作为每个专家可学习量的 PEFT 方法。Frame是低秩专家的混合,其中每个专家 i 拥有一个标量阶数 a_i,并在阶数 a_i 的分数域中施加其低秩更新。一个词元路由器每词元激活前 k 个专家,因此不同词元在不同域中适配,并且阶数本身通过梯度下降训练。该构造是现有适配器的严格泛化:阶数 a_i=0 的专家就是 LoRA 专家,阶数 a_i=1 的专家则是傅里叶域专家,因此Frame将空间 MoE-LoRA 和谱 MoE-LoRA 作为特例包含在内,并学习在连续体上的位置。

这个想法有三个后果。*表达性*:由于不同阶数诱导不同的秩-r 子空间,跨越多个阶数的混合可以表示任何相同秩的单域适配器无法表示的更新 (§4 (https://arxiv.org/html/2607.00162#S4), §5 (https://arxiv.org/html/2607.00162#S5))。*去相关*:不同阶数的分数阶算子相互不相关,因此不同阶数的专家自然去相关,这减少了专家之间和任务之间的干扰 (Borse et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib26))。*效率*:阶数是每个专家一个标量,变换可通过 O(d log d) 的 chirp–FFT 分解 (Ozaktas et al., 1996 (https://arxiv.org/html/2607.00162#bib.bib34)),因此学习域几乎无额外成本。图1 (https://arxiv.org/html/2607.00162#S1.F1) 预览了动机:扫描单个固定阶数时,最优值是任务和层依赖的中间值。我们总结贡献如下。

- • 我们将 PEFT 中的空间域-谱域二分法重新定义为一个连续的轴,即分数阶傅里叶阶数,并展示了最优自适应域因任务、层和词元而异 (§1 (https://arxiv.org/html/2607.00162#S1), §4 (https://arxiv.org/html/2607.00162#S4))。
- • 我们提出Frame,一种具有每专家可学习阶数、O(d log d) 变换替代、基于阶数带的分组负载均衡以及针对阶数的独立优化器的专家混合适配器 (§4 (https://arxiv.org/html/2607.00162#S4))。
- • 我们提供理论:Frame严格泛化 LoRA 和傅里叶适配器,其阶数梯度有界,专家根据阶数间距可证明去相关,替代几乎是精确的 (§5 (https://arxiv.org/html/2607.00162#S5))。
- • 在四个任务族和两个骨干模型上,Frame以更低的激活参数成本优于强 MoE-LoRA 和谱基线,并具有可解释的学习阶数专门化 (§6 (https://arxiv.org/html/2607.00162#S6))。

## 2 相关工作

#### 低秩和专家混合 PEFT。

LoRA (Hu et al., 2022 (https://arxiv.org/html/2607.00162#bib.bib2)) 及其后续工作优化秩预算、分解更新或缩小足迹 (Zhang et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib6); Liu et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib7); Ding et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib8); Kopiczko et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib9))。专家混合变体通过将词元路由到几个低秩专家来提高固定激活成本下的容量 (Dou et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib12); Li et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib13); Wu et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib14); Gao et al., 2024a (https://arxiv.org/html/2607.00162#bib.bib16); Ren et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib18); Zadouri et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib20))。HydraLoRA 共享跨非对称专家的下投影 (Tian et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib15));HMoRA 通过 LoRA 专家层次结构进行路由 (Liao et al., 2025 (https://arxiv.org/html/2607.00162#bib.bib17));LD-MoLE 使路由可微分且动态 (Zhuang et al., 2026 (https://arxiv.org/html/2607.00162#bib.bib22));MoA 认为*异构*专家比相同专家去相关效果更好 (Cao et al., 2026 (https://arxiv.org/html/2607.00162#bib.bib21))。Frame采用这种异构专家模板——词元路由、分组均衡、针对异质性参数的独立优化器以及廉价替代——但引入了一个新的异质性轴:每个专家拥有一个可学习的分数阶傅里叶阶数,将其更新在空间域和谱域之间旋转。所有这些方法都在空间域中操作,并且是Frame中 a=0 特例的实例。

#### 谱 PEFT。

另一条互补路线在固定变换域中重新参数化更新。FourierFT 学习一组稀疏的谱系数并通过逆 DFT 恢复空间更新 (Gao et al., 2024b (https://arxiv.org/html/2607.00162#bib.bib25));FouRA 将低秩投影放在傅里叶域中,并观察到所得基是去相关的且合并良好 (Borse et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib26));WaveFT 转向小波域以实现极致稀疏性 (Bilican et al., 2025 (https://arxiv.org/html/2607.00162#bib.bib27));CrossSpectra 利用跨层谱平滑性 (Zhang et al., 2025 (https://arxiv.org/html/2607.00162#bib.bib28))。FourierMoE 将这一思想与 MoE 结合,将词元路由到拥有固定频带的专家 (Jiang et al., 2026 (https://arxiv.org/html/2607.00162#bib.bib29))。这些方法都承诺使用*单一*变换(DFT 或 DWT)。Frame则通过学习阶数本身来学习变换,在 a=1 处恢复 FourierFT 风格的谱适配器,在 a=0 处恢复 LoRA,作为连续体的两个端点,并让混合占据中间域。

#### 去相关、干扰和合并。

为什么域除了紧凑性之外还重要?占据重叠子空间的更新会造成干扰,无论是在多任务模型内部还是在独立训练的适配器合并时 (Ilharco et al., 2022 (https://arxiv.org/html/2607.00162#bib.bib36); Yadav et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib37); Matena and Raffel, 2022 (https://arxiv.org/html/2607.00162#bib.bib39); Ortiz-Jimenez et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib40); Yu et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib38); Zhang and Zhou, 2025 (https://arxiv.org/html/2607.00162#bib.bib42))。一个常见的补救措施是将更新推入去相关或相互正交的子空间:持续学习和多任务适配的正交子空间约束 (Chaudhry et al., 2020 (https://arxiv.org/html/2607.00162#bib.bib44); Wang et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib43); Zhang and Zhou, 2025 (https://arxiv.org/html/2607.00162#bib.bib42)),稀疏或随机投影 (McDonnell et al., 2023 (https://arxiv.org/html/2607.00162#bib.bib51); Zou et al., 2025c (https://arxiv.org/html/2607.00162#bib.bib24), b (https://arxiv.org/html/2607.00162#bib.bib50), a (https://arxiv.org/html/2607.00162#bib.bib49)),以及基天然去相关的频域投影 (Borse et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib26))。Frame通过可学习的机制追求相同的目标:在良好分离的分数阶阶数上的专家可证明是不相关的 (§5 (https://arxiv.org/html/2607.00162#S5)),因此域多样性——而不是固定投影或人为施加的正交性——起到了分离作用。

## 3 预备知识

#### LoRA 和 MoE-LoRA。

对于冻结线性层 W0 ∈ R^{d_out × d},LoRA 添加低秩更新 ΔW = BA,其中 A ∈ R^{r × d}, B ∈ R^{d_out × r}, r ≪ d,因此层计算 W0 x + (α/r) BA x (Hu et al., 2022 (https://arxiv.org/html/2607.00162#bib.bib2))。MoE-LoRA 层包含 N 个这样的专家 {(A_i, B_i)}_{i=1}^N 和一个路由器 g(x) = softmax(top-k(W_g x)),激活得分最高的 k 个专家:

MoE(x) = W0 x + (α/r) ∑_{i ∈ S(x)} g_i(x) B_i A_i x, (1)
其中 S(x) 是词元 x 的 top-k 专家 (Wu et al., 2024 (https://arxiv.org/html/2607.00162#bib.bib14); Fedus et al., 2022 (https://arxiv.org/html/2607.00162#bib.bib54))。

#### 分数阶傅里叶变换。

阶数为 a 的离散分数阶傅里叶变换 (DFrFT) 是一个酉矩阵 Φ_a ∈ C^{d×d},它推广了 DFT F (Namias, 1980 (https://arxiv.org/html/2607.00162#bib.bib32); Almeida, 1994 (https://arxiv.org/html/2607.00162#bib.bib33); Candan et al., 2000 (https://arxiv.org/html/2607.00162#bib.bib35))。记角度 θ = (π/2)a,其谱形式为

Φ_a = ∑_{m=0}^{d-1} e^{-i m θ} u_m u_m^⊤, (2)
其中 {u_m} 是所有阶数共享的(实)Hermite-Gauss 特征向量,m 索引特征相位。它满足我们通篇使用的四个性质:(i) *恒等*,Φ_0 = I;(ii) *傅里叶极限*,Φ_1 = F;(iii) *指数可加性*,Φ_a Φ_{a'} = Φ_{a+a'},因此 Φ_a Φ_a^* = I(酉性);以及 (iv) *帕塞瓦尔定理*,‖Φ_a v‖_2 = ‖v‖_2。我们记 Ra = Re{Φ_a} ∈ R^{d×d}。

相似文章

PFAdapter:面向个性化联邦多模态大语言模型的分层LoRA分解

arXiv cs.LG

本文介绍了PFAdapter,一种用于多模态大语言模型(MLLMs)个性化联邦微调的通信高效框架。它采用分层LoRA分解,将适配器参数分离为全局共享和本地私有组件,通过正交正则化实现通信成本降低近50%,同时提升个性化性能。

学习,快与慢:走向持续适应的LLMs

Hugging Face Daily Papers

一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。