Mixture-of-Control: 面向Transformer模型的状态感知微调
摘要
提出了Mixture-of-Control (MoC),一种轻量级微调框架,通过稀疏专家混合机制整合局部和全局控制信号,实现高效的跨块通信,在性能上优于先前的基于状态的方法。
arXiv:2606.31397v1 公告类型:新
摘要:基于状态的微调已成为Transformer权重调整的一种有吸引力的替代方案,通过将轻量级控制更新到状态而非模型权重,在保持参数效率的同时显著节省内存。然而,大多数现有的基于状态的方法通常仅应用逐块控制更新,这限制了块间的信息交换并制约了表征适应。同时,先前实现跨块通信的机制往往引入大量计算开销,降低了其高效微调的实用性。我们提出了Mixture-of-Control (MoC),一种轻量级微调框架,可自适应地整合局部和全局控制信号以增强表征学习。MoC将逐块控制状态视为稀疏专家混合过程中的专家,实现了跨Transformer块的高效通信。在多种基于Transformer的基准测试中的实验结果表明,MoC优于基于状态的方法,同时保持相当的内存和计算效率。
查看缓存全文
缓存时间: 2026/07/01 05:36
# “混合控制:基于Transformer模型的状态感知微调”补充材料
来源:https://arxiv.org/html/2606.31397
###### 摘要
基于状态的微调已成为基于权重的Transformer适配方法的强有力替代方案,它通过将轻量级控制更新集成到状态中而非模型权重中,在保持参数效率的同时显著节省内存。然而,大多数现有基于状态的方法通常仅应用逐块控制更新,这限制了块间的信息交换和表征适应能力。与此同时,先前实现跨块通信的机制通常会引入可观的计算开销,降低了它们在高效微调中的实用性。我们提出混合控制(Mixture-of-Control, MoC),这是一个轻量级微调框架,能自适应地整合局部和全局控制信号以增强表征学习。MoC将逐块控制状态视为稀疏混合专家过程中的专家,从而在Transformer块间实现高效通信。跨多种基于Transformer的基准测试的实验结果表明,MoC在保持可比较的内存和计算效率的同时,性能优于基于状态的方法。
机器学习,ICML
## 1 引言
微调大型预训练模型是将基础模型适配到下游任务的标准方法,但全参数微调成本高昂:每个任务需更新和存储数十亿参数。参数高效微调(PEFT)通过冻结主干网络并仅学习少量任务参数来降低这一成本。在PEFT方法中,LoRA(Hu等人,2022(https://arxiv.org/html/2606.31397#bib.bib52))尤为有效,它用低秩项替代权重更新,在大幅减少可训练参数的同时基本保持性能。
许多LoRA变体——包括VeRA(Kopiczko等人,2023(https://arxiv.org/html/2606.31397#bib.bib53))、BinaryLoRA(Zhang等人,2024a(https://arxiv.org/html/2606.31397#bib.bib55))、MoLE(Wu等人,2024(https://arxiv.org/html/2606.31397#bib.bib54))和DoRA(Liu等人,2024a(https://arxiv.org/html/2606.31397#bib.bib56))——通过向量化更新、二值适配、混合LoRA专家或分解更新来进一步提升参数或计算效率。然而,大多数方法仍局限于层局部,跨层通信能力有限,限制了结构化表征的适应性。最近,MoLEx(Teo和Nguyen,2025(https://arxiv.org/html/2606.31397#bib.bib57))通过稀疏混合层专家(Sparse Mixture-of-Layer-Experts)部分解决了这个问题,但其Top-K选择需要额外的层前向传播,增加了每层成本,尤其是在大型模型中。
此外,现有方法通常只减少可训练参数,而未充分解决训练时的内存使用问题。例如,将DoRA的秩减半仅能在8B模型上减少0.256GB的GPU内存(Zhang等人,2025(https://arxiv.org/html/2606.31397#bib.bib51)),这表明更少的可训练参数未必带来有意义的内存节省。类似地,现有的跨层交互机制(如MoLEx(Teo和Nguyen,2025(https://arxiv.org/html/2606.31397#bib.bib57)))通常会增加大量计算和内存开销,随着架构复杂性和模型深度的增加,其可扩展性受限。
这两个问题——受限的跨层通信和高内存开销——催生了一个不同的视角:通过控制理论进行微调(Zhang等人,2024c(https://arxiv.org/html/2606.31397#bib.bib58))。与修改系统参数不同,控制系统通过反馈来引导状态。并行控制(Zhang等人,2025(https://arxiv.org/html/2606.31397#bib.bib51))将LoRA视为控制项,将激活视为状态,通过避免中间状态存储来减少内存。然而,它仍然局限于每一层,缺乏跨深度的全局协调。这引出了我们的核心研究问题:
研究问题
“如何设计基于状态的微调,使其能够捕获深层次跨层交互,同时又不牺牲其核心优势:内存效率?”我们通过**混合控制(Mixture-of-Control, MoC)** 来回答这个问题,这是一种轻量级的基于状态的方法,通过循环混合专家控制路径将局部和全局信号耦合起来。MoC将每一层的低秩控制模块视为一个*专家*,并使用一个共享门控机制将每层的表征稀疏路由到Top-K专家集合,从而产生全局控制信号。然后将此全局信号与层局部控制(例如\(\alpha\) vs. \(1-\alpha\))混合,并注入到冻结的块中,实现跨深度的自适应信息传播。我们的MoC通过低秩投影支持跨层通信,无需额外的预训练块前向传播,以极小的开销保持了状态内存效率。它是架构无关的(FFN或注意力层;共享或分离的门控),在跨基准测试中提升了鲁棒性和适应性,同时匹配PEFT级别的内存使用。
总之,我们的贡献有四个方面:
- • 我们指出了现有PEFT和基于状态的适配的关键局限性:控制器大多是块局部的(全局协调弱),而跨块机制通常会增加大量与块相关的计算,阻碍了向深层/复杂架构的扩展。
- • 我们展示了跨块通信可以通过一个轻量级的低秩*控制*路径来实现,该路径跨层交换信息而无需重用预训练块,为全块交互提供了一种高效替代方案。
- • 我们提出了**混合控制(Mixture-of-Control, MoC)**,一个稳定、内存高效的基于状态框架,将块局部控制与稀疏路由的全局控制专家混合集成,并有理论支持:在温和假设下,展示了表达性保持,同时改善了稳定性、梯度流和表征误差界。
- • 我们在八个预训练Transformer主干网络上进行了涵盖NLU和NLG基准测试的广泛实验,结果表明MoC在参数和内存效率上与强大的PEFT基线相当的同时,持续提升了适配效果。
## 2 相关工作
#### 参数高效微调
基于Transformer的模型(Vaswani等人,2017(https://arxiv.org/html/2606.31397#bib.bib19);Dosovitskiy等人,2020(https://arxiv.org/html/2606.31397#bib.bib24))的快速发展使得全参数微调在计算上变得昂贵,从而推动了参数高效微调(PEFT)。早期方法侧重于调优选定层(Oquab等人,2014(https://arxiv.org/html/2606.31397#bib.bib59);Alain和Bengio,2018(https://arxiv.org/html/2606.31397#bib.bib60);Lee等人,2023(https://arxiv.org/html/2606.31397#bib.bib61);Kaplun等人,2023(https://arxiv.org/html/2606.31397#bib.bib83)),而近期方法则向预训练模型中引入轻量级可训练组件。基于适配器的方法(Houlsby等人,2019(https://arxiv.org/html/2606.31397#bib.bib62);Mahbadi等人,2021(https://arxiv.org/html/2606.31397#bib.bib63))插入瓶颈模块,而基于提示的方法(Lester等人,2021(https://arxiv.org/html/2606.31397#bib.bib64);Liu等人,2022(https://arxiv.org/html/2606.31397#bib.bib65);Li和Liang,2021(https://arxiv.org/html/2606.31397#bib.bib66))优化软提示,但常受初始化敏感性困扰(Razdaibiedina等人,2023(https://arxiv.org/html/2606.31397#bib.bib67))。
#### 低秩适配
低秩适配方法,尤其是LoRA(Hu等人,2021(https://arxiv.org/html/2606.31397#bib.bib68)),通过使用低秩矩阵近似权重更新来减少可训练参数。后续变体通过参数共享、量化或自适应选择进一步提升效率(Kopiczko等人,2023(https://arxiv.org/html/2606.31397#bib.bib53);Dettmers等人,2023(https://arxiv.org/html/2606.31397#bib.bib71);Hyeon-Woo等人,2023(https://arxiv.org/html/2606.31397#bib.bib73);Zhang等人,2024b(https://arxiv.org/html/2606.31397#bib.bib82))。一个值得注意的扩展是使用混合LoRA专家(Wu等人,2024(https://arxiv.org/html/2606.31397#bib.bib54)),其中每层学习一组不同的低秩专家,用于自适应表征。最近,DoRA(Liu等人,2024a(https://arxiv.org/html/2606.31397#bib.bib56))将权重更新分解为幅度和方向分量,提供了改进的性能。尽管有这些进展,大多数方法仍局限于单个层,跨层通信能力有限,限制了适配过程中必要的表征。
#### 跨层通信适配
与局部适配策略不同,混合层专家(Mixture of Layer Experts, MoLEx)(Teo和Nguyen,2025(https://arxiv.org/html/2606.31397#bib.bib57))将每个预训练层(辅以LoRA)概念化为一个专家,并通过跨深度的Top-K路由执行稀疏升级,实现层间的全局信息交换。通过条件性地聚合这些层专家,MoLEx用跨层信号丰富了输入表征,提高了超越局部更新的适应性。然而,其Top-K路由机制需要额外通过所选预训练块进行前向传播,导致计算成本远高于纯局部方法,尤其对于更复杂的模型架构。
#### 控制理论视角与基于状态的调优
近期工作将PEFT与控制理论(Kirk,2004(https://arxiv.org/html/2606.31397#bib.bib50))联系起来,将深度网络解释为动力系统,其中层随时间演变特征状态(Li等人,2018(https://arxiv.org/html/2606.31397#bib.bib76))。这一视角已影响了对连续深度模型、稳定性和优化(Tabuada和Gharesifard,2024(https://arxiv.org/html/2606.31397#bib.bib77);Lu等人,2020(https://arxiv.org/html/2606.31397#bib.bib78);Nguyen等人,2024(https://arxiv.org/html/2606.31397#bib.bib79);Benning等人,2019(https://arxiv.org/html/2606.31397#bib.bib81))的研究。Zhang等人(Zhang等人,2024b(https://arxiv.org/html/2606.31397#bib.bib82))将LoRA形式化为一个受控动力系统,其中预训练模型定义了名义动力学,可学习的控制器实现了适配。在此基础上,基于状态的框架(Zhang等人,2025(https://arxiv.org/html/2606.31397#bib.bib51))通过LoRA引入了并行控制,通过避免中间状态存储来减少内存使用。我们的工作对该框架进行了泛化,提供了一种更具可扩展性的基于状态的适配方法,具有更好的性能和可比较的内存效率。
## 3 预备知识
本节介绍基于权重的方法、基于状态的方法和稀疏混合专家(SMoE)的基础概念。
### 3.1 基于权重的微调
LoRA(Hu等人,2022(https://arxiv.org/html/2606.31397#bib.bib52))通过添加一个低秩更新\(\Delta W = BA\)来微调\(W_0 \in \mathbb{R}^{d \times k}\),其中\(B \in \mathbb{R}^{d \times r}\),\(A \in \mathbb{R}^{r \times k}\),且\(r \ll \min\{d, k\}\),得到\(W' = W_0 + BA\),其中\(W_0\)冻结,\(A, B\)可训练。许多变体利用此结构提升效率,包括VeRA(Kopiczko等人,2023(https://arxiv.org/html/2606.31397#bib.bib53))、MoLE(Wu等人,2024(https://arxiv.org/html/2606.31397#bib.bib54))和DoRA(Liu等人,2024a(https://arxiv.org/html/2606.31397#bib.bib56)),它们利用低秩结构减少计算成本。这些机制归为基于权重的微调(Weight-FT),直接调整模型权重。其有效性通常归因于任务特定更新的低本质秩结构(Hu等人,2022(https://arxiv.org/html/2606.31397#bib.bib52);Aghajanyan等人,2021(https://arxiv.org/html/2606.31397#bib.bib84))。数学上,设\(x_0\)为输入,\(x_t\)为第\(t\)块的输出表征,\(a_t\)为非线性激活(ReLU或GeLU),则预训练Transformer块可如下适配(Chen等人,2022(https://arxiv.org/html/2606.31397#bib.bib85)):
\[
x_{t+1} = x_t + a_t\left((W_t + \Delta W_t)x_t\right). \tag{1}
\]
Weight-FT通常因存储中间状态而招致高内存成本。为了缓解这一问题,基于状态的框架(Zhang等人,2025(https://arxiv.org/html/2606.31397#bib.bib51))从控制理论角度重新形式化了微调。
### 3.2 基于状态的微调
Weight-FT通常因存储中间状态而招致高内存成本。为了缓解这一挑战,基于状态的框架(Zhang等人,2024c(https://arxiv.org/html/2606.31397#bib.bib58))从控制理论角度重新形式化了微调。
#### 前向传播作为反馈控制系统
考虑带仿射控制的连续时间常微分方程(ODEs)(Franklin等人,2002(https://arxiv.org/html/2606.31397#bib.bib49)):
\[
\dot{x}(t) = f_t(W(t)x(t)) + G(t)u(t), \tag{2}
\]
其中\(x(t)\)是状态向量,\(W(t)\)是状态矩阵,\(f_t\)是内在动态,\(u(t)\)是控制输入,\(G(t)\)是控制矩阵。在状态反馈控制系统中,\(u(t)\)可定义为状态\(x(t)\)关于反馈增益矩阵\(K(t)\)的函数,即\(u(t) = K(t)x(t)\)。将其代入方程2中的系统可得:
\[
\dot{x}(t) = f_t(W(t)x(t)) + G(t)K(t)x(t), \tag{3}
\]
其中\(G(t)K(t)x(t)\)作为控制项,通过控制矩阵\(G(t)\)和反馈增益\(K(t)\)在连续空间中修改系统轨迹。对方程3进行离散化得:
\[
x_{t+1} = x_t + f_t(W_t x_t) + G_t K_t x_t. \tag{4}
\]
将\(x_t\)视为第\(t\)块的输出表征,反馈控制环可类比神经网络中的前向传播。
#### 基于状态的微调
受此类比启发,Zhang等人(2025(https://arxiv.org/html/2606.31397#bib.bib51))引入了并行控制,将\(G_t K_t\)解释为低秩控制项:
\[
x_{t+1} = x_t + f_t(W_t x_t) + g_t(x_t), \tag{5}
\]
其中\(g_t\)是控制函数,实践中实现为低秩矩阵变换,即\(g_t(x_t) = \Delta W_t x_t\)。此设计旨在减少中间层的内存使用,同时减轻性能下降。
### 3.3 稀疏混合专家(SMoE)
SMoE模型通常由多个MoE块组成,每个块包含一组专家。每个块内的专家负责处理输入的不同方面,其输出被组合成块的最终输出。设\(\mathbf{X} \in \mathbb{R}^{m \times d}\)为\(m\)个输入令牌嵌入的矩阵,其中每个令牌由一个\(d\)维向量表示,\(\mathbf{W}_{\text{gate}} \in \mathbb{R}^{n \times d}\)为\(n\)个专家的门控权重矩阵。门控得分矩阵\(\mathbf{S} \in \mathbb{R}^{m \times n}\)计算如下:\(\mathbf{S} = \mathbf{X} \mathbf{W}_{\text{gate}}^{\top}\)。
\(\mathbf{S}\)中的每个条目\(s_{i,j}\)表示兼容性得分。相似文章
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
面向混合专家模型中一致专家选择的多层级上下文建模
本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。
使用 NVIDIA NeMo AutoModel 加速 Transformer 微调
NVIDIA NeMo AutoModel 利用 HuggingFace Transformers v5,在微调 Mixture-of-Experts 模型时,无需修改代码(只需一个导入),即可实现 3.4 至 3.7 倍的训练吞吐量提升和 29% 至 32% 的 GPU 内存减少。
通过增加MOE(Qwen 35B A4B+)中每个token的活跃参数,推理token减少8.5%——无需训练或微调!
一篇论文介绍了一种针对稀疏MoE模型的推理时优化方法,通过调整后期transformer层中的专家选择,在无需重新训练的情况下,将推理token减少8.5%,延迟降低10.9%,同时保持准确性。