RAPTOR: 用于专家混合模型的角色感知隐私训练

arXiv cs.LG 论文

摘要

RAPTOR是一个角色感知的框架,用于专家混合模型的差分隐私微调,解决了诸如裁剪干扰和噪声稀释等失败模式,并在实验中显示出相对于标准差分隐私基线的改进。

arXiv:2609.05770v1 公告类型:新 摘要:差分隐私微调方法将稀疏的专家混合模型视为单个密集块,忽略了共享层看到所有数据而专家只看到路由记录的事实。我们识别并正式描述了由此产生的三种失败模式:全局裁剪抑制专家梯度,批量归一化稀释稀疏专家更新,固定隐私噪声降低了低负载专家的信噪比。我们引入了RAPTOR - 一个角色感知隐私训练框架,它交替进行共享和专家优化,直接针对每种失败模式,使用专家特定的裁剪和噪声,结合公共预期所有者分母和独立于计数的更新调度,避免了对私有、实现专家计数的依赖。我们证明所得机制满足 $(\varepsilon,\delta)$-差分隐私:因为每条记录被分配给恰好一个所有者专家,层内的每个专家机制并行组合,因此在隐私方面,更新所有 $E$ 个专家与更新一个专家的成本相同,共享和专家流在训练中顺序组合。我们进一步推导了公共分母估计量的偏差-方差分解,表明其偏差随路由不平衡可预测地增长,从而产生一个无隐私规则,用于根据在小型公共语料库上测量的路由熵选择要保护的层。在Switch Transformer和OLMoE微调上跨GLUE任务以及在DeepSeek-VL2-Tiny上的实验,显示在多个隐私水平 ($\varepsilon$) 下相对于标准差分隐私基线的一致性增益,最大差距通常出现在最严格的预算下。代码和模型公开可用:https://github.com/leduckhai/RAPTOR
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:25

# RAPTOR:面向角色的混合专家模型隐私训练  
来源:https://arxiv.org/html/2609.05770  
Khai Le-Duc  
隶属机构:Vector Institute  
隶属机构:Knovel Engineering Lab  
Nguyen Do Minh Son Hoang, Florent Draye, Thai Hoang, Hoang Phuong Dam, Jiarui Liu  
隶属机构:KAIST  
隶属机构:图宾根智能系统研究所  
隶属机构:Salesforce AI Research  
隶属机构:卡内基梅隆大学  
Chris Ngo, Terry Jingchen Zhang, Anh Le Duc Tran, Nhat Do Minh, Minh Ngoc Le  
隶属机构:多伦多大学  
隶属机构:Vector Institute  
隶属机构:Knovel Engineering Lab  
隶属机构:牛津大学  
隶属机构:Jinesis Lab, 多伦多大学 & Vector Institute  
隶属机构:河内科技大学  
隶属机构:越南国立大学,河内  
My T. Thai, Ran Xu, Silvio Savarese, Mona Diab  
隶属机构:佛罗里达大学  
隶属机构:Salesforce AI Research  
隶属机构:卡内基梅隆大学  
隶属机构:斯坦福大学  
Bernhard Schölkopf, Zhijing Jin, Huy L. Nguyen, Daeyoung Kim  
隶属机构:KAIST  
隶属机构:图宾根智能系统研究所  
隶属机构:Jinesis Lab, 多伦多大学 & Vector Institute  
隶属机构:ELLIS Institute Tübingen  
隶属机构:东北大学  
隶属机构:*共同第一作者*  
[email protected]  
[email protected]  
leduckhai/RAPTOR (https://github.com/leduckhai/RAPTOR)  

###### 摘要  
差分隐私(\(DP\))微调方法将稀疏混合专家(MoE)模型视为单一的密集块,忽略了共享层可见所有数据而专家仅可见路由记录这一事实。我们识别并形式化了由此产生的三种故障模式:全局裁剪抑制专家梯度,批次级归一化稀释稀疏专家更新,固定隐私噪声降低了低负载专家的信噪比。我们引入了 RAPTOR——一个**面向角色的隐私训练**框架(参见图),它交替进行共享层和专家层优化,并直接针对每种故障,使用专家特定的裁剪和噪声,结合公共期望所有者分母以及与计数无关的更新调度,避免对私有、已实现的专家计数的依赖。我们证明所得机制满足 \((\varepsilon, \delta)\)-DP:由于每条记录被分配给恰好一个所有者专家,层内的专家特定机制可以并行组合,因此在隐私意义上,更新所有 \(E\) 个专家的成本不超过更新一个专家的成本,共享流和专家流在训练中顺序组合。我们进一步推导了公共分母估计器的偏差-方差分解,表明其偏差随路由不平衡可预测地增长,从而基于小型公共语料库测量的路由熵产生了一条无需隐私考虑的规则来选择需要保护的层。在 Switch Transformer 和 OLMoE 的 GLUE 任务微调以及 DeepSeek-VL2-Tiny 上的实验显示,在多个隐私级别(\(\varepsilon\))下均优于标准 DP 基线,且优势通常在隐私预算最紧时最大。  

参考标题图 1:将差分隐私应用于稀疏 MoE 并非易事:将模型视为密集会导致三种结构性故障——裁剪干扰、更新尺度稀释和负载依赖的信号退化。我们的面向角色方法旨在解决这些不匹配。  

## 1 引言  
稀疏混合专家(MoE)架构将模型容量与每条记录的计算解耦,使条件稀疏性成为扩展基础模型的核心策略 Shazeer 等 (2017) (https://arxiv.org/html/2609.05770#bib.bib6);Fedus 等 (2022) (https://arxiv.org/html/2609.05770#bib.bib7);Jiang 等 (2024) (https://arxiv.org/html/2609.05770#bib.bib15)。然而,它们许多最具价值的应用——在医疗记录、企业文档、个人交互以及其他私有语料库上——需要针对记忆化的正式保护,为此差分隐私(DP)Dwork 和 Roth (2014) (https://arxiv.org/html/2609.05770#bib.bib2),通过每记录梯度裁剪和高斯噪声强制实施 Abadi 等 (2016) (https://arxiv.org/html/2609.05770#bib.bib1),是目前的主流标准。将两者结合并非现有工具的简单应用:DP 优化器是为密集模型设计的,其中每个参数都从每条记录接收信号,因此一个裁剪界、一个噪声尺度和一个归一化分母就足够了。稀疏路由打破了这一前提——共享组件仍然看到每条记录,而每个专家仅看到路由给它的记录——而关于私有 MoE 训练的唯一先前工作 Tholoniat 等 (2024) (https://arxiv.org/html/2609.05770#bib.bib8) 通过将模型视为单个密集块回避了这种不对称性。我们证明这种不匹配是结构性不兼容,而非实现细节(图 1 (https://arxiv.org/html/2609.05770#S0.F1),左):整体 DP 训练会抑制被更密集块主导的专家梯度(*裁剪干扰*,面板 1),通过全批次归一化稀释稀疏专家更新(*更新尺度稀释*,面板 2),并将固定隐私噪声集中在低负载专家上(*负载依赖的信噪比退化*,面板 3)——这些共同损害了使 MoE 有用的专家专业化(第 4 节 (https://arxiv.org/html/2609.05770#S4))。  

为了解决这些限制,我们提出了 RAPTOR(面向角色的隐私训练),它使 DP 机制与共享/专家角色结构对齐,而不是忽略它(图 1 (https://arxiv.org/html/2609.05770#S0.F1),右)。**共享流**通过标准的每记录裁剪和噪声在所有记录上更新密集组件。**专家流**仅在其所有者记录上更新每个专家,使用专家特定的裁剪 \(C_e\) 和噪声 \(\sigma_e\)(解决裁剪干扰,面板 1),使用一个公共的期望所有者分母 \(D_e = B/E\),该分母永不触及实际计数(在不泄露路由决策的前提下解决稀释,面板 2),采用与计数无关的调度,在每个步骤更新每个专家,并使用无需隐私考虑的基于熵的层选择(解决负载依赖的信噪比退化,面板 3)。图 2 (https://arxiv.org/html/2609.05770#S1.F2) 给出了概述。  

参考标题图 2:RAPTOR 在选定的稀疏层 \(l^{\star}\) 上的概述。(a) 冻结的路由器执行基础 MoE 模型的标准 token 级 top-\(k\) 路由。我们的框架聚合记录 \(x_i\) 的所有 token 的门控权重,并选择一个确定性的**所有者专家** \(a_{l^{\star}}(x_i)\)。前向传播不变:所有激活的专家都做贡献,但只有所有者接收专家参数梯度;激活的非所有者专家使用停止梯度。此分配将 \(\mathcal{D}_{\mathrm{priv}}\) 划分为互斥的所有者组 \(\mathcal{D}_{l^{\star},e} = \{ (x_i,y_i) : a_{l^{\star}}(x_i)=e \}\)。(b) 每个周期为共享流和专家流绘制独立的泊松子样本。共享更新使用裁剪 \(C_s\)、噪声乘子 \(\sigma_s\) 和分母 \(B\)。专家记录按所有者划分,并使用 \(C_e\)、\(\sigma_e\) 和公共分母 \(D_e = B/E\) 更新,对空子集仅添加噪声。专家机制在 \(l^{\star}\) 内并行组合,而共享和专家发布顺序组合,其中 \(\varepsilon_{\mathrm{sh}} = \rho \varepsilon\) 且 \(\varepsilon_{\mathrm{exp}} = (1-\rho) \varepsilon\)。  

#### 贡献。  
1.  **诊断分析**。我们识别并形式化了整体 DP-MoE 训练的三种结构性故障模式——裁剪干扰、更新尺度稀释和负载依赖的信噪比退化(第 4 节 (https://arxiv.org/html/2609.05770#S4))。  
2.  **面向角色的优化**。我们提出了面向角色的隐私训练,通过交替共享/专家流、专家特定的裁剪和噪声以及与计数无关的更新调度来解决所有三种故障(第 5 节 (https://arxiv.org/html/2609.05770#S5))。  
3.  **隐私保证**。我们证明了通过路由诱导的所有者组进行并行组合可满足 \((\varepsilon, \delta)\)-DP:更新层内所有 \(E\) 个专家在隐私意义上不超过更新一个专家(第 6 节 (https://arxiv.org/html/2609.05770#S6))。  
4.  **效用分析与层选择**。我们通过路由不平衡限定了公共分母估计器的偏差,从而基于小型公共语料库上的路由熵产生了无需隐私考虑的规则 \(l^{\star} = \arg\max_l H(q^{(l)})\),并通过 Voronoi 抽象表明该偏差在有界表示漂移下是稳定的(第 7 节 (https://arxiv.org/html/2609.05770#S7))。  
5.  **实证验证**。在 Switch Transformer(四个 GLUE 任务,\(\varepsilon \in \{1,4,8\}\))上,相对于整体和匹配范围的 DP 基线,最高可提升 \(+3.24\) 点,并在 OLMoE 和视觉语言模型 DeepSeek-VL2-Tiny 上显示出一致的改进(第 8 节 (https://arxiv.org/html/2609.05770#S8))。  

## 2 相关工作  
预训练语言模型的私有微调——全参数 Li 等 (2021) (https://arxiv.org/html/2609.05770#bib.bib3) 或通过 LoRA 实现的参数高效微调 Yu 等 (2021) (https://arxiv.org/html/2609.05770#bib.bib4);Hu 等 (2022) (https://arxiv.org/html/2609.05770#bib.bib5)——对所有参数统一应用一个裁剪界、噪声尺度和分母,这对于每个参数都看到每条记录的密集模型来说是一个合理的简化。这在 MoE 路由下失效了,因为共享组件看到每条记录,但每个专家仅看到其路由子集;据我们所知,目前没有 DP 微调方法区分这些暴露模式。另外,非私有 MoE 训练通过批次级负载平衡损失稳定路由,但这无法转化为记录级 DP:它们的梯度破坏了每记录敏感性,并且依赖于实际专家计数,而这是私有的,不能进入归一化或控制流,否则会泄露路由决策。关于私有 MoE 训练的唯一先前工作 Tholoniat 等 (2024) (https://arxiv.org/html/2609.05770#bib.bib8) 通过将 MoE 视为单个密集块来回避此问题——可行,但使得共享、路由和专家参数在结构上无法区分,这抑制了专家梯度,稀释了稀疏更新,并将噪声集中在低负载专家上。我们通过冻结路由器、用公共期望所有者分母替代实际计数,以及通过跨互斥所有者组的并行组合来分析专家更新——解决了 Li 等 (2021) (https://arxiv.org/html/2609.05770#bib.bib3);Yu 等 (2021) (https://arxiv.org/html/2609.05770#bib.bib4);Hu 等 (2022) (https://arxiv.org/html/2609.05770#bib.bib5) 所忽略的路由完全缺失的空白,也弥补了 Tholoniat 等 (https://arxiv.org/html/2609.05770#bib.bib8) 尽管路由存在却保留了整体优化器的不足。更多相关工作见附录 A (https://arxiv.org/html/2609.05770#A1)。  

## 3 预备知识  
### 3.1 设置与符号  
令 \(\mathcal{D}_{\mathrm{priv}} = \{ (x_i,y_i) \}_{i=1}^n\) 为私有数据集。稀疏 MoE 模型在层 \(\mathcal{L}\) 上的每个稀疏层有 \(E\) 个专家(\([E] = \{1,\ldots,E\}\)),参数为 \(\theta = (\theta_{\mathrm{sh}}, \theta_{\mathrm{rt}}, \{\theta_{l,e}\})\)。每个专家具有角色 \(r(e) \in \{ \textsc{routed}, \textsc{shared} \}\):共享专家(例如 DeepSeek-MoE 的始终活跃专家 Dai 等 (2024) (https://arxiv.org/html/2609.05770#bib.bib29))看到所有 token 并归入 \(\theta_{\mathrm{sh}}\);路由专家仅看到分配的 token。除非另有说明,对所有 \(e\) 有 \(r(e) = \textsc{routed}\)。在步骤 \(t\),\(\mathcal{B}_{t}^{\mathrm{exp}} \subseteq \mathcal{D}_{\mathrm{priv}}\) 被泊松子采样,因此其实际大小是随机的且私有;我们记 \(B = \mathbb{E}[\|\mathcal{B}_{t}^{\mathrm{exp}}\|]\) 为固定的公共目标大小,并使用 \(B\) 进行归一化——绝不使用实际计数——这是 \(D_e = B/E\) 背后的原则(第 5 节 (https://arxiv.org/html/2609.05770#S5))。对于梯度 \(g\) 和半径 \(C>0\),\(\mathrm{clip}(g,C) = g \cdot \min\{1, C/\|g\|_2\}\);下标 \(s,e\) 区分流共享/专家流的量,例如 \((C_s, \sigma_s, \eta_s)\) 对比 \((C_e, \sigma_e, \eta_e)\)。  

### 3.2 差分隐私  
###### 定义 1.  
Dwork 和 Roth (2014) (https://arxiv.org/html/2609.05770#bib.bib2)  
\(\mathcal{A}\) 是 \((\varepsilon, \delta)\)-DP 的,如果对于所有相邻数据集 \(\mathcal{D}, \mathcal{D}'\) 和输出集 \(\mathcal{S}\),有  
\[
\Pr[\mathcal{A}(\mathcal{D}) \in \mathcal{S}] \leq e^{\varepsilon} \Pr[\mathcal{A}(\mathcal{D}') \in \mathcal{S}] + \delta.
\]  
DP-SGD Abadi 等 (2016) (https://arxiv.org/html/2609.05770#bib.bib1) 通过每记录裁剪和高斯噪声使每一步的梯度私有化:对于期望大小为 \(B\) 的 \(\mathcal{B}_{t}\),  
\[
\bar{g}_{t} = \frac{1}{B}\! \left( \sum_{i \in \mathcal{B}_{t}} \mathrm{clip}(g_{i,t}, C) + \mathcal{N}(0, \sigma^{2} C^{2} I) \right).
\]  
(1)  
我们以这种方式对每次发布进行私有化,但使用 Adam 优化——\(\bar{g}_{t}\) 替换原始梯度馈入 Adam 的动量估计,形成 **DP-Adam**。这是对已发布序列的后处理,除了已计费的 \(T\)-次组合(第 6.2 节 (https://arxiv.org/html/2609.05770#S6.SS2))外,不增加额外的隐私成本。  

### 3.3 稀疏 MoE 模型与负载均衡  
稀疏 MoE Transformer Shazeer 等 (2017) (https://arxiv.org/html/2609.05770#bib.bib6);Fedus 等 (2022) (https://arxiv.org/html/2609.05770#bib.bib7) 用 \(E\) 个专家和一个路由器(将每个 token 分配给其中 \(k\) 个)替代了密集的 FFN;共享专家归入共享流,路由专家归入专家流,稀疏激活导致负载不平衡。我们的方法将每条记录确定性地分配给每层一个路由专家,即其**所有者专家**——即在 \(k\) 次分配中接收该记录 token 最多的专家,在 \(k=1\) 时退化为标准情况——我们的并行组合分析依赖于此结构(第 6 节 (https://arxiv.org/html/2609.05770#S6))。辅助负载平衡损失 \(\mathcal{L}_{\mathrm{aux}}\) 依赖于批次级路由统计,给出的每记录梯度反映了其他记录的决策,并破坏了 DP-SGD 所需的每记录敏感性;因此我们冻结路由器并省略 \(\mathcal{L}_{\mathrm{aux}}\)。  

## 4 诊断整体私有优化故障  
整体私有优化对所有 MoE 参数应用一个裁剪界、一个噪声尺度和一个归一化分母——仿佛模型是密集的。这忽略了共享层、路由器和任务头从每条记录接收信号,而每个专家仅从其路由记录接收信号。在 DP 下,这种不对称性导致三种结构性故障,每一种都是机制定义的属性,而非任何超参数选择。附录 G (https://arxiv.org/html/2609.05770#A7) 从代数上形式化了这一主张,并报告了实证的角色不匹配和每专家信噪比诊断。

相似文章

TENP: 用于混合专家的梯形专家神经元剪枝

arXiv cs.LG

TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。

MoEGen:用于实例自适应LoRA生成的专家混合方法

arXiv cs.CL

本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。