异步P2P gossip学习网络中知识蒸馏的收敛理论

arXiv cs.LG 论文

摘要

本文为异步点对点gossip学习网络中的知识蒸馏提供收敛理论,证明其能收缩函数不一致性,并分析理论收敛速率。

arXiv:2609.01952v1 公告类型:新 摘要:去中心化、无服务器学习日益连接运行不同架构的设备,其中标准工具去中心化SGD未定义,因为具有不同参数数量的模型无法平均。知识蒸馏(KD)交换软预测而非权重,规避了这一障碍,但完全去中心化、异步点对点(P2P)KD的收敛理论尚缺乏。我们提供一个理论,将共识从参数空间转移到函数(输出)空间:KD事件是同伴预测分布在logit空间中的几何收缩算子,我们在参考测度的预测希尔伯特空间中进行分析。在标准平滑性/方差假设和两个可实现性假设下,一个桥接参数SGD到功能步,另一个控制受限任务/KD对齐,时间平均功能平稳性和函数空间不一致性以速率$O(1/(\eta T))$收敛到$O(\eta)+O(B_f^2)+O(\zeta_f^2)$邻域。这里$B_f$是从任务最优到同伴可达类的距离,$\zeta_f$衡量持续的本地任务异质性。在实验中的同质、宽度异质和混合家族网络中,KD将函数不一致性收缩$40-61\倍$,而孤立训练则不然。采样平稳性诊断在共享骨架主运行中的后期暂态指数为$0.99-1.90$,四点步长扫描显示了预测的暂态:邻域权衡。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:13

# 异步P2P八卦学习网络中知识蒸馏的收敛理论  
来源:https://arxiv.org/html/2609.01952  
Tiyao LiuJinhao JingZeji LiKaijie ChenHarikrishna Kuttivelil\\correspondingKatia Obraczka\\corresponding  
###### 摘要  
去中心化、无服务器的学习日益连接运行不同架构的设备,而标准工具——去中心化SGD——在模型具有不同参数数量时无法定义平均操作。知识蒸馏(KD)通过交换软预测而非权重来规避此障碍,但完全去中心化、异步点对点(P2P)KD的收敛理论尚缺失。我们将共识从参数空间转移到函数(输出)空间:KD事件在logit空间中对对等方的预测分布构成几何收缩算子,并在参考测度上的预测希尔伯特空间中进行分析。在标准平滑性/方差假设及两个可实现性假设下(一个将参数SGD与函数步长桥接,另一个控制受限任务/KD对齐),时间平均函数平稳性与函数空间不一致性以速率\(O(1/(\eta T))\)收敛至\(O(\eta)+O(B_f^2)+O(\zeta_f^2)\)邻域。此处\(B_f\)是任务最优解到对等方可达类别间的距离,\(\zeta_f\)衡量持久局部任务异质性。在实验的同质、宽度异质及混合族网络中,KD将函数不一致性收缩40–61倍,而孤立训练则无此效果。共享骨架主运行的采样平稳性诊断具有0.99–1.90的后期瞬态指数,四点步长扫描展示了预测的瞬态-邻域权衡。  
1美国加州大学圣克鲁兹分校,美国  
2中国石油大学,中国  
3香港中文大学(深圳),中国  
4香港城市大学,香港特别行政区,美国  
5美国弗吉尼亚大学,美国  
## 引言  
八卦学习将中央服务器从分布式训练中移除。每个对等方持有私有数据,执行局部更新,并通过点对点(P2P)网络与邻居通信,无需全局时钟。在去中心化SGD中,通信步骤是参数向量的加权平均:\(x_i \leftarrow \sum_j W_{ij} x_j\)。此操作要求所有对等方使用相同的参数空间\(\mathbb{R}^d\)(Lian等2017;Boyd等2006),因此当网络包含不同架构时未定义。知识蒸馏(KD)提供了自然替代方案,因为对等方交换软预测而非参数。无论由何种网络生成,预测均位于类别单纯形中。联邦蒸馏方法利用此共同输出空间,但该领域考虑的方法依赖于协调器或同步轮次(Hinton、Vinyals与Dean 2015;Li与Wang 2019;Lin等2020;Chang等2019),且未分析完全去中心化、异步设置。我们探讨异步P2P KD过程在对等方具有不同可达函数类时是否允许收敛理论。  
我们在参考测度\(\mu\)上衡量共识。对于对等方\(i\),令\(p_i = \text{softmax}(z_i/\tau)\)表示温度缩放预测。预测属于共同希尔伯特空间\(L^2(\mu; \mathbb{R}^C)\),其中我们通过\(\Psi_t^f = \frac{1}{N}\sum_i \mathbb{E}\|p_i - \bar{p}\|_\mu^2\)衡量不一致性。KD交换具有logit梯度\(\tau(p_i - p_j)\),因此它充当函数空间混合步长。其收缩速率与\(\rho_f = \Theta(\eta \alpha p_{\min} \lambda_2(\mathcal{L})/|E|)\)成正比。我们在Lyapunov论证中将此收缩与任务风险下降相结合。证明使用A4(在附录E中详细说明并论证,连同A10)将参数更新与其函数效应关联,并使用A10控制超出单个对等方可达类的方向。  
##### 贡献。  
我们为异步随机边P2P KD建立收敛界,控制时间平均函数平稳性与函数空间不一致性于\(O(\eta)+O(B_f^2)+O(\zeta_f^2)\)邻域内。三项分离了随机离散化、表示误差和持久局部任务异质性。我们刻画了为异构对等方保持定义的函数空间通信算子,并将参数平均保持为同质模型控制。附录给出自包含证明并明确陈述两个建模桥梁,包括A10的充分验证模型。在实验中,我们记录定理的可观测项,并仅使用孤立训练和同质D-SGD作为机制控制。实验未做出任务准确性排序声明或从架构确定\(B_f\)。  
### 相关工作  
##### 去中心化优化与八卦SGD。  
去中心化-SGD理论涵盖具有参数平均的非凸优化,并已扩展至变化拓扑、有向图、数据异质性和异步更新(Lian等2017;Koloskova等2020;Assran等2019)。这些分析在共享参数空间中使用局部随机梯度(Dandi等2022;Sun、Daneshmand与Scutari 2019)。因此,该机制在模型具有不同参数规模和架构的系统中自然未定义,而知识蒸馏提供了解决方案,因为它在输出空间操作。  
##### 知识蒸馏(KD)与联邦KD。  
KD将教师的软预测转移给学生(Hinton、Vinyals与Dean 2015)。因为交换对象是预测,KD可以连接不同架构的模型。FedMD在共享公共集上蒸馏(Li与Wang 2019),FedDF使用服务器端集成蒸馏(Lin等2020),Cronus研究恶意客户端下的黑箱软标签交换(Chang等2019)。这些方法使用协调器或同步协议。近期去中心化联邦KD方法保留中央协调(Taya等2022),包括IMFL的梯度聚合器(Ying等2026)和TopoMoDistill的同步服务器(Wu等2026)。无服务器八卦蒸馏(Khowaja等2026)迄今已被评估,但其一般收敛行为尚未确立。我们的设置是异步无服务器案例,我们首次在函数空间中提供收敛分析。更全面的相关工作在附录C中。  
## 预备知识  
### 重要符号  
完整表格可在附录A中找到。  
### 核心假设  
附录D中列出的标准假设遵循D-SGD理论中使用的(Zeng与Lei 2025;Dandi等2022)。对于P2P KD特有的假设,如下所列。对于A4和A10,虽然仍是假设,但它们是数学上和相关工作中充分论证的坚实假设(附录E中)。  
(A3)表示容量下限:A3命名当异构对等方被要求接近相同任务最优预测器时出现的不可约近似误差。令\(\mathcal{P}_i := \{p_\theta: \theta \in \mathbb{R}^{d_i}\} \subseteq \mathcal{H}\)为对等方\(i\)在参考测度上的可达预测类,并令\(q^\star := \arg\min_{p \in \mathcal{S}} F(p)\)为在\(\mathcal{S} := \{p = \text{softmax}(z/\tau): \|z\|_\infty \leq G_z\}\)上的约束任务最小化器。神谕容量下限有限:  
\[
B_f^2 := \frac{1}{N}\sum_{i=1}^N \operatorname{dist}_\mu(q^\star, \mathcal{P}_i)^2,
\]  
\[
\operatorname{dist}_\mu(q, \mathcal{P}_i) := \inf_{p \in \mathcal{P}_i} \|q - p\|_\mu.
\]  
此下限桥接共同输出空间最优与对等方特定可达函数类之间的差距。证明仅将\(B_f^2\)用作终端邻域中的近似误差参数。附录D给出约束最小化器约定并解释为何\(B_f\)是神谕量。  
(A4)参数到logit可实现性(核几何):这陈述了小参数空间SGD步长何时可解释为logit和预测空间中的受控有限支撑步长。令\(\mu_M = M^{-1}\sum_{r=1}^M \delta_{x_r}\)为经验参考测度,并令\(\mathcal{H}_z := \{Z \in \mathbb{R}^{M \times C}: Z_{r,:} \mathbf{1} = 0\}\)带\(M^{-1}\) Frobenius内积。对于对等方\(i\),定义中心化logits \(Z_i(\theta_i)\),logit雅可比矩阵\(J_i^z := D_{\theta_i} Z_i(\theta_i)\),受限logit核\(\Theta_i := J_i^z (J_i^z)^*\),切空间\(T_i^z := \operatorname{range}(J_i^z)\),及正交投影\(\Pi_i^z := \Pi_{T_i^z}\)。在定理2使用的冻结有限支撑核区域中,\(\kappa_- \Pi_i^z \preceq \Theta_i \preceq \kappa_+ \Pi_i^z\)。对于预测雅可比矩阵\(J_i^p := D_{\theta_i} P_i\)和预测核\(K_i := J_i^p (J_i^p)^*\),带切空间\(T_i^p\)和投影\(\Pi_i^p\),存在常数\(0 < \underline{\kappa}_p \leq \overline{\kappa}_p < \infty\)使得\(\underline{\kappa}_p \Pi_i^p \preceq K_i \preceq \overline{\kappa}_p \Pi_i^p\)。参数到函数的Taylor余项和随机推前噪声满足附录D中使用的条件矩界。对于私有批次到参考支撑任务推前,写  
\[
G_i^{\rm task} = K_i g_i^t + \delta_i^t,
\]  
\[
\frac{1}{N}\sum_i \|\delta_i^t\|_\mu^2 \leq \chi_G \frac{1}{N}\sum_i \|g_i^t\|_\mu^2 + \chi_B B_f^2 + \chi_\zeta \zeta_f^2.
\]  
此处\(g_i^t = \nabla_f F_i(p_i^t)\)。此跨核保真条款是A4的一部分,未由A6断言。A4桥接实际参数SGD和证明中使用的有限支撑函数递归。它不断言全空间满射性且不隐含A10。链式法则恒等式、Taylor余项和核持久性细节延迟至附录D(假设本身在附录E和引理G1中进一步论证)。  
(A10)受限任务/KD对齐:这限制了任务梯度和定向KD拉力位于单个对等方可实现的切方向之外的程度。对于每个事件时间\(t\),条件于\(\mathcal{F}_t\),令\(g_i^t := \nabla_f F_i(p_i^t)\),\(\psi_t^f := N^{-1}\sum_i \|p_i^t - \bar{p}^t\|_\mu^2\),和\(\psi_t^z := N^{-1}\sum_i \|Z_i^t - \bar{Z}^t\|_{\mu_M}^2\)。任务梯度法向分量服从  
\[
\frac{1}{N}\sum_i \|(I - \Pi_i^{p,t}) g_i^t\|_\mu^2 \leq \gamma_{\mathrm{task}} \frac{1}{N}\sum_i \|g_i^t\|_\mu^2 + \nu_{\mathrm{task},\Psi} \psi_t^f + \nu_{\mathrm{task},B} B_f^2, \quad 0 \leq \gamma_{\mathrm{task}} < 1.
\]  
对于KD条款,定义中心化有限支撑推前\(d_{ij}^z := A_{ij}(Z_i - Z_j) = P_i - P_j\),\(A_{ij} := \int_0^1 D_Z \text{softmax}\left(\frac{Z_j + s(Z_i - Z_j)}{\tau}\right) ds\)。\(Z_i - Z_j\)和\(P_i - P_j\)均在类和为零的有限支撑环境空间中表示,因此\(\Pi_i^z\)在该公共坐标系中作用于\(d_{ij}^z\)。定向KD拉力法向分量服从  
\[
\frac{1}{|\vec{E}|}\sum_{(i,j) \in \vec{E}} \|(I - \Pi_i^z) d_{ij}^z\|_{\mu_M}^2 \leq \gamma_{\mathrm{KD}} \psi_t^z + \nu_{\mathrm{KD},B} B_f^2, \quad \vec{E} := \{(i,j),(j,i): (i,j) \in E\}.
\]  
A10桥接共同输出空间KD拉力和对等方特定切空间。小增益条件仅使用瞬态系数\(\gamma_{\mathrm{task}}\)和\(\gamma_{\mathrm{KD}}\);乘以\(B_f^2\)的系数只需有限。附录命题G1–G3给出充分情况并解释为何相对任务梯度项必要(假设本身在附录E中进一步论证)。  
## 系统架构  
我们使用图1所示的八卦蒸馏架构。  
图1:异步P2P知识蒸馏架构。每个对等方在

相似文章

让知识蒸馏的成本低到足以大规模运行

Hugging Face Blog

Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。

知识蒸馏对小型语言模型偏见的非对称影响

arXiv cs.CL

本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。

重新思考逆向KL作为自适应熵蒸馏

arXiv cs.LG

本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。