基于熵正则化概率门控的稀疏模型发现方法用于稀缺数据联邦学习

arXiv cs.LG 论文

摘要

本文提出熵正则化概率门控机制,在稀疏联邦优化中保持不确定性,从而在数据异质性和稀缺数据条件下提升稀疏性恢复能力与测试性能。

arXiv:2607.00275v1 公告类型: 新 摘要: 联邦学习是一种分布式机器学习范式,允许多个客户端在不共享数据的情况下协作学习。在数据异质性和部分客户端参与的情况下,联邦学习面临挑战。学习稀疏模型有助于提升联邦学习中的通信与计算效率,但在小样本高维(d >> N)场景下尤为困难,因为优化可能产生无法泛化到未见测试数据的参数配置。虽然基于幅度的剪枝未考虑参数空间中的不确定性探索,但采用概率门控和L0约束的公式允许在训练过程中从相互竞争的稀疏配置中采样。本文研究门分布熵正则化作为在稀疏联邦优化中保持不确定性的机制,通过防止过早确定稀疏支持集来探索其影响。我们考察了该机制在数据异质性、客户端参与异质性和稀疏性条件下的表现。在合成基准和真实基准上的实验表明,与联邦迭代硬阈值法和基于稠密联邦平均训练后的剪枝相比,该方法在测试数据的统计性能以及稀疏性恢复准确性方面均有一致提升。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:37

# 熵正则化概率门用于稀疏数据联邦学习中的稀疏模型发现
来源:https://arxiv.org/html/2607.00275
Krishna Harsha Kovelakuntla Huthasana Alireza Olama Andreas Lundell 工程与信息技术系,奥布学术大学 \{kkovelak, alireza\.olama, andreas\.lundell\}@abo\.fi

###### 摘要

联邦学习(FL)是一种分布式机器学习(ML)范式,它允许多个客户端在不共享数据的情况下进行协作。在数据异质性和部分客户端参与的情况下,FL面临挑战。学习稀疏模型有助于提高FL中的通信和计算效率,但在小样本高维(d≫N)情况下尤其困难,因为优化可能产生无法泛化到未见测试数据的参数配置。虽然基于幅度的剪枝未考虑参数空间中的不确定性探索,但通过概率门和L0约束的公式可以在训练期间从竞争性稀疏配置中进行采样。在这项工作中,我们研究了门分布的熵正则化作为一种机制,通过防止早期承诺稀疏支持来维持稀疏联邦优化中的不确定性。我们考察了它在数据异质性、客户端参与异质性和稀疏性下的影响。在合成和真实基准上的实验表明,无论是在测试数据的统计性能还是在稀疏恢复准确性方面,该方法都持续优于联邦迭代硬阈值(Fed-IHT)和密集联邦平均(FedAvg)训练后的剪枝方法。

关键词

熵正则化,稀疏性,联邦学习,不确定性,参数探索,概率门,熵最大化,稀疏联邦学习,L0约束

## 1 引言

联邦学习(FL)算法运行在分布式机器学习(ML)环境中,多个客户端协作训练[16 (https://arxiv.org/html/2607.00275#bib.bib4)]。该框架以每个客户端的隐私要求为特征,并避免数据共享。虽然并非所有分布式环境都对隐私敏感,但FL仍然有益,因为它消除了对集中化数据的需求[11 (https://arxiv.org/html/2607.00275#bib.bib5)]。FL可以由单个服务器协调,也可以由客户端相互通信来协调。在这项工作中,我们研究由服务器集中协调的FL,以获得单一的全局模型,如图1 (https://arxiv.org/html/2607.00275#S1.F1)所示。

服务器客户端1客户端2客户端3客户端4

图1:客户端-服务器联邦学习架构,具有中央协调。实线箭头表示聚合后的全局模型分发给客户端,而虚线箭头表示客户端发送给服务器的局部模型更新。通常通过迭代平均来自客户端的参数或梯度,并将全局模型重新分发给客户端进行进一步学习,来学习全局模型。然而,客户端之间的统计异质性和训练期间的客户端部分参与给FL中的学习过程带来了挑战。此外,稀疏训练和推理有助于提高泛化能力[23 (https://arxiv.org/html/2607.00275#bib.bib6)]并增强FL中的计算和通信效率,从而带来了发现稀疏模型的额外挑战[25 (https://arxiv.org/html/2607.00275#bib.bib42)]。

诱导稀疏性的一种常见方法依赖于L1和L2范数[1]\[1\]\[1\]对于θ∈Rd,L1范数为‖θ‖1=∑i=1d|θi|,L2范数为‖θ‖2=(∑i=1dθi^2)^(1/2)。用于正则化,它们直接依赖于参数幅度并提供不同水平的收缩。相比之下,使用与幅度无关的L0伪范数是有利的,因为它对非零参数施加恒定惩罚,并且有助于学习具有期望参数密度ρ的模型。FL中L0密度约束优化问题的拉格朗日函数可以定义为:

L(θ,λ)=∑_(c=1)^C (n_c/N) L^(c)(θ) + λ(‖θ‖_0 - ρ|θ|),‖θ‖_0=∑_(j=1)^(|θ|) I[θ_j≠0], (1)

其中,L^(c)(θ)表示客户端c的归一化损失,定义为:

L^(c)(θ) = (1/n_c) ∑_(i=1)^(n_c) ℓ(h(x_i^(c);θ), y_i^(c)). (2)

这里,C是FL中的客户端数量,每个客户端持有一个本地数据集{D^(c)}_(c=1)^C = (X^(c),Y^(c)),其中X^(c)∈R^(n_c×in),Y^(c)∈R^(n_c×out),且∑_(c=1)^C n_c = N。我们假设模型h(x;θ): R^in→R^out和损失函数ℓ(h(x;θ),y),其中x∈R^in,y∈R^out,θ∈R^d。上述带有拉格朗日乘子λ的公式导致了一个极小-极大优化问题,原则上可以使用梯度下降-上升法解决。然而,L0伪范数的不可微性使得在标准基于梯度的学习框架中进行优化变得复杂。

Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]引入了一种使用随机门z∈R^p和θ=θ̃⊙z[2]\[2\]\[2\]⊙表示逐元素乘积[9 (https://arxiv.org/html/2607.00275#bib.bib37)]。作为模型的有效参数的重参数化方法。通过假设z服从硬具体分布(伯努利分布的近似),L0范数近似为活跃门的期望数量,即∑_j E_q(z)[z_j],从而实现了基于梯度的L0正则化目标优化。Gallego-Posada等人[7 (https://arxiv.org/html/2607.00275#bib.bib13)]通过使用L0密度约束并求解所得的极小-极大问题,将该框架扩展到允许用户在集中式环境中定义目标稀疏性。Huthasana等人[10 (https://arxiv.org/html/2607.00275#bib.bib56)]进一步将该方法适应于FL环境中的稀疏性学习,考虑了数据和客户端参与的异质性。

然而,学习稀疏模型具有挑战性,尤其是在小样本高维(d≫N)情况下[18 (https://arxiv.org/html/2607.00275#bib.bib48),6 (https://arxiv.org/html/2607.00275#bib.bib49),22 (https://arxiv.org/html/2607.00275#bib.bib50),19 (https://arxiv.org/html/2607.00275#bib.bib51)],此时优化不稳定,导致多个竞争性参数配置的解具有较差的稀疏恢复和对未见测试数据的泛化行为。Bao等人[3 (https://arxiv.org/html/2607.00275#bib.bib59)]研究了低样本-高维情况下的统计恢复,但考虑的是单个客户端相对于参数数量样本量较小,而总样本量N远超参数数量。我们旨在研究总样本量N相对于参数数量d=|θ|较小的情况,类似于集中式设置,在FL中数据异质性和客户端参与异质性下极具挑战性。

Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]指出在优化中对相对熵或Kullback-Leibler散度KL(q(z)∥p(z))进行惩罚,其中p(z)是先验,q(z)是用于不确定性探索的近似后验。熵正则化的概念并不新鲜,常用于在决策层(类或动作的分布)鼓励多样性和探索,在强化学习(RL)中,并适应于输入空间的不确定性探索(依赖数据的潜在变量分布),在变分自编码器中[2 (https://arxiv.org/html/2607.00275#bib.bib52),5 (https://arxiv.org/html/2607.00275#bib.bib53)]。它也用于贝叶斯推断,在集中式和FL设置中[1 (https://arxiv.org/html/2607.00275#bib.bib54),26 (https://arxiv.org/html/2607.00275#bib.bib55)]。在他们的方法中,硬具体门分布q(z)不直接依赖于数据,可以在训练后独立于数据进行采样。在这项工作中,我们将Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]、Gallego-Posada等人[7 (https://arxiv.org/html/2607.00275#bib.bib13)]的公式与相对熵惩罚相结合,在通信高效的FL设置中探索非零参数配置的不确定性,并表明它始终优于训练期间基于迭代硬阈值剪枝[24 (https://arxiv.org/html/2607.00275#bib.bib26)]和训练后对使用经典联邦平均算法[16 (https://arxiv.org/html/2607.00275#bib.bib4)]训练的密集模型进行剪枝的方法。

本文的其余部分组织如下。我们首先提出用于联邦优化的熵正则化L0约束公式,然后提出分布式算法,接着是在异质性FL设置中的实验,最后进行总结。

## 2 公式

假设模型h(x;θ): R^in→R^out和损失函数ℓ(h(x;θ),y),其中x∈R^in,y∈R^out,θ∈R^d,考虑一个集中式数据集D=(X,Y),其中X∈R^(N×in),Y∈R^(N×out)。使用[14 (https://arxiv.org/html/2607.00275#bib.bib12),7 (https://arxiv.org/html/2607.00275#bib.bib13)],极小-极大目标可以定义为损失关于门分布的期望,并且L0伪范数近似为活跃门的期望数量,即∑_j E_q(z|φ)[z_j],如方程3所示。由于每个z_j是无参数噪声的确定性变换,期望可以使用蒙特卡洛采样和重参数化梯度进行优化[17 (https://arxiv.org/html/2607.00275#bib.bib36), ch. 3.3.3]。

L̂(θ̃,φ,λ) = (1/R)∑_(r=1)^R [ (1/N)∑_(i=1)^N ℓ(h(x_i;θ̃⊙z^(r)), y_i) ] + λ( ∑_(j=1)^(|θ|) E_q(z|φ)[z_j] - ρ|θ| ). (3)

在联邦学习(FL)环境中,有C个客户端持有数据集{D^(c)}_(c=1)^C = (X^(c),Y^(c)),我们考虑一个重参数化线性模型h(x;θ̃⊙z): R^in→R^out和损失函数ℓ(h(x;θ̃⊙z),y)。这里,X^(c)∈R^(n_c×in),Y^(c)∈R^(n_c×out),∑_(c=1)^C n_c = N,x∈R^in,y∈R^out,θ=θ̃⊙z∈R^in。门参数定义为φ=logα∈R^in。

对应于熵正则化L0密度约束优化问题的拉格朗日函数为:

L̂(θ̃,φ,λ) = ∑_(c=1)^C (n_c/N) L^(c)(θ̃,φ) + λ( ∑_(j=1)^(|θ|) E_q(z|φ)[z_j] - ρ|θ| ) + T ∑_(j=1)^(|θ|) KL(q(z_j|φ) || p(z_j|φ_init)). (4)

这里,p(z|φ_init)是先验,也是一个硬具体分布,L^(c)(θ̃,φ)表示客户端c的归一化损失的蒙特卡洛估计,定义为:

L^(c)(θ̃,φ) = (1/R)∑_(r=1)^R (1/n_c)∑_(i=1)^(n_c) ℓ(h(x_i^(c);θ̃⊙z^(r)), y_i^(c)). (5)

随机门z使用硬具体分布采样,对拉伸的二值具体随机变量应用硬sigmoid变换[14 (https://arxiv.org/html/2607.00275#bib.bib12),15 (https://arxiv.org/html/2607.00275#bib.bib15)],定义为:

s = σ( (log(u/(1-u)) + logα) / β′ ), u ~ U(0,1),
s̄ = s(ζ-γ)+γ, z = min(1, max(0, s̄)). (6)

活跃门的期望[3]\[3\]\[3\]E_q(z|φ)[z_j] = 1 - Q(s̄_j ≤ 0|φ_j) = σ( logα_j - β′ log(-γ/ζ) ) 由Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]使用累积分布函数Q(s̄)导出。我们引入了T≥0,我们将其视为一个常数,带或不带衰减,以惩罚熵。得到的极小-极大优化问题是:

θ̃*, φ*, λ* = arg min_(θ̃,φ) arg max_(λ≥0) L̂(θ̃,φ,λ). (7)

参数θ̃和φ=logα通过使用重参数化梯度的梯度下降进行联合优化。λ通过梯度上升更新,并采用重启策略:一旦满足稀疏性约束,将其值重置为0[7 (https://arxiv.org/html/2607.00275#bib.bib13)]。由于硬具体分布是伯努利分布的连续近似,KL(q(z_j)||p(z_j))的计算涉及一个关于s̄的附加项,因此z∈(0,1),这可以使用截断分布q(s̄|s̄∈(0,1))或其蒙特卡洛估计来计算。我们使用了Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]在附录A (https://arxiv.org/html/2607.00275#A1)中提供的封闭形式表达式。# 熵正则化概率门用于稀疏数据联邦学习中的稀疏模型发现
来源:https://arxiv.org/html/2607.00275
Krishna Harsha Kovelakuntla Huthasana Alireza Olama Andreas Lundell 工程与信息技术系,奥布学术大学 \{kkovelak, alireza\.olama, andreas\.lundell\}@abo\.fi

###### 摘要

联邦学习(FL)是一种分布式机器学习(ML)范式,它允许多个客户端在不共享数据的情况下进行协作。在数据异质性和部分客户端参与的情况下,FL面临挑战。学习稀疏模型有助于提高FL中的通信和计算效率,但在小样本高维(d≫N)情况下尤其困难,因为优化可能产生无法泛化到未见测试数据的参数配置。虽然基于幅度的剪枝未考虑参数空间中的不确定性探索,但通过概率门和L0约束的公式可以在训练期间从竞争性稀疏配置中进行采样。在这项工作中,我们研究了门分布的熵正则化作为一种机制,通过防止早期承诺稀疏支持来维持稀疏联邦优化中的不确定性。我们考察了它在数据异质性、客户端参与异质性和稀疏性下的影响。在合成和真实基准上的实验表明,无论是在测试数据的统计性能还是在稀疏恢复准确性方面,该方法都持续优于联邦迭代硬阈值(Fed-IHT)和密集联邦平均(FedAvg)训练后的剪枝方法。

关键词

熵正则化,稀疏性,联邦学习,不确定性,参数探索,概率门,熵最大化,稀疏联邦学习,L0约束

## 1 引言

联邦学习(FL)算法运行在分布式机器学习(ML)环境中,多客户端协作训练[16 (https://arxiv.org/html/2607.00275#bib.bib4)]。该框架以每个客户端的隐私要求为特征,并避免数据共享。虽然并非所有分布式环境都对隐私敏感,但FL仍然有益,因为它消除了对集中化数据的需求[11 (https://arxiv.org/html/2607.00275#bib.bib5)]。FL可以由单个服务器协调,也可以由客户端相互通信来协调。在这项工作中,我们研究由服务器集中协调的FL,以获得单一的全局模型,如图1 (https://arxiv.org/html/2607.00275#S1.F1)所示。

服务器客户端1客户端2客户端3客户端4

图1:客户端-服务器联邦学习架构,具有中央协调。实线箭头表示聚合后的全局模型分发给客户端,而虚线箭头表示客户端发送给服务器的局部模型更新。通常通过迭代平均来自客户端的参数或梯度,并将全局模型重新分发给客户端进行进一步学习,来学习全局模型。然而,客户端之间的统计异质性和训练期间的客户端部分参与给FL中的学习过程带来了挑战。此外,稀疏训练和推理有助于提高泛化能力[23 (https://arxiv.org/html/2607.00275#bib.bib6)]并增强FL中的计算和通信效率,从而带来了发现稀疏模型的额外挑战[25 (https://arxiv.org/html/2607.00275#bib.bib42)]。

诱导稀疏性的一种常见方法依赖于L1和L2范数[1]\[1\]\[1\]对于θ∈Rd,L1范数为‖θ‖1=∑i=1d|θi|,L2范数为‖θ‖2=(∑i=1dθi^2)^(1/2)。用于正则化,它们直接依赖于参数幅度并提供不同水平的收缩。相比之下,使用与幅度无关的L0伪范数是有利的,因为它对非零参数施加恒定惩罚,并且有助于学习具有期望参数密度ρ的模型。FL中L0密度约束优化问题的拉格朗日函数可以定义为:

L(θ,λ)=∑_(c=1)^C (n_c/N) L^(c)(θ) + λ(‖θ‖_0 - ρ|θ|),‖θ‖_0=∑_(j=1)^(|θ|) I[θ_j≠0], (1)

其中,L^(c)(θ)表示客户端c的归一化损失,定义为:

L^(c)(θ) = (1/n_c) ∑_(i=1)^(n_c) ℓ(h(x_i^(c);θ), y_i^(c)). (2)

这里,C是FL中的客户端数量,每个客户端持有一个本地数据集{D^(c)}_(c=1)^C = (X^(c),Y^(c)),其中X^(c)∈R^(n_c×in),Y^(c)∈R^(n_c×out),且∑_(c=1)^C n_c = N。我们假设模型h(x;θ): R^in→R^out和损失函数ℓ(h(x;θ),y),其中x∈R^in,y∈R^out,θ∈R^d。上述带有拉格朗日乘子λ的公式导致了一个极小-极大优化问题,原则上可以使用梯度下降-上升法解决。然而,L0伪范数的不可微性使得在标准基于梯度的学习框架中进行优化变得复杂。

Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]引入了一种使用随机门z∈R^p和θ=θ̃⊙z[2]\[2\]\[2\]⊙表示逐元素乘积[9 (https://arxiv.org/html/2607.00275#bib.bib37)]。作为模型的有效参数的重参数化方法。通过假设z服从硬具体分布(伯努利分布的近似),L0范数近似为活跃门的期望数量,即∑_j E_q(z)[z_j],从而实现了基于梯度的L0正则化目标优化。Gallego-Posada等人[7 (https://arxiv.org/html/2607.00275#bib.bib13)]通过使用L0密度约束并求解所得的极小-极大问题,将该框架扩展到允许用户在集中式环境中定义目标稀疏性。Huthasana等人[10 (https://arxiv.org/html/2607.00275#bib.bib56)]进一步将该方法适应于FL环境中的稀疏性学习,考虑了数据和客户端参与的异质性。

然而,学习稀疏模型具有挑战性,尤其是在小样本高维(d≫N)情况下[18 (https://arxiv.org/html/2607.00275#bib.bib48),6 (https://arxiv.org/html/2607.00275#bib.bib49),22 (https://arxiv.org/html/2607.00275#bib.bib50),19 (https://arxiv.org/html/2607.00275#bib.bib51)],此时优化不稳定,导致多个竞争性参数配置的解具有较差的稀疏恢复和对未见测试数据的泛化行为。Bao等人[3 (https://arxiv.org/html/2607.00275#bib.bib59)]研究了低样本-高维情况下的统计恢复,但考虑的是单个客户端相对于参数数量样本量较小,而总样本量N远超参数数量。我们旨在研究总样本量N相对于参数数量d=|θ|较小的情况,类似于集中式设置,在FL中数据异质性和客户端参与异质性下极具挑战性。

Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]指出在优化中对相对熵或Kullback-Leibler散度KL(q(z)∥p(z))进行惩罚,其中p(z)是先验,q(z)是用于不确定性探索的近似后验。熵正则化的概念并不新鲜,常用于在决策层(类或动作的分布)鼓励多样性和探索,在强化学习(RL)中,并适应于输入空间的不确定性探索(依赖数据的潜在变量分布),在变分自编码器中[2 (https://arxiv.org/html/2607.00275#bib.bib52),5 (https://arxiv.org/html/2607.00275#bib.bib53)]。它也用于贝叶斯推断,在集中式和FL设置中[1 (https://arxiv.org/html/2607.00275#bib.bib54),26 (https://arxiv.org/html/2607.00275#bib.bib55)]。在他们的方法中,硬具体门分布q(z)不直接依赖于数据,可以在训练后独立于数据进行采样。在这项工作中,我们将Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]、Gallego-Posada等人[7 (https://arxiv.org/html/2607.00275#bib.bib13)]的公式与相对熵惩罚相结合,在通信高效的FL设置中探索非零参数配置的不确定性,并表明它始终优于训练期间基于迭代硬阈值剪枝[24 (https://arxiv.org/html/2607.00275#bib.bib26)]和训练后对使用经典联邦平均算法[16 (https://arxiv.org/html/2607.00275#bib.bib4)]训练的密集模型进行剪枝的方法。

本文的其余部分组织如下。我们首先提出用于联邦优化的熵正则化L0约束公式,然后提出分布式算法,随后是在异质性FL设置中的实验,最后进行总结。

## 2 公式

假设模型h(x;θ): R^in→R^out和损失函数ℓ(h(x;θ),y),其中x∈R^in,y∈R^out,θ∈R^d,考虑一个集中式数据集D=(X,Y),其中X∈R^(N×in),Y∈R^(N×out)。使用[14 (https://arxiv.org/html/2607.00275#bib.bib12),7 (https://arxiv.org/html/2607.00275#bib.bib13)],极小-极大目标可以定义为损失关于门分布的期望,并且L0伪范数近似为活跃门的期望数量,即∑_j E_q(z|φ)[z_j],如方程3所示。由于每个z_j是无参数噪声的确定性变换,期望可以使用蒙特卡洛采样和重参数化梯度进行优化[17 (https://arxiv.org/html/2607.00275#bib.bib36), ch. 3.3.3]。

L̂(θ̃,φ,λ) = (1/R)∑_(r=1)^R [ (1/N)∑_(i=1)^N ℓ(h(x_i;θ̃⊙z^(r)), y_i) ] + λ( ∑_(j=1)^(|θ|) E_q(z|φ)[z_j] - ρ|θ| ). (3)

在联邦学习(FL)环境中,有C个客户端持有数据集{D^(c)}_(c=1)^C = (X^(c),Y^(c)),我们考虑一个重参数化线性模型h(x;θ̃⊙z): R^in→R^out和损失函数ℓ(h(x;θ̃⊙z),y)。这里,X^(c)∈R^(n_c×in),Y^(c)∈R^(n_c×out),∑_(c=1)^C n_c = N,x∈R^in,y∈R^out,θ=θ̃⊙z∈R^in。门参数定义为φ=logα∈R^in。

对应于熵正则化L0密度约束优化问题的拉格朗日函数为:

L̂(θ̃,φ,λ) = ∑_(c=1)^C (n_c/N) L^(c)(θ̃,φ) + λ( ∑_(j=1)^(|θ|) E_q(z|φ)[z_j] - ρ|θ| ) + T ∑_(j=1)^(|θ|) KL(q(z_j|φ) || p(z_j|φ_init)). (4)

这里,p(z|φ_init)是先验,也是一个硬具体分布,L^(c)(θ̃,φ)表示客户端c的归一化损失的蒙特卡洛估计,定义为:

L^(c)(θ̃,φ) = (1/R)∑_(r=1)^R (1/n_c)∑_(i=1)^(n_c) ℓ(h(x_i^(c);θ̃⊙z^(r)), y_i^(c)). (5)

随机门z使用硬具体分布采样,对拉伸的二值具体随机变量应用硬sigmoid变换[14 (https://arxiv.org/html/2607.00275#bib.bib12),15 (https://arxiv.org/html/2607.00275#bib.bib15)],定义为:

s = σ( (log(u/(1-u)) + logα) / β′ ), u ~ U(0,1),
s̄ = s(ζ-γ)+γ, z = min(1, max(0, s̄)). (6)

活跃门的期望[3]\[3\]\[3\]E_q(z|φ)[z_j] = 1 - Q(s̄_j ≤ 0|φ_j) = σ( logα_j - β′ log(-γ/ζ) ) 由Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]使用累积分布函数Q(s̄)导出。我们引入了T≥0,我们将其视为一个常数,带或不带衰减,以惩罚熵。得到的极小-极大优化问题是:

θ̃*, φ*, λ* = arg min_(θ̃,φ) arg max_(λ≥0) L̂(θ̃,φ,λ). (7)

参数θ̃和φ=logα通过使用重参数化梯度的梯度下降进行联合优化。λ通过梯度上升更新,并采用重启策略:一旦满足稀疏性约束,将其值重置为0[7 (https://arxiv.org/html/2607.00275#bib.bib13)]。由于硬具体分布是伯努利分布的连续近似,KL(q(z_j)||p(z_j))的计算涉及一个关于s̄的附加项,因此z∈(0,1),这可以使用截断分布q(s̄|s̄∈(0,1))或其蒙特卡洛估计来计算。我们使用了Louizos等人[14 (https://arxiv.org/html/2607.00275#bib.bib12)]在附录A (https://arxiv.org/html/2607.00275#A1)中提供的封闭形式表达式。

相似文章

边缘设备上多模态联邦学习的熵引导张量压缩

arXiv cs.LG

论文介绍了MESH-FL,一种用于边缘设备上多模态联邦学习的熵引导矩阵乘积态压缩框架。它自适应地分配每层和每种模态的压缩秩,在异构树莓派集群上实现了高达56.8倍的压缩,并在最终准确率上比未压缩的FedAvg提升了2.01%。

面向模态异质性下的鲁棒联邦多模态图学习

arXiv cs.LG

本文提出FedMPO,一种鲁棒的联邦多模态图学习方法,通过拓扑感知的跨模态生成、缺失感知的专家路由和可靠性感知的聚合来解决模态异质性和缺失模态问题,在多个数据集上实现了性能提升。