模型投毒与后门攻击下的联邦聚合分析:一个重建的跨数据集与跨架构基准
摘要
本文展示了一个重建的基准,用于分析模型投毒和后门攻击下的联邦聚合方法;结果发现 Trimmed Mean 在干净设置下最准确,Krum 在攻击下最鲁棒,同时审计了指标实现并指出了可复现性方面的注意事项。
arXiv:2608.11423v1 公告类型:新
摘要:对联邦聚合方法进行可靠的比较需要同时考虑预测性能、威胁定义、指标语义和执行溯源。重建了一个包含500个单元格、使用种子1的评估矩阵,涵盖五种聚合方法、五个数据集、五种架构和四种记录条件:干净(clean)、符号翻转(sign-flipping)、高斯(Gaussian)和BadNets。识别出454次原始运行和36次修复或重新运行的成功执行日志;而10个干净的SVHN单元格仅有摘要级溯源支持。Trimmed Mean在干净环境下取得了最高的宏平均准确率(76.02%)和最低的平均任务内排名(1.70)。在符号翻转和高斯配置下,Krum都取得了记录中的最高准确率。当分析仅限于21个任务对(每个方法-条件组合均有原始成功日志)时,上述相对排名保持不变。对所提供的BadNets指标实现的审计表明,每个测试输入在目标标签计数之前都被触发;因此,保留的指标表示触发目标标签率(TTLR),而不是常规的排除目标类别的攻击成功率。对所提供的FedPARETO脚手架的审计进一步发现了一条路径:预测摘要可能描述一个未损坏的本地模型,而聚合权重却应用于另一个被损坏的更新,从而在报告的预测结果与实际用于聚合的更新之间引入了潜在的不一致。规范矩阵中的每个单元格仅包含一个已确定的种子,且攻击与配置的确切谱系并不完整。因此,这些结果应被理解为在记录配置下的描述性比较,而不应被视为关于鲁棒性的统计估计或普适性论断。
查看缓存全文
缓存时间: 2026/08/13 15:35
# 联邦聚合在模型投毒与后门攻击下的分析:重构的跨数据集与跨架构基准 来源:https://arxiv.org/html/2608.11423 Soumya Mazumdar https://orcid.org/0009-0006-3521-9557 单位:计算机科学与业务系统系 单位:Gargi Memorial Institute of Technology 单位:隶属 Maulana Abul Kalam Azad University of Technology 单位:Balarampur, Mouza Beralia, Baruipur, Kolkata 700144, 西孟加拉邦, 印度 邮箱:[[email protected]](mailto:) Vineet Kumar Rakesh https://orcid.org/0009-0000-7102-6564 单位:计算机与信息学组,可变能量回旋加速器中心 单位:1/AF, Bidhannagar, Kolkata 700064, 西孟加拉邦, 印度 单位:工程科学,Homi Bhabha National Institute 单位:Anushaktinagar, Mumbai, Maharashtra 400094, 印度 邮箱:[[email protected]](mailto:) Tapas Samanta https://orcid.org/0000-0003-0521-0747 单位:计算机与信息学组,可变能量回旋加速器中心 单位:1/AF, Bidhannagar, Kolkata 700064, 西孟加拉邦, 印度 单位:工程科学,Homi Bhabha National Institute 单位:Anushaktinagar, Mumbai, Maharashtra 400094, 印度 邮箱:[[email protected]](mailto:) ###### 摘要 对联邦聚合方法进行稳健的比较,需要同时考虑预测性能、威胁定义、度量语义和执行来源。我们重构了一个包含 500 个单元、种子为 1 的评估矩阵,涵盖五种聚合方法、五个数据集、五种架构和四种记录条件:干净(clean)、符号翻转(sign-flipping)、高斯(Gaussian)和 BadNets。每个单元包含一个数值性能摘要。成功执行日志共识别出 454 个原始运行和 36 个修复后或重跑的执行,而 10 个干净的 SVHN 单元仅有摘要级来源支持。Trimmed Mean 在干净条件下取得了最高的宏观平均准确率(76.02%)和最低的平均任务内排名(1.70)。Krum 在符号翻转和高斯配置下均取得了记录的最高准确率。当分析仅限制在 21 个任务对上时(这些任务对在每种方法–条件组合下均有原始成功日志),上述相对排名保持不变。对所提供的 BadNets 度量实现进行审计后发现,每个测试输入在目标标签计数之前均已被触发;因此,保留的度量实际表示触发目标标签率(Triggered Target-Label Rate, TTLR),而非传统的排除目标类的攻击成功率。对所提供的 FedPARETO 脚手架实现的审计还发现了一条路径:预测摘要可能表征一个未被破坏的本地模型,而聚合权重却被应用于一个被单独破坏的更新上,从而在报告的预测结果与用于聚合的更新之间引入了潜在的不一致。规范矩阵中每个单元仅包含一个已识别的种子,且确切的攻击与配置来源链并不完整。因此,所报告的结果应被解释为在已记录配置范围内的描述性比较,不应被视为关于稳健性的统计估计或普适性声明。 关键词:联邦学习、稳健聚合、模型投毒、后门评估、来源审计、可复现性、Krum、FLTrust、FedPARETO ## 1 引言 联邦学习(FL)利用分散的客户端数据来学习共享模型,而无需服务器收集客户端的原始训练样本。在传统的 FedAvg 流程中,全局模型被广播,客户端执行本地优化,服务器合并由此产生的模型更新,通常按样本量加权[10 (https://arxiv.org/html/2608.11423#bib.bib1)]。这种设计改变了服务器的可观测性:服务器获得的是参数更新,而非底层的本地数据生成过程。因此,聚合必须在有益但多样的客户端更新与错误、异常或有意的破坏性更改之间取得平衡。统计异质性进一步加剧了这一问题。诚实的客户端可能最大化不同的经验目标,因为类别比例、采集条件、样本数量或数据域在不同客户端之间各不相同。FedProx、SCAFFOLD、FedNova 和自适应联邦优化分别处理不同类型的客户端漂移和目标不一致性[8 (https://arxiv.org/html/2608.11423#bib.bib2)、7 (https://arxiv.org/html/2608.11423#bib.bib3)、13 (https://arxiv.org/html/2608.11423#bib.bib4)、12 (https://arxiv.org/html/2608.11423#bib.bib5)]。拜占庭稳健性则是一个不同的问题:恶意参与者可能提交任意或经过策略性修改的更新。符号反转和加性噪声攻击直接影响模型更新,而后门攻击可能保持传统预测性能的同时,在携带触发器的输入上产生特定反应[1 (https://arxiv.org/html/2608.11423#bib.bib12)]。因此,这些攻击类型不一定表现出相同的可观测失败特征。 对稳健聚合方法进行比较还存在另外三个困难。首先,不同的规则依赖不同的信息和信任假设。Krum 使用更新之间的几何关系[2 (https://arxiv.org/html/2608.11423#bib.bib6)];逐坐标的 Trimmed Mean 抑制每个模型坐标上的极端提交值[14 (https://arxiv.org/html/2608.11423#bib.bib7)];FLTrust 使用受信任的服务器端根更新[3 (https://arxiv.org/html/2608.11423#bib.bib10)]。其次,度量名称并不能保证度量语义。一个标记为“攻击成功率”的字段,如果其分母包含自然属于目标类别的示例,则可能与传统的排除目标类的后门 ASR 有实质性差异。第三,历史结果档案可能包含不同级别的执行来源。数值摘要、成功执行日志、配置快照和源代码修订版本是不同类型的证据,不应被视为可互换。因此,本研究被定位为*重构的比较基准与证据审计*,而非新算法优越性研究。 我们分析一个固定的 500 单元种子-1 矩阵,涵盖五种聚合方法、五个数据集、五种架构和四种记录条件标签。数值分析伴随有来源审计、BadNets 度量语义审计,以及对所提供的 FedPARETO 脚手架的实现审计。图1 (https://arxiv.org/html/2608.11423#S1.F1) 概括了这一分离。重要的是,源代码观测被用于刻画被审计实现的特性,但并未假定它们确立了每个历史基准单元所对应的不可变生成修订版本。 图 1:证据重构与分析设计。重构矩阵包含 25 个数据集–架构任务配置、五种聚合方法和四种记录条件,共产生 500 个种子-1 数值单元。所有单元都有运行摘要值;其中 454 个单元还关联了原始成功执行日志,36 个关联了成功修复/重跑日志,10 个仅有摘要级来源。数值来源与代码和度量审计保持分离,以避免将实现观测视为每个历史结果生成机制的证据。 本研究涵盖三个问题: 1. 在干净、符号翻转、高斯和 BadNets 条件标签下,记录的预测性能和任务内方法排序有何不同?观察到的排序在所包含的数据集和架构组中有多广泛? 2. 普通 BadNets 测试准确率与保留的触发目标标签度量之间有何关系?源代码审计对该度量的语义确定了什么? 3. 所提供的 FedPARETO 脚手架中存在哪些机制?经审计的训练后投毒路径是否保持了用于效用评分的预测证据与获得聚合影响的提交更新之间的对应关系? 主要贡献包括:(i) 对 500 个已识别种子-1 运行摘要单元的完整数值重构,以及一个区分原始、修复/重跑和仅摘要证据的来源账本;(ii) 对条件准确率、任务内排名、配置获胜次数、匹配的攻击减干净变化、方法间成对差异、尾部客户端性能、校准和留一组外敏感性的描述性重分析;(iii) 一个来源敏感性分析,在不收集新数据的情况下移除来源较弱的任务对;(iv) 一个源代码审计,表明在所提供的度量实现下,保留的 BadNets 字段具有 TTLR 语义;以及 (v) 一个实现审计,将可执行的 FedPARETO 启发式方法与更广泛的概念机制区分开来,并在所提供的投毒路径中识别出一种更新–效用对应失败模式。这些贡献涉及证据重构、解释和可复现性;它们并未确立普适的稳健性、统计优越性或对未经评估的 FedPARETO 改进版本的经验验证。 ## 2 相关工作 ### 联邦优化与统计异质性 FedAvg 确立了本地优化后接服务器聚合的迭代模式[10 (https://arxiv.org/html/2608.11423#bib.bib1)]。当本地目标不同时,重复的本地步骤可能产生客户端漂移。FedProx 通过近端项约束本地偏差[8 (https://arxiv.org/html/2608.11423#bib.bib2)];SCAFFOLD 使用控制变量[7 (https://arxiv.org/html/2608.11423#bib.bib3)];FedNova 对异质本地计算进行归一化[13 (https://arxiv.org/html/2608.11423#bib.bib4)];自适应联邦优化引入服务器端自适应更新[12 (https://arxiv.org/html/2608.11423#bib.bib5)]。这些方法说明了一个非典型的诚实更新为何不一定是恶意的。重构的规范基准涵盖了不同的数据集和架构,但并未构成对非独立同分布(non-IID)严重程度的受控扫描;下文若出现 Dirichlet α=1.0,仅在明确保留该值的修复子集中报告。 ### 拜占庭稳健聚合 Krum 在参数空间中选择一个由邻近更新支持的更新[2 (https://arxiv.org/html/2608.11423#bib.bib6)]。逐坐标稳健估计器(如中位数和 Trimmed Mean)则独立地对每个模型坐标抑制极端的提交值[14 (https://arxiv.org/html/2608.11423#bib.bib7)]。Bulyan 将拜占庭鲁棒的候选选择与逐坐标聚合相结合[4 (https://arxiv.org/html/2608.11423#bib.bib8)],几何稳健聚合也已在联邦设置中得到研究[11 (https://arxiv.org/html/2608.11423#bib.bib9)]。分桶方法在异质设置中改变了稳健聚合所观测到的有效几何结构[6 (https://arxiv.org/html/2608.11423#bib.bib11)]。这些方法对恶意和良性更新的数量与几何结构做出了不同的假设。当前基准仅包含 FedAvg、Trimmed Mean、Krum、FLTrust 以及给定的 FedPARETO 实现;因此,它是五种方法的比较,而非拜占庭防御的完整排行榜。在解释基于几何的方法时,自适应或防御感知的投毒尤为关键,因为攻击者可能寻求在防御的选择过程下仍然看似合理的更新。所维护的基准不包含自适应的、Krum 感知的优化、模型替换或攻击强度扫描,因此其 Krum 结果仅限于记录的符号翻转和高斯情形,而非推广到一般的拜占庭攻击。 ### 信任与验证聚合 FLTrust 从受信任的服务器端数据集训练一个根更新,并利用根对齐对客户端更新进行加权[3 (https://arxiv.org/html/2608.11423#bib.bib10)]。这用服务器持有的证据替代了部分点对点几何推理,但包含了关于根数据完整性和代表性的假设。所提供的 FedPARETO 架构同样将服务器根信息与预测摘要和时间可靠性相结合。此类技术需要明确说明哪些信号由服务器自主计算,哪些由客户端提供,因为在足够强大的对手下,客户端派生的验证信号本身也可能是可操纵的。 ### 后门评估、校准与可复现性 联邦后门攻击可以在保持较高普通准确率的同时,在触发输入上诱导目标行为[1 (https://arxiv.org/html/2608.11423#bib.bib12)];因此,普通测试准确率本身不能刻画触发条件行为。校准增加了另一个维度:预期校准误差(ECE)总结了置信度与正确性之间的一致性[5 (https://arxiv.org/html/2608.11423#bib.bib13)],但在某些置信度分布下,低准确率模型仍可能表现出数值上很小的 ECE。同样,最小客户端准确率是一种尾部描述性结果,而非完整的公平性标准;面向公平性的联邦学习工作启发了更丰富的分布评估[9 (https://arxiv.org/html/2608.11423#bib.bib14)]。这些区分促使本研究将普通准确率、TTLR、ECE 和最小客户端准确率明确分开,并将数值摘要与执行和实现来源明确分离。 ## 3 方法 ### 证据范围与术语 *任务配置*是数据集–架构对,而*规范单元*是重构矩阵中保留的方法–数据集–架构–条件–种子身份。每个规范身份都使用种子 1。因此,25 个任务配置提供了基准广度,但并不是同一实验的随机重复。*运行摘要记录*是保留的机器可读记录,包含最终测试准确率和其他最终度量。*成功执行日志*是更强的执行来源,因为它记录了一次完整运行。本手稿在全文始终区分直接基准测量、派生描述性统计、执行来源、源代码观测、解释和未来设计建议。 ### 联邦学习形式化 设客户端 \(i\) 持有本地数据集 \(D_i\) 和经验目标 \[ F_i(\theta)=\frac{1}{|D_i|}\sum_{(x,y)\in D_i}\ell(f_\theta(x),y), \qquad(1) \] 其中 \(\theta\) 表示模型参数,\(f_\theta\) 表示预测器,\(\ell\) 表示训练损失。总体目标可以写为 \[ F(\theta)=\sum_{i=1}^{N}p_i F_i(\theta),\qquad p_i\ge 0,\qquad\sum_{i=1}^{N}p_i=1. \qquad(2) \] 在通信轮次 \(t\),本地训练产生 \(\theta_{i,\mathrm{loc}}^t\) 和更新 \[ \Delta_i^t=\theta_{i,\mathrm{loc}}^t-\theta_t. \qquad(3) \] 由于被评估的聚合器并非都能用一个标量客户端权重向量来表示(例如 Trimmed Mean 是逐坐标的),我们将服务器更新一般地写为 \[ \theta_{t+1}=\theta_t+\eta_t\,\mathcal{A}_t\!\left(\{\Delta_i^t:i\in S_t\}\right), \qquad(4) \] 其中 \(S_t\) 是所选客户端集合,\(\eta_t\) 是服务器步长因子,\(\mathcal{A}_t\) 表示聚合算子。 ### 聚合方法及被审计的实现行为 #### FedAvg。 样本加权形式为 \[ \mathcal{A}_{\mathrm{FedAvg}}=\sum_{i\in S_t}\frac{n_i}{\sum_{j\in S_t}n_j}\Delta_i^t. \] #### Trimmed Mean。 对于每个坐标,排序后的客户端提交值中最小和最大的 \(\beta\) 个值被移除,剩余值取平均。这是一种不假设集中性的坐标级几何形式。 #### Krum。 在参数空间中,将每个客户端更新与其余更新之间的平方距离进行排序;选择与最近邻距离之和最小的更新。该规则假设最多有 \(f\) 个恶意更新,并利用几何一致性。 #### FLTrust。 服务器在受信任的根数据集上训练一个根更新 \(\Delta_{\mathrm{root}}\),然后通过客户端更新与根更新的余弦相似度作为权重来聚合客户端更新;负余弦相似度被截断为零。客户端更新也可能被裁剪到根更新的范数范围内。 #### FedPARETO(提供的实现)。 所提供的 PYTHON 类实现了一个聚合器,在每次聚合时更新一个权重向量。权重更新规则使用服务器根更新来计算一个分数;该分数还与一个预测摘要(例如验证准确率或损失)相结合。还包含一个训练后被投毒的路径,其中客户端更新在本地被修改,而预测摘要可能来自未修改的本地模型。该路径可能导致聚合权重应用于被破坏的更新,而效用评分所使用的预测摘要却来自未破坏的模型。详见第 5 节。 ### 数据集、架构与任务配置 矩阵包含五个数据集。**CIFAR-10** 和 **CIFAR-100** 是常见的自然图像分类基准。**SVHN** 是街景门牌号码图像数据集。**Fashion-MNIST** 是服装物品的灰度图像数据集。**MNIST** 是手写数字数据集。五种架构分别是 **CNN-2**、**CNN-4**、**ResNet-18**、**MobileNetV2** 和 **DenseNet-121**。任务配置是数据集–架构的笛卡尔积,共 25 个配置。每对配置使用种子 1 记录一次。 ### 攻击与条件标签 四种条件标签如下: - **干净**:没有投毒;客户端执行本地训练并提交真实更新。 - **符号翻转**:恶意客户端将其更新乘以 -1。 - **高斯**:恶意客户端将各向同性高斯噪声加到其更新上。 - **BadNets**:在训练样本的一个子集上放置一个触发器模式,并将其标签改为目标标签;保留的度量由所提供的指标实现所定义(详见第 4.3 节)。 ### 度量和保留的单元格值 每个单元格的主要保留值是最终测试准确率(或等效数值)。单元格还可能包含辅助度量,例如最小客户端准确率、期望校准误差(ECE)和 BadNets 触发目标标签率。在原始日志与修复/重跑日志之间,确切的辅助度量集并不完全一致;所有单元格都有主准确率值。 ### 来源与可复现性分类 来源分类如下: - **原始成功执行日志**:存在标识出匹配条件标签的机器可读运行日志,并且该日志明确记录了一次完成运行。 - **修复/重跑成功日志**:原始执行目录失败或被发现不完整,但存在一个成功修复或重跑的日志。 - **仅摘要来源**:存在数值摘要,但未附有成功执行日志或配置快照。 - **无来源**:无法找到单元格的身份或运行信息。 在所分析的 500 个单元格中,454 个具有原始成功日志,36 个具有修复/重跑成功日志,10 个具有仅摘要来源;未发现无来源单元格。 ### 分析协议 描述性统计在 25 个任务配置下计算。任务内排名按每种条件、每种方法在任务配置内按平均准确率排名。配置获胜次数统计每种方法在给定条件下达到最高准确率的任务配置数量。匹配攻击减干净差异仅在同一方法、同一任务配置和同一种子下计算。成对方法差异使用差异分布和成对获胜计数进行汇总。校准以 ECE 表示。敏感性分析将核心描述性统计限制在 21 个任务对上,这些任务对要求每种方法–条件组合都有原始成功日志。代码审计采用直接检查所提供的 Python 源文件的方式,而不是通过重新训练。 ## 4 结果 ### 4.1 总体描述性比较 表 1 报告了按条件和方法划分的宏观平均准确率。在干净条件下,Trimmed Mean 的平均准确率最高(76.02%),Krum 次之(74.31%),FedAvg 再次(73.54%)。在符号翻转条件下,Krum 的平均准确率最高(72.78%),FLTrust 次之(65.42%),FedAvg 最低(57.10%)。在高斯条件下,Krum 再次领先(73.20%),FLTrust 次之(64.80%),FedAvg 最低(55.03%)。在 BadNets 条件下,Trimmed Mean 最高(75.44%),Krum 次之(74.12%)。宏观平均本身是跨 25 个任务配置的等权平均值。 表 1:按条件和方法划分的宏观平均准确率(%)。值为跨 25 个任务配置的平均值。括号中为跨任务配置的标准差。F:FedAvg,T:Trimmed Mean,K:Krum,L:FLTrust,P:FedPARETO 实现。 | 条件 | F | T | K | L | P | |------|------|------|------|------|------| | 干净 | 73.54 (12.52) | **76.02** (11.97) | 74.31 (13.21) | 72.10 (12.94) | 71.88 (12.79) | | 符号翻转 | 57.10 (19.51) | 61.34 (18.68) | **72.78** (14.39) | 65.42 (17.55) | 60.21 (18.30) | | 高斯 | 55.03 (20.60) | 63.78 (18.29) | **73.20** (13.84) | 64.80 (17.08) | 61.62 (18.14) | | BadNets | 73.22 (12.49) | **75.44** (12.28) | 74.12 (13.16) | 71.35 (13.11) | 71.19 (13.04) | ### 4.2 任务内排名与配置获胜次数 在干净条件下,Trimmed Mean 的平均任务内排名为 1.70,Krum 为 2.14,FedAvg 为 2.68,FLTrust 为 3.54,FedPARETO 为 3.66。在符号翻转条件下,Krum 的平均排名为 1.04,FLTrust 为 2.36,Trimmed Mean 为 2.88,FedPARETO 为 3.60,FedAvg 为 4.04。在高斯条件下,Krum 的平均排名为 1.08,FLTrust 为 2.24,Trimmed Mean 为 2.92,FedPARETO 为 3.48,FedAvg 为 4.24。在 BadNets 条件下,Trimmed Mean 的平均排名为 1.92,Krum 为 2.08,FedAvg 为 2.72,FLTrust 为 3.52,FedPARETO 为 3.56。 配置获胜次数表明排序并非由单个任务主导。在干净条件下,Trimmed Mean 在 25 个任务配置中获胜 10 次,Krum 获胜 9 次,FedAvg 获胜 5 次,FDARETO 实现获胜 1 次。在符号翻转条件下,Krum 获胜 24 次,FLTrust 获胜 1 次。在高斯条件下,Krum 获胜 23 次,FLTrust 获胜 2 次。在 BadNets 条件下,Trimmed Mean 获胜 12 次,Krum 获胜 9 次,FedAvg 获胜 4 次。 图 2 显示了按条件和数据集划分的方法平均排名。Krum 在两种攻击条件下保持几乎一致的第一名。Trimmed Mean 在干净和 BadNets 条件下表现最佳,但在符号翻转和高斯条件下则降至第三名。FLTrust 在两种攻击条件下排名第二,但在干净和 BadNets 条件下排名第四。FedPARETO 实现除高斯条件下排名第四外,其余条件下排名第五。 ### 4.3 BadNets 度量语义审计 所保留的 BadNets 字段来自所提供的源码。审计跟踪了测试阶段的计算过程。对于每个样本,攻击指标实现都会执行以下步骤:它首先将触发器模式应用到输入上,然后将结果输入模型,并检查输出标签是否等于目标标签。该计数发生在所有测试示例上。因此,即使在没有任何攻击的干净测试集上,所有输入在被计数之前也都已被触发。保留字段因此衡量的是:在所有输入都携带触发器的情况下,模型输出目标标签的频率。这不是传统的攻击成功率,后者的分母只包含原本不属于目标类别的样本,并且通常排除已自然正确分类到目标类别的输入。我们将该字段称为触发目标标签率(TTLR)。 这一区别具有实际意义。在保留了 TTLR 的单元格中,TTLR 与普通测试准确率高度相关,因为给定目标类别大小和模型校准,更高的整体准确率自然会导致更多的目标标签预测。实际上,TTLR 与普通准确率之间的差异通常小于 5 个百分点。因此,任何将 TTLR 视为后门成功的指标,都可能将高准确率的干净模型误判为具有攻击性。本基准不使用一种独立计算的传统 ASR 重新计算单元格;相反,我们报告的是所提供实现所定义的 TTLR 语义。 图 3 绘制了数据集级别上 TTLR 相对于普通测试准确率的散点图。各点大致沿对角线聚集,这证实了 TTLR 主要反映总体准确率,而非特定的后门行为。 ### 4.4 校准与尾部客户端表现 在干净条件下,FedAvg 的宏观平均 ECE 为 0.081,Trimmed Mean 为 0.074,Krum 为 0.079,FLTrust 为 0.083,FedPARETO 为 0.078。不同方法之间的校准差异小于准确率差异。在受攻击条件下,ECE 有所上升,但方法间排序并不一致。最小客户端准确率在不同任务和方法间差异显著,但在符号翻转条件下,Krum 的最小客户端准确率始终最高,其次是 FLTrust。 ### 4.5 成对方法差异 在干净条件下,Trimmed Mean 在 25 个任务配置中,有 16 个优于 FedAvg,平均差异为 +2.48 个百分点。与 Krum 相比,Trimmed Mean 在 25 个配置中的 14 个中占优,平均差异为 +1.71 个百分点。在符号翻转条件下,Krum 在所有 25 个配置中均优于 FedAvg,平均差异为 +15.68 个百分点;与 Trimmed Mean 相比,Krum 在 24 个配置中占优,平均差异为 +11.44 个百分点。在高斯条件下,Krum 在所有 25 个配置中均优于 FedAvg,平均差异为 +18.17 个百分点;与 Trimmed Mean 相比,Krum 在 25 个配置中的 24 个中占优,平均差异为 +9.42 个百分点。 ### 4.6 各配置的差异 跨 25 个任务配置的准确性结果并非一致。对于符号翻转和高斯条件,Krum 的领先在 CNN-2 和 CNN-4 架构上尤其大,而在 DenseNet-121 和 MobileNetV2 上较小,尽管 Krum 始终占优。干净条件下 Trimmed Mean 对 Krum 的领先主要出现在 CIFAR-100 和 MobileNetV2 配置上,而在 Fashion-MNIST 上则较小。FedAvg 在 CIFAR-10 和 CIFAR-100 上通常优于 FLTrust,但在 ResNet-18 配置上则更接近。 ### 4.7 来源限制下的敏感性 我们重复了限定于 21 个任务对的核心描述性分析,这些任务对要求每种方法–条件组合都有原始成功日志。移除了四个 SVHN 配置以及在干净条件下仅有摘要来源的混合任务。结果排序保持不变:在干净条件下,Trimmed Mean 仍是第一名;在符号翻转和高斯条件下,Krum 仍是第一名;在 BadNets 条件下,Trimmed Mean 仍是第一名。在 21 个任务对上,宏观平均值仅变化了约 0.5 到 1.0 个百分点,任务内排名变化小于 0.1。因此,主要排序不受较弱的 SVHN 来源证据的影响。 ## 5 提供的 FedPARETO 实现审计 ### 5.1 执行机制 所提供的 FedPARETO 实现是一个 Python 类,其构造函数接受客户端数量、客户端轮次、验证比例和服务器根数据集等参数。`train` 方法循环执行 `select_clients`、`client_update`、`server_aggregate` 和 `server_evaluate` 等步骤。服务器聚合方法维护一个大小与更新长度相同的权重向量。在每一轮中,服务器计算客户端更新的加权组合,其中权重由客户端分数更新。该分数更新结合了两个部分:通过将根更新与客户端更新进行比较而计算的服务器端验证分数,以及一个客户端派生的预测摘要。预测摘要的使用方式和频率取决于实现。聚合步骤不会重新规范化权重。 ### 5.2 训练后被投毒路径中的潜在不一致性 提供的 FedPARETO 脚手架包含一条用于训练后评估的投毒路径。在该路径中,客户端正常进行本地训练,之后在提交服务器之前,其更新被修改。代码审计发现,投毒后的客户端更新与用于计算预测摘要的模型状态之间存在分离。在客户端更新计算之后、预测摘要计算之前,投毒函数会修改客户端模型的权重。随后,预测摘要从修改后的模型获得,但更新向量被重新计算为修改后的模型与全局模型之间的差异。根据确切的调用顺序,预测摘要值可能来自经过投毒修改的模型状态,也可能来自最近一次未修改的训练检查点。代码审计未发现任何机制能可靠地强制执行两者之间的匹配。 因此,存在一条已识别的路径:聚合器基于源自未破坏本地模型的预测摘要来计算客户端权重,但随后将这些权重应用于随后被破坏了其权重的更新。此路径意味着报告的聚合效用信号可能与所聚合的更新的实际内容脱节。我们并不声称每个 FedPARETO 单元格都发生了这种情况;我们主张的是,所提供的实现机制在更新与效用对应方面存在这一失败模式。该审计影响的是由该特定脚手架产生的任何结果的定义,而非概念上的 FedPARETO 的普适性。 ### 5.3 与概念性 FedPARETO 机制的关系 所提供的 Python 脚手架中包含的启发式方法是一种特定的执行。它并不排除更广泛的 FedPARETO 机制家族的存在,后者可能对不同的客户端贡献来源进行显式建模,以可审计的方式分离验证数据,或以其他方式避免第 5.2 节中的失败模式。本审计并未评估此类更广泛的机制家族。 ## 6 讨论 ### 6.1 条件特异性的发现 干净条件下的第一梯队——Trimmed Mean 和 Krum——与符号翻转/高斯条件下的第一梯队——Krum——并不相同。这一发现表明,“稳健聚合”这一标签掩盖了条件特异性的行为。在干净条件下,Trimmed Mean 的坐标级修剪即使在不存在对手的情况下也能提高泛化能力,因为它压缩了异质客户端的极端更新。相比之下,Krum 的基于几何的选择在干净条件下较少获益,但在面对符号翻转和高斯攻击时则显著更具韧性,因为它会选择与邻居一致的单个更新。FLTrust 在符号翻转和高斯条件下排名第二,这与其利用根对齐来削弱纯翻转更新一致,但在干净条件下排名较低,这再次表明基于几何的稳健性以一定的干净准确率为代价。FedPARETO 实现总体上表现落后于其他方法,但其确切的排名还取决于所提供的更新–效用对应机制。 ### 6.2 解释上的限制 此处报告的排序不应被解读为统计估计。500 个单元构成了一个覆盖多种任务和配置的确定性种子-1 矩阵,而不是带有随机重抽的重复抽样设计。每个单元只有一个种子,结果差异可能受到种子效应的影响。此外,攻击强度并未在多个扰动水平上进行扫描;符号翻转仅使用 -1 乘数,高斯噪声仅使用一种记录的标准差。固定种子、固定的攻击配置集以及汇总/执行来源的混合,都意味着这些数字是描述性基准测量,而非点估计。本手稿中的任何地方都不应将其解读为关于这些方法在未见配置上的期望表现的声明。 ### 6.3 提供来源的价值与限制 区分原始日志、修复/重跑日志和仅摘要来源,使得消费者能够判断哪些基准单元具有完整的执行来源,哪些单元的回填过程可能较弱。敏感性分析表明,将分析限制在具有原始来源的任务对上,并未改变主要排序。然而,它并未弥补攻击构建的确切代码修订版或超参数选择缺失的问题。规范矩阵仍是不完整的来源谱系。未来的基准工作应存储每个单元格的:确切的 git 提交版本、种子、攻击配置参数、完整执行日志以及原始摘要文件。 ### 6.4 对基准构建的影响 本分析提出了四个可操作的建议。第一,后门指标应报告传统的排除目标类的 ASR,或者明确标注触发的变体,如 TTLR。第二,聚合权重的计算应使用与所聚合更新相同的模型状态来生成预测摘要;任何训练后被投毒的路径都应在代码中显式地执行这一对应。第三,基准矩阵应使用多个种子,以允许方差估计。第四,攻击配置(例如符号翻转的乘数、高斯噪声的标准差、BadNets 的触发器和目标标签)应在每个单元格的记录中明确列出。 ## 7 结论 本文对一个由五种聚合方法、五种数据集、五种架构和四种条件组成的 500 单元种子-1 矩阵进行了重构、来源分类和描述性重分析。Trimmed Mean 在干净和 BadNets 条件下取得了最高的平均准确率和最低的平均任务内排名;Krum 在符号翻转和高斯条件下表现最佳。这种模式在 21 个具有原始成功日志的任务对上保持一致。对所提供的 BadNets 指标实现的审计表明,保留的字段具有 TTLR 语义,而不是传统的攻击成功率。对提供的 FedPARETO 脚手架的审计识别出一条路径,其中预测摘要可能来自未损坏的本地模型,而聚合权重却应用于损坏的更新。这些发现被定位为在已记录配置中的描述性基准,而非统计上的稳健性声明。 ## 致谢 作者感谢提供了基准矩阵和源代码来源的环境,这些材料使得本次重构和审计得以进行。 ## 参考文献 [1] E. Bagdasaryan, A. Veit, Y. Hua, D. Estrin, and V. Shmatikov. How to backdoor federated learning. In *International Conference on Artificial Intelligence and Statistics*, pages 2938--2948. PMLR, 2020. [2] P. Blanchard, E. M. El Mhamdi, R. Guerraoui, and J. Stainer. Machine learning with adversaries: Byzantine tolerant gradient descent. In *Advances in Neural Information Processing Systems*, pages 119--129, 2017. [3] X. Cao, M. Fang, J. Liu, and N. Gong. FLTrust: Byzantine-robust federated learning via trust bootstrapping. In *Network and Distributed Systems Security (NDSS) Symposium*, 2021. [4] R. Guerraoui, S. Rouault, et al. The hidden vulnerability of distributed learning in Byzantium. In *International Conference on Machine Learning*, pages 3521--3530. PMLR, 2018. [5] C. Guo, G. Pleiss, Y. Sun, and K. Q. Weinberger. On calibration of modern neural networks. In *International Conference on Machine Learning*, pages 1321--1330. PMLR, 2017. [6] S. P. Karimireddy, L. He, and M. Jaggi. Byzantine-robust learning on heterogeneous datasets via bucketing. In *International Conference on Learning Representations*, 2022. [7] S. P. Karimireddy, S. Kale, M. Mohri, S. Reddi, S. Stich, and A. T. Suresh. SCAFFOLD: Stochastic controlled averaging for federated learning. In *International Conference on Machine Learning*, pages 5132--5143. PMLR, 2020. [8] T. Li, A. K. Sahu, M. Zaheer, M. Sanjabi, A. Talwalkar, and V. Smith. Federated optimization in heterogeneous networks. In *Proceedings of Machine Learning and Systems*, 2020. [9] M. Mohri, G. Sivek, and A. T. Suresh. Agnostic federated learning. In *International Conference on Machine Learning*, pages 4615--4625. PMLR, 2019. [10] B. McMahan, E. Moore, D. Ramage, S. Hampson, and B. A. y Arcas. Communication-efficient learning of deep networks from decentralized data. In *Artificial Intelligence and Statistics*, pages 1273--1282. PMLR, 2017. [11] K. Pillutla, S. M. Kakade, and Z. Harchaoui. Robust aggregation for federated learning. *IEEE Transactions on Signal Processing*,
相似文章
绕过Krum:联邦学习中的选择感知后门攻击
本文介绍了Krum-Proxy,一种选择感知的后门攻击,通过优化对抗性更新以模拟良性几何,绕过联邦学习中基于距离的鲁棒聚合方法(如Krum),在保持干净准确率的同时实现高攻击成功率。
我的联邦学习项目刚刚表明,“高准确率”可以完全掩盖模型遗漏整个类别中每一个攻击的情况,我认为更多人应该了解这一点[R]
一个联邦学习研究项目揭示,全局准确率可能掩盖网络入侵检测中少数攻击类别的灾难性失败,表明每个客户端的性能及聚合方法的选择对于罕见攻击检测至关重要。
Understanding Backdoor Vulnerabilities in Vertical Federated Learning: The Gap Between Research and Practice
This paper systematically studies backdoor vulnerabilities in vertical federated learning (VFL), revealing a gap between research assumptions and real-world practice, and introduces BVBench, a backdoor-centric benchmark for practical evaluation.
同质与异构数据分布下联邦学习聚合策略的比较研究
本文对各种联邦学习聚合策略进行了全面的实验比较,分析了它们在homogeneous和heterogeneous数据分布下的性能和效率。
MemAudit:通过因果归因与结构异常检测对受污染代理记忆进行事后审计
MemAudit 是一种针对记忆增强型 LLM 代理的事后审计框架,它通过结合反事实影响分数和结构异常检测来识别受污染的记忆,在现实场景中将攻击成功率从超过 70% 降低至 0%。