FedLNS:利用LayerNorm签名建模减轻联邦LLMs中的对抗性操纵

arXiv cs.LG 论文

摘要

FedLNS是一个服务器端框架,使用LayerNorm签名来筛选联邦学习中语言模型的恶意更新,增强对对抗性操纵的鲁棒性。

arXiv:2608.18736v1 Announce Type: new 摘要:联邦训练使语言模型能够从分布式的私有文本中学习,但服务器无法直接验证产生每个客户端更新的本地监督或优化过程。因此,恶意客户端可以在被污染的目标上训练,引入不正确的上下文-令牌关联,并通过重复聚合降低全局模型的质量。这种降级还会增加不可靠或幻觉生成的风险。我们提出带有归一化签名的联邦学习(FedLNS),一个用于轻量级恶意更新筛选的服务器端框架。FedLNS通过可训练归一化层参数的变化来表示每个客户端更新,并根据一个稳健的、历史感知的跨客户端参考来筛选可疑更新。由于签名是从服务器端提取返回的本地模型中得到的,与标准联邦学习(FL)方法相比,FedLNS不需要额外的客户端到服务器参数或元数据交换。筛选后,保留的完整模型更新可以使用标准FL或其他兼容的聚合规则进行聚合。FedLNS不需要原始客户端数据、可信服务器数据集、标记的攻击示例或单独训练的检测器。在从零开始训练的GPT风格、BERT风格和LLaMA风格模型上,使用200个客户端进行实验表明,在40%种群级目标操纵下,FedLNS在所有三种架构中,无论是在IID(独立且同分布)还是非IID数据分区下,都实现了比六个基线中最强者更低的测试困惑度。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:34

# FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵  
来源:https://arxiv.org/html/2608.18736  
Jong-Ik Park、Carlee Joe-Wong、Wei Ni、Falko Dressler  

**致谢**:  
K. Li 隶属于卢森堡大学安全、可靠性与信任跨学科研究中心 (SnT)(邮箱:[email protected])。  
J. Park 与 C. Joe-Wong 隶属于美国宾夕法尼亚州卡内基梅隆大学电气与计算机工程系(邮箱:{jongikp, cjoewong}@andrew.cmu.edu)。  
W. Ni 隶属于澳大利亚珀斯西澳伊迪斯·科文大学工程学院(邮箱:[email protected])。  
F. Dressler 隶属于德国柏林工业大学电气工程与计算机科学学院。  
K. Li 与 J. Park 对本工作贡献均等。  

###### 摘要  
联邦训练使语言模型能够从分布式私有文本中学习,但服务器无法直接验证生成每个客户端更新的本地监督或优化过程。因此,恶意客户端可能在受损目标上进行训练、引入错误的上下文-词元关联,并通过重复聚合降低全局模型质量。这种性能下降还会增加生成不可靠或幻觉性内容的风险。我们提出*基于归一化签名的联邦学习*(FedLNS),这是一种用于轻量级恶意更新筛选的服务器端框架。FedLNS通过可训练归一化层参数的变化来表征每个客户端更新,并基于鲁棒的、具有历史感知能力的跨客户端参考对可疑更新进行筛选。由于签名是从服务器端从返回的本地模型中提取的,与标准联邦学习方法相比,FedLNS不需要额外的客户端到服务器参数或元数据交换。筛选后,保留的完整模型更新可使用标准联邦学习或其它兼容的聚合规则进行聚合。在200个客户端上从零开始训练的GPT风格、BERT风格和LLaMA风格模型上的实验表明,在群体级目标操纵比例为40%的情况下,FedLNS在所有三种架构上,无论是在IID(独立同分布)还是非IID数据分区下,均能取得比六个基线方法中最强者更低的测试困惑度。  

###### 索引关键词:联邦学习,联邦语言模型,恶意更新筛选,鲁棒聚合,归一化层。  

## I 引言  
大型语言模型正越来越多地支持搜索、问答、软件开发、决策辅助和人机交互。它们在特定应用中的有效性通常取决于分散在用户、组织和设备之间的领域特定文本[7, 27]。由于隐私、所有权、保密性或法规限制,集中化此类数据可能不可行[1, 13, 28]。联邦学习通过协调一个共享模型而不收集原始客户端数据来解决这一局限性:在每一轮通信中,服务器广播当前全局模型,被选中的客户端在本地对其进行优化,服务器聚合它们返回的更新以开始另一轮训练[24, 51, 45]。这种保护隐私的分离也创造了一个关键的安全漏洞。服务器可以观察到返回的更新,但无法直接验证产生这些更新的本地输入、目标和优化过程[51, 46, 50]。因此,恶意客户端可以操纵其本地目标并提交有害更新,同时遵守通信协议。对于联邦语言模型,检测此类行为尤其困难,因为每个更新可能包含数百万或数十亿个参数,并且良性客户端更新也可能存在显著差异。  

本工作考虑*恶意目标操纵*,如图1所示。在因果语言建模中,每个位置的目标是下一个词元,而在掩码语言建模中,目标是被掩码过程隐藏的原始词元。恶意客户端将这些目标替换为错误的词元,优化错误的上下文-目标关联,并将由此产生的更新提交给服务器。如果此类更新被服务器接受并反复聚合,它们可能将受损的训练信号传播到全局模型中,降低测试集性能并扭曲模型对词元续写的预测分布[47]。这些影响可能进而增加语义不一致或幻觉性生成的风险[29, 3]。因此,本工作的重点是在聚合前筛选可疑的客户端更新,将提高生成可靠性视为限制受损训练信号的下游效应。  

现有拜占庭鲁棒联邦学习方法通过基于距离的选择、坐标级鲁棒统计、范数控制或基于聚类的过滤来抑制有害更新[5, 52, 41, 34]。由于这些方法作用于完整的客户端更新,其服务器端处理仍然受限于全模型维度,而高维良性变异可能掩盖恶意偏离。近期研究通过攻击敏感维度选择或对参数高效更新的监督分析,减少了联邦学习服务器端用于恶意更新筛选的表示维度[55, 42]。这些结果表明,筛选不必依赖完整的模型更新。然而,一个重要问题仍然存在:*能否使用紧凑的、架构感知的表示,在无需标记攻击样本、可信服务器数据或单独训练的检测器的情况下筛选可疑更新?*  

为了解决这个问题,我们提出*基于归一化签名的联邦学习*(FedLNS),一种用于轻量级恶意更新筛选的服务器端框架。FedLNS不是检查完整的高维更新,而是从模型归一化层可训练参数的变化中构建一个紧凑的、架构感知的签名。这些参数控制着Transformer块中隐藏表示的缩放,在架构支持时还包括偏移[2, 44, 53, 48]。因此,这些参数的变化提供了本地训练如何改变隐藏模型表示的紧凑、架构感知视图。对于每个参与客户端,服务器提取相对于广播全局模型的归一化层签名,并将其与从先前观察到的客户端最新签名构建的鲁棒历史参考进行比较。这些参考与坐标级中值和中值绝对偏差统计量进行比较,以减少异常条目条目的影响[52, 54]。FedLNS随后采用带有贝叶斯信息准则的正则化高斯混合模型建模,以确定当前参与者是形成一个连贯群体,还是两个具有不同偏离程度的群体。当识别出两个群体时,FedLNS保留偏离程度较低、因此更可能是良性的群体,而无需预先了解恶意客户端的比例。由于归一化层签名是从服务器端从返回的本地模型中提取的,FedLNS不增加防御特定的客户端传输开销。筛选后,保留的完整模型更新使用标准的样本加权规则进行聚合,该规则可以替换为另一种兼容的联邦学习聚合规则。FedLNS不需要原始客户端数据、可信服务器数据集、标记的恶意更新、单独训练的检测器或辅助全局模型。通过限制目标受损更新的整合,FedLNS旨在提高全局模型的鲁棒性,并在恶意目标操纵下降低预测不确定性。  

本工作的贡献如下:  
- • **紧凑的模型更新表示**。我们引入了一种归一化层更新签名,通过一个小型的、架构感知的参数子集而非完整的高维更新来表征每个客户端更新。由于签名是从返回的本地模型中提取的,它为执行全模型聚合之前的服务器端筛选提供了一种模块化的表示。  
- • **无监督的、具有历史感知能力的筛选**。我们开发了一种服务器端更新保留规则,该规则从最近观察到的签名构建鲁棒的跨客户端参考,并结合中值/MAD标准化与BIC引导的混合建模。该规则不需要原始客户端数据、可信服务器数据集、标记的更新、预定义的恶意比例、单独训练的检测器或防御特定的客户端到服务器载荷。  
- • **跨架构评估**。我们在GPT风格、BERT风格和LLaMA风格模型上评估了FedLNS,使用200个客户端、IID和两分片非IID分区,以及影响0%-40%客户端群体的目标操纵。在40%的比例下,FedLNS在IID和两分片非IID分区下的所有三种架构上均取得了比所有六个基线方法更低的困惑度。最大降低幅度为困惑度降低18.57%,词元级语义熵降低6.50%。  

本文其余部分组织如下。第II节回顾相关工作。第III节介绍FedLNS框架。第IV节提供理论分析。第V节描述实验评估和性能分析。第VI节总结全文。  

## II 相关工作  
与FedLNS相关的工作主要涉及两个方向:联邦学习中的*鲁棒聚合与恶意更新筛选*以及*参数高效或模型内部表示*。  

### II-A 鲁棒聚合与恶意更新筛选  
拜占庭鲁棒聚合利用几何、坐标级或基于幅度的特性来抑制有害的联邦学习更新。Multi-Krum选择在成对距离下保持接近多数邻域的更新[5]。坐标级中值和截断均值在参数维度上独立应用鲁棒统计[52],而范数有界聚合通过更新裁剪或缩放限制客户端影响[41]。FLAME结合聚类、裁剪和噪声注入来减少可疑客户端的贡献[34]。由于这些方法作用于*完整的模型更新*,其服务器端处理仍然受限于全模型维度。其他联邦学习防御使用可信参考、多个模型或历史客户端行为。FLTrust从可信服务器数据构建参考更新,并根据客户端更新与该参考的一致性对其进行评分[8]。FLCert将客户端分组,训练多个全局模型,并结合其预测以提供认证鲁棒性[9]。FLDetector从之前的通信轮次预测客户端更新轨迹,并检测偏离预期行为的持续偏差[54]。总的来说,这些方法依赖于具有代表性的服务器数据、额外的模型实例或足够规律的客户端历史记录。  

近期安全方法减少了筛选过程中分析的表示维度。Dim-Krum选择具有更强后门相关变化的维度,并在受限空间中应用基于Krum的检测[55]。Safe-FedLLM从LoRA更新中提取特征,并使用标记的良性和恶意样本训练一个离线监督探针[42]。这些方法表明,恶意更新筛选不必处理每个模型参数,但它们分别依赖于攻击敏感坐标选择或标记的更新样本及单独训练的探针。  

### II-B 参数高效适配与模型内部信号  
参数高效适配表明,任务相关的模型变化可以通过受限的可训练子集来表达。适配器微调引入小型可训练模块[23];BitFit仅更新偏置参数[4];IA3学习缩放中间激活的紧凑向量[31]。LN-Tuning通过归一化增益和偏置参数适配语言模型[36]。虽然这些方法设计用于适配而非安全,但它们表明,相对较小的参数子集可以编码本地优化引起的有意义的变化。  

归一化层在Transformer架构中形成一个结构上重复的参数子集。它们根据形式的不同,调节归一化隐藏表示的缩放以及偏移[2, 44, 53]。先前的工作进一步表明,它们的位置和行为影响优化、梯度传播和Transformer的表达能力[48, 6]。它们在Transformer块中的受限参数化和循环作用为研究归一化参数变化作为客户端更新信号提供了架构基础。  

语言模型的可靠性也通过输出锚定、不确定性和内部模型信号进行了研究。基于锚定的方法将生成内容与源证据、知识表示或语义关系进行比较[17, 35, 20, 19],而基于不确定性和一致性的方法则使用语义...

相似文章

PFAdapter:面向个性化联邦多模态大语言模型的分层LoRA分解

arXiv cs.LG

本文介绍了PFAdapter,一种用于多模态大语言模型(MLLMs)个性化联邦微调的通信高效框架。它采用分层LoRA分解,将适配器参数分离为全局共享和本地私有组件,通过正交正则化实现通信成本降低近50%,同时提升个性化性能。

NLNet Labs LLM 政策

Lobsters Hottest

NLNet Labs 宣布了一项限制在代码和文档贡献中使用 LLM 的政策,要求披露 LLM 的使用情况,并禁止 AI 生成的代码。

联邦学习

ML at Berkeley

本文解释了联邦学习作为一种保护隐私的机器学习技术的概念,该技术通过在本地设备而非中央服务器上训练模型来实现。文章详细描述了加密参数更新和聚合的过程,旨在降低数据泄露风险,同时保持模型性能。

迈向LLM的下一个前沿:私有数据训练——联邦微调的跨域基准

arXiv cs.LG

本文提出了一个在私有数据上对大型语言模型进行联邦微调的跨域基准,评估了LoRA、QLoRA和IA3策略在医疗和金融数据集上的表现。结果表明,联邦微调接近集中式训练的性能,并优于孤立学习,证明了在数据无法共享时通过联邦微调适配LLM的可行性。