Groundhog Bit-Flip Attack:通过比特翻转在Mixture-of-Experts LLMs中植入无限生成循环

arXiv cs.CL 论文

摘要

本文提出了Groundhog Bit-Flip Attack (GBFA),一种针对Mixture-of-Experts (MoE) 大语言模型的拒绝钱包可用性攻击,该攻击通过比特翻转停用与终止相关的专家模型,导致无限生成循环。

arXiv:2608.25276v1 公告类型:新 摘要:Mixture-of-Experts (MoE) 架构通过路由机制选择性地激活专家子网络,实现了可扩展且高效的大语言模型(LLMs)。然而,这种自适应设计引入了新的攻击面:特定专家与某些令牌(如序列结束符)变得不成比例地相关,使攻击者能够通过轻量级扰动操纵模型行为。在这项工作中,我们提出了 \textbf{Groundhog Bit-Flip Attack (GBFA)},这是首个基于比特翻转的 \textit{拒绝钱包可用性攻击},针对基于MoE的LLMs。通过识别并翻转与相关专家激活相关的路由层比特,我们证明GBFA在三种不同的LLM模式(对话式、推理式和代理任务)中显著扩展了解码令牌使用量,同时在很大程度上保持了语义保真度。在四个主要的实际MoE-based LLMs中,手动停用平均少于 \textbf{4个专家} 将平均输出膨胀驱动到 $\mathbf{5912\%}$,大多数测试样本达到最大令牌数。这些结果揭示了MoE架构对比特翻转的鲁棒性漏洞,并突出了GBFA作为针对LLMs的可用性攻击的潜力。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:17

# 土拨鼠比特翻转攻击:通过比特翻转在混合专家大语言模型中播种无限生成循环
来源:https://arxiv.org/html/2608.25276
胡康康††谢谢:同等贡献\.郑天成邮箱:[zhengtiancheng@g\.ucla\.edu](mailto:[email protected])孙明轩邮箱:[msun@seu\.edu\.cn](mailto:[email protected])徐天鸿机构:美国东北大学邮箱:[ruyiding@lsu\.edu](mailto:[email protected])张帆机构:中国浙江大学费云思机构:美国东北大学丁如意机构:美国路易斯安那州立大学机构:美国加州大学洛杉矶分校机构:中国东南大学

###### 摘要

混合专家模型架构通过路由机制选择性地激活专家子网络,实现了可扩展且高效的大语言模型。然而,这种自适应设计引入了新的攻击面:特定专家与某些令牌(例如,序列结束符)产生不成比例的关联,使得攻击者可以通过轻量级扰动操纵模型行为。在本研究中,我们提出了土拨鼠比特翻转攻击,这是首个针对基于混合专家模型的大语言模型的、基于比特翻转的"钱包耗尽"可用性攻击。通过识别并翻转与相关专家激活相关的路由层比特,我们证明了在三种不同的大语言模型模式(对话、推理和智能体任务)中,土拨鼠比特翻转攻击显著延长了推理时的令牌使用量,同时在很大程度上保持了语义保真度。在四种主要的现实世界混合专家大语言模型中,平均手动停用少于4个专家就能使平均输出膨胀达到5912%,并且大多数测试样本达到了最大令牌数。这些结果揭示了混合专家架构对比特翻转的鲁棒性漏洞,并凸显了土拨鼠比特翻转攻击作为大语言模型可用性攻击的潜在威胁。

## 1引言

为了降低大语言模型的推理成本,服务提供商越来越多地采用混合专家模型架构,该架构在扩展模型容量的同时,仅对每个令牌激活一小部分专门的专家。近期模型如 Mixtral Jiang et al\. \(2024\) (https://arxiv.org/html/2608.25276#bib.bib6)、DeepSeek DeepSeek\-AI \(2024\) (https://arxiv.org/html/2608.25276#bib.bib8)、Qwen3\-MoE Qwen Team \(2025\) (https://arxiv.org/html/2608.25276#bib.bib44) 和 GPT\-OSS OpenAI \(2025\) (https://arxiv.org/html/2608.25276#bib.bib9) 证明了这种设计在支持并发推理方面的有效性。然而,这种稀疏架构也引入了新的攻击面。

参考说明图 1:针对混合专家大语言模型的土拨鼠比特翻转攻击。先前的工作主要集中在利用混合专家特定的架构漏洞来攻击大语言模型。MoEcho Ding et al\. \(2025b\) (https://arxiv.org/html/2608.25276#bib.bib4) 利用专家执行的时间和空间轨迹作为侧信道来推断用户提示和输出。SAFE\-XL Lai et al\. \(2025\) (https://arxiv.org/html/2608.25276#bib.bib48) 揭示,基于混合专家模型的大语言模型的内在安全对齐行为强烈依赖于特定的位置专家。在本研究中,我们观察到终止令牌(例如,序列结束符)的生成由一个专门的子集专家控制。因此,旨在提高推理效率的相同路由机制可能成为可用性漏洞:通过扰乱这些与终止相关的专家,攻击者可以延迟或抑制终止令牌的生成。这种威胁在快速发展的智能体应用中尤为严重,因为膨胀的输出直接转化为"钱包耗尽"风险。

混合专家模型的稀疏性使得比特翻转攻击成为可用性攻击的天然工具,因为终止行为可以集中在一小部分路由参数中。少量有针对性的比特翻转就可以扰乱与终止相关的专家激活,并引发过度的生成。然而,现有的比特翻转攻击研究主要关注模型完整性 Rakin et al\. \(2022b\) (https://arxiv.org/html/2608.25276#bib.bib33),例如准确性下降或输出损坏,而针对基于混合专家模型的大语言模型的"钱包耗尽"攻击尚未被探索。为了填补这些空白,我们引入了土拨鼠比特翻转攻击111以电影《土拨鼠之日》命名。在本文中,“无限”指的是耗尽分配令牌预算(max\_new\_tokens)的生成,而非字面上的无限生成。,这是首个针对基于混合专家模型的大语言模型的比特翻转"钱包耗尽"攻击。土拨鼠比特翻转攻击将混合专家模型的路由视为结构攻击面:如图1 (https://arxiv.org/html/2608.25276#S1.F1) 所示,路由器参数中的有针对性比特翻转可以将令牌从终止相关专家重新路由,从而延迟序列终止。这导致显著的输出膨胀和推理成本增加,同时在很大程度上保持了语义保真度。

我们的分析表明,混合专家模型的专家对终止相关令牌(包括序列结束符和思考结束符)表现出强烈的专门化。一小部分*终止相关专家*不成比例地控制着停止生成,使得混合专家模型的路由成为可用性操纵的局部攻击面。通过对路由器级别的比特翻转来扰乱这些专家,攻击者可以延迟终止并引发过度生成。这将比特翻转攻击从旨在降低模型准确性或损坏输出的完整性攻击,重新定义为在保持表面实用性的同时最大化输出长度的可用性攻击,直接导致推理成本增加和"钱包耗尽"风险。

本文做出了以下贡献:

- •专家-令牌专门化。我们发现了混合专家模型专家的专门化模式,表明一小部分专家主导了序列结束符或思考结束符的处理,从而控制了终止行为。
- •系统检测方法。我们引入了全局和局部专家检测方法,使用激活差异指标来高效识别与目标相关的专家,这些专家在特定令牌生成时会被持续激活。
- •识别易感比特。我们表明,少量路由器权重或偏置比特对目标相关专家施加了不成比例的控制。通过分析比特级扰动下的专家激活敏感性,我们识别出了土拨鼠比特翻转攻击的易感比特。
- •结构化"钱包耗尽"攻击演示。我们在三种大语言模型模式(对话、推理和智能体任务)下的六个混合专家模型上演示了结构化"钱包耗尽"攻击。我们进一步在其中的四个模型上使用土拨鼠比特翻转实现了这些攻击。仅需最少的参数更改,我们的攻击在所有三种模式下都持续引起显著的输出膨胀,在最严重的情况下将输出令牌数放大了高达87倍。

## 2背景

### 2\.1混合专家模型

混合专家模型架构通过为每个令牌仅激活一小部分参数,高效地扩展语言模型,从而在推理成本与更小的密集模型相当的情况下实现万亿参数容量。混合专家模型层用一组专家网络和一个路由器取代了密集的前馈块,路由器为每个令牌选择k个专家。给定一个隐藏状态h∈Rd\\mathbf\{h\}\\in\\mathbb\{R\}^\{d\},路由器计算

z=h⊤Wg,g=Softmax\(TopK\(z,k\)\),\\mathbf\{z\}=\\mathbf\{h\}^\{\\top\}\\mathbf\{W\}\_\{g\},\\qquad\\mathbf\{g\}=\\text\{Softmax\}\(\\text\{TopK\}\(\\mathbf\{z\},k\)\),\(1\) 其中Wg∈Rd×N\\mathbf\{W\}\_\{g\}\\\!\\in\\\!\\mathbb\{R\}^\{d\\times N\}是路由器矩阵。该层的输出聚合了所选专家:

y=∑i=1NgiEi\(h\)\.\\mathbf\{y\}=\\sum\_\{i=1\}^\{N\}g\_\{i\}\\,E\_\{i\}\(\\mathbf\{h\}\)\.\(2\) 一些近期的混合专家模型设计(例如,DeepSeek\-V3, Qwen3\-MoE)进一步引入了*共享专家*,它们与前k个路由专家一起始终对每个令牌激活,用于捕获通用知识,而路由专家则进行专门化。

混合专家模型已成为扩展大语言模型的主流方法:Switch Transformer Fedus et al\. \(2022\) (https://arxiv.org/html/2608.25276#bib.bib11) 首次将参数量推至万亿规模,Mixtral\-8x7B Jiang et al\. \(2024\) (https://arxiv.org/html/2608.25276#bib.bib6) 使用远少于GPT\-3\.5的活跃参数达到了相当的性能,而近期的系统如DeepSeek\-V2 DeepSeek\-AI \(2024\) (https://arxiv.org/html/2608.25276#bib.bib8)、Qwen3 Qwen Team \(2025\) (https://arxiv.org/html/2608.25276#bib.bib44) 和GPT\-OSS\-20B OpenAI \(2025\) (https://arxiv.org/html/2608.25276#bib.bib9) 继续在推理、编码和智能体工作负载中改进该架构。它们日益增长的采用凸显了理解混合专家模型特定安全漏洞的重要性。

### 2\.2比特翻转攻击

比特翻转攻击利用这样一个事实:对存储权重的比特级别进行细微但精心选择的更改,可以在仅修改极小比例参数的情况下,导致模型行为产生不成比例的巨大变化 Rakin et al\. \(2019\) (https://arxiv.org/html/2608.25276#bib.bib2);Liu et al\. \(2017\) (https://arxiv.org/html/2608.25276#bib.bib18);Ghavami et al\. \(2022\) (https://arxiv.org/html/2608.25276#bib.bib19);Rakin et al\. \(2022b\) (https://arxiv.org/html/2608.25276#bib.bib33)。这种敏感性源于底层的数值表示。在IEEE 754 FP32中,每个值由1个符号位、8个指数位和23个尾数位组成,在不同字段翻转比特会产生性质不同的扰动规模:对1\.5进行符号位翻转得到−1\.5,翻转最高指数位将1\.5变为∼\\sim3\.1×10383\.1\\times 10^\{38\},而翻转最低尾数位仅将其改变∼\\sim10−710^\{\-7\}。量化的INT8权重表现出类似的行为,其中最高有效位翻转会导致符号或幅度的大幅跳跃,而最低有效位翻转仅引起边际调整。

Rowhammer是在商用硬件上实现此类比特翻转的最广泛研究的软件故障注入原语 Kim et al\. \(2014\) (https://arxiv.org/html/2608.25276#bib.bib23):通过重复访问选定的DRAM行,攻击者可以在不需要物理访问目标机器的情况下,诱导相邻行发生翻转。端到端的Rowhammer攻击已在CPU Kwong et al\. \(2020\) (https://arxiv.org/html/2608.25276#bib.bib24);Seaborn and Dullien \(2015\) (https://arxiv.org/html/2608.25276#bib.bib25);Jattke et al\. \(2024\) (https://arxiv.org/html/2608.25276#bib.bib26);Frigo et al\. \(2020\) (https://arxiv.org/html/2608.25276#bib.bib27);Jattke et al\. \(2022\) (https://arxiv.org/html/2608.25276#bib.bib28);Kogler et al\. \(2022\) (https://arxiv.org/html/2608.25276#bib.bib29);Hassan et al\. \(2022\) (https://arxiv.org/html/2608.25276#bib.bib30);Olgun et al\. \(2024\) (https://arxiv.org/html/2608.25276#bib.bib31) 和 GPU Lin et al\. \(2025\) (https://arxiv.org/html/2608.25276#bib.bib1) 上得到证明,并已被用于神经网络,以实现准确性下降 Rakin et al\. \(2019\) (https://arxiv.org/html/2608.25276#bib.bib2);Yao et al\. \(2020\) (https://arxiv.org/html/2608.25276#bib.bib32),针对性误分类 Rakin et al\. \(2022b\) (https://arxiv.org/html/2608.25276#bib.bib33);Bai et al\. \(2023\) (https://arxiv.org/html/2608.25276#bib.bib34);Cai et al\. \(2021\) (https://arxiv.org/html/2608.25276#bib.bib35),后门植入 Rakin et al\. \(2020\) (https://arxiv.org/html/2608.25276#bib.bib36);Zheng et al\. \(2023\) (https://arxiv.org/html/2608.25276#bib.bib37);Kunbei et al\. \(2024\) (https://arxiv.org/html/2608.25276#bib.bib38);Chen et al\. \(2021\) (https://arxiv.org/html/2608.25276#bib.bib39);Tol et al\. \(2023\) (https://arxiv.org/html/2608.25276#bib.bib40);Li et al\. \(2025\) (https://arxiv.org/html/2608.25276#bib.bib41),以及模型提取 Rakin et al\. \(2022a\) (https://arxiv.org/html/2608.25276#bib.bib42),将其确立为一种成熟且现实的威胁向量。我们在第3.4节分析各种基于混合专家模型的大语言模型的路由器层,并开发相应的比特翻转策略 (https://arxiv.org/html/2608.25276#S3.SS4)。

## 3土拨鼠比特翻转攻击

参考说明图 2:我们的三步土拨鼠比特翻转攻击流程概述。步骤 1:通过比较目标令牌的专家激活频率与非目标令牌的专家激活频率,并选择超过阈值的专家来识别与目标相关的专家。步骤 2:通过评估翻转每个候选比特是否会抑制所选目标相关专家的得分(使用缓存的隐藏状态)来搜索易感路由器比特。步骤 3:执行在线比特翻转攻击以抑制序列结束符生成并产生非常长的输出。图2 (https://arxiv.org/html/2608.25276#S3.F2) 展示了我们的攻击流程,该流程在三个步骤中解决了每个研究问题。完整的算法细节见附录A (https://arxiv.org/html/2608.25276#A1)。

为了对混合专家模型大语言模型实施土拨鼠比特翻转攻击,我们提出三个研究问题:

- •问题1:基于混合专家模型的大语言模型是否对终止相关令牌(如序列结束符和思考结束符)表现出专家专门化?
- •问题2:我们能否识别出其激活强烈影响响应长度的终止相关专家?
- •问题3:对易感专家的针对性比特翻转攻击能否有效引发基于混合专家模型的大语言模型的输出膨胀?

### 3\.1威胁模型

攻击场景。我们考虑一个云端推理场景,服务提供商部署一个开源混合专家模型大语言模型用于按令牌计费的推理 DeepSeek \(2025\) (https://arxiv.org/html/2608.25276#bib.bib5)。用户提交查询,并根据输入和输出令牌收费。攻击者被建模为与受害者大语言模型位于同一物理服务器上的非特权租户(例如,在公共机器学习即服务环境中),来自多个租户的工作负载以时间片方式共享GPU资源,这与先前工作一致 Lin et al\. \(2025\) (https://arxiv.org/html/2608.25276#bib.bib1)。攻击者利用硬件漏洞(例如,Rowhammer Kim et al\. \(2014\) (https://arxiv.org/html/2608.25276#bib.bib23) 或电压毛刺 Moro et al\. \(2013\) (https://arxiv.org/html/2608.25276#bib.bib16))向受害者的模型参数注入比特翻转,无需提升权限或物理访问。攻击者的目标是通过对混合专家模型路由器中的战略性比特翻转来膨胀输出令牌消耗,从而发起"钱包耗尽"攻击,同时保持语义连贯性以避免被检测。

攻击者能力。我们假设攻击者对受害混合专家模型具有白盒访问权限,包括模型超参数(例如,专家数量)和参数(例如,路由器权重)。这是现实的,因为许多混合专家模型大语言模型以公共检查点的形式发布,具有开放权重,攻击者可以直接获取参数。我们还假设攻击者是与受害者共享硬件的共同租户(例如,在多租户机器学习即服务中)。因此,攻击者可以在模型推理期间通过故障注入技术向受害者的大语言模型注入有针对性的比特翻转。

攻击目标。攻击者旨在通过控制目标令牌生成来发起"钱包耗尽"攻击(增加用户对大语言模型API的查询成本):(1)抑制目标令牌以产生长输出,或(2)改变目标令牌的频率。

隐蔽性约束。为了确保土拨鼠比特翻转攻击的隐蔽性,攻击者将任务性能维持在可接受的阈值内,在很大程度上保持原始语义连贯性(例如,困惑度、基准测试分数)不受影响。

### 3\.2目标相关专家激活概率建模

如图2步骤1所示 (https://arxiv.org/html/2608.25276#S3.F2),我们分析了模型在目标令牌位置与非目标令牌位置的专家激活频率。

符号说明。考虑一个具有L个混合专家模型前馈层的模型,索引为l∈\{1,...,L\}l\\in\\\{1,\\ldots,L\\\},每层包含K个专家。令S=\{s1,...,sN\}\\mathcal\{S\}=\\\{s\_\{1\},\\ldots,s\_\{N\}

相似文章

谁在翻转?自模型与跨模型反论点揭示LLM答案的不稳定性

Hugging Face Daily Papers

本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

arXiv cs.AI

本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。