故障强化:通过GPU降压提升CNN对抗鲁棒性
摘要
本文介绍了GPU降压作为一种硬件级防御手段,通过引入有益的随机故障来提高训练过程中CNN的对抗鲁棒性和能效。
arXiv:2608.20572v1 公告类型:新
摘要:卷积神经网络(CNN)面临双重挑战:对对抗攻击的脆弱性和高昂的训练成本。对抗训练有效但代价高昂,随着学习转向能源受限的边缘设备,这一负担愈发沉重。本文通过训练期间的GPU降压来应对这两个问题。降低供电电压引入随机扰动,作为隐式正则化,在降低功耗的同时提高鲁棒性。我们在比特级表征降压引起的故障,然后在MNIST和CIFAR-10数据集上,分别在标准和对抗两种训练模式下,以标称和降压电压训练LeNet、VGG-6和MobileNetV3,并评估所有模型对对抗攻击的抵抗能力。在两种模式下,降压模型始终比其标称电压对应模型取得更高的对抗准确率,表明硬件诱导的故障甚至能增强对抗训练。由于动态功耗随供电电压二次方缩放,这些鲁棒性增益伴随着显著的能源节约。因此,GPU降压是一种易于部署的硬件级防御,无需算法改变,并为鲁棒性和能效共同提升开辟了有前景的方向。
查看缓存全文
缓存时间: 2026/08/24 04:31
# 通过GPU降压增强CNN对抗鲁棒性:化故障为坚固
来源:https://arxiv.org/html/2608.20572
Ihsen Alouani4, 以及 Khaled N. Khasawneh1
作者单位:1美国乔治梅森大学,费尔法克斯,美国 - 邮箱:{bomidi, atahmasi, halsyour, kkhasawn}@gmu.edu
2SecureMind Technologies Inc,费尔法克斯,美国 - 邮箱:[email protected]
3罗切斯特理工学院,罗切斯特,美国 - 邮箱:[email protected]
4贝尔法斯特女王大学,贝尔法斯特,英国 - 邮箱:[email protected]
###### 摘要
卷积神经网络(CNN)面临双重挑战:易受对抗攻击以及高昂的训练成本。对抗训练有效但代价高昂,随着学习转向能源受限的边缘设备,这种负担愈发沉重。本文通过在训练期间对GPU进行降压来同时解决这两个问题。降低供电电压会在算术运算中引入随机扰动,这些扰动可作为隐式正则化,在降低功耗的同时提升鲁棒性。我们在比特级刻画了降压诱发的故障,并在两种训练模式(标准训练和对抗训练)下,在标称电压和降压电压条件下,分别在MNIST和CIFAR-10上训练了LeNet、VGG-6和MobileNetV3,并评估所有模型抵御对抗攻击的能力。在这两种模式下,降压模型的对抗准确率始终高于其标称电压对应模型,表明硬件诱发的故障甚至能增强对抗训练的效果。由于动态功耗与供电电压成平方关系,这些鲁棒性提升的同时带来了显著的能源节省。因此,GPU降压是一种易于部署的硬件级防御,无需任何算法修改,并开辟了一条前景广阔的方向:鲁棒性与能效可同步提升。
###### 关键词:
机器学习,对抗攻击,故障注入,降压,节能训练,AI鲁棒性。
## I 引言
卷积神经网络(CNN)已成为现代计算机视觉的基础组件,赋能从医学影像到自动驾驶等众多应用。然而,训练这些模型需要大量计算资源,包括高性能GPU和巨大的能源消耗[25 (https://arxiv.org/html/2608.20572#bib.bib1)]。这些挑战在边缘计算中尤为突出,因为模型不仅被部署在无人机、可穿戴设备、自动驾驶汽车等资源受限平台上(这些平台通常在严格的功耗预算下运行),还越来越多地需要在这些平台上进行微调[19 (https://arxiv.org/html/2608.20572#bib.bib23)]。在此类环境中,增强鲁棒性技术所带来的计算开销往往令人望而却步。因此,在保持模型准确性和鲁棒性的同时提高训练效率,已成为一个关键的研究目标。
参见插图 图1:工作流概述 近期研究集中在算法层面,通过量化、剪枝和加速器协同设计[23 (https://arxiv.org/html/2608.20572#bib.bib2),6 (https://arxiv.org/html/2608.20572#bib.bib3)]。另一个互补的杠杆作用于其下层,即硬件修改,如电压调整会影响模型性能和学习动态[18 (https://arxiv.org/html/2608.20572#bib.bib24)]。先前的工作研究了这种行为的安全影响,表明降压如何被利用以可控的方式诱发故障[14 (https://arxiv.org/html/2608.20572#bib.bib15),29 (https://arxiv.org/html/2608.20572#bib.bib25)],同时也展示了其作为防御机制的潜力,通过注入良性噪声来干扰对抗攻击[22 (https://arxiv.org/html/2608.20572#bib.bib16),12 (https://arxiv.org/html/2608.20572#bib.bib13),13 (https://arxiv.org/html/2608.20572#bib.bib14)]。这些降压诱发的故障源于电压余量减小,导致晶体管开关可靠性下降,可能引发时序违规、不稳定的存储行为以及计算过程中的信号采样错误。与以存储为中心的故障机制(如Rowhammer引发的DRAM干扰或有针对性的权重腐蚀攻击[3 (https://arxiv.org/html/2608.20572#bib.bib17),31 (https://arxiv.org/html/2608.20572#bib.bib18),1 (https://arxiv.org/html/2608.20572#bib.bib26)],这些攻击涉及对存储数据的持久性修改,并有相应的缓解方法[28 (https://arxiv.org/html/2608.20572#bib.bib19),24 (https://arxiv.org/html/2608.20572#bib.bib20)])不同,降压故障源于底层硬件执行过程中的瞬态干扰。
同样值得注意的是,这些防御机制主要在推理阶段运行,其中故障被引入到已训练的模型中,并且通常通过基于软件的注入来模拟[13 (https://arxiv.org/html/2608.20572#bib.bib14),22 (https://arxiv.org/html/2608.20572#bib.bib16)],而不是在降压硬件条件下进行实验观察。因此,训练阶段瞬态故障的影响在很大程度上尚未被探索。相比之下,这项工作研究了仅通过物理GPU降压所诱发的瞬态故障,并研究了是否可以利用这些扰动来有益地影响训练动态。
降压为学习本身的算术运算注入了微妙的随机性,这可能会促使网络趋向更平坦的表示,而非基于梯度的攻击所利用的尖锐决策边界。由于动态功耗与供电电压成平方关系,这同一个旋钮也能降低能耗。因此,该技术具有双重益处:更绿色的训练和更具弹性的模型,仅通过一次硬件设置改变,无需任何算法修改。
为研究此问题,我们分别在标称电压和降压电压下运行标准训练和对抗训练,在MNIST[16 (https://arxiv.org/html/2608.20572#bib.bib21)]和CIFAR-10[15 (https://arxiv.org/html/2608.20572#bib.bib22)]上训练LeNet[16 (https://arxiv.org/html/2608.20572#bib.bib21)]、VGG-6[27 (https://arxiv.org/html/2608.20572#bib.bib27)]和MobileNetV3[11 (https://arxiv.org/html/2608.20572#bib.bib28)],并在一系列扰动预算下评估所有模型抵御PGD攻击[21 (https://arxiv.org/html/2608.20572#bib.bib29)]的能力(图1 (https://arxiv.org/html/2608.20572#S1.F1))。在这两种模式下,降压变体始终比其标称电压对应模型更鲁棒,同时消耗更少的能量。
这些发现代表了令人鼓舞的第一步,而非完整的防御方案。除了证明降压可以在提供能效优势的同时提高对抗攻击的鲁棒性外,我们的结果还暗示了硬件可靠性、能源优化和AI鲁棒性交叉领域的一个有前景的新研究方向。基于这些鼓舞人心的结果,鼓励该领域的未来工作进一步探索比特级故障行为,并将评估扩展到更大的基础模型和量化模型,因为鲁棒性动态和节能效果可能在这些模型中更为显著。本文的贡献总结如下。
- •我们刻画了真实GPU上由降压引起的计算故障,表明这些故障是随机的但可控的。
- •我们提出训练时降压作为一种新颖的手段,用于提高GPU上CNN的鲁棒性,证明训练期间硬件产生的噪声是一种实用、易于部署且节能的安全机制。
- •我们评估了降压在标准训练和对抗训练下的效果,表明它在两种模式下都能提高鲁棒性。
- •我们量化了由此产生的功耗降低,表明这些鲁棒性提升伴随着可测量的能源节省和可接受的计算可靠性。
## II 背景与相关工作
### II-A 降压诱发的故障
降压,即将电路的供电电压降低到其标称水平以下,是提高高性能系统(如GPU)能效的有效方法,因为动态功耗大致与供电电压的平方成正比。然而,同样的电压降低会减慢晶体管开关速度并降低电路时序,从而产生计算不稳定性和瞬态故障。因此,电压、延迟和错误概率之间的定量关系决定了降压如何影响基于GPU的深度学习。
对功耗的影响:GPU总功耗是动态功耗和静态功耗之和,
P_total = P_dyn + P_static = α_s * C_L * V_dd^2 * f_clk + I_leak * V_dd (1)
其中α_s是开关活动因子,C_L是有效负载电容,f_clk是时钟频率,I_leak是泄漏电流。由于P_dyn与V_dd成平方关系,而P_static线性下降,因此降低电压会降低这两项,代价是时序可靠性。
电压-延迟关系与时序故障:CMOS逻辑门的传播延迟t_d强烈依赖于供电电压,
t_d ∝ V_dd / (V_dd - V_th)^α, t_d ≤ T_clk = 1 / f_clk (2)
其中V_th是阈值电压,α(通常在1和2之间)是速度饱和指数,T_clk是时钟周期。正确的操作要求第二个条件在所有逻辑路径上都成立。当降压将t_d推到超过T_clk时,会发生时序违规,导致输出错误或瞬态故障。随着电压余量缩小,此类故障的可能性呈指数增长,
P_fault ≈ e^(-β * (V_dd - V_min)) (3)
其中V_min是最小稳定电压,β是硬件相关的敏感性常数。随着V_dd接近V_min,系统会从可靠计算急剧转变为频繁的软错误。在GPU工作负载中,这些故障主要表现为浮点算术中的小幅扰动,
ỹ = y + δ(V_dd) (4)
其中y是正确输出,ỹ是降压下的计算结果,δ(V_dd)是电压相关的噪声,其方差随电压降低而增大。因此,轻微降压引入随机噪声,而激进降压会导致显著的数值不稳定。
对深度学习的意义:此类故障并非总是有害的。神经网络由于其分布式表示而能够容忍低水平噪声,降压诱发的随机错误可能充当类似于dropout或权重噪声的正则化器,有可能提高泛化性和鲁棒性。相反,过度的降压会破坏基于梯度的优化,并降低收敛性和准确性。
### II-B 基于随机化的防御
卷积神经网络(CNN)仍然容易受到对抗扰动的影响,即精心设计的输入小幅变化能剧烈改变预测结果。基于随机化的防御通过向推理或训练过程注入随机性来对抗这一威胁,使得攻击者依赖的结构化梯度变得不可靠。随机性应用于三个层面:对输入,通过随机缩放、填充和增强[30 (https://arxiv.org/html/2608.20572#bib.bib4),5 (https://arxiv.org/html/2608.20572#bib.bib5)];对中间特征,通过噪声注入将单一网络转变为隐式的随机模型集成[20 (https://arxiv.org/html/2608.20572#bib.bib6)];对参数,通过蒙特卡洛dropout、贝叶斯不确定性建模以及随机量化或权重噪声[10 (https://arxiv.org/html/2608.20572#bib.bib10)]。随机平滑通过在高斯噪声下平均预测以获得范数球内的概率鲁棒性保证来形式化这一思想[17 (https://arxiv.org/html/2608.20572#bib.bib7),4 (https://arxiv.org/html/2608.20572#bib.bib8)],后续变体在相当准确率下提高了认证鲁棒性[8 (https://arxiv.org/html/2608.20572#bib.bib9),10 (https://arxiv.org/html/2608.20572#bib.bib10)]。
该范式存在已知局限。期望-变换攻击通过平均随机化本身恢复可用梯度[2 (https://arxiv.org/html/2608.20572#bib.bib11)],而过度噪声会降低干净输入的准确率,因此需要对随机性程度进行校准。尽管如此,随机化仍然是实现鲁棒性的一种灵活且低成本的途径,而像GPU降压诱发的硬件级随机效应,通过在训练期间提供内在随机性来扩展这一途径,无需额外计算成本,同时保持推理的确定性。
## III 提出的方法论
我们提出一种利用硬件级降压向CNN训练注入有益随机噪声的训练方法论。本节定义威胁模型,形式化降压诱发的故障如何进入学习过程,并描述训练过程和操作点选择。
### III-A 威胁模型
我们考虑标准的白盒规避设置:攻击者完全了解训练好的模型架构和参数,并使用一阶方法制作L_p有界扰动,在我们的评估中体现为在一系列预算ε下的PGD。攻击者攻击在标称电压下执行的部署模型;防御者仅控制训练过程的硬件配置。我们假设防御者的GPU支持通过标准驱动工具调整电压,并且训练在无致命故障的情况下完成,这一条件通过第III-C节(https://arxiv.org/html/2608.20572#S3.SS3)中的操作点选择来强制执行。针对模型本身的故障注入攻击[3 (https://arxiv.org/html/2608.20572#bib.bib17),31 (https://arxiv.org/html/2608.20572#bib.bib18),1 (https://arxiv.org/html/2608.20572#bib.bib26)]不在我们的研究范围内。
### III-B 降压作为训练时噪声源
如第II节(https://arxiv.org/html/2608.20572#S2)所述,在标称电压以下运行会对单个算术运算造成扰动,表示为ỹ = y + δ(V_dd),其中δ的方差随电压降低而增大。
在训练过程中,前向传播、反向传播和权重更新中的每个操作都会受到此类扰动。因此,在步骤t的参数更新实际上是
w_{t+1} = w_t - η (∇L(w_t) + δ_t) (5)
其中η是学习率,L是训练损失,δ_t是通过梯度计算累积的电压诱导扰动。与增加计算并针对所选位置(输入、激活或权重)的基于软件的噪声注入不同,δ_t出现在每个操作中,零计算成本且无需修改训练流程。与其将这些扰动视为错误来抑制,我们将其视为内在噪声正则化,这与先前证据一致,即训练期间应用的随机噪声可提高对抗鲁棒性[17 (https://arxiv.org/html/2608.20572#bib.bib7)]。由于每次操作的扰动集中在...相似文章
理解对抗鲁棒剪枝模型的容错性
本文实证研究了剪枝、对抗训练和硬件引起的权重故障如何共同影响卷积神经网络的可靠性,发现对抗训练会增加对固定为零故障的敏感性,而剪枝对故障敏感性几乎没有影响。
提升脑机接口的安全性
本文提出了一种轻量级卷积神经网络架构,用于提高基于脑电图的脑机接口的对抗鲁棒性,通过对抗攻击评估,并显示出比现有模型更好的分类性能。
CoG引导的权重纠正用于容错深度神经网络
提出了一种重心引导的权重纠正方法,用于容错深度神经网络,在LSTM和CNN模型上实现了显著的容错性能提升,且无需重新训练。
神经 GPU 的扩展与局限性
本文探讨了神经 GPU 模型的扩展与局限性,通过课程设计和规模扩展展示了改进方案,使其能够学习十进制数和长表达式的算术运算,同时识别出对称输入上的失败模式,这些模式类似于对抗样本。
ProWAFT:一种面向基于FPGA的CNN加速器的工作负载感知与动态容错的ROMA-LPD实例
ProWAFT是一种主动式工作负载感知容错框架,用于基于FPGA的CNN加速器,通过部分重配置选择性应用三模冗余(TMR),以最小化延迟、能耗和可靠性风险的综合目标。