CoG引导的权重纠正用于容错深度神经网络
摘要
提出了一种重心引导的权重纠正方法,用于容错深度神经网络,在LSTM和CNN模型上实现了显著的容错性能提升,且无需重新训练。
arXiv:2607.15753v1 发布类型:新
摘要:用于安全关键应用的深度神经网络(DNN)容易受到硬件和内存故障的影响,这些故障会破坏网络权重并降低可靠性。本文提出了一种重心(CoG)引导的权重纠正方法,该方法根据每层内权重的空间特征来修复故障权重。所提出的方法使用距离感知纠正规则检测并纠正权重故障,无需重新训练或修改架构。通过在不同误码率(BER)下进行故障注入,评估了所提方法在容忍硬件故障方面的有效性。
对基于LSTM的安全关键网络(包括用于疾病进展追踪的StageNet和用于心脏异常检测的MTFNet)的实验表明,在BER为10^{-3}时,容错性能分别提升高达230倍和6.41倍,且精度损失可忽略不计。当扩展到卷积神经网络(CNN)时,在相似的故障条件下,该方法在ResNet-18和VGG-16上分别实现了高达49.55倍和20.79倍的提升。据我们所知,这是首次将CoG概念应用于神经网络权重张量以增强模型可靠性的工作。
查看缓存全文
缓存时间: 2026/07/20 09:30
# CoG引导的权重校正方法用于容错深度神经网络
来源:https://arxiv.org/html/2607.15753
Samira Nazari\{bahram.parchekani, samira.nazari, azarpeyvand\}@znu.ac.ir
Ali Azarpeyvand\{bahram.parchekani, samira.nazari, azarpeyvand\}@znu.ac.ir
Mohammad Hasan Ahmadilivani\{mohammad.ahmadilivani, jaan.raik, tara.ghasempouri\}@taltech.ee
Tara Ghasempouri\{mohammad.ahmadilivani, jaan.raik, tara.ghasempouri\}@taltech.ee
Jaan Raik\{mohammad.ahmadilivani, jaan.raik, tara.ghasempouri\}@taltech.ee
###### 摘要
用于安全关键应用的深度神经网络(DNN)容易受到硬件和内存故障的影响,这些故障会破坏网络权重并降低可靠性。本文提出了一种重心(CoG)引导的权重校正方法,该方法基于每层内权重的空间特征来恢复故障权重。所提出的方法利用距离感知校正规则检测和校正权重故障,无需重新训练或修改架构。通过在具有不同误码率(BER)的情况下进行故障注入,评估了所提方法在容忍硬件故障方面的有效性。在基于LSTM的安全关键网络(包括用于疾病进展跟踪的StageNet和用于心脏异常检测的MTFNet)上进行的实验表明,在BER为10^{-3}时,故障容忍能力分别提高了高达230倍和6.41倍,而精度损失可忽略不计。当扩展到卷积神经网络(CNN)时,在类似故障条件下,该方法在ResNet-18和VGG-16上分别实现了高达49.55倍和20.79倍的改进。据我们所知,这是首次将CoG概念应用于神经网络权重张量以增强模型可靠性的工作。
###### 索引术语:深度神经网络,可靠性,重心,故障注入,安全关键应用,权重故障。
## I 引言
机器学习(ML),特别是深度神经网络(DNN),已在图像识别、自然语言处理和自动驾驶系统等多个领域展现出强大的能力[1 (https://arxiv.org/html/2607.15753#bib.bib1),2 (https://arxiv.org/html/2607.15753#bib.bib2),3 (https://arxiv.org/html/2607.15753#bib.bib3)]。其中,医疗保健和汽车等安全关键应用不仅需要高精度,还需要高可靠性[4 (https://arxiv.org/html/2607.15753#bib.bib4),5 (https://arxiv.org/html/2607.15753#bib.bib5),6 (https://arxiv.org/html/2607.15753#bib.bib6)]。在这些领域中,硬件可靠性至关重要,因为错误的预测可能导致灾难性后果。硬件可靠性定义为在存在硬件故障的情况下系统产生正确结果的概率。硬件故障可能来自多种来源,例如软错误(由高能粒子撞击引起)、工艺变化、温度变化和老化[7 (https://arxiv.org/html/2607.15753#bib.bib7),8 (https://arxiv.org/html/2607.15753#bib.bib8)]。这些故障表现为逻辑或内存中的位翻转,可能破坏中间计算或模型参数。随着技术规模的缩小,故障率(尤其是内存组件中的故障率)显著增加,威胁着DNN加速器的可靠部署[9 (https://arxiv.org/html/2607.15753#bib.bib9),10 (https://arxiv.org/html/2607.15753#bib.bib10),11 (https://arxiv.org/html/2607.15753#bib.bib11)]。
在医疗保健应用中,DNN被广泛用于疾病诊断、治疗计划和异常检测等任务[12 (https://arxiv.org/html/2607.15753#bib.bib12),13 (https://arxiv.org/html/2607.15753#bib.bib13)]。这些应用通常依赖于处理时间序列数据。在此背景下,长短期记忆网络(LSTM)因其能够通过循环数据处理保留长期时间依赖性而非常有效[14 (https://arxiv.org/html/2607.15753#bib.bib14)]。它们在心律失常检测、疾病阶段预测和其他异常监测系统等任务中的成功使其非常适合实际的医疗保健应用。然而,在硬件加速器上部署LSTM使其面临可靠性威胁。单个硬件故障可能会改变LSTM单元内的权重或隐藏状态,导致错误分类或预测[15 (https://arxiv.org/html/2607.15753#bib.bib15),16 (https://arxiv.org/html/2607.15753#bib.bib16)]。例如,在使用LSTM模型进行疾病阶段预测(如癌症)时,内存中的单个位翻转可能会将关键阶段误分类为正常。这种错误会阻碍及时和相关的治疗,可能导致致命的后果。这些场景突显了研究LSTM在医疗保健应用中硬件可靠性的迫切需求,以及开发相应的容错机制的必要性。
由于内存极易受到故障的影响,并且其内容不会像数据路径中的缓冲区和锁存器那样频繁被覆盖,因此保护存储在内存中的DNN参数对于确保可靠部署是必要的。多项研究调查了DNN在自动驾驶和医疗保健等安全关键应用中的可靠性[7 (https://arxiv.org/html/2607.15753#bib.bib7),4 (https://arxiv.org/html/2607.15753#bib.bib4),5 (https://arxiv.org/html/2607.15753#bib.bib5),6 (https://arxiv.org/html/2607.15753#bib.bib6)]。尽管LSTM网络在这些领域中被广泛使用,但它们在硬件故障下的可靠性以及成本效益的容错机制的开发仍然相对未充分探索[5 (https://arxiv.org/html/2607.15753#bib.bib5)]。最近的研究已开始填补这一空白。[15 (https://arxiv.org/html/2607.15753#bib.bib15)]提出了LSTM参数的详细弹性表征,揭示循环权重是对故障最敏感的组件,因为它们直接影响LSTM的记忆行为。作者进一步证明,将故障权重重置为零可以显著增强弹性。此外,[17 (https://arxiv.org/html/2607.15753#bib.bib17)]提出了两种零内存开销的LSTM保护机制:(i) 对激活函数输入施加范围限制,以及 (ii) 将最脆弱的权重位置零。他们的发现表明,与激活限制相比,选择性复位关键位提供了更好的保护。[18 (https://arxiv.org/html/2607.15753#bib.bib18)]对LSTM参数的指数位应用汉明码,以保护内存免受软错误的影响。
现有方法试图检测和纠正或缓解故障,但其影响仍然有限,因为它们不关心参数的值及其统计分布。权重矩阵中的空间模式在DNN的功能中可能发挥关键作用。在这项工作中,通过分析权重矩阵的空间模式,我们首次提出了一种基于重心概念纠正错误参数的新方案。我们分析了层内大权重值的位置,确定了数值较大的中心点作为CoG,并根据权重与CoG的距离检测和校正权重。本文的贡献如下:
- • 提出了一种轻量级检测机制,使用从每层统计分布导出的黄金(无故障)边界来识别故障权重。
- • 引入了一种空间校正策略,利用每个权重张量的CoG引导故障恢复。故障权重根据其与CoG的空间距离进行校正,从而保持统计平衡并减少错误传播。
- • 所提出的方法在基于LSTM的安全关键网络(用于疾病进展跟踪的StageNet和用于心脏异常检测的MTFNet)上使用真实世界数据集以及在传统CNN(ResNet-18和VGG-16)上进行了验证。
本文的其余部分组织如下。第II节 (https://arxiv.org/html/2607.15753#S2) 介绍了权重矩阵属性的分析,并引入了相关预备知识,包括CoG的定义,这为设计有效的故障检测和校正策略提供了基础。第III节 (https://arxiv.org/html/2607.15753#S3) 引入了CoG引导的权重校正方案。第IV节 (https://arxiv.org/html/2607.15753#S4) 描述了实验设置、在基于LSTM网络和传统网络上的评估,并讨论了结果。最后,第V节 (https://arxiv.org/html/2607.15753#S5) 对本文进行了总结。
## II DNN中权重矩阵的统计特性
在DNN中,每层的参数被组织为权重矩阵(或在卷积/循环层中为张量),其统计和空间特性强烈影响其功能和故障敏感性。对预训练DNN中的这些特征进行剖析,可以深入了解其行为,并指导设计有针对性的故障检测和校正策略。通常,层中的大多数权重值分布在一个有限范围内,例如[-0.5, +0.5]或[-1, +1],具体取决于DNN的架构以及训练过程中应用的初始化和正则化[19 (https://arxiv.org/html/2607.15753#bib.bib19)]。仍可能存在少数具有较大幅度的异常值,特别是在更深或正则化较少的DNN中。这种有限分布反映了预训练DNN的稳定性,并有助于推理过程中的数值稳定性[19 (https://arxiv.org/html/2607.15753#bib.bib19)][20 (https://arxiv.org/html/2607.15753#bib.bib20)]。
给定层中权重的直方图通常近似于正态(高斯)分布,大多数权重集中在零附近。这种钟形曲线是由优化过程和正则化技术(如L2正则化[20 (https://arxiv.org/html/2607.15753#bib.bib20)])的应用产生的,确保了稳定的前向传播,并降低了激活爆炸或消失的风险[21 (https://arxiv.org/html/2607.15753#bib.bib21)][22 (https://arxiv.org/html/2607.15753#bib.bib22)]。此外,一层的权重平均值通常接近零,表明信息流中没有强偏差,而它们的方差保持较低,意味着紧密集中在均值周围[23 (https://arxiv.org/html/2607.15753#bib.bib23)][24 (https://arxiv.org/html/2607.15753#bib.bib24)]。这种低方差、零均值的分布保证了DNN在推理过程中的可靠性[25 (https://arxiv.org/html/2607.15753#bib.bib25)][26 (https://arxiv.org/html/2607.15753#bib.bib26)]。
虽然大多数权重较小且集中在零附近,但一小部分可能具有较大的幅度。这些大幅度权重通常形成局部聚类,在表示任务特定特征方面起着关键作用。例如,在CNN中,具有较大权重的滤波器经常类似于Gabor模式[27 (https://arxiv.org/html/2607.15753#bib.bib27)],这些模式检测具有特定方向和空间频率的边缘和纹理。全局稀疏性和局部重要权重的这种组合反映了只有一部分参数影响DNN的输出[28 (https://arxiv.org/html/2607.15753#bib.bib28)][29 (https://arxiv.org/html/2607.15753#bib.bib29)]。
为了捕捉矩阵中大幅度值的空间集中性,引入了受物理学启发的度量——重心[30 (https://arxiv.org/html/2607.15753#bib.bib30)]。在DNN的背景下,CoG可以表示一层权重张量中集中权重幅度的质心,作为空间引导的故障检测和校正的基础。数学上,对于具有元素w_{ij}的权重矩阵W∈R^{m×n},行方向CoG定义为:
CoG_x = (∑_{i=1}^{m}∑_{j=1}^{n}|w_{ij}|·i) / (∑_{i=1}^{m}∑_{j=1}^{n}|w_{ij}|), (1)
其中i和j分别表示行和列索引。列方向CoG定义为:
CoG_y = (∑_{i=1}^{m}∑_{j=1}^{n}|w_{ij}|·j) / (∑_{i=1}^{m}∑_{j=1}^{n}|w_{ij}|). (2)
2D矩阵的CoG对应于点(CoG_x, CoG_y),并且该概念自然扩展到更高阶的张量,通过沿每个维度计算加权平均值(图1 (https://arxiv.org/html/2607.15753#S2.F1))。
参考图标题
图 1:权重矩阵的CoG概念示意图。(左) 2D权重矩阵中的CoG。(右) 该概念扩展到更高维矩阵。
这些定义将更大的影响力赋予具有较大幅度权重的位置,从而识别出最具影响力权重的中心区域。该技术类似于图像处理和模式识别中的质心计算,其中像素强度被视为质量来定位对象的几何中心[31 (https://arxiv.org/html/2607.15753#bib.bib31)][19 (https://arxiv.org/html/2607.15753#bib.bib19)]。先前的研究表明,DNN权重中的故障可以跨层传播并显著降低推理精度,特别是当它们影响大幅度参数时[32 (https://arxiv.org/html/2607.15753#bib.bib32),33 (https://arxiv.org/html/2607.15753#bib.bib33),34 (https://arxiv.org/html/2607.15753#bib.bib34)]。相比之下,小的扰动通常被激活非线性度和统计冗余所掩盖。现有的容错方法依赖于权重的统计剖析,但很少利用其空间组织。由于大幅度权重往往聚集在特定区域,识别这些区域可以实现空间有针对性的故障检测和校正。所提出的基于CoG的方法基于这一观察,以最小的开销增强DNN的可靠性。
## III 方法:基于CoG的故障弹性增强
本节介绍了所提出的基于CoG的方法,用于增强DNN对权重故障的弹性。图2 (https://arxiv.org/html/2607.15753#S3.F2) 展示了整体工作流,分为两个互补阶段:1) 离线模式:用于剖析;2) 在线模式:用于推理过程中的故障检测和校正。
参考图标题
图 2:基于CoG的错误检测和校正策略概述。(a) 离线模式,其中从黄金预训练权重中一次性提取每层的一小组参考参数(最小值、最大值、平均值、CoG和最优距离);(b) 在线模式,其中使用预计算的CoG和距离感知阈值检测和选择性校正权重故障。
在离线模式中,每层对DNN的黄金预训练权重进行一次分析,以提取一小组固定的参考参数。具体来说,每层仅存储五个标量值:最小权重值(w_{min}^{l})、最大权重值(w_{max}^{l})和平均权重值(w_{avg}^{l})、CoG以及最优距离(d_{l}^{opt})(这些将在后续算法中解释)。这些参数构成每层的黄金剖面,并作为故障检测的统计基线,无需存储完整的相似文章
故障强化:通过GPU降压提升CNN对抗鲁棒性
本文介绍了GPU降压作为一种硬件级防御手段,通过引入有益的随机故障来提高训练过程中CNN的对抗鲁棒性和能效。
权重归一化:加速深度神经网络训练的简单重参数化方法
OpenAI 提出了权重归一化,一种重参数化技术,通过将权重向量的长度与方向解耦,改进神经网络训练的收敛性和计算效率,且不引入小批次依赖关系,适用于循环神经网络和对噪声敏感的应用场景。
理解对抗鲁棒剪枝模型的容错性
本文实证研究了剪枝、对抗训练和硬件引起的权重故障如何共同影响卷积神经网络的可靠性,发现对抗训练会增加对固定为零故障的敏感性,而剪枝对故障敏感性几乎没有影响。
以数据为中心的调试:面向训练神经网络的团队 [P]
WeightsLab 是一个开源、PyTorch 原生的工具,允许团队在训练过程中暂停、检查实时损失信号,并在数据问题(如标签错误和类别不平衡)影响模型性能之前发现它们。它专为处理图像、视频和 LiDAR 点云的计算机视觉工程师而设计。
通过解耦权重向量的幅度和方向改进神经网络训练 | Alexander Hägele
这篇博客文章介绍了幅度-方向(MD)解耦方法,该方法将神经网络权重矩阵分解为方向分量和幅度分量,并使用独立的学习率进行优化。实验表明,该方法在Adam和Muon优化器上均提升了性能,实现了跨模型宽度的自动学习率迁移,并在大规模混合专家模型中展现了缩放优势。