面向边缘系统的延迟约束DNN架构学习:使用Zerorized Batch Normalization
摘要
本文提出了一种面向延迟的神经网络学习方法,使用Zerorized Batch Normalization优化严格延迟约束下边缘系统的DNN架构。实验表明,在NVIDIA Jetson设备上,该方法在精度损失极小的情况下显著降低了延迟。
arXiv:2607.06922v1 Announce Type: new
摘要:深度学习应用已广泛应用于边缘设备,以减轻访问云服务器的隐私和延迟问题。在深度神经网络设计过程中,确定神经元数量以最大化性能并非直观。特别是,许多应用场景是实时的且有严格的延迟约束,而传统的神经网络优化方法并不能直接改变延迟关键型边缘系统的模型推理时间成本。在这项工作中,我们提出了一种面向延迟的神经网络学习方法,以优化模型在高精度的同时满足延迟约束。为了提高效率,我们还引入了一个通用硬件定制的延迟预测器,通过一次性训练过程优化此流程,以学习满足延迟约束的模型。实验结果表明,与最先进的方法相比,我们的方法能够很好地适应“硬”延迟约束并实现高精度。在与原始模型相同的训练设置下,满足ImageNet-100数据集上34毫秒的延迟约束,我们在NVIDIA Jetson Nano上将GoogLeNet的延迟从40.32毫秒降低到34毫秒,精度仅下降0.14%。当结合量化时,我们的方法可以进一步改进,GoogLeNet仅下降0.04%。在NVIDIA Jetson TX2上,我们将VGG-19从119.98毫秒压缩到34毫秒,甚至提高了0.5%的精度,并将GoogLeNet从20.27毫秒扩展到34毫秒,实现了0.78%的更高精度。我们还在此开源了该框架:https://github.com/ntuliuteam/ZeroBN
查看缓存全文
缓存时间: 2026/07/09 07:46
# 面向边缘系统的延迟约束DNN架构学习:基于归零批归一化方法 来源:https://arxiv.org/html/2607.06922 ###### 摘要 深度学习应用已广泛部署于边缘设备,以缓解访问云服务器带来的隐私和延迟问题。在设计深度神经网络时,确定神经元数量以最大化性能并非直观。特别地,许多应用场景是实时的,且具有严格的延迟约束,而传统的神经网络优化方法并不直接改变延迟关键型边缘系统的模型推理时间成本。本文提出一种面向延迟的神经网络学习方法,在满足延迟约束的同时优化模型以获得高精度。为提高效率,我们还引入了一种通用的硬件定制延迟预测器,通过一次性训练过程即可学习满足延迟约束的模型。实验结果表明,与最先进方法相比,我们的方法能够很好地满足“硬”延迟约束并实现高精度。在ImageNet-100数据集上,在原始模型相同训练设置下满足34ms延迟约束时,我们将GoogLeNet的延迟从40.32ms降低至34ms,在NVIDIA Jetson Nano上精度仅降低0.14%。结合量化后,我们的方法可进一步将GoogLeNet的精度损失降低至仅0.04%。在NVIDIA Jetson TX2上,我们将VGG-19从119.98ms压缩至34ms,甚至提升其精度0.5%;并将GoogLeNet从20.27ms扩展至34ms,实现更高精度0.78%。我们还在此开源了框架:https://github.com/ntuliuteam/ZeroBN。 ###### 关键词:深度神经网络,延迟优化,边缘设备,延迟预测,神经网络学习,高性能 ††期刊:Future Generation Computer Systems \affiliation\[label1\]organization=南洋理工大学计算机科学与工程学院,addressline=新加坡,postcode=639798 \affiliation\[label2\]organization=HP-NTU数字制造企业实验室,addressline=南洋理工大学,postcode=639798,country=新加坡 \affiliation\[label4\]organization=挪威科技大学计算机科学系,addressline=特隆赫姆,postcode=7491,country=挪威 \affiliation\[label3\]organization=惠普公司,city=帕洛阿尔托,postcode=94304,state=加利福尼亚,country=美国 ## 1 引言 深度神经网络(DNN)在包括图像识别和目标检测\[1 (https://arxiv.org/html/2607.06922#bib.bib1)\]等多种应用中取得了显著成功。与此同时,由于访问云服务器会损害数据机密性且因网络带宽不稳定无法保证延迟,许多DNN应用已越来越多地部署在边缘设备上,如自动驾驶车辆、医疗设备等\[2 (https://arxiv.org/html/2607.06922#bib.bib2)\]。尽管通过人工设计\[3 (https://arxiv.org/html/2607.06922#bib.bib3)\]或神经架构搜索(NAS)\[4 (https://arxiv.org/html/2607.06922#bib.bib4)\]设计了各种模型架构以提高DNN应用的准确性和效率,但不同计算能力和资源的边缘设备涌现,导致现有模型与大多数边缘设备之间存在不匹配。许多应用具有严格的响应延迟要求,例如自动驾驶车辆和无人机跟踪。然而,复杂模型显著降低了边缘设备的性能,使其在延迟关键型系统中不可接受。另一方面,简单模型为了降低延迟而牺牲了太多精度。因此,为了实现具有最佳精度和保证延迟的高效边缘DNN系统,DNN模型需要包含高效的架构和适当的计算成本(每秒浮点运算次数,FLOPs),以充分利用底层硬件提供的计算资源。尽管有些工作使用NAS\[4 (https://arxiv.org/html/2607.06922#bib.bib4)\]来解决这个问题,但为每个边缘设备设计新的DNN模型非常耗时,且需要大量工程努力\[4 (https://arxiv.org/html/2607.06922#bib.bib4),5 (https://arxiv.org/html/2607.06922#bib.bib5)\]。因此,优化现有的DNN模型更有前景且更具通用性\[6 (https://arxiv.org/html/2607.06922#bib.bib6)\]。 神经网络剪枝\[1 (https://arxiv.org/html/2607.06922#bib.bib1),6 (https://arxiv.org/html/2607.06922#bib.bib6),7 (https://arxiv.org/html/2607.06922#bib.bib7),8 (https://arxiv.org/html/2607.06922#bib.bib8),9 (https://arxiv.org/html/2607.06922#bib.bib9)\]和神经网络缩放\[10 (https://arxiv.org/html/2607.06922#bib.bib10),11 (https://arxiv.org/html/2607.06922#bib.bib11)\]可以分别通过从DNN中移除冗余参数或扩展DNN的通道和层数来改变模型复杂度。因此,我们借鉴其思想来改进模型架构,并在保持高精度的同时改变推理延迟。然而,这些现有方法存在三个缺陷。首先,这些方法采用间接性能指标,例如FLOPs或通道数和层数作为优化目标。这些指标并非硬件特定,无法准确反映DNN模型在边缘设备上的实际延迟。现有技术难以针对延迟关键型边缘应用优化模型,因此直接的DNN延迟优化策略对于高效的边缘智能系统更为关键。其次,当将延迟作为优化目标时,这些方法需要在整个优化过程中每次修改后将模型部署到设备上进行测量。如图1(绿色线)所示,这种测量过程非常耗时,因为与硬件交互获取延迟通常需要数分钟\[12 (https://arxiv.org/html/2607.06922#bib.bib12)\],在大设计空间中成本过高。此外,这些方法\[1 (https://arxiv.org/html/2607.06922#bib.bib1),6 (https://arxiv.org/html/2607.06922#bib.bib6),7 (https://arxiv.org/html/2607.06922#bib.bib7),8 (https://arxiv.org/html/2607.06922#bib.bib8),9 (https://arxiv.org/html/2607.06922#bib.bib9),10 (https://arxiv.org/html/2607.06922#bib.bib10)\]使用的间接性能目标(如FLOPs)必须迭代调整,以满足目标边缘系统上的延迟要求。这加剧了开销问题。 参照图注 图1:硬件感知神经网络优化的工作流程。借助延迟预测器,主机可以在过程中避免耗时的设备端测量,极大提升效率。 第三,一些方法非常耗时,主要分为三部分:预训练、优化和再训练\[1 (https://arxiv.org/html/2607.06922#bib.bib1)\]。需要预训练模型来识别模型不同部分的重要性,用于优化过程以消除或添加参数。再训练对新模型进行微调以恢复精度。由于训练过程复杂且耗时,网络优化的高开销主要来自预训练和再训练阶段。同时,为了得到满足优化目标的模型,一些先前的方法\[1 (https://arxiv.org/html/2607.06922#bib.bib1),13 (https://arxiv.org/html/2607.06922#bib.bib13)\]必须进行多轮优化-再训练过程。这进一步加剧了开销问题。然而,先前工作\[14 (https://arxiv.org/html/2607.06922#bib.bib14)\]已经表明,预训练并非获得高效且具有竞争力模型的必要步骤。该工作还指出,架构比重要元素的继承权重值对最终模型的效率更为关键。因此,需要一种高效的学习方法,无需预训练模型和再训练过程即可直接优化模型架构,以减少时间成本。 本文旨在开发一个全面的、硬件感知的DNN优化框架,能够高效且有效地使各种DNN模型适应不同的边缘系统。我们提出一个神经网络优化框架,通过仅一次学习过程,在延迟约束下获得尽可能高的精度。我们首先设计了一个紧凑的学习方案,通过动态归零和恢复批归一化(BN)层,将冗余的DNN压缩以满足目标设备上的“硬”延迟要求。在此基础上,我们提出一个针对简单模型的缩放方案,以提高其精度并避免昂贵的缩放因子搜索过程\[10 (https://arxiv.org/html/2607.06922#bib.bib10)\]。因此,该框架是一个全面且自适应的学习方法,可以同时优化复杂和简单模型。 本文的主要贡献如下: - • 我们提出一种紧凑模型学习方法,能够提取最优DNN架构以满足“硬”延迟约束并保持高精度。该方法仅使用一次性训练过程(称为紧凑学习),避免了昂贵的预训练/再训练成本。提出了通道的全局重要性排名和动态零恢复过程,以扩展探索空间,获得更好的架构。(见第3.1节 (https://arxiv.org/html/2607.06922#S3.SS1)) - • 我们提出一个基于机器学习的延迟预测器,嵌入到我们的自适应学习框架中,为每次零训练阶段提供指导,从而避免耗时的设备端测量。该方法也可推广用于构建其他硬件指标预测器。(见第3.2节 (https://arxiv.org/html/2607.06922#S3.SS2)) - • 我们引入一个模型缩放方案,以更好地将简单模型部署到高端边缘设备上,从而提高精度仍满足延迟约束。得益于我们的紧凑学习可以从通道和层两个维度优化模型,缩放方法不需要耗时的缩放因子搜索过程。(见第3.3节 (https://arxiv.org/html/2607.06922#S3.SS3)) - • 我们通过大量实验证明,我们的自适应学习框架能通过一次性训练过程,有效且高效地优化冗余或简单模型,以适应特定延迟约束下的各种边缘设备,在精度和效率方面均优于先前方法。(见第4节 (https://arxiv.org/html/2607.06922#S4)) 本文其余部分组织如下:第2节 (https://arxiv.org/html/2607.06922#S2)介绍背景和相关工作;第3节 (https://arxiv.org/html/2607.06922#S3)详细描述我们提出的方法;实验结果在第4节 (https://arxiv.org/html/2607.06922#S4)中呈现;最后,我们在第5节 (https://arxiv.org/html/2607.06922#S5)总结本文。 ## 2 相关工作与背景 本节介绍模型优化和延迟预测的预备知识,包括这些相关工作的成果和一些缺陷。 ### 2.1 神经网络压缩 许多研究者提出了降低当前复杂DNN模型高复杂度以适应新兴嵌入式系统的方法。这些方法包括神经网络剪枝\[1 (https://arxiv.org/html/2607.06922#bib.bib1)\]——减少模型中的权重数量;量化\[15 (https://arxiv.org/html/2607.06922#bib.bib15)\]——减少模型中的权重比特数;知识蒸馏\[16 (https://arxiv.org/html/2607.06922#bib.bib16)\]——修改模型架构使其更简化。 #### 2.1.1 神经网络剪枝 近期的工作要么致力于非结构化剪枝(即权重剪枝)\[13 (https://arxiv.org/html/2607.06922#bib.bib13),17 (https://arxiv.org/html/2607.06922#bib.bib17)\],要么致力于结构化剪枝(即通道/层剪枝)\[1 (https://arxiv.org/html/2607.06922#bib.bib1),6 (https://arxiv.org/html/2607.06922#bib.bib6),7 (https://arxiv.org/html/2607.06922#bib.bib7)\]。非结构化剪枝方法直接删除权重张量中单个不重要的元素,可以实现较小的精度损失。然而,它们需要支持稀疏计算的特殊硬件和库来运行剪枝后的模型。相比之下,结构化剪枝方法是粗粒度的,它删除整个规则区域(例如通道/层)的权重张量,不需要额外的支持。因此,结构化剪枝方法易于部署在不同类型的处理器上。由于本文旨在优化适用于通用边缘设备的模型,我们通过消除通道和层设计了一个高效的紧凑模型学习框架。如图2 (https://arxiv.org/html/2607.06922#S2.F2)所示,移除层或通道可以降低延迟。然而,在相同FLOPs下,不同模型架构的延迟降低趋势对层剪枝或通道剪枝有不同的倾向。因此,我们合理地将通道剪枝和层剪枝都纳入我们的框架,通过学习过程确定最优方法。 传统的剪枝策略包括典型的三阶段过程:1)预训练,2)剪枝,3)再训练。然而,预训练阶段对于获得高效的最终紧凑模型并非必要\[14 (https://arxiv.org/html/2607.06922#bib.bib14)\]。同时,模型架构而非重要元素的继承权重值对最终模型的效率和精度更为关键\[14 (https://arxiv.org/html/2607.06922#bib.bib14)\]。因此,本文旨在提出一种高效方法,无需预训练模型和再训练步骤即可找到最优紧凑架构。 参照图注 图2:在NVIDIA Jetson TX2上测量,通过改变通道数(宽度)或层数(深度)时,FLOPs数量与推理延迟之间的关系。 为了获得高效的模型架构,我们应该对跨层的通道重要性进行排名(即全局通道重要性排名),以保留整个模型中的重要通道,而不是预定义每层的剪枝比率。在全局通道重要性排名方法中,使用批归一化(BN)\[18 (https://arxiv.org/html/2607.06922#bib.bib18)\]作为缩放因子更为高效。网络瘦身(NS)\[1 (https://arxiv.org/html/2607.06922#bib.bib1)\]利用BN移除冗余通道,并取得了一些良好结果。然而,该工作存在一些局限性。首先,它采用“硬”方法去除通道,这意味着如果在剪枝过程中通道被消除,它们将不会在后续训练过程中恢复。另一个缺点是,在预训练步骤之后,所有通道的重要性排名是固定的,这意味着从大压缩比获得的紧凑模型必须是小压缩比的子模型。事实上,每层通道数有许多不同的设置,因此他们的方法盲目了设计空间,无法针对特定压缩比获得更高效的架构。在本文中,我们旨在设计一种动态方法来做出压缩决策。软滤波器剪枝(SFP)\[6 (https://arxiv.org/html/2607.06922#bib.bib6\]
相似文章
Collate:面向延迟关键边缘系统的协作神经网络学习
介绍Collate,一种面向协作神经网络学习的训练框架,可处理具有延迟约束的异构边缘设备,以最小开销实现精度提升。
多时间尺度隐式动作深度强化学习在边缘-云网络中的联合优化
提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架,用于分层边缘-云计算中的联合服务放置、计算委托和功率控制,实现高达20.8%的延迟降低和13%的资源利用率提升。
EvoLP:面向实时边缘系统模型压缩的自进化延迟预测器
EvoLP 是一种面向边缘设备上神经网络模型的自进化延迟预测器,旨在指导模型压缩同时满足严格的延迟约束。它在多个边缘设备和模型变体上均优于先前的方法。
面向边缘设备低延迟脑电图分类的可微分逻辑门网络
本文介绍了可微分逻辑门网络(Diff-Logic)作为传统神经网络的一种硬件原生替代方案,用于边缘设备上的实时脑电图分类,在显著降低延迟和模型大小的同时实现了有竞争力的性能。
权重归一化:加速深度神经网络训练的简单重参数化方法
OpenAI 提出了权重归一化,一种重参数化技术,通过将权重向量的长度与方向解耦,改进神经网络训练的收敛性和计算效率,且不引入小批次依赖关系,适用于循环神经网络和对噪声敏感的应用场景。