低延迟激活正则化稀疏神经算子与蒸馏辅助实现的实时边缘部署虚拟感知
摘要
本文提出了一种Sparse-Activation-ReLU (SAR)层,用于低延迟、高能效的虚拟感知,在延迟-误差-能效指标上实现了显著提升,并通过合成知识蒸馏降低了误差。
arXiv:2608.23987v1 公告类型:新
摘要:虚拟感知使数字孪生和安全关键系统能够实时重建和预测时空物理现象。然而,传统的计算和数据驱动方法在边缘部署时常常面临泛化、延迟和能效方面的挑战。神经算子提供了一个有前景的替代方案,但仍然依赖于高功耗硬件。脉冲神经元和神经形态计算可以提高效率,但代理梯度训练和多步脉冲引入了收敛和延迟挑战。我们提出了Sparse-Activation-ReLU (SAR)层,这是一种单步替代方案,无需代理梯度训练即可促进激活稀疏性,同时与基于事件的计算兼容。在基于树干的NOMAD架构中,与可变脉冲神经元 (VSN) 和漏积分-放电 (LIF) 实现相比,SAR在综合延迟-误差-能效 (LEE) 指标上实现了超过五倍的改进。我们进一步分析了脉冲熵和特征使用,并引入了合成知识蒸馏,使LEE评分降低了两倍以上。最后,我们通过基于ReLU的脉冲损失和图邻域阈值化改进了VSN。在Heat Exchanger数据集上,这些方法分别将L2误差降低了两倍以上和近七倍,同时减少了脉冲和空间聚合。总体而言,所提出的工作通过提供一种可面向神经形态或其他边缘设备集成的替代框架,迈出了实现高能效虚拟感知的一步,该框架可以作为比较未来基于稀疏性或脑启发脉冲的高效设计在延迟、能效和误差性能方面的黄金标准。
查看缓存全文
缓存时间: 2026/08/26 09:30
# 低延迟激活正则化稀疏神经算子与蒸馏辅助,面向实时边缘部署虚拟传感 来源:https://arxiv.org/html/2608.23987 **作者**:William Howes **所属机构**:Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering Department, University of Illinois Urbana-Champaign, Urbana, IL, USA **作者**:Farid Ahmed **所属机构**:Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering Department, University of Illinois Urbana-Champaign, Urbana, IL, USA **作者**:Syed Bahauddin Alam\* **所属机构**:Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering Department, University of Illinois Urbana-Champaign, Urbana, IL, USA **所属机构**:National Center for Supercomputing Applications, Urbana, IL, USA ###### 摘要 虚拟传感使数字孪生和安全关键系统能够实时重建和预测时空物理场。然而,传统计算与数据驱动方法在边缘部署时,常面临泛化能力、延迟和能效方面的挑战。神经算子提供了一种有前景的替代方案,但仍依赖高功耗硬件。脉冲神经元与神经形态计算可提升效率,但替代梯度训练与多步脉冲机制又引入了收敛性与延迟问题。我们提出了**稀疏激活ReLU(SAR)层**,这是一种无需替代梯度训练、促进激活稀疏性的单步替代方案,并兼容基于事件的计算。在基于主干的NOMAD架构中,SAR在**延迟-误差-能量(LEE)**综合指标上,相比可变脉冲神经元(VSN)和Leaky Integrate-and-Fire(LIF)实现,提升了五倍以上。我们进一步分析了脉冲熵与特征使用情况,并引入了**合成知识蒸馏**,将LEE分数降低了两倍以上。最后,我们通过基于ReLU的脉冲损失与图邻居阈值改进了VSN。在**Heat Exchanger**数据集上,这些方法分别将L2误差降低了两倍以上和近七倍,同时减少了脉冲与空间聚合开销。总体而言,本工作通过提供一个可定位至神经形态或其他边缘设备集成的替代框架,为实现能效虚拟传感迈出了重要一步。该框架可作为未来基于稀疏性或类脑脉冲设计的黄金标准,以比较其延迟、能耗与误差性能。 ## 1 引言 随着人工智能的飞速发展,现代数据中心基础设施前所未有的计算需求显著增加了全球电力消耗,重新燃起了对核能作为可靠、无碳且可扩展的能源的兴趣,以支持下一代计算技术[1, 2]。特别是,小型模块化反应堆(SMRs)和微型反应堆提供了灵活的模块化部署策略,使得将核能高效集成到分布式应用中成为可能,包括军事设施、偏远社区、工业设施以及其他传统大型核反应堆不适用的高功率环境[3]。随着这些反应堆系统物理规模的持续缩小和部署灵活性的提升,相应地需要提高监控、控制和运行感知能力,以减少停机时间、增强安全裕度并提高整体经济性。**虚拟传感**,即通过计算方法实时重建支配性物理场的时空分布,提供了一条实现这些目标的途径,它能洞察那些直接测量不可能或成本过高的系统状态。通过将稀疏的物理边界测量(例如入口流量传感器)映射到稠密的时空场(包括瞬态流体流动、温度和压力分布),虚拟传感实现了在整个核系统生命周期内增强材料退化评估、异常检测、预测性维护和运行决策。现有方法主要基于传统数值方法,如有限元法(FEM),或包括物理信息神经网络(PINNs)在内的机器学习框架[4]。尽管这些方法在多种科学应用中取得了成功,但它们常常由于计算复杂性而难以满足在线监控的严格实时要求,对未见运行条件的泛化能力有限,或者严格依赖于可能不可用或难以建立的控制方程[4, 5, 6]。 为了克服这些局限,神经算子作为一类强大的数据驱动架构应运而生。它们能够在不进行显式方程积分的情况下,学习无限维函数空间之间的映射,从而在无需重新训练的情况下,对未见过的边界和初始条件进行快速推理[7]。最早和最有影响力的神经算子架构包括DeepONet[8],它通过独立的分支和主干网络分别处理边界条件和评估坐标;以及傅里叶神经算子(FNO)[9],它在结构化计算网格上执行迭代谱卷积。更新的神经算子设计已将这些能力扩展到日益复杂的多物理场系统和不规则计算网格上。尽管在重建精度和泛化能力方面取得了显著进展,但对计算效率的关注相对较少。大多数现有的神经算子研究假设数据中心级加速器(如NVIDIA A100和H200 GPU)的可用性,而许多实际的虚拟传感应用需要在资源受限的边缘硬件上部署,且有严格的延迟、内存和功耗预算[10, 11]。因此,开发能够保持高重建保真度同时显著降低计算成本的高能效神经算子,仍是一个重要且尚未充分探索的研究方向。 脉冲神经网络(SNNs)[12, 13, 14, 15]因其固有的稀疏性和事件驱动的计算模式,已成为实现高效人工智能最具前景的范式之一。受生物神经系统的启发,SNNs在时间上整合输入,并且仅在神经元发放脉冲时传递信息,从而允许选择性地进行计算,而非像传统人工神经网络那样通过密集的激活模式。这种事件驱动的时空行为通过自然利用推理过程中单个神经元重要性的差异,显著减少了不必要的计算。在可用的神经元模型中,Leaky Integrate-and-Fire(LIF)神经元已成为最广泛采用的模型之一,因为它提供了生物真实性与计算效率之间的有效平衡[16]。然而,传统的LIF神经元在回归任务(包括主要的时空场重建)上性能有限,主要由于精度损失,这促使了可变脉冲神经元(VSN)的发展。VSN能够处理直接编码的连续值输入,避免精度损失,同时在前一个LIF神经元的记忆/整合动态之上产生分级脉冲输出,保留了事件驱动通信的计算优势[17]。 当前包含VSN的神经算子实现几乎完全使用替代梯度进行训练,这在优化过程中引入了前向和后向传递之间的固有不匹配,常常导致训练动态不稳定和重建性能下降[18]。神经形态社区中常探索的另一种策略是将人工神经网络转换为SNN,尽管这些方法有时需要较长的脉冲时间窗口,并依赖脉冲率编码和二元脉冲通信来准确表示连续信息[19, 20]。随着VSN中分级脉冲输出的引入(已被证明能改善神经算子应用中的回归性能),通信从基于率的编码转向直接传输连续值信息,这使得将标准的ANN-SNN转换公式映射到VSN框架变得困难。尽管基于VSN的神经算子在虚拟传感应用中展现了令人鼓舞的性能[21, 17, 22],但它们从根本上仍受限于替代梯度优化。增加脉冲时间步数可以提高重建精度(如本文后续所示),但代价是推理延迟增加、计算成本更高、总体脉冲活动更多,从而导致能耗增加。在本文中,我们选择停留在可变/连续通信框架内,以实现理想的回归性能。此外,我们专注于低延迟性能。VSN在性能和潜在效率方面已取得初步成功,甚至已被证明可以在单个脉冲步骤内执行[17, 21],但这种形式完全移除了预期的记忆动态。为了避免不稳定的替代训练、保持在单步范围内并移除不必要的记忆整合,同时保持低延迟性能,我们在神经算子框架内提出了一个**稀疏激活层**,它允许类似VSN的可变通信,并利用ReLU激活函数诱导的天然稀疏性,以实现对能量-精度权衡和延迟性能的改进控制。 本质上,我们提出的**稀疏激活ReLU(SAR)层**对ReLU激活函数的稀疏输出施加基于激活的稀疏性正则化,从而能够显式控制激活稀疏性,进而在低延迟下将神经元通信活动降低到现有基于VSN的方法之下,同时保持可变通信这一回归神经算子性能的关键要素,并通过无替代优化同时保持卓越的重建精度。SAR层框架可以轻松映射到ANN到神经形态的转换公式,但由于其移除了记忆动态,我们提出的工作也可以应用于任何能够利用激活稀疏性的硬件/软件,尤其是在密集连接神经网络的神经形态实现存在困难的情况下。另一个在脉冲算子研究中相对未被探索的问题是神经形态集成或一般边缘部署的可行性,该研究侧重于将脉冲层附加到模型架构。为解决这个问题,我们探索了一个用于边缘部署虚拟传感的**合成神经算子蒸馏框架**,该框架专注于使用来自更复杂、对边缘部署实施不太自然的算子模型的合成知识蒸馏,来增强较弱的、神经形态友好或更通用硬件可移植且激活稀疏的算子架构的性能,不仅提供稀疏通信和能效,还提供低内存/延迟需求。知识蒸馏在神经算子领域已有初步介绍[23, 24],但我们以神经形态/利用稀疏性的硬件进行神经算子边缘部署的独特视角引入了该技术,特别是合成生成,利用复杂、对设备不够友好的架构作为教师模型。尽管SAR层并非旨在替代传统的脉冲动态(一旦更有效的优化技术可用,它最终可能提供更丰富的特征表示和更好的瞬态物理现象建模),但它是在严格实时环境中部署的一个实用低延迟替代方案,同时也建立了一个强有力的基准,未来脉冲神经算子的发展可以据此进行评估。 基于这一理念,以及保留更传统脉冲动态或可变脉冲信号灵活性(在SAR层中被移除)的兴趣,我们还在**可变脉冲神经元(VSN)** 的背景下探索了基于激活ReLU的正则化。我们探索了两种机会来减少延迟并提高VSN的性能,尽管它存在替代梯度问题。首先,我们用神经元脉冲前的记忆激活输出减去阈值(并通过ReLU函数处理)替代了原始的基于百分比的损失项,提供了一个更丰富的损失项,该损失项探索了神经元脉冲事件的强度,以在无需更长脉冲序列的情况下提高性能。此外,我们探索了在**可变脉冲图神经算子(VS-GNO)[21]** 的空间聚合层的门控机制中使用基于ReLU的阈值技术,对节点的邻居进行在线过滤,本质上是从整体聚合中移除不必要的边,从而提高计算速度和延迟。虽然原始机制自适应地调整图并迫使门控权重趋近于零,但它最终在整体计算中包含了所有邻居。因此,我们尝试使用单独的基于激活的损失项进行邻居阈值化,以允许可控的精度-边数权衡,从而提高空间聚合效率。 本文的贡献总结如下: 1. **无替代梯度的可变信号神经算子,面向神经形态/稀疏传感**。我们引入了**稀疏激活ReLU(SAR)框架**,它提供稀疏的、基于事件的激活输出以实现能效,其性能可与传统脉冲模型相媲美。SAR层存在一种直接的ANN到神经形态转换方法,消除了替代梯度优化,同时能够显式控制基于神经算子的虚拟传感中的能量-精度权衡。在缺乏记忆动态和传统脉冲特性的情况下,SAR层成为严格实时环境下的一个实用低延迟替代方案。
相似文章
FusionSense: 三阶段近传感器学习实现运行时自适应多模态边缘智能
FusionSense提出了一种面向多模态边缘智能的三阶段近传感器学习框架,通过融合感知滤波同时降低计算与通信开销,在RGB-深度/激光雷达任务上实现高达33倍的能耗节省和显著的数据缩减收益。
面向边缘系统的延迟约束DNN架构学习:使用Zerorized Batch Normalization
本文提出了一种面向延迟的神经网络学习方法,使用Zerorized Batch Normalization优化严格延迟约束下边缘系统的DNN架构。实验表明,在NVIDIA Jetson设备上,该方法在精度损失极小的情况下显著降低了延迟。
SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力
SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。
从权重到特征:SAE引导的激活正则化用于LLM持续学习
本文提出了一种用于大语言模型的持续学习方法,该方法使用预训练的稀疏自编码器(SAEs)在激活空间而非权重空间中进行正则化,从而在无需存储先前数据的同时避免灾难性遗忘,并实现了更好的内存效率和更强的基准性能。
用于探索、净化和模型合并的谱重连方法
本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。