FusionSense: 三阶段近传感器学习实现运行时自适应多模态边缘智能

arXiv cs.LG 论文

摘要

FusionSense提出了一种面向多模态边缘智能的三阶段近传感器学习框架,通过融合感知滤波同时降低计算与通信开销,在RGB-深度/激光雷达任务上实现高达33倍的能耗节省和显著的数据缩减收益。

arXiv:2605.22868v1 公告类型:新 摘要:自主系统与智能工业部署日益将计算分布在近传感器、边缘和云端资源之间,严格的能耗、时延和可靠性预算要求运行时自适应。实际上,决定在每个节点计算和传输什么至关重要;然而,随着多模态传感器套件(摄像头、激光雷达/深度等)在边缘端激增,大多数现有方法要么(i)在强大服务器上融合模态,要么(ii)应用忽略跨模态依赖性的单模态近传感器滤波器,导致冗余传输或漏检事件。我们提出FusionSense,一种面向能量受限自主边缘系统的融合感知智能传感框架。轻量级近传感器分类器通过三步训练: (i) 服务器端融合模型学习下游任务,(ii) 过滤安全(FoS)标签量化各模态相对于融合决策的必要性,(iii) 通过注入近传感器预测作为辅助信号来压缩边缘端融合模型。结果是一个运行时决策层,它同时降低计算与通信,并且随传感器数量线性扩展。在基于SynDrone的双模态(RGB+深度/激光雷达)设置上,FusionSense以远高于单模态滤波器的数据缩减率维持任务质量,并带来巨大的端到端收益:在1% FoI出现率下能耗降低33倍,10%时降低11倍,固定30%数据缩减时质量损失减少92.3%,且能耗节省约为最佳先前滤波基线的1.5倍。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:54

# 三阶段近传感器学习:面向运行时自适应多模态边缘智能

来源:https://arxiv.org/html/2605.22868
,Ryozo Masukawa加州大学尔湾分校美国加州尔湾rmasukaw@uci\.edu (https://arxiv.org/html/2605.22868v1/mailto:[email protected]),Minhyoung Na韩国国民大学韩国首尔minhyoung0724@kookmin\.ac\.kr (https://arxiv.org/html/2605.22868v1/mailto:[email protected]),Hyunwoo Oh加州大学尔湾分校美国加州尔湾hyunwooo@uci\.edu (https://arxiv.org/html/2605.22868v1/mailto:[email protected]),Yoshiki Yamaguchi芝浦工业大学日本埼玉bp21016@shibaura\-it\.ac\.jp (https://arxiv.org/html/2605.22868v1/mailto:[email protected]),Wenjun Huang加州大学尔湾分校美国加州尔湾wenjunh3@uci\.edu (https://arxiv.org/html/2605.22868v1/mailto:[email protected]),SungHeon Jeong加州大学尔湾分校美国加州尔湾sungheoj@uci\.edu (https://arxiv.org/html/2605.22868v1/mailto:[email protected])和Mohsen Imani加州大学尔湾分校美国加州尔湾m\.imani@uci\.edu (https://arxiv.org/html/2605.22868v1/mailto:[email protected])

###### 摘要。

自主系统和智能工业部署日益将计算任务划分到近传感器、边缘和云端资源上,其中严格的能耗、延迟和可靠性预算要求具备*运行时*自适应性。实际上,在每个时间点决定*计算和传输什么*至关重要;然而,随着多模态传感器套件(摄像头、LiDAR/深度等)在边缘端的普及,大多数现有方法要么(i)在强大的服务器上融合模态,要么(ii)应用忽略跨模态依赖的单模态近传感器滤波器,导致冗余传输或事件遗漏。我们提出了FusionSense,一种面向能量受限自主边缘系统的融合感知智能传感框架。轻量级近传感器分类器通过三步流程进行训练:(i)服务器端融合模型学习下游任务,(ii)生成“过滤安全”(FoS)标签以量化相对于融合决策时各模态的必要性,(iii)通过将近传感器预测作为辅助信号注入来压缩边缘端融合模型。最终形成一个运行时决策层,在计算和通信方面联合优化,且传感器数量扩展时呈*线性*增长。在采用SynDrone的双模态(RGB+深度/LiDAR)设置上,FusionSense在远高于单模态滤波器的数据缩减率下维持了任务质量,并实现了显著的端到端收益:在FoI出现率为1%时能耗降低高达33倍,在10%时降低11倍,在固定30%数据缩减率下质量损失降低92.3%,并且比之前最好的滤波基线高出约1.5倍的节能效果。

## 1. 引言

现代制造业中的自主系统日益将工作负载分散到近传感器/设备端处理、边缘节点和云端后端,平台必须在严格的能耗、延迟、可靠性和热约束下做出运行时决策(Alikhani等人,2024 (https://arxiv.org/html/2605.22868#bib.bib362); Isuwa等人,2023 (https://arxiv.org/html/2605.22868#bib.bib363); Taufique等人,2025 (https://arxiv.org/html/2605.22868#bib.bib364); Yun等人,2025b (https://arxiv.org/html/2605.22868#bib.bib354), 2026c (https://arxiv.org/html/2605.22868#bib.bib370))。随着多模态传感器(例如RGB、LiDAR/深度、IMU)在边缘端成为标配,在*传输和融合之前*对传感器间相关性进行建模变得至关重要;否则,系统会浪费上行带宽,并在需要互补线索时面临精度下降的风险(Alikhani等人,2023 (https://arxiv.org/html/2605.22868#bib.bib365))。虽然大型后端模型通常能利用这种跨模态结构,但边缘设备也必须内化这种结构,以保持高效和准确(Taufique等人,2025 (https://arxiv.org/html/2605.22868#bib.bib364); Xun等人,2024 (https://arxiv.org/html/2605.22868#bib.bib366))。在实践中,*智能传感*——在传感器端或附近进行预处理——已在农业(Liakos等人,2018 (https://arxiv.org/html/2605.22868#bib.bib252))、医疗(Bahri等人,2018 (https://arxiv.org/html/2605.22868#bib.bib253))、物流(Woschank等人,2020 (https://arxiv.org/html/2605.22868#bib.bib256))、隐私保护(Pramanik等人,2023 (https://arxiv.org/html/2605.22868#bib.bib254))和安全(Khalid等人,2023 (https://arxiv.org/html/2605.22868#bib.bib255))领域得到采用;然而,大多数部署是单模态且任务特定的,因此无法捕捉跨模态依赖关系。

随着边缘设备数量的增加,需要在服务器端处理的数据量也随之增加,导致严重的可扩展性问题。一个有前景的方向是近传感器自适应(Yun等人,2024 (https://arxiv.org/html/2605.22868#bib.bib353); Huang等人,2024 (https://arxiv.org/html/2605.22868#bib.bib355)),即放置在传感器端的微型AI模型过滤冗余数据,仅将与任务相关的信息转发到服务器端进行后续操作。当观察到“关注帧”(FoI)的概率较低时,这种策略非常有效,能以适度的质量损失节省能量。*然而,*当现代边缘节点集成*多个*传感器时,简单地应用独立的单模态滤波器就变得次优:它(i)即使子集足以用于融合决策,也会传输冗余模态,并且(ii)可能过度过滤,从而遗漏需要互补线索的事件。此外,数据量和计算量会随着每个新增模态而增长,将可扩展性和热挑战转移到边缘端本身。

我们提出FusionSense,一种遵循务实设计原则的融合感知智能传感框架。我们将多传感器流视为相关随机变量,并训练轻量级近传感器分类器来逼近更复杂的服务器端融合模型的联合决策边界。我们的方法受多模态融合研究的启发(Sharma等人,2022 (https://arxiv.org/html/2605.22868#bib.bib226); Kim等人,2022 (https://arxiv.org/html/2605.22868#bib.bib233)),并经过实证验证。具体而言,FusionSense引入了一个*三步*学习过程:(1)为下游任务训练一个高容量的服务器融合模型,(2)导出“过滤安全”(FoS)标签,指示何时每个模态对于融合决策是不必要的,(3)通过将近传感器预测作为辅助信号注入来压缩边缘端融合模型——从而形成一个运行时决策层,在边缘-云连续体中协同优化计算和通信,并且随传感器数量*线性*扩展。

我们在双模态(摄像头-LiDAR)设置上实例化并评估了FusionSense。实验表明,FusionSense在远高于单模态滤波器的数据缩减率下维持了任务质量,并实现了显著的端到端收益:在FoI出现率为1%时能耗降低高达33倍,在10%时降低11倍;在固定30%数据缩减率下,相对于单模态滤波器,质量损失降低了92.3%;与之前最好的滤波基线相比,我们的方法实现了约1.5倍的节能效果。

我们的原创工作提供了以下贡献:

- •我们提出了FusionSense,一个*融合感知的智能传感*框架,通过根据融合任务学习近传感器的保留/丢弃决策,减少多模态融合系统的总能耗——这填补了面向智能工业自主性的多模态边缘传感领域日益增长的空白。
- •FusionSense引入了三步训练方法:(i)学习服务器融合模型,(ii)从融合决策中导出模态级FoS监督信号,(iii)通过近传感器预测压缩边缘融合模型,使其能够部署在计算连续体中能量受限的设备上。
- •在摄像头-LiDAR实验中,FusionSense在FoI为1%时能耗降低高达33倍,10%时降低11倍,在30%数据缩减率下质量损失降低92.3%,并且比之前最好的滤波基线高出约1.5倍的节能效果——同时随传感器数量*线性*扩展。

## 2. 相关工作

### 2.1. 多模态传感器融合

理解复杂环境通常需要融合异构传感器流,以便共同利用互补线索进行感知和决策(Sharma等人,2022 (https://arxiv.org/html/2605.22868#bib.bib226))。多模态表示学习的最新进展进一步表明,不同模态可以嵌入共享空间,以提高识别的鲁棒性和可迁移性(Girdhar等人,2023 (https://arxiv.org/html/2605.22868#bib.bib241))。在自主感知中,摄像头-LiDAR融合已成为在不同操作条件下实现可靠3D理解的基石(Sato等人,2023 (https://arxiv.org/html/2605.22868#bib.bib242))。具体而言,特征级和鸟瞰视图的管线,如BEVFusion(Liu等人,2023 (https://arxiv.org/html/2605.22868#bib.bib243))、3D Dual-Fusion(Kim等人,2022 (https://arxiv.org/html/2605.22868#bib.bib233))、EA-LSS(Hu等人,2023 (https://arxiv.org/html/2605.22868#bib.bib236))和UFO(Kim等人,2024 (https://arxiv.org/html/2605.22868#bib.bib237)),在nuScenes等大规模基准上取得了强劲结果(Caesar等人,2020 (https://arxiv.org/html/2605.22868#bib.bib235))。这些系统通常假设所有模态(或适当预处理的特征)都可供中央融合模型使用;它们的主要目标是在全模态输入下最大化下游准确度和鲁棒性。相比之下,我们的视角侧重于*融合前*阶段——在融合之前决定*传输或计算什么*——从而在减少端到端资源使用的同时保留多模态优势。

### 2.2. 节能边缘/AIoT计算

深度神经网络在视觉、音频及其他领域取得了最先进的结果,并且越来越多地部署在移动/嵌入式平台上(Liu等人,2020 (https://arxiv.org/html/2605.22868#bib.bib249); Javed等人,2017 (https://arxiv.org/html/2605.22868#bib.bib239); Yun等人,2025a (https://arxiv.org/html/2605.22868#bib.bib367), 2026b (https://arxiv.org/html/2605.22868#bib.bib369))。这一趋势催生了众多AIoT应用,涵盖智能环境和监控(Li and Han, 2022 (https://arxiv.org/html/2605.22868#bib.bib356); Teng, 2021 (https://arxiv.org/html/2605.22868#bib.bib357); Madhusudhan and Pravisha, 2024 (https://arxiv.org/html/2605.22868#bib.bib358); Yun等人,2026a (https://arxiv.org/html/2605.22868#bib.bib368))。为了适应严格的能耗和延迟预算,经典的效率手段包括量化、剪枝和专用低功耗硬件(Sun等人,2023 (https://arxiv.org/html/2605.22868#bib.bib359))。一个互补的研究方向是*近传感器智能*,即轻量级模型抑制或汇总原始数据,仅将与任务相关的信息转发到下游(Yun等人,2024 (https://arxiv.org/html/2605.22868#bib.bib353); Huang等人,2024 (https://arxiv.org/html/2605.22868#bib.bib355))。然而,在分布式环境中,通信子系统(例如Wi-Fi/5G)可能主导能耗和延迟(Shi等人,2016 (https://arxiv.org/html/2605.22868#bib.bib248); Yang等人,2023 (https://arxiv.org/html/2605.22868#bib.bib247)),这意味着“发送所有内容,但进行压缩”(Chen等人,2020 (https://arxiv.org/html/2605.22868#bib.bib231); Wang等人,2022 (https://arxiv.org/html/2605.22868#bib.bib225))在信息事件稀疏或某些模态暂时无用时可能仍然次优。这些观察结果促使了*融合感知*决策的产生,该决策通过根据每个模态对融合任务的贡献来调节传输,从而协同优化计算和通信,而不是应用模态无关的压缩或单模态滤波。

### 2.3. 动态多模态数据上的智能传感

实际运行使传感器暴露于特定模态的退化(例如低光照、眩光、雾),这些退化可能损害单个数据流并改变哪些模态最具信息量(Linnhoff等人,2022 (https://arxiv.org/html/2605.22868#bib.bib244));与此同时,诸如LiDAR欺骗等安全问题凸显了冗余和优雅降级的必要性(Sato等人,2023 (https://arxiv.org/html/2605.22868#bib.bib242))。因此,丰富的文献研究了动态融合和鲁棒性:学习何时以及如何信任每种模态(Liu等人,2017 (https://arxiv.org/html/2605.22868#bib.bib219); Tsai等人,2018 (https://arxiv.org/html/2605.22868#bib.bib227); Takahashi and Tan, 2019 (https://arxiv.org/html/2605.22868#bib.bib229); Zhi-Xuan等人,2020 (https://arxiv.org/html/2605.22868#bib.bib228))。值得注意的是,跨模态补偿模型(CCM)检测受损输入并以自监督方式进行补偿(Lee等人,2021 (https://arxiv.org/html/2605.22868#bib.bib232)),而DynMM则使用跨模态组合的专家混合路由来减少计算而不牺牲精度(Xue and Marculescu, 2023 (https://arxiv.org/html/2605.22868#bib.bib230))。然而,这些方法大多假设所有模态(或特征)已经通过上行链路到达中央模型;它们优化的是*采集后*融合,而不是*采集前*的采集/传输策略。我们的工作是互补的:我们利用融合模型的决策来监督轻量级近传感器选择器,这些选择器在*传输前*采取行动,从而避免不必要的数据移动,同时保留下游动态鲁棒多模态融合的优势。

参照图注图1. 我们提出的传感与信息处理管线与其他方法的比较:(a) 传统方法,(b) 基于压缩的方法,(c) 使用之前为单传感器环境设计的过滤方法,以及 (d) 我们的方法。

## 3. 智能多传感设计

复杂的机器学习任务通常需要庞大的模型,这些模型难以部署在边缘设备上。例如,一个前沿的基于Transformer的分类模型(Chen等人,2022 (https://arxiv.org/html/2605.22868#bib.bib343))在四个NVIDIA Tesla V100 GPU上需要80小时的训练,尽管它设计为比其前身使用更少的计算资源。许多研究还涉及用于复杂任务的大型模型,例如大型预训练多模态模型(Wu等人,2022 (https://arxiv.org/html/2605.22868#bib.bib344))和大型Transformer模型(Baade等人,2022 (https://arxiv.org/html/2605.22868#bib.bib345))。因此,在边缘传感器上实时实现这些先进的基于深度学习的多模态融合任务面临着巨大的实际困难。我们的方法通过二值化任务来应对这些挑战,具体来说,仅检测来自多个传感器中对于复杂操作所必需的“关注帧”(FoI)数据。与早期使用近传感器模块的方法不同,我们的策略通过专为融合环境定制的设计实现了最优节能。在本节中,我们介绍我们的智能多传感框架,在融合背景下与先前方法进行比较,并解释我们的模型训练技术。

### 3.1. 智能多传感框架

我们提出的方法与之前的方法(Chen等人,2020 (https://arxiv.org/html/2605.22868#bib.bib231); Huang等人,2024

相似文章

边缘设备上多模态联邦学习的熵引导张量压缩

arXiv cs.LG

论文介绍了MESH-FL,一种用于边缘设备上多模态联邦学习的熵引导矩阵乘积态压缩框架。它自适应地分配每层和每种模态的压缩秩,在异构树莓派集群上实现了高达56.8倍的压缩,并在最终准确率上比未压缩的FedAvg提升了2.01%。