EMMI:通过融合表示压缩实现通信高效的 MLLM 推理的边缘多模态智能
摘要
EMMI 提出了一种方法,用于在边缘设备上通过压缩表示来实现通信高效的 MLLM 推理,将通信负载降低 32 倍,同时保持准确性。
arXiv:2609.11058v1 公告类型:新
摘要:多模态大语言模型(MLLMs)的最新进展为边缘智能开辟了新机会,使得能够跨异构传感器模态(如视觉、文本和遥测数据)进行推理。然而,在资源受限的边缘平台上部署这些能力仍然具有挑战性,因为现代 MLLMs 具有显著的计算、内存和通信需求。边缘多模态智能(EMMI)不是传输原始传感器观测或在网络中间层分割神经网络,而是在边缘设备和服务器资源之间通信一个紧凑表示,从而实现通信高效的边缘 MLLM 推理。为实现这一点,EMMI 在边缘执行特定模态编码、跨模态表示融合和学习压缩,仅传输一个紧凑的潜表示到服务器端资源,用于高容量 MLLM 推理。这种以表示为中心的设计减少了通信开销,保留了本地数据隐私,并在异构边缘设备和服务器端 MLLMs 之间提供了固定大小的接口。在一个代表性的多模态基准上评估表明,EMMI 可以将通信负载减少 32 倍,同时保持相当的下游准确性,导致在带宽受限的边缘条件下,估计的端到端推理延迟最多减少 3.4 倍。
查看缓存全文
缓存时间: 2026/09/11 08:27
# 面向通信高效MLLM推理的边缘多模态智能:基于融合表征压缩
来源:https://arxiv.org/html/2609.11058
## EMMI:面向通信高效MLLM推理的边缘多模态智能:基于融合表征压缩
致谢:请在此注明适用的资助机构。若无,请删除此项。
###### 摘要
多模态大语言模型(MLLMs)的最新进展为边缘智能开辟了新机遇,支持跨视觉、文本和遥测数据等异构传感器模态的推理。然而,由于现代MLLMs在计算、内存和通信方面的巨大需求,在资源受限的边缘平台上部署这些能力仍然面临挑战。边缘多模态智能(EMMI)并非传输原始传感器观测数据或在中间层划分神经网络,而是在边缘设备和服务器资源之间传输紧凑表征,从而实现通信高效的边缘MLLM推理。为此,EMMI在边缘进行模态特定编码、跨模态表征融合和学习压缩,仅将紧凑的潜在表征传输至服务器端资源以进行高容量MLLM推理。这种以表征为中心的设计降低了通信开销,保护了本地数据隐私,并在异构边缘设备与服务器端MLLMs之间提供了固定大小的接口。在代表性多模态基准上的评估表明,EMMI在保持相当下游精度的同时,可将通信负载减少32倍,在带宽受限的边缘条件下,预估端到端推理延迟最多降低3.4倍。
###### 索引关键词:
边缘智能,多模态大语言模型(MLLMs),表征压缩,边缘-服务器推理
## 一、引言
随着边缘系统日益自主化,其有效性取决于在严格资源约束下进行跨异构模态推理的能力。在许多操作环境中,可行的洞察需要联合解释视觉观测、传感器测量、遥测数据和上下文信息。这种对多模态推理的依赖,催生了能够整合多元信息源以支持边缘及时且上下文感知决策的智能系统。近期多模态大语言模型(MLLMs)的进展,通过统一处理异构输入,为实现此类能力提供了有前景的基础。
与针对特定任务设计的传统轻量级多模态模型不同,MLLMs能够在统一架构中捕捉异构输入间的高阶关系,并进行上下文跨模态推理。这些能力使得在复杂环境中实现更灵活和可泛化的决策成为可能。然而,其巨大的计算、内存和通信需求,在现代MLLMs的能力与边缘平台可用资源之间造成了显著的部署鸿沟。
为在边缘平台启用MLLM能力,现有部署策略探讨了降低模型复杂度、利用远程计算资源和最小化通信成本。然而,这些方法仅解决单一的资源约束,而未解决边缘限制下高效多模态推理的根本挑战。减小模型规模可能限制MLLMs的表达能力,而卸载计算或传输中间表征则可能引入通信开销和延迟。因此,要在边缘实现基于MLLM的实用智能,需要一种在保留任务相关多模态信息的同时,使计算和通信适应边缘约束的部署策略。
弥合这一部署鸿沟需要在边缘和服务器资源之间仔细协调计算与通信。直接卸载多模态输入可以减少本地处理需求,但在传输大量传感器流时会引入显著的通信开销。设备端优化技术降低了资源消耗,但往往牺牲了使MLLMs有价值的推理能力和通用性。现有的分割计算方法将模型执行分布在边缘和服务器设备上;然而,它们在推理过程中仍可能需要频繁交换中间表征,这在带宽和延迟受限的情况下限制了其有效性。这些局限性表明,MLLMs的高效边缘部署不仅仅需要缩减模型规模或转移计算,更需要一种策略,在保留跨模态推理能力的同时,变革多模态信息在边缘设备与远程资源之间的表征与通信方式。
为应对这些挑战,我们提出EMMI,一种边缘多模态智能架构,它将多模态表征生成与跨边缘和服务器资源的高容量MLLM推理解耦。EMMI不传输原始传感器流,也不依赖于需要频繁中间特征交换的传统分割执行,而是在通信前于边缘进行模态特定编码和跨模态融合,生成统一的多模态表征,随后压缩并传输至服务器资源。通过在传输前进行多模态交互,EMMI将通信边界从原始输入、模态特定特征或模型激活,转变为用于服务器端推理的紧凑统一表征。这种以表征为中心的设计减少了通信开销,同时保留了任务相关信息,并在异构边缘设备与服务器端推理模型之间提供了固定大小的接口。
本文其余部分组织如下:第二节介绍关于MLLMs和边缘智能的相关工作。第三节描述提出的EMMI框架和系统架构。第四节介绍实验方法和评估设置。第五节讨论结果与分析。最后,第六节总结全文。
## 二、相关工作
边缘约束下的多模态智能。传统的多模态系统通常采用轻量级、任务特定的架构,用于人类活动识别[1 (https://arxiv.org/html/2609.11058#bib.bib1),2 (https://arxiv.org/html/2609.11058#bib.bib2)]和机载空中感知[3 (https://arxiv.org/html/2609.11058#bib.bib3)]等应用。近期的多模态大语言模型(MLLMs),如Flamingo[4 (https://arxiv.org/html/2609.11058#bib.bib4)]、BLIP-2[5 (https://arxiv.org/html/2609.11058#bib.bib5)]和LLaVA[6 (https://arxiv.org/html/2609.11058#bib.bib6)],则支持跨异构输入的通用推理。然而,它们的计算和内存需求限制了其在资源受限边缘平台上的部署[7 (https://arxiv.org/html/2609.11058#bib.bib7),8 (https://arxiv.org/html/2609.11058#bib.bib8)]。近期的紧凑型MLLMs通过减少模型规模和计算需求来瞄准这一缺口[7 (https://arxiv.org/html/2609.11058#bib.bib7),9 (https://arxiv.org/html/2609.11058#bib.bib9)],但相对于全容量MLLMs[9 (https://arxiv.org/html/2609.11058#bib.bib9),10 (https://arxiv.org/html/2609.11058#bib.bib10)]仍受限制。这些局限性促使人们寻求既能保留高容量多模态推理,又能使计算和通信适应边缘约束的方法。
设备端MLLM优化。现有在边缘启用MLLM部署的努力通过三个互补方向减少模型计算和内存:硬件加速,使用NPU和存内计算设计等专用架构[11 (https://arxiv.org/html/2609.11058#bib.bib11)];模型压缩,包括量化[12 (https://arxiv.org/html/2609.11058#bib.bib12)];以及高效MLLM架构,即重新设计模型以实现更小的占用空间和更好的可部署性[13 (https://arxiv.org/html/2609.11058#bib.bib13),14 (https://arxiv.org/html/2609.11058#bib.bib14),15 (https://arxiv.org/html/2609.11058#bib.bib15)]。虽然这些方法提高了边缘效率,但它们仍然受限于模型效率与高容量多模态推理之间的权衡[9 (https://arxiv.org/html/2609.11058#bib.bib9),10 (https://arxiv.org/html/2609.11058#bib.bib10)]。*EMMI则不同,它保留了高容量MLLM推理能力,同时将通信边界转向在边缘生成的紧凑多模态表征。*
分割计算与协同推理。分割计算通过将模型执行划分到资源受限的设备和远程服务器之间,实现边缘-服务器协同推理[16 (https://arxiv.org/html/2609.11058#bib.bib16),17 (https://arxiv.org/html/2609.11058#bib.bib17),18 (https://arxiv.org/html/2609.11058#bib.bib18),19 (https://arxiv.org/html/2609.11058#bib.bib19),20 (https://arxiv.org/html/2609.11058#bib.bib20),21 (https://arxiv.org/html/2609.11058#bib.bib21)]。虽然早期方法侧重于通过高效分区和激活传输来减少深度神经网络推理的通信开销[22 (https://arxiv.org/html/2609.11058#bib.bib22)],但近期努力已将协同推理扩展到大语言模型和多模态系统。LLM推理框架探索自适应分区、推测执行和协同服务,以降低跨异构资源的模型执行成本[23 (https://arxiv.org/html/2609.11058#bib.bib23),24 (https://arxiv.org/html/2609.11058#bib.bib24),25 (https://arxiv.org/html/2609.11058#bib.bib25)]。多模态系统进一步将模态处理和语言推理分布在边缘-云资源之间[26 (https://arxiv.org/html/2609.11058#bib.bib26)]。然而,现有的协同推理方法主要优化计算执行的位置,而通信仍然与中间激活、模态特定特征或模型状态绑定。这些表征仍然依赖于底层模型架构和输入模态,限制了随着多模态系统纳入日益多样化的传感器流时的可扩展性。*EMMI则不同,它改变了跨越边缘-服务器边界的内容,在边缘生成并压缩统一的多模态表征,并传输紧凑的潜在表征用于服务器端MLLM推理。*
通信高效的表征传输。除了计算放置,边缘MLLM部署还面临通信挑战:边缘与服务器之间交换的中间表征仍会引入显著的传输开销。现有方法通过表征压缩和语义感知传输来减少此开销。特征压缩方法如BottleNet++[27 (https://arxiv.org/html/2609.11058#bib.bib27)]压缩中间激活,而任务导向的通信框架则学习与下游目标相关的紧凑表征[28 (https://arxiv.org/html/2609.11058#bib.bib28),29 (https://arxiv.org/html/2609.11058#bib.bib29)]。学习型压缩技术进一步使用神经压缩模型提高传输效率[30 (https://arxiv.org/html/2609.11058#bib.bib30)]。近期工作将通信高效推理扩展到多模态LLM。TOFC[31 (https://arxiv.org/html/2609.11058#bib.bib31)]通过特征合并和熵建模,在设备-边缘协同推理框架中减少了视觉特征传输。然而,这些方法通常压缩模态特定表征,并在传输后进行多模态交互,限制了其在边缘利用跨模态依赖性的能力。*EMMI通过改变传输的表征本身来扩展这些努力。EMMI不发送原始传感器输入或独立的模态特定特征,而是在边缘进行跨模态融合,并生成统一的潜在表征用于服务器端MLLM推理。此设计在异构边缘传感器与高容量MLLMs之间提供了固定大小的通信接口,同时保留了开放式多模态推理所需的灵活性。*
## 三、系统模型与解决方案
本节介绍边缘-服务器系统模型以及EMMI在边缘约束下实现通信高效MLLM推理的设计。
参见标题图1:EMMI流水线:在边缘进行编码、融合和压缩;在服务器进行解压和推理。
### 三-A 系统模型
我们考虑一个由一个或多个资源受限边缘平台组成的分布式边缘-服务器多模态智能系统,这些平台通过带宽有限的无线链路连接到配备高容量多模态大语言模型(MLLMs)的远程服务器基础设施。边缘平台收集并进行本地处理异构传感器观测,而服务器端资源提供计算密集型多模态推理。设 V=\{v_1,v_2,...,v_N\} 表示一组边缘设备,其中 N 代表参与的边缘平台数量。每个边缘设备在时间步 t 收集来自多个模态的观测,表示为:
X_i^t = \{x_{i,1}^t, x_{i,2}^t, ..., x_{i,M_i}^t\}, (1)
其中 M_i 表示边缘设备 i 处可用模态的数量,x_{i,m}^t 表示来自模态 m 的观测。该系统旨在从边缘设备收集的异构观测中获取基于MLLM的推理结果。由于高容量MLLMs需要大量的计算和内存资源,推理在边缘平台和远程服务器之间协同进行。这需要通过无线链路将信息从边缘观测传输以供服务器端MLLM处理。因此,端到端推理延迟包括边缘处理 (T_edge)、通信 (T_comm) 和服务器端推理 (T_server):
T_total = T_edge + T_comm + T_server, (2)
通信延迟取决于传输数据大小 S_tx 和可用带宽 B:
T_comm = \frac{S_tx}{B}, (3)
因此,系统必须在边缘资源约束下平衡分配给边缘和服务器资源的计算工作量,同时最小化通信开销。
### 三-B EMMI框架
为在上述系统模型下实现高效的MLLM推理,EMMI采用以表征为中心的边缘-服务器架构,其中边缘设备生成紧凑的多模态表征供服务器端推理使用,而不是传输原始传感器流或依赖架构的激活。此设计将资源受限的边缘处理与计算密集型MLLM推理分离,同时减少通信开销和原始传感器数据的暴露。图1 (https://arxiv.org/html/2609.11058#S3.F1) 展示了整体架构。
I) 边缘侧多模态表征生成。边缘流水线包含三个组件:编码、跨模态融合和表征压缩。它们共同生成作为边缘和服务器资源间通信接口的多模态表征。相似文章
EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
边缘设备上多模态联邦学习的熵引导张量压缩
论文介绍了MESH-FL,一种用于边缘设备上多模态联邦学习的熵引导矩阵乘积态压缩框架。它自适应地分配每层和每种模态的压缩秩,在异构树莓派集群上实现了高达56.8倍的压缩,并在最终准确率上比未压缩的FedAvg提升了2.01%。
NeoMME:一个用于高效微调和推理的单塔多模态原生多语言基础编码器
NeoMME 展示了一系列高效的多模态编码器,采用掩码离散扩散进行预训练,在视觉文档检索和高嵌入压缩方面表现优异,同时在基准测试中超越了更小的模型。
LLaVA-UHD v4:高效视觉编码在 MLLMs 中的关键要素是什么?
本文介绍了 LLaVA-UHD v4,该模型通过采用基于切片(slice-based)的编码和 ViT 内部早期压缩,提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时,将计算成本降低了 55% 以上。
MolEmb:多模态大型语言模型可以成为强大的分子嵌入模型
本文介绍了MolEmb,这是一个轻量级框架,它调整多模态大型语言模型以实现通用的分子嵌入,支持上下文感知的表示和跨模态检索,同时还提出了一个诊断基准MolCAR。