射频卷积神经网络
摘要
射频卷积神经网络(RF-CNNs)重新利用现有的无线通信硬件,以实现边缘设备上的高效AI推理,展示了深度CNN性能,同时显著节省能源。
arXiv:2609.19279v1 公告类型:新
摘要:直接在边缘设备如智能手机、可穿戴设备和无人机上运行人工智能(AI)模型,可以提供低延迟、广泛可扩展性和数据隐私,但这些设备很少具备现代神经网络所需的计算能力。作为回应,已经开发了边缘加速器,但每个加速器都会在已经受限于尺寸、重量、功耗和成本(SWaP-C)的设备上添加计算硬件。另一种选择在于这些设备已有的组件:每个无线电台中的频率混频器在时间上乘以信号,天然地在频域执行卷积。在此,我们介绍了射频卷积神经网络(RF-CNNs),它重新利用现有通信硬件进行CNN推理。多通道卷积被映射到频率音调上,由无源混频器一次执行完成。我们通过实验证明,RF-CNN可以运行深度CNN,参数多达2640万,层数达九层,从无线信号和图像的分类到可控图像生成,性能接近全精度水平。因为权重通过无线传输到达,且模拟硬件与通信共享,边缘设备仅在数据准备和读出上消耗能量——低至每个乘加操作0.72飞焦耳,比使用额外数字处理器的成本低两个数量级。这些结果表明,已部署的无线基础设施可以为数十亿已连接的设备带来高效、最先进的AI推理。
查看缓存全文
缓存时间: 2026/09/18 08:50
# 射频卷积神经网络 来源:https://arxiv.org/html/2609.19279 机构:杜克大学电气与计算机工程系,美国北卡罗来纳州达勒姆市27708 机构:麻省理工学院电子研究实验室,美国马萨诸塞州剑桥市02139 ## 摘要 直接在智能手机、可穿戴设备和无人机等边缘设备上运行人工智能模型,具有低延迟、普遍可扩展性和数据隐私保护的优势,但这些设备通常不具备现代神经网络所需的计算能力。为此,边缘加速器应运而生,然而每增加一个加速器都会在设备本已受限的尺寸、重量、功耗与成本方面带来额外负担。一种替代方案在于利用这些设备已有的硬件:每个无线电台中的频率混合器能够在时域内对信号进行乘法运算,从而自然地在频域中执行卷积操作。本文提出射频卷积神经网络,旨在将现有通信硬件重新用于卷积神经网络推理。多通道卷积被映射到频率音调上,由无源混合器单次执行。实验表明,该系统能够运行多达2640万参数、九层深度的卷积神经网络,从无线信号与图像分类到可控图像生成任务中,性能接近全精度模型。由于权重通过空中传输,且模拟硬件与通信系统共享,边缘设备仅需承担数据准备与读取的能耗——每个乘累加操作低至0.72飞焦耳,比使用额外数字处理器的成本低两个数量级。这些结果表明,已部署的无线基础设施能够为数十亿现有设备提供高效、前沿的AI推理能力。 ## 引言 人工智能正通过规模化而不断进步:机器学习模型持续扩展,其所需计算量的增长速度已超过硬件效率提升的速度。大量智能需求存在于网络边缘,数据中心因延迟、隐私或带宽等因素无法提供服务,因此推理必须在数据产生处执行。边缘设备——智能手机、可穿戴设备、无人机——在电池、散热、体积和成本方面受到固定预算的限制。主流解决方案是为这些设备配备专用加速器;然而,每增加一个加速器都会消耗定义边缘场景的有限资源,且其面临的障碍是物理而非算法层面的:在现有资源限制下,计算所需的硬件无法与计算发生的位置共存。 但解决这一限制的硬件实际上已存在于每个具备通信功能的边缘设备中。所有无线边缘设备均包含射频前端,包括频率混合器与本地振荡器、数据转换器和天线。频率混合器在时域中对两个信号进行乘法运算,根据卷积定理,此乘法等效于频域中的相关操作——这正是通信系统中用于在频段间转换信号的运算,同时也是卷积层执行的操作,即输入与核函数的互相关。因此,频率混合器执行的运算正是卷积推理所依赖的操作。无线前端无需修改即可作为卷积处理器。 然而,这一对应关系尚未被充分挖掘。推动高效边缘推理的专用加速器——数字处理器、模拟存内计算以及光子处理器——均通过在设备现有组件旁增加计算硬件来适配模型。另一类互补工作则利用内在物理机制进行计算,其中计算内嵌于物理过程本身;此处模型需适配该机制,但该机制未必符合特定机器学习架构所需的操作。计算也在无线通信本身中被探索:包括设备间信道以及设备内部前端的计算。 一种方法是改造传播环境,使信道模拟层功能,例如使用多址信道作为模拟加法器,配置智能表面模拟卷积层和全连接层,或利用富散射环境与时间调制编码超表面在波域中计算。另一种方法则是直接利用前端电路本身进行计算,通过可重构射频或微波电路实现模拟线性代数运算,包括可调矩阵乘法器、微波线性模拟计算机以及基于振荡器的微波网络。在本研究中,被动混合器直接评估全连接层的矩阵-向量乘法,权重由中央无线电广播或通过仿真分析。 以上两种方法中,计算要么通过工程化无线电环境进行模拟,仅能实现单层或浅层网络;要么被简化为通用矩阵-向量乘法,忽略了卷积的权重共享与局部性特征。混合器自身的相关性未被直接用于计算卷积层。 本文提出射频卷积神经网络,旨在将无线通信硬件重新用于边缘推理中的卷积神经网络——这一网络支撑着现代视觉与信号处理任务。无源频率混合器在本地输入与从中央无线电无线接收的权重驱动下,直接在模拟域中执行卷积层操作,利用混合器的原生运算而非工程模拟。原本服务于通信的转换器、振荡器和混合器因此被重新用作卷积神经网络加速器,无需专用硬件。由于映射是原生而非近似实现,网络加深时仍能保持精度:在无线测试平台上,该系统能够运行宽达1024通道的卷积神经网络,以及深达九层的卷积神经网络,测试精度接近全精度数字基线,涵盖一维与二维输入的分类与生成推理任务:包括复数值无线信号分类、自然图像(如CIFAR-10)分类,以及可控图像生成(如人脸生成)。 由于计算通过硬件复用实现,该方案避免了边缘推理的两大能耗瓶颈:权重通过无线传输而非设备本地存储与访问,且前端硬件本已因通信而供电运行。因此,系统能耗仅存在于本地输入/输出的编解码与传输/接收环节。最终实现了低于飞焦耳每乘累加操作的能耗预算,边缘设备端低至0.72飞焦耳每乘累加——比在设备上额外增加数字处理器的成本低两个数量级以上。 这些结果表明,已部署的无线基础设施可被复用为边缘端完整深度卷积推理的基底,为未来网络实现通信与计算融合架构迈进了一步。 ## 基于频率混合的卷积 射频卷积神经网络架构如图1b所示。中央无线电(如5G基站或Wi-Fi接入点)将其机器学习权重广播给覆盖范围内的边缘设备;每个设备在本地生成输入,并通过自身通信前端获取输出。计算本身在无源频率混合器(后称计算混合器)中进行,远程接收的权重与本地传输的输入被馈入该混合器(图2a)。混合器执行的操作非常基础:它在时域中对两个输入波形进行乘法运算,而时域乘法等价于频域互相关——将复数值输入与权重编码为两系列频率音调的幅度与相位,混合器输出频谱将逐音调包含两系列的互相关结果。卷积层是输入与核函数的互相关操作,因此混合器通过其物理特性完成计算;接下来需将高维张量映射到一维音调序列上。 该映射即频率音调映射算法,可将任意维度的复数值多通道一维或二维卷积转换为单次一维互相关。为简化说明,考虑使用方形核(K×K)与图像(I×I)的卷积层,且输入与输出通道数相同(C)。在该系统中,每个输入通道逐行展开到某个频率子带内的I²个音调上,行间设置零填充保护音调以避免行间相关。输入的C个通道与权重对应通道对齐后,占用C个相邻子带,共计C·I²个音调。通道维度的映射使得每对对齐子带的相关结果叠加到同一输出音调上,因此输入通道的求和由混合本身完成,完整输出Y即呈现在单个输出子带上。 一次混合操作即可执行整个多通道卷积,每个输出元素累积K²·C个乘积;对每个输出通道重复此操作(共C次),使用相同输入配合不同权重,即可完成整个层计算。最终,时域波形可通过快速傅里叶变换与逆变换在频域音调序列之间转换。 ## 能耗分析:规避成本与剩余成本 在边缘设备上运行该系统涉及三部分能耗:机器学习权重传输、模拟射频硬件运行以及模数边界处的数字处理。我们认为仅第三部分应计入边缘设备能耗,正是在此核算方式下,该系统展现出能耗优势。 首先,机器学习权重通过无线从中央无线电接收,而非在设备本地存储与访问,因此权重存储与数据搬运的能耗——数字加速器的主要成本来源——不由边缘设备承担。其次,模拟射频硬件复用通信收发器现有组件,包括本地振荡器与放大器,其能耗本已用于通信,因此计算不产生额外成本。第三,数字边界处理包括:编码(逆快速傅里叶变换形成输入时域波形)、数模转换器发射、模数转换器接收以及解码环节。
相似文章
用于AI无人机检测系统的紧凑型卷积神经网络
本文提出用于检测FPV无人机的轻量级卷积神经网络,利用时域光栅化射频信号,消除频域预处理,以低计算成本实现高精度,适用于嵌入式系统。
RF-DETR:面向实时检测Transformer的神经架构搜索
RF-DETR提出了一种轻量级检测Transformer,通过权重共享神经架构搜索实现最先进的实时目标检测,在COCO和Roboflow100-VL上优于先前方法,同时运行速度快达20倍。
清除障碍:AI增强的RF干扰抑制
本文介绍了一种AI增强的RF干扰抑制方法,该方法使用带有有限标量量化分词器的Transformer模型,以提升性能并最小化延迟,并通过数字信号场景中的音频指标进行验证。
CRFCAN:一种用于亚THz OFDM系统中联合信道与相位噪声估计的复数值跨域残差网络
提出CRFCAN,一种用于亚THz OFDM系统中联合信道与相位噪声估计的复数值残差网络,通过受物理启发的结构实现端到端恢复,并优于传统和最先进深度学习模型。
在生产级边缘设备上进行供应商无关的机器学习推理 [R]
描述了使用 ncnn 的 Vulkan 后端在生产级边缘设备上进行供应商无关的机器学习推理,在人脸检测和嵌入模型上相比 CPU ONNX 实现了 10 倍加速。