作为深度物理神经网络的多层MIMO中继:功率放大器作为激活函数
摘要
提出了一种深度无线物理神经网络,其中多跳MIMO中继实现可训练的线性变换,功率放大器的非线性作为激活函数,从而实现图像分类的空中推理。
查看缓存全文
缓存时间: 2026/07/22 08:20
# 多层MIMO中继作为深度物理神经网络:功率放大器作为激活函数
来源: https://arxiv.org/html/2607.18354
Meng Hua, Itsik Bergel, , and Deniz Gündüz本工作由UKRI资助,项目包括AI\-R \(EP/X030806/1\)和INFORMED\-AI \(EP/Y028732/1\),以及SNS JU项目6G\-GOALS(欧盟Horizon计划,资助协议号101139232)。M\. Hua和D\. Gündüz就职于英国伦敦帝国理工学院电气与电子工程系,伦敦SW7 2AZ(电子邮件:\{m\.hua,d\.gunduz\}@imperial\.ac\.uk)。I\. Bergel就职于以色列巴伊兰大学工程学院,拉马特甘5290002(电子邮件:itsik\.bergel@biu\.ac\.il)。
###### 摘要
无线物理神经网络(WPNN)将神经计算直接嵌入模拟硬件中,与传统数字实现相比,能耗和延迟更低。本文提出一种深度WPNN,其中非线性激活由多跳多输入多输出(MIMO)中继网络实现,每个中继实现一个可训练的复线性增益和偏置,随后利用功率放大器的内在非线性作为激活函数。因此,多个中继的级联实现了一个空中全连接网络,其参数可以端到端训练。我们针对不同的信道状态信息(CSI)可用场景开发了两种收发器设计:一种基于最小二乘(LS)的方案,仅需要接收端CSI;另一种基于奇异值分解(SVD)的方案,需要发射端和接收端CSI。仿真结果表明,所提出的架构能够实现精确的空中推理用于图像分类。特别地,结果突出了利用硬件非线性增强推理能力的优势。
## I引言
人工智能(AI)的显著成功主要归功于在图形处理单元(GPU)上执行的深度学习模型,其巨大的并行性和数值精度使得高效训练和推理成为可能。然而,GPU继承了冯·诺依曼架构,其中内存和计算之间的物理分离会带来显著的能耗和延迟成本,特别是在大规模或实时部署中。新兴的物理神经网络(PNN)概念提供了一种有前途的替代方案[14 (https://arxiv.org/html/2607.18354#bib.bib15),10 (https://arxiv.org/html/2607.18354#bib.bib11),7 (https://arxiv.org/html/2607.18354#bib.bib8)]:线性映射和非线性激活通过可控的模拟机制(包括电子、光学或无线)实现,其内在动力学和非线性使得能够以显著更低的能量和延迟进行原位推理。
最近,在空中实现无线PNN(WPNN)的研究日益受到关注[4 (https://arxiv.org/html/2607.18354#bib.bib5)]。首先,物理底层(例如可重构智能表面(RIS)的相移和中继的放大系数)可以被视为无线介质中可训练的神经元。其次,基本的代数运算(如矩阵乘法和求和)可以通过利用无线多址信道的叠加特性在空中自然实现[1 (https://arxiv.org/html/2607.18354#bib.bib1)],从而显著降低计算能耗和处理延迟。尽管如此,关于空中WPNN的研究仍处于早期阶段,迄今为止报告的文献数量有限[12 (https://arxiv.org/html/2607.18354#bib.bib13),5 (https://arxiv.org/html/2607.18354#bib.bib6),16 (https://arxiv.org/html/2607.18354#bib.bib17),8 (https://arxiv.org/html/2607.18354#bib.bib9),9 (https://arxiv.org/html/2607.18354#bib.bib10),15 (https://arxiv.org/html/2607.18354#bib.bib16),6 (https://arxiv.org/html/2607.18354#bib.bib7),11 (https://arxiv.org/html/2607.18354#bib.bib12),2 (https://arxiv.org/html/2607.18354#bib.bib2),13 (https://arxiv.org/html/2607.18354#bib.bib14),3 (https://arxiv.org/html/2607.18354#bib.bib3)]。具体而言,[12 (https://arxiv.org/html/2607.18354#bib.bib13),5 (https://arxiv.org/html/2607.18354#bib.bib6),16 (https://arxiv.org/html/2607.18354#bib.bib17),8 (https://arxiv.org/html/2607.18354#bib.bib9),9 (https://arxiv.org/html/2607.18354#bib.bib10),15 (https://arxiv.org/html/2607.18354#bib.bib16),6 (https://arxiv.org/html/2607.18354#bib.bib7),11 (https://arxiv.org/html/2607.18354#bib.bib12)]研究了使用RIS作为神经网络神经元,其中RIS元素的可调相移被视为网络的可训练参数。例如,在[11 (https://arxiv.org/html/2607.18354#bib.bib12)]中,作者提出利用RIS通过利用多径传播延迟实现一维卷积运算,其中每个信道冲激响应充当一个独立的有限冲激响应滤波器,与发射信号卷积以模拟数字卷积神经网络。中继也被探索作为WPNN硬件,见[2 (https://arxiv.org/html/2607.18354#bib.bib2),13 (https://arxiv.org/html/2607.18354#bib.bib14),3 (https://arxiv.org/html/2607.18354#bib.bib3)],其中中继放大系数被解释为模拟神经元权重。当使用多个中继时,无线信道和放大增益的组合效应形成了一个等效的虚拟多输入多输出(MIMO)系统。例如,[2 (https://arxiv.org/html/2607.18354#bib.bib2)]证明,通过利用放大增益和功率放大器(PA)的内在非线性,可以实现显著的通信性能增益。然而,上述研究尚未充分利用空间自由度或物理设备的内在非线性,这从根本上限制了它们的表达能力。
在本文中,我们通过多跳MIMO中继架构研究深度物理神经网络,如图1 (https://arxiv.org/html/2607.18354#S1.F1)所示。我们的主要贡献如下:首先,我们提出了一种用于实现深度WPNN的多跳MIMO中继架构,将每个中继的可训练放大、偏置和PA非线性形式化地关联到一个全连接层的权重、偏置和激活函数。其次,我们针对不同的信道状态信息(CSI)可用场景提出了两种收发器方案:一种基于最小二乘(LS)的方案,仅需接收端CSI(CSIR);另一种基于奇异值分解(SVD)的方案,需要发射端和接收端CSI(CSIR/T)。两种方案都支持通过PA模型的标准反向传播进行端到端训练。第三,通过在Fashion-MNIST数据集上的仿真,我们表明,与预期相反,解耦特征模式的SVD方案在深度级联中并未从PA非线性中获益,而LS方案则利用非线性并随深度扩展而良好扩展。
请参阅说明
图1:多跳MIMO中继系统的架构。
## II系统模型
如图1 (https://arxiv.org/html/2607.18354#S1.F1)所示,我们考虑一个多跳MIMO中继系统,信息通过MMM个MIMO中继R1,...,RM\{R\_\{1\},\\ldots,R\_\{M\}\}从源节点传输到用户。为方便表示,我们将源节点和用户分别记为R0R\_\{0\}和RM\+1R\_\{M\+1\}。网络中的所有节点均配置相同数量的发射和接收天线。具体来说,令NmN\_\{m\}表示节点RmR\_\{m\}的发射或接收天线数量,其中m∈\{0,...,M\+1\}m\\in\\left\\\{\{0,\\ldots,M\+1\}\\right\\\}。
该中继网络的目标是在信号S∈S\\bf S\\in\{\\cal S\}在R0R\_\{0\}处可用,并通过MMM个MIMO中继传输到RM\+1R\_\{M\+1\}时,执行一个通用的推理任务。该任务表示为T:S→Y\\mathcal\{T\}:\\mathcal\{S\}\\rightarrow\\mathcal\{Y\},其中Y\\mathcal\{Y\}表示任务特定的输出空间。关于图像分类任务的具体示例将在第IV节 (https://arxiv.org/html/2607.18354#S4)中介绍。令Hm∈CNm×Nm−1\{\{\\mathbf\{H\}\}\_\{m\}\}\\in\{\{\\mathbb\{C\}\}^\{\{N\_\{m\}\}\\times\{N\_\{m\-1\}\}\}\}表示从节点Rm−1\{\{R\_\{m\-1\}\}\}到节点Rm\{\{R\_\{m\}\}\}的复基带等效MIMO信道,其中m∈\{1,...,M\+1\}m\\in\\left\\\{\{1,\\ldots,M\+1\}\\right\\\}。我们对所有无线链路采用莱斯衰落模型。具体来说,第mm跳的信道矩阵Hm\{\{\\bf\{H\}\}\_\{m\}\}表示为
Hm=αm\(KK\+1Hm,LoS\+1K\+1Hm,NLoS\),\\displaystyle\{\{\\mathbf\{H\}\}\_\{m\}\}\{\\text\{ = \}\}\\sqrt\{\{\\alpha\_\{m\}\}\}\\left\(\{\\sqrt\{\\frac\{K\}\{\{K\+1\}\}\}\{\{\\mathbf\{H\}\}\_\{m,\{\\text\{LoS\}\}\}\}\+\\sqrt\{\\frac\{1\}\{\{K\+1\}\}\}\{\{\\mathbf\{H\}\}\_\{m,\{\\text\{NLoS\}\}\}\}\}\\right\),\(1\)其中αm\{\{\\alpha\_\{m\}\}\}捕获第mm跳的大尺度衰落,KK表示莱斯因子。视距(LoS)分量Hm,LoS\{\{\\mathbf\{H\}\}\_\{m,\{\\text\{LoS\}\}\}\}建模为确定性秩一矩阵,表示为
Hm,LoS=ar\(θmr;Nm\)atH\(θm−1t;Nm−1\),\\displaystyle\{\{\\mathbf\{H\}\}\_\{m,\{\\text\{LoS\}\}\}\}=\{\{\\mathbf\{a\}\}\_\{\\text\{r\}\}\}\\left\(\{\\theta\_\{m\}^\{\\text\{r\}\};\{N\_\{m\}\}\}\\right\)\{\\mathbf\{a\}\}\_\{\\text\{t\}\}^\{H\}\\left\(\{\\theta\_\{m\-1\}^\{\\text\{t\}\};\{N\_\{m\-1\}\}\}\\right\),\(2\)其中ar\(θmr;Nm\)\{\{\\mathbf\{a\}\}\_\{\\text\{r\}\}\}\\left\(\{\\theta\_\{m\}^\{\\text\{r\}\};\{N\_\{m\}\}\}\\right\)和at\(θm−1t;Nm−1\)\{\{\\mathbf\{a\}\}\_\{\\text\{t\}\}\}\\left\(\{\\theta\_\{m\-1\}^\{\\text\{t\}\};\{N\_\{m\-1\}\}\}\\right\)分别表示节点RmR\_\{m\}和Rm−1R\_\{m\-1\}处的接收和发射阵列响应向量。与LoS路径相关的到达角(AoA)和离开角(AoD)分别记为θmr\{\\theta\_\{m\}^\{\\text\{r\}\}\}和θm−1t\{\\theta\_\{m\-1\}^\{\\text\{t\}\}\},假设它们在\[0,π\]\\left\[\{0,\\pi\}\\right\]上独立均匀分布。对于具有NN个天线的均匀线性阵列,其阵列响应表示为
ac\(θ;N\)=\[1,ejπsinθ,...,ejπsinθ\(N−1\)\]T,c∈\{r,t\}\.\\displaystyle\{\{\\mathbf\{a\}\}\_\{\\text\{c\}\}\}\\left\(\{\\theta;N\}\\right\)=\{\\left\[\{1,\{e^\{j\\pi\\sin\\theta\}\},\\ldots,\{e^\{j\\pi\\sin\\theta\\left\(\{N\-1\}\\right\)\}\}\}\\right\]^\{T\}\},\{\\text\{c\}\}\\in\\left\\\{\{\{\\text\{r,t\}\}\}\\right\\\}\.\(3\)非LoS(NLoS)分量Hm,NLoS\{\{\{\\mathbf\{H\}\}\_\{m,\{\\text\{NLoS\}\}\}\}\}建模小尺度散射,其中每个条目独立分布为\[Hm,NLoS\]i,j∼CN\(0,1\)\{\\left\[\{\{\{\\mathbf\{H\}\}\_\{m,\{\\text\{NLoS\}\}\}\}\}\\right\]\_\{i,j\}\}\\sim\{\\cal CN\}\\left\(\{0,1\}\\right\)。
令Xm∈CNm×L\{\{\\mathbf\{X\}\}\_\{m\}\}\\in\{\{\\mathbb\{C\}\}^\{\{N\_\{m\}\}\\times L\}\}和Ym∈CNm×L\{\{\\mathbf\{Y\}\}\_\{m\}\}\\in\{\{\\mathbb\{C\}\}^\{\{N\_\{m\}\}\\times L\}\}分别表示节点RmR\_\{m\}处的发射和接收符号,其中m∈\{0,1,...,M\+1\}m\\in\\left\\\{\{0,1,\\ldots,M\+1\}\\right\\\},LL表示发射符号数,将在后面指定。我们有
Ym=HmXm−1\+Nm,m∈\{1,...,M\+1\},\\displaystyle\{\{\\bf\{Y\}\}\_\{m\}\}=\{\{\\bf\{H\}\}\_\{m\}\}\{\{\\bf\{X\}\}\_\{m\-1\}\}\+\{\{\\bf\{N\}\}\_\{m\}\},~m\\in\\left\\\{\{1,\\ldots,M\+1\}\\right\\\},\(4\)其中Nm∈CNm×L\{\{\\mathbf\{N\}\}\_\{m\}\}\\in\{\{\\mathbb\{C\}\}^\{\{N\_\{m\}\}\\times L\}\}表示加性高斯白噪声,Nm\{\{\\bf\{N\}\}\_\{m\}\}中的每个条目独立分布为\[Nm\]i,j∼CN\(0,σ2\)\{\\left\[\{\{\{\\bf\{N\}\}\_\{m\}\}\}\\right\]\_\{i,j\}\}\\sim\{\\cal CN\}\\left\(\{0,\{\\sigma^\{2\}\}\}\\right\)。
我们考虑两种情况,即CSIR MIMO和CSIR/T MIMO,具体取决于每个节点处CSI的可用性。
### II-ACSIR MIMO系统
在CSIR MIMO系统中,CSI在每个跳的接收端可用,从而允许其对发射信号进行均衡。根据(4 (https://arxiv.org/html/2607.18354#S2.E4))中的输入输出关系,利用Hm\{\{\\mathbf\{H\}\}\_\{m\}\}的知识,RmR\_\{m\}可以执行接收端信号处理来估计发射符号。我们采用LS估计器来恢复Xm−1\{\{\{\\bf\{\\hat\{X\}\}\}\}\_\{m\-1\}\}的估计值X^m−1\{\{\{\\bf\{\\hat\{X\}\}\}\}\_\{m\-1\}\}。通过应用由θm\{\{\{\\bm\{\\theta\}\}\_\{m\}\}\}参数化的节点特定处理函数,RmR\_\{m\}处的发射信号可以表示为
Xm=gθm\(Ym,Hm,σ2\),m∈\{1,...,M\+1\},\\displaystyle\{\{\\bf\{X\}\}\_\{m\}\}=\{g\_\{\{\{\\bm\{\\theta\}\}\_\{m\}\}\}\}\\left\(\{\{\{\{\\bf\{Y\}\}\}\_\{m\}\},\{\{\\bf\{H\}\}\_\{m\}\},\{\\sigma^\{2\}\}\}\\right\),~m\\in\\left\\\{\{1,\\ldots,M\+1\}\\right\\\},\(5\)其中gθm\(⋅\)\{g\_\{\{\{\\bm\{\\theta\}\}\_\{m\}\}\}\}\\left\(\\cdot\\right\)表示在RmR\_\{m\}处实现的信号处理函数。
### II-BCSIR/T MIMO系统
在CSIR/T MIMO系统中,CSI在每个跳的发射端和接收端均可用。因此,由WPNN参数φm\{\{\{\\bm\{\\phi\}\}\_\{m\}\}\}参数化的RmR\_\{m\}处编码函数可以表示为
Xm=fφm\(Ym,Hm,Hm\+1,σ2\),m∈\{1,...,M\},\\displaystyle\\\!\\\!\\\!\{\{\\bf\{X\}\}\_\{m\}\}=\{f\_\{\{\{\\bm\{\\phi\}\}\_\{m\}\}\}\}\\left\(\{\{\{\{\\bf\{Y\}\}\}\_\{m\}\},\{\{\\bf\{H\}\}\_\{m\}\},\{\{\\bf\{H\}\}\_\{m\+1\}\},\{\\sigma^\{2\}\}\}\\right\),~m\\in\\left\\\{\{1,\\ldots,M\}\\right\\\},\(6\)其中fφm\(⋅\)\{f\_\{\{\{\\bm\{\\phi\}\}\_\{m\}\}\}\}\\left\(\\cdot\\right\)表示在RmR\_\{m\}处实现的信号处理函数。
由多跳MIMO中继网络实现的WPNN进行端到端训练,以近似任务映射T\\mathcal\{T\}。记T^Θ\(S\)\\widehat\{\\mathcal\{T\}\}\_\{\\bm\{\\Theta\}\}\(\{\\bf S\}\)为从输入样本S\\bf S到用户决策的映射,由所有可训练的物理层参数Θ\\bm\{\\Theta\}(放大矩阵、偏置、发射/接收处理以及最终读出层)参数化,目标是最小化任务特定的损失:minΘE\(S,y\)∼PS,y\[L\(T^Θ\(S\),y\)\]\\min\_\{\\bm\{\\Theta\}\}\\mathbb\{E\}\_\{\(\{\\bf S\},y\)\\sim P\_\{\{\\bf S\},y\}\}\[\{\\cal L\}\(\\widehat\{\\mathcal\{T\}\}\_\{\\bm\{\\Theta\}\}\(S\),y\)\],其中y∈Yy\\in\\mathcal\{Y\}是真实标签。
## IIIPA非线性在多跳MIMO中继系统中的作用
为了说明PA非线性的作用,我们对比线性PA和非线性PA的情况。
线性PA:假设每个中继的PA严格工作在线性区域,使得Xm=WmYm\{\{\\mathbf\{X\}\}\_\{m\}\}=\{\{\\mathbf\{W\}\}\_\{m\}\}\{\{\\mathbf\{Y\}\}\_\{m\}\},其中Wm∈CNm×Nm\{\{\\mathbf\{W\}\}\_\{m\}\}\\in\{\{\\mathbb\{C\}\}^\{\{N\_\{m\}\}\\times N\_\{m\}\}\}是线性放大矩阵。将其递归代入(4 (https://arxiv.org/html/2607.18354#S2.E4))得到
YM\+1=HM\+1WMHMWM−1⋯H1X0\+Neff,\\displaystyle\{\{\\mathbf\{Y\}\}\_\{M\+1\}\}=\{\{\\mathbf\{H\}\}\_\{M\+1\}\}\{\{\\mathbf\{W\}\}\_\{M\}\}\{\{\\mathbf\{H\}\}\_\{M\}\}\{\{\\mathbf\{W\}\}\_\{M\-1\}\}\\cdots\{\{\\mathbf\{H\}\}\_\{1\}\}\{\{\\mathbf\{X\}\}\_\{0\}\}\+\{\{\\mathbf\{N\}\}\_\{\{\\text\{eff\}\}\}\},\(7\)其中Neff\{\{\\mathbf\{N\}\}\_\{\{\\text\{eff\}\}\}\}聚合了每跳的噪声,并与X0\{\\bf X\}\_\{0\}独立。端到端映射X0→YM\+1\{\{\\mathbf\{X\}\}\_\{0\}\}\\to\{\{\\mathbf\{Y\}\}\_\{M\+1\}\}因此是线性的,并且对于任何MM退化为单个复合全连接层,这从根本上限制了WPNN的表达能力。基本上,相似文章
学习的中继表示用于前瞻性离散扩散模型
本文介绍了学习的中继表示(Relay),一种使掩码扩散模型能够在去噪步骤之间传播潜在信息的方法,克服了硬重置问题并改善了性能-延迟权衡。该方法在编码任务上优于标准的监督微调,同时将推理延迟降低高达32%。
构建机器智能的物理AI层
# MIT林肯实验室提出"原理驱动基础模型":无需微调即可跨域泛化 MIT林肯实验室的研究人员提出了一种名为**"原理驱动基础模型"(principle-driven foundation models)**的新范式。与传统方法不同,该范式将信号理论物理原理(傅里叶分解、能量守恒、对称性)直接编码到模型中,而非依靠从大量配对数据集中学习统计相关性。 ## 核心思路 传统基础模型的训练范式通常需要: - 海量标注数据 - 跨域配对样本 - 针对下游任务的微调 而该研究另辟蹊径——**仅使用RF(射频)数据进行训练**,并将傅里叶分解、能量守恒、对称性等物理原理内嵌于模型架构本身,使模型能够捕捉信号在本质层面的通用特征,而非特定域的统计规律。 ## 关键结果 该模型的冻结编码器(frozen encoder)仅有 **199万参数**,却在以下条件下取得了令人瞩目的成绩: - **跨越15项多样化任务**,涵盖音频、图像、文本和视频四大模态 - **无需对目标域进行任何微调** - **平均准确率达到77.7%** ## 为何值得关注 | 特性 | 传统基础模型 | 原理驱动基础模型 | |------|------------|----------------| | 训练数据来源 | 多模态大规模配对数据 | 仅RF数据 | | 参数规模 | 通常数十亿级 | 仅199万 | | 跨域泛化 | 依赖微调 | 零样本迁移 | | 泛化依据 | 统计相关性 | 物理原理 | ## 深层意义 这项研究表明,**物理原理本身可以作为一种强大的归纳偏置(inductive bias)**,使模型在极低参数量和数据量的条件下实现跨模态泛化。这对于数据稀缺、计算资源受限的应用场景尤为重要,同时也为"可解释AI"提供了一条新路径——模型的泛化能力来源于可解释的物理规律,而非黑箱式的统计拟合。 该工作挑战了"规模即能力"的主流叙事,暗示在某些场景下,**结构化的物理先验知识可能比堆砌数据和参数更为高效**。
PE-MHL:用于复杂系统可扩展学习的物理编码模块化混合层
本文提出PE-MHL,一种物理编码模块化混合层框架,通过数据驱动子模型逐步优化基于物理的模型,提供理论收敛保证,并在控制基准测试中优于单一网络。
具有可训练非线性连接的低功耗模拟神经网络用于连续控制
本文介绍了受Kolmogorov-Arnold网络启发的低功耗模拟神经网络,在连接上放置可训练的非线性函数,使其能够以远少于多层感知器的节点和连接高效执行连续控制任务,并在硬件上演示,预计功耗仅为微瓦级。
@AnimaAnandkumar: 神经算子 – 将流行神经网络转换为神经算子用于科学建模 扩展神经网…
本文提出了将流行神经网络架构(CNNs、GNNs、Transformers)转换为神经算子的原则性方法,这些神经算子学习无限维函数空间之间的映射,使得在不同离散化下进行科学建模时能够获得一致的预测。发表于《Nature Machine Intelligence》。