内存与计算频率联合优化以实现能效DNN推理
摘要
本文提出了一种针对移动设备能效DNN推理的内存与计算频率联合优化方法,与其他方法相比,能耗可降低高达10.4%。
arXiv:2608.13863v1 公告类型:新
摘要:移动设备上的深度神经网络(DNN)推理由于计算和内存资源有限,常常导致高延迟和高能耗。为了实现能效DNN推理,大多数现有研究专注于动态电压频率调节(DVFS)来调整计算频率,而内存频率对推理性能的影响被大大忽视。在本文中,我们考虑了内存频率和计算频率对DNN推理时间的影响,并联合优化这两个频率以及通信资源,以实现能效DNN推理。基于一个实际的推理时间模型,我们制定了一个优化问题,旨在最小化所有移动设备在截止时间约束下的能耗。对于本地推理,我们通过凸优化推导出一个近优的闭式解;对于给定带宽的边缘推理,我们获得了传输功率的最优闭式解。此外,我们提出了一种低复杂度的启发式算法,以多项式时间复杂度有效地解决整体问题。基于实测数据的仿真结果表明,所提出的本地推理近优解在严格的截止时间约束下能够达到最优性能,与最优解相比,性能差距最多为2.5%。同时,我们提出的算法显著降低了设备能耗,与其他方法相比,能耗可降低高达10.4%。
查看缓存全文
缓存时间: 2026/08/17 09:55
# 能效DNN推理的内存与计算频率联合优化
来源:https://arxiv.org/html/2608.13863
韩云初1, 南兆军2, 周圣1, 牛志升1
Affiliation: 1清华大学电子工程系,北京国家信息科学与技术研究中心,中国北京 100084
Affiliation: 2重庆电子工程职业学院电子信息与物联网学院,中国重庆 401331
Affiliation: Emails: hyc23@mails\.tsinghua\.edu\.cn, nanzhaojun@cquet\.edu\.cn, \{sheng\.zhou@, niuzhs@\}tsinghua\.edu\.cn
###### 摘要
移动设备上的深度神经网络(DNN)推理常因计算和内存资源有限而面临高延迟和高能耗问题。为实现能效DNN推理,现有研究大多聚焦于动态电压频率调节(DVFS)以调整计算频率,而内存频率对推理性能的影响却在很大程度上被忽视。本文综合考虑内存频率和计算频率对DNN推理时间的影响,并联合优化这两种频率与通信资源以实现能效DNN推理。基于实际推理时间模型,我们在截止时限约束下构建了最小化所有移动设备能耗的优化问题。针对本地推理,我们通过凸优化推导出近似最优闭式解;针对边缘推理,在给定带宽下获得传输功率的最优闭式解。此外,我们提出了一种低复杂度启发式算法,可在多项式时间复杂度内有效求解整体问题。基于实测数据的仿真结果表明,所提出的本地推理近似最优解在严格截止时限约束下可达到最优性能,与最优解的性能差距不超过2.5%。同时,所提算法相比其他方法最高可降低设备能耗达10.4%。
## I 引言
深度神经网络(DNN)的快速发展极大推动了计算机视觉和人工智能应用的发展\[1 (https://arxiv.org/html/2608.13863#bib.bib1)\],\[2 (https://arxiv.org/html/2608.13863#bib.bib2)\]。然而,DNN推理对计算和内存访问的密集需求给能量和计算资源有限的移动设备带来了严峻挑战。为实现低延迟和高能效的DNN推理,移动边缘计算(MEC)\[3 (https://arxiv.org/html/2608.13863#bib.bib3)\]作为一种有前景的技术应运而生,它允许将计算任务从移动设备卸载到邻近的边缘服务器。此外,边缘智能\[4 (https://arxiv.org/html/2608.13863#bib.bib4)\]被提出作为新范式,能在无线网络边缘(如基站和路侧单元)实现实时智能服务。但移动设备仍需高效管理其本地计算和内存资源,以平衡推理延迟与能耗。
为解决此问题,动态电压频率调节(DVFS)\[5 (https://arxiv.org/html/2608.13863#bib.bib5)\],\[6 (https://arxiv.org/html/2608.13863#bib.bib6)\]技术已被广泛研究,通过动态调整处理器工作频率来实现延迟与能耗的权衡。现有基于DVFS的方法主要关注调整计算频率(如CPU频率、GPU频率)以降低延迟或能耗。例如,文献\[7 (https://arxiv.org/html/2608.13863#bib.bib7)\]设计了鲁棒DNN分割与资源分配算法以处理不确定推理时间,其中采用DVFS调整本地推理的计算频率。此外,DVFS可与批处理技术结合以降低能耗\[8 (https://arxiv.org/html/2608.13863#bib.bib8)\]或提高吞吐量\[9 (https://arxiv.org/html/2608.13863#bib.bib9)\]。
引用自标题
图\. 1:内存频率缩放对Jetson TX1上ResNet152和VGG19的DNN推理时间与能耗的影响。
然而,近期研究揭示,内存频率缩放对DNN推理的整体延迟、能耗和精度特性也起着关键作用,尤其对于内存密集型DNN模型\[10 (https://arxiv.org/html/2608.13863#bib.bib10)\],\[11 (https://arxiv.org/html/2608.13863#bib.bib11)\],\[12 (https://arxiv.org/html/2608.13863#bib.bib12)\],\[13 (https://arxiv.org/html/2608.13863#bib.bib13)\]。文献\[10 (https://arxiv.org/html/2608.13863#bib.bib10)\]对边缘设备联合内存频率与计算频率缩放对DNN推理时间的影响进行了表征和分析。文献\[11 (https://arxiv.org/html/2608.13863#bib.bib11)\]分别研究了内存频率与计算频率对DNN推理能效的影响,并提出了一种强化学习算法来优化这些频率。文献\[12 (https://arxiv.org/html/2608.13863#bib.bib12)\]的作者主要分析了内存频率与计算频率对内核级应用的影响。文献\[13 (https://arxiv.org/html/2608.13863#bib.bib13)\]阐述了内存电压缩放对边缘设备DNN精度与鲁棒性的影响。为进一步研究内存频率缩放对DNN推理延迟和能耗的影响,我们在Jetson TX1上部署了ResNet152\[14 (https://arxiv.org/html/2608.13863#bib.bib14)\]和VGG19\[15 (https://arxiv.org/html/2608.13863#bib.bib15)\]以评估相应性能,结果如图1 (https://arxiv.org/html/2608.13863#S1.F1)所示。观察发现,当内存频率从0.1GHz提升至1.6GHz时,ResNet152和VGG19的平均推理时间分别降低了84%和93%。同时,仅调整内存频率即可实现平均能耗80%和92%的降低。因此,内存频率缩放同样能显著影响推理时间和能耗。尽管存在这些潜力,针对能效DNN推理的内存频率与计算频率联合优化尚未得到充分研究。
本文考虑一种边缘智能系统,通过联合优化内存频率、计算频率和通信资源来降低移动设备的能耗。具体而言,我们在某些特定情况下推导出本地推理问题的最优解。此外,我们分析了该问题的上界并推导出近似最优闭式解。同时,边缘推理问题的分析提供了给定带宽下传输功率的最优闭式解,并提出了一种启发式算法以高效求解整体优化问题。仿真结果表明,所提出的近似最优解在本地推理中性能与最优解的差距在2.5%以内,且相比其他方法最高可降低能耗达10.4%,验证了所提方法的有效性。
## II 系统概述
### II\-A 系统模型
如图2 (https://arxiv.org/html/2608.13863#S2.F2)所示,我们考虑一个由\(N\)个移动设备和一个边缘服务器组成的边缘智能系统。所有移动设备的集合表示为\(\mathcal{N} \triangleq \{1,2,\dots,N\}\)。采用正交频分多址(OFDMA)技术以减少移动设备间的干扰,并假设分配给各设备的带宽不重叠。每个设备需要在给定期限\(D_n\)内执行DNN推理任务。本文考虑二进制卸载模式(即\(x_n \in \{0,1\}\)),其中移动设备\(n\)可执行本地推理(即\(x_n=1\))或通过卸载推理任务进行边缘推理(即\(x_n=0\))。对于本地推理,移动设备可在截止时限约束下调整内存频率和计算频率以节省DNN推理的能耗。对于边缘推理,移动设备可通过调整传输功率来改善传输能耗,同时满足通信延迟约束。由于MEC服务器的强大计算能力,边缘推理时间可忽略不计,且因MEC服务器通常由电网供电,本文忽略其能耗\[16 (https://arxiv.org/html/2608.13863#bib.bib16)\]。此外,由于推理结果数据量小,其下载延迟也被忽略\[17 (https://arxiv.org/html/2608.13863#bib.bib17)\]。
引用自标题
图\. 2:联合优化内存与计算频率、传输功率和带宽的边缘智能系统示意图。
### II\-B 推理时间与能耗模型
我们通过真实实验获取不同内存频率与计算频率组合下的平均推理时间\[10 (https://arxiv.org/html/2608.13863#bib.bib10)\],内存频率\(f_{n,\mathrm{mem}}\)和计算频率\(f_{n,\mathrm{com}}\)对DNN推理时间的影响建模为:
\[ t_n^{\mathrm{loc}} = a_n f_{n,\mathrm{mem}}^{-b_n} + c_n f_{n,\mathrm{com}}^{-d_n}, \forall n \in \mathcal{N}, \tag{1} \]
CMOS电路的动态功耗表示为\(P = \alpha C V^2 f\),其中\(\alpha\)、\(C\)、\(V\)和\(f\)分别表示活动因子、电容、供电电压和频率\[18 (https://arxiv.org/html/2608.13863#bib.bib18)\]。由于功耗包括内存和计算功耗\[19 (https://arxiv.org/html/2608.13863#bib.bib19)\],移动设备\(n\)执行推理的功耗写为:
\[ p_n^{\mathrm{loc}} = \kappa_{n,\rm{mem}} f_{n,\rm{mem}}^{3} + \kappa_{n,\rm{com}} f_{n,\rm{com}}^{3} + \sigma_{n}, \forall n \in \mathcal{N}, \tag{2} \]
其中细节详见文献\[10 (https://arxiv.org/html/2608.13863#bib.bib10)\]。因此,移动设备\(n\)执行推理的能耗为:
\[ e_n^{\mathrm{loc}} = p_n^{\mathrm{loc}} t_n^{\mathrm{loc}}, \forall n \in \mathcal{N}. \tag{3} \]
### II\-C 传输时间与能耗模型
移动设备\(n\)的传输速率可写为:
\[ r_n = B_n \log_2 \left(1 + \frac{p_n h_n}{\sigma^2}\right), \forall n \in \mathcal{N}, \tag{4} \]
其中\(B_n\)、\(p_n\)、\(h_n\)和\(\sigma^2\)分别表示分配带宽、传输功率、信道增益和噪声功率。移动设备\(n\)任务卸载的传输延迟可写为:
\[ t_n^{\mathrm{tran}} = \frac{s_n}{r_n}, \forall n \in \mathcal{N}, \tag{5} \]
其中\(s_n\)为计算任务的数据量。相应的传输能耗为:
\[ e_n^{\mathrm{tran}} = p_n t_n^{\mathrm{tran}}, \forall n \in \mathcal{N}. \tag{6} \]
## III 问题建模与求解
本文旨在通过优化二进制卸载决策\(x_n\)、传输功率\(p_n\)、带宽\(B_n\)、内存频率\(f_{n,\mathrm{mem}}\)和计算频率\(f_{n,\mathrm{com}}\),最小化所有移动设备的能耗总和,同时需满足截止时限约束。优化问题可表述为:
\[ \textbf{P1:} \min_{\{x_{n},p_{n},B_{n},f_{n,\mathrm{mem}},f_{n,\mathrm{com}}\}} \sum_{n\in\mathcal{N}} \left( x_{n}e_{n}^{\mathrm{loc}} + \left(1-x_{n}\right)e_{n}^{\mathrm{tran}} \right) \tag{7a} \]
\[ \text{s.t.} \ x_{n}t_{n}^{\mathrm{loc}} + \left(1-x_{n}\right)t_{n}^{\mathrm{tran}} \leq D_{n}, \forall n\in\mathcal{N}, \tag{7b} \]
\[ \quad \ \ f_{n,\min} \leq f_{n,\mathrm{mem}} \leq f_{n,\max}, \forall n\in\mathcal{N}, \tag{7c} \]
\[ \quad \ \ F_{n,\min} \leq f_{n,\mathrm{com}} \leq F_{n,\max}, \forall n\in\mathcal{N}, \tag{7d} \]
\[ \quad \ \ p_{n,\min} \leq p_{n} \leq p_{n,\max}, \forall n\in\mathcal{N}, \tag{7e} \]
\[ \quad \ \ x_{n} \in \{0,1\}, \forall n\in\mathcal{N}, \tag{7f} \]
\[ \quad \ \ \sum_{n\in\mathcal{N}} x_{n}B_{n} \leq B, \tag{7g} \]
\[ \quad \ \ B_{n} \geq 0, \forall n\in\mathcal{N}, \tag{7h} \]
其中(7b)为截止时限约束,(7c)为内存频率约束,(7d)为计算频率约束,(7e)为传输功率约束,(7f)为二进制卸载决策约束,(7g)和(7h)分别表示带宽约束。由于变量\(x_n\)为二进制且在目标函数中耦合,问题P1是一个混合整数非线性规划(MINLP)问题。为简化问题P1,我们首先关注单用户场景。在特定条件下求解最优解,而对于更一般情况则推导近似最优闭式解。此外,对于边缘推理,我们在给定带宽下推导出传输功率的最优闭式解。最后,我们提出一种启发式算法求解问题P1,通过贪心搜索可能执行边缘推理的设备。详细分析和求解如下。
首先考虑问题P1的一个特殊单用户情形,相应问题表述为:
\[ \textbf{P2:} \min_{\{x_{n},p_{n},B_{n},f_{n,\mathrm{mem}},f_{n,\mathrm{com}}\}} x_{n}e_{n}^{\mathrm{loc}} + \left(1-x_{n}\right)e_{n}^{\mathrm{tran}} \tag{8a} \]
\[ \text{s.t.} \ x_{n}t_{n}^{\mathrm{loc}} + \left(1-x_{n}\right)t_{n}^{\mathrm{tran}} \leq D_{n}, \forall n\in\mathcal{N}, \tag{8b} \]
\[ \quad \ \ f_{n,\min} \leq f_{n,\mathrm{mem}} \leq f_{n,\max}, \forall n\in\mathcal{N}, \tag{8c} \]
\[ \quad \ \ F_{n,\min} \leq f_{n,\mathrm{com}} \leq F_{n,\max}, \forall n\in\mathcal{N}, \tag{8d} \]
\[ \quad \ \ p_{n,\min} \leq p_{n} \leq p_{n,\max}, \forall n\in\mathcal{N}, \tag{8e} \]
\[ \quad \ \ x_{n} \in \{0,1\}, \forall n\in\mathcal{N}, \tag{8f} \]
\[ \quad \ \ 0 \leq B_{n} \leq B, \tag{8g} \]相似文章
利用移动NPU的高效端侧扩散大语言模型推理
本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。
Quant.npu:通过全静态量化实现端侧大语言模型的高效移动NPU推理
Quant.npu 提出了一种面向移动 NPU 的全静态量化框架,利用可学习参数和旋转矩阵,无需运行时重新计算即可实现高效的低比特大语言模型推理,延迟最高降低 15.1%。
移动NPU上的能效型端侧RAG:Snapdragon X Elite系统设计与基准测试
本文介绍了首个完全运行在移动NPU(Snapdragon X Elite上的Qualcomm Hexagon)上的端到端RAG流水线,相比CPU实现了高达18倍的LLM预填充加速和4倍的能耗降低,且无质量退化。
[论文] 面向消费级设备混合CPU-GPU LLM推理的自动化张量调度
本文提出了一种面向消费级设备混合CPU-GPU LLM推理的自动化张量调度方法。
文献综述:边缘端LLM推理:持续负载下移动设备、NPU和GPU的性能效率权衡 | 手机上LLM的Bnechmarking [R]
本文献综述分析了持续负载下移动设备、NPU和GPU上LLM推理的性能效率权衡,重点关注手机上LLM的基准测试。