多时间尺度隐式动作深度强化学习在边缘-云网络中的联合优化

arXiv cs.LG 论文

摘要

提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架,用于分层边缘-云计算中的联合服务放置、计算委托和功率控制,实现高达20.8%的延迟降低和13%的资源利用率提升。

arXiv:2607.18288v1 公告类型:新 摘要:在动态任务到达和异构资源条件下,分层边缘-云计算(HECC)系统中边缘层和云层之间的负载不均衡会降低延迟性能,导致严重的排队延迟和资源利用率低下。为了解决这一挑战,我们研究了一个联合服务放置、计算委托和功率控制(JSCP)问题,以最小化平均端到端(e2e)延迟。由于离散变量和连续变量之间的强耦合,所得到的JSCP问题是一个混合整数非凸且NP-hard的优化问题。为了实现易于处理的优化和稳定的系统适应,我们利用决策动态中的固有差异,将问题分解为长期系统配置和短期资源分配子问题。基于此公式,我们提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架(2T-MDRL-LA),以联合优化服务放置、用户关联、计算委托、任务卸载和用户传输功率。引入了一种基于变分自编码器的隐式动作表示,以有效压缩高维组合动作空间。仿真结果表明,所提出的框架能够有效适应动态网络条件,并且与分支定界解决方案相比实现了接近最优的性能。与没有计算委托的方案相比,平均e2e延迟降低高达20.8%,资源利用率提升13%,同时收敛速度比传统近端策略优化快约50%。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:18

# 多时间尺度潜在动作深度强化学习用于边缘-云网络联合优化
来源:https://arxiv.org/abs/2607.18288
查看PDF (https://arxiv.org/pdf/2607.18288)

> 摘要:在动态任务到达和异构资源条件下,边缘层与云层之间的负载不均衡会降低分层边缘-云计算(HECC)系统的延迟性能,导致严重的排队延迟和低效的资源利用。为应对这一挑战,我们研究了联合服务放置、计算委派和功率控制(JSCP)问题,以最小化平均端到端(e2e)延迟。由于离散变量与连续变量之间的强耦合,JSCP问题是一个混合整数非凸且NP难的优化问题。为了实现可处理的优化和稳定的系统自适应,我们利用决策动态的内在差异,将问题分解为长期系统配置和短期资源分配子问题。基于这一公式,我们提出了一种具有潜在动作空间的双时间尺度多层深度强化学习框架(2T-MDRL-LA),以联合优化服务放置、用户关联、计算委派、任务卸载和用户发射功率。引入基于变分自编码器的潜在动作表示,有效压缩高维组合动作空间。仿真结果表明,所提框架能够有效适应动态网络条件,与分支定界解相比达到近乎最优的性能。与不含计算委派的方案相比,平均端到端延迟降低高达20.8%,资源利用率提升13%,且收敛速度比传统近端策略优化快约50%。

## 提交历史

来自:Van-Dinh Nguyen博士 [查看邮箱](https://arxiv.org/show-email/61b7ace9/2607.18288) **[v1]** 2026年6月30日星期二 11:56:15 UTC(2,739 KB)

相似文章

性能驱动的多时间尺度学习环境抽象

arXiv cs.LG

本文提出了一种用于强化学习的性能驱动的状态抽象方法,直接优化决策质量,采用多时间尺度框架共同调整策略和树状结构抽象。该算法基于Q值差异细化或聚合状态空间,相比基线实现了更好的样本效率和更快的重新规划。

动态潜路由

Hugging Face Daily Papers

动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。