多时间尺度隐式动作深度强化学习在边缘-云网络中的联合优化
摘要
提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架,用于分层边缘-云计算中的联合服务放置、计算委托和功率控制,实现高达20.8%的延迟降低和13%的资源利用率提升。
arXiv:2607.18288v1 公告类型:新
摘要:在动态任务到达和异构资源条件下,分层边缘-云计算(HECC)系统中边缘层和云层之间的负载不均衡会降低延迟性能,导致严重的排队延迟和资源利用率低下。为了解决这一挑战,我们研究了一个联合服务放置、计算委托和功率控制(JSCP)问题,以最小化平均端到端(e2e)延迟。由于离散变量和连续变量之间的强耦合,所得到的JSCP问题是一个混合整数非凸且NP-hard的优化问题。为了实现易于处理的优化和稳定的系统适应,我们利用决策动态中的固有差异,将问题分解为长期系统配置和短期资源分配子问题。基于此公式,我们提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架(2T-MDRL-LA),以联合优化服务放置、用户关联、计算委托、任务卸载和用户传输功率。引入了一种基于变分自编码器的隐式动作表示,以有效压缩高维组合动作空间。仿真结果表明,所提出的框架能够有效适应动态网络条件,并且与分支定界解决方案相比实现了接近最优的性能。与没有计算委托的方案相比,平均e2e延迟降低高达20.8%,资源利用率提升13%,同时收敛速度比传统近端策略优化快约50%。
查看缓存全文
缓存时间: 2026/07/22 08:18
# 多时间尺度潜在动作深度强化学习用于边缘-云网络联合优化 来源:https://arxiv.org/abs/2607.18288 查看PDF (https://arxiv.org/pdf/2607.18288) > 摘要:在动态任务到达和异构资源条件下,边缘层与云层之间的负载不均衡会降低分层边缘-云计算(HECC)系统的延迟性能,导致严重的排队延迟和低效的资源利用。为应对这一挑战,我们研究了联合服务放置、计算委派和功率控制(JSCP)问题,以最小化平均端到端(e2e)延迟。由于离散变量与连续变量之间的强耦合,JSCP问题是一个混合整数非凸且NP难的优化问题。为了实现可处理的优化和稳定的系统自适应,我们利用决策动态的内在差异,将问题分解为长期系统配置和短期资源分配子问题。基于这一公式,我们提出了一种具有潜在动作空间的双时间尺度多层深度强化学习框架(2T-MDRL-LA),以联合优化服务放置、用户关联、计算委派、任务卸载和用户发射功率。引入基于变分自编码器的潜在动作表示,有效压缩高维组合动作空间。仿真结果表明,所提框架能够有效适应动态网络条件,与分支定界解相比达到近乎最优的性能。与不含计算委派的方案相比,平均端到端延迟降低高达20.8%,资源利用率提升13%,且收敛速度比传统近端策略优化快约50%。 ## 提交历史 来自:Van-Dinh Nguyen博士 [查看邮箱](https://arxiv.org/show-email/61b7ace9/2607.18288) **[v1]** 2026年6月30日星期二 11:56:15 UTC(2,739 KB)
相似文章
性能驱动的多时间尺度学习环境抽象
本文提出了一种用于强化学习的性能驱动的状态抽象方法,直接优化决策质量,采用多时间尺度框架共同调整策略和树状结构抽象。该算法基于Q值差异细化或聚合状态空间,相比基线实现了更好的样本效率和更快的重新规划。
投影潜在强化学习动作:迈向通用的、可扩展的图组合优化
本文介绍了用于图组合优化的投影智能体,采用强化学习和图神经网络,在连续动作嵌入空间中运行,以提升泛化能力和可扩展性,并发布了LaGCO-RL库。
SCALE:面向智能体工作流调度的可扩展交叉注意力学习与外推方法
本文提出SCALE,一种面向智能体LLM工作流DAG的深度强化学习调度器,通过交叉注意力与结构化表示正则化,泛化至未见过的集群规模,无需重新训练即可降低响应时间。
动态潜路由
动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。
STARIXNet:面向云平台实时资源分配的多变量多属性深度学习方法
STARIXNet是一种轻量级神经网络,通过捕获系统指标之间的多变量时空关系来改进云资源分配,优先考虑服务稳定性而非预测准确性。在沃尔玛部署后,它在保持服务可靠性的同时实现了10%-50%的成本节约。