深度强化学习用于自主订单拣选机器人的动态电池管理

arXiv cs.LG 论文

摘要

本文提出了一种基于近端策略优化(PPO)的深度强化学习框架,用于仓库中自主移动机器人的动态电池充电,与基线方法相比,最高可实现6%的订单完成率提升。

arXiv:2607.05683v1 公告类型:新 摘要:仓库中自主移动机器人(AMR)的电池充电是一项关键运营挑战,严重影响订单处理时间和吞吐量。本研究针对随机订单到达下的动态AMR充电问题,机器人需学习最优充电决策。传统的固定规则启发式方法在动态环境中常显次优,且未能考虑多机器人协调,导致资源严重低效。为克服这些局限,我们提出了一种基于近端策略优化(PPO)的深度强化学习(DRL)框架,专为具有固定充电站的多区域仓库设计。该模型动态学习两个关键决策:充电站选择和最优充电时长,并明确考虑充电站的预期排队时间。大量数值实验将所提模型与最先进的DRL和传统启发式方法进行了对比。结果表明,与最强基线相比,我们的PPO框架将订单完成率提高了高达6%,同时显著减少了充电操作的总时间。此外,我们验证了模型在不同仓库配置和随机到达率下的鲁棒性。最后,我们解读了学习到的DRL策略,为其超越标准基准的优越性提供了有价值的运营洞察。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:44

# 面向自主拣货员动态电池管理的深度强化学习 来源: https://arxiv.org/html/2607.05683 Taniya Shaji · Abhay Sobhanan (通讯作者,电子邮箱:[email protected],印度管理学院班加罗尔分校,班加罗尔 Bannerghatta 路 560076,卡纳塔克邦,印度) · Christof Defryn (安特卫普大学,Prinsstraat 13,安特卫普 2000,比利时)

###### 摘要

仓库中自主移动机器人 (AMR) 的电池充电是一个关键的运营挑战,会严重影响订单处理时间和吞吐量。在本研究中,我们针对订单到达随机的情况下动态 AMR 充电问题,要求机器人学习最优充电决策。传统的固定规则启发式方法在动态环境中往往表现次优,且未能考虑多 AMR 协调,导致严重的资源低效。为克服这些局限,我们提出一种基于近端策略优化 (PPO) 的深度强化学习 (DRL) 框架,适用于带有固定充电站的多区块仓库。我们的模型动态学习两个关键决策:充电站选择与最优充电时长,并显式考虑充电站的预期排队时间。大量数值实验将所提模型与最先进的 DRL 和传统启发式方法进行基准比较。结果表明,与最强基线相比,我们的 PPO 框架将订单完成率提升高达 6%,同时显著减少了充电操作的总耗时。此外,我们在不同仓库配置和随机到达率下验证了模型的鲁棒性。最后,我们解释了所学的 DRL 策略,并提供了关于其优于标准基准的有价值运营见解。

关键词:仓库物流,深度强化学习,电池充电,自主移动机器人,机器学习

## 1 引言

现代配送中心越来越多地依赖自主移动机器人 (AMR) 来自动化内部物流操作,如库存的存储、检索和运输。为了在这些结构化仓库环境中保持高吞吐量,集中式规划软件为这些机器人分配任务,必须在严格的时间、能量和能力约束下高效执行。这些运营的规模正在迅速扩大;例如,在 2025 年,亚马逊部署了其第 100 万个机器人单元 (Dresser, 2025 (https://arxiv.org/html/2607.05683#bib.bib1))。其型号如 Titan 和 Proteus 在仓库地板上导航,从特定存储位置检索订单并将其运输到指定的卸货点,全部由集中式控制系统严格协调 (Greenawalt, 2025 (https://arxiv.org/html/2607.05683#bib.bib2))。这些 AMR 的持续运行根本上受限于其有限的电池容量。为了维持电力,机器人必须定期中断其分配的任务,前往固定的、通常是感应式或无线充电站 (Wiferion, (https://arxiv.org/html/2607.05683#bib.bib3))。商用锂铁磷酸电池需要较长的停机时间。例如,它们平均需要 2.7 小时才能充满电 (McNulty 等, 2022 (https://arxiv.org/html/2607.05683#bib.bib30)),而现代型号如 KUKA 的 KMP 1500P 从 20% 充到 80% 大约需要一小时 (KUKA AG, (https://arxiv.org/html/2607.05683#bib.bib31))。因此,充电协议对仓库效率有至关重要的影响。在拥有多台 AMR 且充电基础设施有限的密集仓库环境中,这形成了一个复杂的资源分配问题。没有协调的调度,多台机器人可能同时寻求充电,导致严重的瓶颈、排队延迟以及充电站利用不均衡,最终降低整个系统的吞吐量。在订单随机到达的动态环境中,充电问题的复杂性进一步加剧。在典型的区域路由设置中,单个 AMR 被分配到特定的仓库区块,并必须在存储通道、中央仓库和周边充电站之间导航,决策具有高度相互依赖性。AMR 必须持续评估订单选择、返回仓库的时机及其当前电量状态,同时考虑充电站的实时可用性和预期的未来需求。传统上,行业实践依赖于简单的基于规则的启发式方法,例如仅在电池低于固定阈值时才引导机器人充电。然而,这些短视的方法未能考虑订单到达的随机性和充电站的实时拥堵,导致车队协调欠佳。

为了解决这些局限性,我们提出了一个深度强化学习 (DRL) 框架,使 AMR 能够做出动态、环境感知的决策。DRL 非常适合此任务,因为它能有效管理高维状态空间,并将复杂的实时输入直接映射到高效策略 (Mnih 等, 2015 (https://arxiv.org/html/2607.05683#bib.bib4); Panzer and Bender, 2022 (https://arxiv.org/html/2607.05683#bib.bib5))。通过捕捉仓库的底层动态,我们的模型使机器人能够在智能平衡电池电量和充电队列的同时,最大化订单完成率。

本研究的主要贡献如下:
- • 我们开发了一个利用近端策略优化 (PPO) 的多智能体 DRL 框架,以联合优化多区块仓库中 AMR 的路由和充电操作,该仓库配备固定充电基础设施。
- • 我们设计了一个全面的用于充电决策的动作空间,规定了三个关键组成部分:何时开始充电、使用哪个充电站以及充电多长时间。
- • 我们引入了一个动态卸货决策模型,允许 AMR 学习何时将拣选好的订单返回仓库,从而最小化不必要的行驶时间。
- • 我们显式建模了订单的随机到达和充电站的排队动态,产生了一个协调策略,以最小化整体运营时间和因过度充电或等待而浪费的非生产时间。

为了验证我们的方法,我们将所提出的 DRL 模型与传统启发式方法以及替代 DRL 基线进行基准比较,基于订单完成率评估性能。

本文的其余部分组织如下。第 2 节回顾相关文献,讨论不同 DRL 技术用于改进仓库操作的领域,并确定研究差距。在第 3 节中,我们描述问题、环境、实验设置、假设和参数。在第 4 节中,我们将问题表述为马尔可夫决策过程 (MDP) 形式,该形式将用于构建 DRL 框架。在第 5 节中,解释了用于 DRL 模型的方法论和算法工作原理。在第 6 节中,我们讨论 DRL 训练结果、所学策略,并与其他算法进行评估。在第 7 节中,我们进行了额外的敏感性分析,以进一步评估模型的鲁棒性。

## 2 文献综述

基于强化学习 (RL) 的方法在仓库运营中获得了越来越多的关注,因为它们使智能体能够做出实时决策,并通过与环境交互持续改进性能。Kuhnle 等 (2019 (https://arxiv.org/html/2607.05683#bib.bib37)) 讨论了一种在订单调度任务中实现 RL 算法的系统方法。超越传统制造设置的最新进展,如云制造,得益于部署 DRL 技术进行调度任务 (Dong 等, 2020 (https://arxiv.org/html/2607.05683#bib.bib23))。在本节中,我们讨论了一些使用 DRL 进行仓库运营的现有文献。对于电池充电操作,我们额外讨论了传统算法方法以及 DRL 框架。

### 2.1 智能体路由与订单拣选

Mahmoudinazlou 等 (2025 (https://arxiv.org/html/2607.05683#bib.bib11)) 解决了动态订单拣选问题,其中订单到达是随机的,高效拣货员路由至关重要,他们提出了一个 DRL 框架来动态优化单区块仓库的拣货员路线。类似地,Cals 等 (2021 (https://arxiv.org/html/2607.05683#bib.bib19)) 提出了一个基于 PPO 的订单分批和拣选框架,减少了延迟订单的数量,而 Beeks 等 (2022 (https://arxiv.org/html/2607.05683#bib.bib32)) 增加了一个额外的目标来最小化拣选成本。在一项相关的路径规划研究中,Bai 等 (2024 (https://arxiv.org/html/2607.05683#bib.bib43)) 开发了一个改进的双深度 Q 网络 (DDQN) 模型,以在未知环境中生成更安全、更短的全局路径。为了应对动态环境的复杂性,几项研究将先进的神经架构与 DRL 集成。Xiao 等 (2024 (https://arxiv.org/html/2607.05683#bib.bib47)) 将图神经网络 (GNN) 与 PPO 集成,以促进多智能体协同导航系统。类似地,使用亚马逊的 Kiva 系统仓库布局,Shen 等 (2021 (https://arxiv.org/html/2607.05683#bib.bib22)) 提出了一种多智能体异步优势行动者-评论家算法,并结合注意力机制进行路径规划,而 Li 等 (2019 (https://arxiv.org/html/2607.05683#bib.bib27)) 提出了一种基于 DQN 的调度算法,在最小化行驶时间的同时减轻车辆交通。此外,Yang 等 (2020 (https://arxiv.org/html/2607.05683#bib.bib35)) 将无碰撞路径的先验知识与 DQN 框架相结合,以解决多机器人仓库中的慢收敛和过度随机性问题。对于层次化任务分配,Pal 等 (2025 (https://arxiv.org/html/2607.05683#bib.bib16)) 采用 PPO 框架训练两个智能体:一个规划器从队列中选择任务,一个执行器根据机器人当前状态分配最合适的机器人,从而最小化操作时间和执行延迟。

### 2.2 供应链库存管理

DRL 也被应用于库存管理问题,其中基于学习的方法在不确定需求下优化存储、补货和生产决策。为了解决存储分配问题,Teck 等 (2025 (https://arxiv.org/html/2607.05683#bib.bib45)) 采用 PPO 动态重新定位快速消费品的存储货架,减少了补货站的周期时间和拥堵,而 He 等 (2023 (https://arxiv.org/html/2607.05683#bib.bib56)) 应用 DRL 从密集的拼图式存储系统中检索请求的订单。针对库存补货和需求预测问题,Tian 等 (2024 (https://arxiv.org/html/2607.05683#bib.bib57)) 将 DRL 与门控循环单元和多头注意力相结合,以从历史观察中捕捉需求的季节性和趋势。类似地,Chien 等 (2020 (https://arxiv.org/html/2607.05683#bib.bib44)) 采用 DQN 模型动态选择最优的需求预测模型。此外,在确定订单数量方面,Stranieri 等 (2024 (https://arxiv.org/html/2607.05683#bib.bib46)) 表明 PPO 在确定生产和运输的产品数量方面优于其他 DRL 算法。尽管这些研究解决了与库存相关的优化问题,但它们并未考虑在共享充电约束下运行的 AMR 的电池充电决策。

### 2.3 电池充电

移动机器人最优充电调度在之前的文献中已有研究,尽管大多数现有工作仅部分与多区块仓库环境的复杂性相符,并且许多依赖于前往机器人处的移动充电器 (Drenner 等, 2009 (https://arxiv.org/html/2607.05683#bib.bib6))。Carli 等 (2020 (https://arxiv.org/html/2607.05683#bib.bib8)) 采用整数规划框架学习电池充电调度,而 Fu 等 (2021 (https://arxiv.org/html/2607.05683#bib.bib7)) 使用移动充电器服务低电量机器人,最小化其相遇时间。在一个机器人自主性较低的大体静态环境中,Zou 等 (2018 (https://arxiv.org/html/2607.05683#bib.bib9)) 比较了电池恢复策略:插入式电池充电、感应式电池充电和电池更换,而 Tomy 等 (2020 (https://arxiv.org/html/2607.05683#bib.bib10)) 将充电决策构建为多目标决策问题,最小化电池使用成本并最大化任务完成奖励。

#### 2.3.1 深度强化学习用于电池充电

专注于充电时长,Bischoff 等 (2026 (https://arxiv.org/html/2607.05683#bib.bib12)) 提出了一个 PPO 模型,该模型决定智能体在最近的充电站充电的离散电池电平,而 Lin 等 (2023 (https://arxiv.org/html/2607.05683#bib.bib13)) 采用 SARSA 算法确定充电调度。关注智能体行为的研究显示,Zellner 等 (2023 (https://arxiv.org/html/2607.05683#bib.bib15)) 采用 DQN 框架最大化区域覆盖,同时最小化智能体的电池约束违反次数,并且 Deng 等 (2020 (https://arxiv.org/html/2607.05683#bib.bib14)) 开发了一个框架,选择需要充电的最低电量的智能体数量,以及智能体停止充电的上限。在一项相关研究中,Zhang 等 (2023 (https://arxiv.org/html/2607.05683#bib.bib34)) 使用决斗深度双 Q 网络将车辆调度和电池更换决策建模为双目标优化问题,而 Yoshida 等 (2021 (https://arxiv.org/html/2607.05683#bib.bib29)) 学习电动铁路列车中的充电决策以改善功率利用。

### 2.4 研究差距

所回顾的文献突出了 DRL 在仓库优化中的应用,特别是在路由、订单拣选和库存管理方面。然而,在充电资源由多个 AMR 共享的环境中,AMR 的充电决策仍然相对未充分探索。现有方法通常未能联合考虑充电站选择、超越固定规则的充电时长、充电站拥堵以及动态任务执行。为解决这些局限性,本研究提出了一个新颖的 DRL 框架,旨在最大化订单完成率。在该框架中,在多区块仓库中运行的 AMR 在连续电池消耗、实时订单到达和共享充电基础设施的导航过程中,动态学习最优充电策略。

## 3 问题描述

在本节中,我们制定一个定制的仓库环境来训练和评估所提出的 DRL 模型。物理设施被离散化为一个坐标网格,以便于精确的空间跟踪 AMR。此后,我们将 AMR 简称为“智能体”。考虑图 1 (https://arxiv.org/html/2607.05683#S3.F1) 所示的仓库布局。仓库由 N 个不同的矩形区块组成,每个区块由一个智能体专门服务。客户订单以速率为 μ 订单/秒的泊松过程动态到达。到达后,每个订单立即分配给负责相应区块的智能体。设施包括一个位于左下角的仓库用于订单卸货,以及 M 个固定充电站均匀分布在上边界和下边界,其中 N > M。此外,每个智能体有一个固定的

相似文章

面向仓库SLAM吞吐量控制的离线强化学习

arXiv cs.LG

本文提出了一种离线强化学习框架,用于优化仓库履约环境中的SLAM吞吐量控制,在吞吐量最大化与下游稳定性之间取得平衡。该方法与算法无关,并证明CQL策略将系统健康状况提升了22.97%,并将限流持续时间减少了3.18%。

AI系统学会让仓库机器人交通顺畅运行

MIT News — Artificial Intelligence

来自MIT和Symbotic的研究人员开发了一种深度强化学习系统,用于优化自主仓库中的机器人交通。该系统通过动态优先调度机器人来避免拥堵,实现了比现有方法高出25%的吞吐量提升。