OR-Transformer:将实时决策扩展到1,000个物品
摘要
该论文介绍了OR-Transformer,一种基于置换等变Transformer架构的深度强化学习框架,用于供应链中的联合补货,可扩展到超过1,000个物品,在优于基线方法的同时将决策时间减少数百万倍。
arXiv:2609.01933v1 公告类型:新
摘要:现代供应链运营可能需要协调数千个异质物品的补货,这些物品具有相关随机需求、异质提前期和共享固定订购成本,导致观察空间超过$10^4$维。在此规模下,滚动时域随机混合整数线性规划(MILPs)变得极其缓慢,而标准强化学习(RL)方法在高维动作空间中面临日益具有挑战性的信用分配问题。我们介绍了OR-Transformer,一种用于随机需求下联合补货的深度强化学习框架,采用物品置换等变Transformer架构,并通过库存动态进行路径梯度训练。在问题规模高达1,024个库存物品的情况下,随着规模的增长,OR-Transformer越来越优于基于学习的和滚动时域MILP基线方法。它还相对于MILP求解器将在线决策时间减少超过400万倍,使得在供应链运营中实现实时、大规模深度RL成为可能。
查看缓存全文
缓存时间: 2026/09/03 06:12
# OR-Transformer:将实时决策能力扩展至1,000个物品
来源:https://arxiv.org/html/2609.01933
作者:Shuze Daniel Liu(麻省理工学院),David Simchi-Levi(普渡大学),Claire Chen(加州理工学院),Chutong Gao(麻省理工学院/普渡大学),Shangtong Zhang(弗吉尼亚大学)
###### 摘要
现代供应链运营可能需要在相关随机需求、异构提前期和共享固定订购成本下,协调数千个异构物品的补货,其观测空间超过 \(10^{4}\) 维。在此规模下,滚动时域随机混合整数线性规划(MILPs)变得异常缓慢,而标准强化学习(RL)方法在高维动作空间中面临日益严峻的信用分配挑战。我们提出 OR-Transformer,一个用于随机需求下联合补货的深度强化学习框架,其采用物品置换等变 Transformer 架构,并通过库存动态进行路径梯度训练。在问题规模高达 1,024 个库存物品的测试中,OR-Transformer 随着规模增长,其性能越来越优于基于学习的方法和滚动时域 MILP 基线。与 MILP 求解器相比,它还将在线决策时间缩短了超过 400 万倍,使得供应链运营中实时的大规模深度强化学习成为可能。
## 1 引言
库存管理是零售和供应链运营中的一个基本决策问题,涉及何时下订单以及随时间订购每种物品的数量。这些决策的经济影响可能非常显著。例如,IHL 集团估计,缺货和库存过剩每年给零售商造成约 1.7 万亿美元的损失,约占全球零售额的 6.2%【13 (https://arxiv.org/html/2609.01933#bib.bib26)】。
在大型零售商中,补货决策通常需要跨多个产品进行协调。例如,【17 (https://arxiv.org/html/2609.01933#bib.bib24)】报告称,沃尔玛和永辉等大型连锁超市采用联合补货策略来降低运输成本。在此类情境中,共享的固定订购成本将各产品的决策联系起来:每次联合订购都会产生该成本,决策者必须决定包含哪些产品以及订购多少数量。这种耦合产生了*联合补货问题*(JRP),这是运筹学(OR)中的一个经典问题【9 (https://arxiv.org/html/2609.01933#bib.bib25), 14 (https://arxiv.org/html/2609.01933#bib.bib23)】。
扩大随机联合补货的规模对优化和学习都具有挑战性。当物品超过 1,000 个【36 (https://arxiv.org/html/2609.01933#bib.bib34)】时,在我们的设定中,观测空间和动作空间分别超过 \(10^{4}\) 和 \(10^{3}\) 维,使得滚动时域随机 MILPs 异常缓慢【34 (https://arxiv.org/html/2609.01933#bib.bib29), 2 (https://arxiv.org/html/2609.01933#bib.bib35)】,而 RL 信用分配也日益困难。异构的提前期和相关需求引入了时间和物品间的额外依赖关系【27 (https://arxiv.org/html/2609.01933#bib.bib32), 8 (https://arxiv.org/html/2609.01933#bib.bib30)】。此外,共享固定订购成本在零订购和任何正订购之间造成了不连续性,这对标准的连续动作 RL 方法构成了挑战【30 (https://arxiv.org/html/2609.01933#bib.bib21), 11 (https://arxiv.org/html/2609.01933#bib.bib22), 1 (https://arxiv.org/html/2609.01933#bib.bib20)】。
先前的工作研究了基于学习的联合补货、可微库存控制以及基于 Transformer 的库存策略,但现有方法要么忽略了此处考虑的共享固定成本耦合,要么在小得多的动作维度上进行研究【31 (https://arxiv.org/html/2609.01933#bib.bib31), 27 (https://arxiv.org/html/2609.01933#bib.bib32), 1 (https://arxiv.org/html/2609.01933#bib.bib20), 16 (https://arxiv.org/html/2609.01933#bib.bib33)】。
我们提出 OR-Transformer,一个用于随机联合补货的深度强化学习框架。它使用物品置换等变 Transformer,允许对库存物品进行任意重排,同时自注意力机制捕获物品状态间的依赖关系。训练方法利用可微的库存动态将路径梯度直接传播到连续订单量,从而实现在高维动作空间中的直接信用分配。
我们将 OR-Transformer 与跨越多种模型架构和训练算法的基于学习的基线,以及经典的滚动时域随机 MILP 基线【34 (https://arxiv.org/html/2609.01933#bib.bib29), 2 (https://arxiv.org/html/2609.01933#bib.bib35)】进行了评估。我们的实验表明,随着问题规模的增长,OR-Transformer 越来越优于基线;参见图 1.1 (https://arxiv.org/html/2609.01933#S1.F1)。在 1,024 个库存物品时,OR-Transformer 达到约 0.35M 的折现成本,与基于学习的基线相比降低了 74.7%–90.8%,与滚动时域 MILP 控制器相比降低了约 96%,尽管后者允许每个决策长达 10 分钟的优化时间。在运行时间比较中,OR-Transformer 将在线决策时间缩短了超过 400 万倍,为大规模实时库存控制提供了一条实用路径。
## 2 问题形式化
我们考虑一个具有 \(n\) 个物品的随机联合补货问题。每个物品 \(i\) 有持有成本 \(h_{i}\)、缺货成本 \(b_{i}\)、提前期 \(L_{i}\) 和最大订购量 \(\bar{q}_{i}\)。下任何联合订单都会产生一个共享固定成本 \(K\),未满足的需求将被延期。令 \(D_{i,t}\) 表示物品 \(i\) 在时间 \(t\) 的随机需求。我们通过一个观测到的共同随机因子 \(F_{t} \in \mathbb{R}\) 对跨物品的需求进行相关性建模。完整的需求规范和额外的形式化细节见附录 B (https://arxiv.org/html/2609.01933#A2)。
令 \(\mathbf{I}_{t}\) 表示净库存向量,\(\mathbf{P}_{t}\) 表示预计在未来时间步到达的未完成订单,\(\Theta\) 表示定义问题实例的时间不变参数。状态为 \(s_{t} = (\mathbf{I}_{t}, \mathbf{P}_{t}, F_{t}; \Theta)\)。在每个时间步 \(t \in \mathbb{N}\),令 \(Y_{t} \in \{0,1\}\) 表示是否下联合订单,令 \(\mathbf{Q}_{t} = (Q_{1,t}, \ldots, Q_{n,t})^{\top}\) 表示订购量,其中 \(0 \leq Q_{i,t} \leq \bar{q}_{i}\)。动作为 \(a_{t} = (Y_{t}, \mathbf{Q}_{t})\)。物品 \(i\) 的订单在提前期 \(L_{i}\) 后到达,未完成订单在 \(\mathbf{P}_{t}\) 中跟踪。令 \([x]^{+} \doteq \max\{x,0\}\)。单步成本为 \(C_{t} = K Y_{t} + \sum_{i=1}^{n}\bigl(h_{i}[I_{i,t} - D_{i,t}]^{+} + b_{i}[D_{i,t} - I_{i,t}]^{+}\bigr)\)。
令 \(\pi\) 表示补货策略,\(\gamma \in (0,1)\) 为折扣因子。目标是最小化期望的无限期折现成本 \(\min_{\pi}\; \mathbb{E}_{\pi}\!\left[\sum_{t=0}^{\infty} \gamma^{t} C_{t}\right]\)。
## 3 方法
图 3.1:OR-Transformer 架构与训练。独立的 Transformer 网络生成订单开启决策、物品订购量和价值估计。基于分数的梯度用于训练离散的开启决策,而路径梯度则通过库存动态传播以训练连续订购量。
OR-Transformer 包含一个物品置换等变 Transformer 策略和一个通过库存动态传播梯度的训练过程。图 3.1 (https://arxiv.org/html/2609.01933#S3.F1) 总结了架构和梯度流。完整细节见附录 C (https://arxiv.org/html/2609.01933#A3)。
##### 物品置换等变 Transformer。
状态被编码为一个全局 token 和每个库存物品一个 token。三个独立的 Transformer 网络分别参数化订单开启决策、订购量以及估计期望未来折现成本的评论家(critic)。未使用位置或物品索引嵌入,因此任意重排库存物品不会改变全局输出,并相应地重排订购量输出。自注意力允许每个物品表示融入其他物品状态的信息,捕获跨物品依赖关系。
令 \(p_{t}\) 表示开启订单的概率,\(Q_{i,t}\) 表示物品 \(i\) 的订购量。策略输出为 \(Y_{t} \sim \operatorname{Bernoulli}(p_{t}), \qquad Q_{i,t} = \bar{q}_{i}\,\operatorname{sigmoid}\!\left(\mathbf{w}_{Q}^{\top}\mathbf{h}_{i,t}^{Q} + c_{Q}\right),\) (1) 其中 \(\mathbf{h}_{i,t}^{Q}\) 是物品 \(i\) 的最终 Transformer 表示,\(\mathbf{w}_{Q}\) 是共享订购量输出头的学习权重向量,\(c_{Q}\) 是其学习标量偏置;回顾 \(\bar{q}_{i}\) 是物品 \(i\) 的最大订购量。对于任意物品置换矩阵 \(\mathbf{P}\),将订单开启概率、订购量向量和价值估计分别记为 \(p(s)\), \(\mathbf{Q}(s)\), 和 \(V(s)\),有:\(p(\mathbf{P}s) = p(s), \qquad V(\mathbf{P}s) = V(s), \qquad \mathbf{Q}(\mathbf{P}s) = \mathbf{P}\mathbf{Q}(s).\) (2) 因此,订单开启概率和价值估计是置换不变的,而订购量向量是置换等变的。
##### 路径训练。
订单开启决策 \(Y_{t}\) 是离散的,而订购量 \(\mathbf{Q}_{t}\) 是连续的。我们使用基于分数的策略梯度训练 \(Y_{t}\)。在给定抽样的订单开启和需求下,库存动态相对于 \(\mathbf{Q}_{t}\) 是可微的;因此,我们通过生成的库存轨迹和未来成本反向传播路径梯度。因此,时间 \(t\) 的订购量通过其对未来库存和未完成订单的影响,从后续成本接收梯度。这比仅依赖抽样回报为高维订购量决策提供了更直接的信用分配。评论家估计未来期望成本,并提供训练期间使用的价值估计。
## 4 实验
##### 实验设置。
我们在相关随机需求、异构提前期、异构物品成本和共享设置成本下,评估物品数 \(n \in \{1,4,16,64,1,024\}\) 的联合补货问题。我们将 OR-Transformer 与三个学习基线进行比较。Transformer-PPO 使用 Transformer 主干网络和 PPO 策略梯度进行订购量决策;HPO 使用一个两隐藏层的多层感知机(MLP)和路径梯度【1 (https://arxiv.org/html/2609.01933#bib.bib20)】;PPO【30 (https://arxiv.org/html/2609.01933#bib.bib21)】使用一个两隐藏层的 MLP 和 PPO 策略梯度。我们还与使用 Gurobi【10 (https://arxiv.org/html/2609.01933#bib.bib37)】和 HiGHS【12 (https://arxiv.org/html/2609.01933#bib.bib36)】求解的滚动时域随机 MILPs 进行比较。所有学习方法使用相同数量的优化更新和每次更新相同数量的样本。性能在一个包含 128 个 episode 的保留集上使用折现库存成本进行评估,越低越好。完整的实验规范见附录 D (https://arxiv.org/html/2609.01933#A4)。
图 4.1:1,024 个物品时的 OR-Transformer 与 Gurobi 对比。允许 Gurobi 每个决策最多六小时的优化时间,OR-Transformer 在相同的保留 episode 上实现了 19.1% 更低的库存成本和超过 \(4\times 10^{6}\) 倍更快的在线决策速度。误差条显示一个标准误;越低越好。
##### 扩展性能。
图 1.1 (https://arxiv.org/html/2609.01933#S1.F1) 显示,随着问题规模的增长,基线在不同规模下的表现下降。在 4 个物品时,PPO 是第一个发散的方法。在 16 个物品时,HPO 也发散,表明即使有路径梯度,高维联合补货对 MLP 策略来说仍然具有挑战性。在 64 个物品时,Transformer-PPO 也发散,表明即使有 Transformer 架构,PPO 策略梯度对于高维订购量决策也变得日益困难。OR-Transformer 保持稳定并扩展到 1,024 个物品,其成本低于滚动时域 MILP 基线。在 1,024 个物品时,在一个 50 个决策的评估期内,OR-Transformer 达到约 0.35M 的折现成本,而最佳学习基线为 1.39M,降低了约 75%。所有问题规模下的完整成本比较(包括滚动时域 MPL 结果)报告在附录 D.3 (https://arxiv.org/html/2609.01933#A4.SS3) 中。
##### 在线决策质量与计算。
我们进一步在 1,024 个物品上,比较了 OR-Transformer 与滚动时域 Gurobi 在一个八个决策的评估期内的表现,同时允许 Gurobi 每个补货决策最多六小时的优化时间。如图 4.1 (https://arxiv.org/html/2609.01933#S4.F1) 所示,OR-Transformer 达到 \(126.61\pm 4.23\) K 的折现成本,而 Gurobi 为 \(156.58\pm 4.93\) K,对应 19.1% 的成本降低。OR-Transformer 决策总共需要 0.0432 秒,而 Gurobi 需要 48 小时 49 分钟,使得 OR-Transformer 在线决策速度**超过四百万倍**。完整比较报告在附录 D.2 (https://arxiv.org/html/2609.01933#A4.SS2) 中。
## 5 结论
我们提出了 OR-Transformer,一个用于大规模随机联合补货的深度强化学习框架,采用物品置换等变 Transformer 架构,并通过库存动态进行路径梯度训练。在问题规模高达 1,024 个物品的测试中,OR-Transformer 随着规模增长,其性能越来越优于基于学习的方法和滚动时域 MILP 基线,同时将在线决策时间缩短了超过 400 万倍。这些结果为大规模随机库存系统的高效实时决策提供了一条路径。
## 致谢
David Simchi-Levi 部分得到普渡大学数据科学中心的支持。Shangtong Zhang 部分得到美国国家科学基金会奖项 III-2128019、SLES-2331904 和 CAREER-2442098;联邦网络倡议中央弗吉尼亚节点奖项 VV-1Q26-001;以及思科教师研究奖的支持。
## 参考文献
- [1] M. Alvo, D. Russo, and Y. Kanoria (2026). Policy optimization in hybrid discrete-continuous action spaces via mixed gradients. arXiv preprint arXiv:2605.14297. 引用于:§1 (https://arxiv.org/html/2609.01933#S1.p3.1), §4 (https://arxiv.org/html/2609.01933#S4.SS0.SSS0.Px1.p1.1)。
- [2] R. Barati and Q. V. Hu (2026). Gym-invmgmt: an open benchmarking framework for inventory management methods. arXiv preprint arXiv:2605.11355. 引用于:§1 (https://arxiv.org/html/2609.01933#S1.p3.1), §1 (https://arxiv.org/html/2609.01933#S1.p3.2)。相似文章
面向可扩展多任务强化学习的大决策模型
本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。
一种基于深度强化学习(DRL)的Transformer方法用于解决开放车间调度问题
介绍了一种基于Transformer的调度策略,该策略通过强化学习训练,用于开放车间调度问题,展示了在小规模实例上训练的模型能够泛化到更大规模的问题,并与经典调度启发式算法竞争。
在线请求的动态多车场车辆路径问题:事件驱动的Transformer-深度强化学习与滚动 horizon 基准测试
本文提出一种基于Transformer和深度强化学习的事件驱动框架,用于动态多车场车辆路径问题,并与启发式和优化方法进行比较。
Transformer联合作者验证后Transformer时代成本效率突破
一个1.5亿参数的非Transformer架构在ARC-AGI-1上实现了最先进的成本效率,并获得了Transformer论文联合作者Łukasz Kaiser的验证,表明循环潜在推理可以取代暴力扩展。
RF-DETR:面向实时检测Transformer的神经架构搜索
RF-DETR提出了一种轻量级检测Transformer,通过权重共享神经架构搜索实现最先进的实时目标检测,在COCO和Roboflow100-VL上优于先前方法,同时运行速度快达20倍。