适应不断变化的需求:用于零售供应链运营的代理AI
摘要
本文提出了一种图约束的代理AI框架,利用大型语言模型适应零售供应链运营的不断变化需求,并在与零售合作伙伴的评估中显示,与直接LLM重构相比,提高了正确性和端到端成功率。
arXiv:2609.03860v1 宣布类型:新
摘要:零售供应链运营依赖于耦合的决策模块,这些模块必须随着需求的变化而适应。大型语言模型为这项任务提供了自然语言接口,但现有方法主要关注单个优化模型。将其扩展到异构决策管道具有挑战性,因为一个需求可能允许多条具有不同下游效果的干预路径。我们将需求驱动的适应制定为干预路径和可接受模块级变更的联合选择,并提出一种图约束的代理框架,其中领域代理公开可接受的重构接口,中央处理器在有限干预路径上进行搜索。候选项使用下游关键绩效指标进行验证和比较。在与大型零售合作伙伴的合作中,我们评估了从从业者访谈中提取的100个仓库需求,使用GPT、Qwen和DeepSeek作为基础LLM。与直接LLM重构相比,我们的框架在所有三个模型中都提高了正确性和端到端成功率,将端到端成功率从72--76%提高到79--83%。
查看缓存全文
缓存时间: 2026/09/04 06:13
# 适应不断变化的需求:面向零售供应链运营的智能体AI
来源:https://arxiv.org/html/2609.03860
\\workshoptitle
第二届机器学习与运筹学交叉研讨会
郑磊 | 杨丽萍 | 附属机构:中国科学技术大学管理学院
李子浩 | 附属机构:中国科学技术大学管理学院
吕国栋 | 附属机构:香港科技大学商学院
柯启明 | 附属机构:新加坡国立大学运筹学与分析研究所 | 附属机构:新加坡国立大学商学院
\[2pt\]\*通讯作者\. 余仲平 | 附属机构:新加坡国立大学运筹学与分析研究所 | 附属机构:新加坡国立大学商学院
\[2pt\]\*通讯作者\.
###### 摘要
零售供应链运营依赖于相互关联的决策模块,这些模块必须能够适应不断变化的需求。大语言模型为此任务提供了自然语言接口,但现有方法主要关注单个优化模型。将其扩展到异构决策管道具有挑战性,因为一项需求可能允许多种具有不同下游效果的干预路径。我们将需求驱动的适应表述为干预路径和允许的模块级变更的联合选择,并提出一个图约束的智能体框架,其中领域智能体暴露允许的重构接口,中央处理器在有界干预路径上进行搜索。候选项使用下游关键绩效指标进行验证和比较。与一家大型零售合作伙伴协作,我们评估了从从业者访谈中获取的100项仓库需求,使用GPT、Qwen和DeepSeek作为基础大语言模型。与直接的大语言模型重构相比,我们的框架在所有三个模型上都提高了正确性和端到端成功率,将端到端成功率从72-76%提高到79-83%。
## 1引言
零售供应链运营涉及一系列连接配送中心履约与门店补货的决策。一旦补货订单到达配送中心,箱货必须在被发往门店之前被分配、成批、拣选和包装。这些决策通常由不同的决策模块处理,其输出会传递到后续操作中。例如,包装决定了运往门店的装载单元的数量和组成,这会影响到货后所需的搬运和货架补货工作量。这些模块也可能依赖不同的求解决策支持工具中的启发式算法、学习策略,或随机优化模型的代理方法。因此,对一个模块的修改可能会改变后续模块面临的操作条件。
这种模块化结构在部署后难以适应需求的变化。在零售供应链中,订单构成、资源可用性或执行条件的变化可能需要修改模块的模型、算法或参数,同时又不干扰下游决策。此类变更通常需要人工专家来识别受影响的组件、进行修订并重新部署系统。然而,及时的适应至关重要:补货调整相比现有策略已带来4-24%的利润增长。规划者和操作者通常知道业务流程中应该改变什么,但不知道如何在底层决策系统中实现它。这为大语言模型创造了天然的应用场景。近期研究表明,大语言模型可以将自然语言需求转化为优化模型和求解器代码,而智能体分解和结构化验证可以进一步提高可靠性。大语言模型还可以通过显式的模型补丁修改已部署的优化模型。
将这些方法扩展到耦合的决策管道仍然具有挑战性。一项需求可能在不同的模块中有多个干预点,而上游的变更可能会改变下游的输入和可行决策。由此产生的重构空间很大但具有结构性,且特定需求通常仅涉及模块和重构接口的一个小子集。即使在这个子集中,多个局部有效的重构也可能满足需求,但在下游重新执行后会导致不同的系统级结果。因此,我们将允许的干预组织在预定义的重构图中,使用分层路由保留一小部分合理的路径,并通过下游执行在产生的候选项中进行选择。
本文有三个贡献。首先,我们将模块化决策系统的需求驱动适应表述为干预路径和允许的模块级变更的联合选择,干预的质量在受影响的下游模块重新执行后进行评估。这种表述区分了模块级有效性和系统级成效。其次,我们开发了一个图约束的智能体解决方案框架,其中中央处理器在预定义图上跨不同模块搜索候选项,领域智能体实例化并验证补丁,基于执行的选择解决那些允许多种合理实现的需求。第三,与一家大型零售合作伙伴协作,我们使用GPT、Qwen和DeepSeek作为基础大语言模型,在100项由从业者引导的仓库需求上评估了该框架。相对于直接的大语言模型重构,该框架为每个基础大语言模型都提高了重构正确性和端到端成功率,端到端成功率从72-76%提升至79-83%。对于具有多种合理重构的需求,使用DeepSeek时,端到端成功率从54%提升至72%。
## 2问题设置与模块化智能体系统
我们考虑一个用于零售供应链运营的模块化决策系统$\mathcal{S}=(\mathcal{M},\mathcal{E}_S)$。集合$\mathcal{M}=\{\mathcal{M}_1,\ldots,\mathcal{M}_M\}$包含$M$个决策模块,$\mathcal{E}_S\subseteq\mathcal{M}\times\mathcal{M}$捕获它们之间的依赖关系。$(\mathcal{M}_j,\mathcal{M}_m)\in\mathcal{E}_S$表示模块$j$的输出是模块$m$的输入。我们将模块$m$表示为$\mathcal{M}_m=(\mathcal{D}_m,\mathcal{P}_m,\mathcal{H}_m,\mathcal{T}_m,\mathcal{V}_m)$,其中$\mathcal{D}_m$表示其数据和状态,$\mathcal{P}_m$是其数学模型,$\mathcal{H}_m$是其求解过程,$\mathcal{T}_m$是其重构接口,每个接口命名$\mathcal{P}_m$的一个可修改组件、$\mathcal{H}_m$中的一个规则或一个配置参数,$\mathcal{V}_m$是其验证规则。求解过程可能因模块而异。具体来说,$\mathcal{H}_m$可以是优化求解器、构造性启发式算法、排序策略或混合过程,因为将$\mathcal{P}_m$的大型实例求解到最优性可能不切实际。第4节研究的仓库决策管道遵循此结构。
适应从需求$q$和系统状态$x$开始,包括$\mathcal{D}_1,\ldots,\mathcal{D}_M$和在依赖边上已实现的输出。适应问题确定在何处干预以及如何修改模块。干预通过$\mathcal{T}_m$中的一个接口进行,并可能因此改变数学模型$\mathcal{P}_m$、$\mathcal{H}_m$中的算法逻辑或一个配置参数。由于$\mathcal{E}_S$中的依赖是有向的,这样的变更可以通过改变后续模块的输入和可行决策向下游传播。换句话说,在模块$m$处的干预会触发模块$m$以及系统$\mathcal{S}$中从其可达的每个模块的重新执行,按依赖顺序进行。因此,局部有效性并不能确立干预的质量,干预的质量是根据此次重新执行得到的系统级关键绩效指标来评估的。
此外,我们将此适应问题表述为一个双层智能体架构,将干预选择与模块执行分离。每个决策模块由一个*领域智能体*表示,该智能体保留模块特定的实现和验证逻辑。领域智能体暴露一组预定义的允许重构接口$\mathcal{T}_m^{\mathrm{adm}}\subseteq\mathcal{T}_m$,这些接口源自模块结构和领域知识。一个接口在推理前是固定的、在适用时带有参数界限,并由$\mathcal{V}_m$中的确定性规则检查时是允许的。给定一项需求,*中央处理器*在这些接口中选择干预的位置和方式。相应的领域智能体然后实施选定的更改,并使用$\mathcal{V}_m$验证结果。这种分离将大语言模型限制在受控的干预选择内,同时将实现和可行性检查留给领域智能体。附录A中的图1的第一部分说明了这一架构。
## 3图约束的智能体重构与候选选择
#### 分层干预选择\.
如果没有结构,大语言模型将不得不在所有暴露的接口中同时选择受影响的模块、干预类型及其实施。中央处理器通过一个预定义的图$G$来结构化此选择,该图在推理前根据模块化决策系统及其允许的重构接口构建。图包含四种节点类型——意图、领域智能体、粗粒度修改和细粒度接口——其有向边记录哪些节点对是兼容的,包括意图-智能体、意图-粗粒度、智能体-粗粒度和粗粒度-细粒度。由于$G$在需求到达之前是固定的,中央处理器不能引入图中不存在的干预。
对于系统状态$x$下的需求$q$,中央处理器在$G$上分层确定干预。它首先识别一个意图$i$和一个非空的领域智能体集合$A$,然后为每个领域智能体$a\in A$,选择一个兼容的粗粒度修改$c$和细粒度修改$f$。我们称这种结构选择为一个*路径*,记为$\rho=(i,A,c,f)$。如果对于每个$a\in A$,兼容关系$(i,a)$、$(i,c)$、$(a,c)$和$(c,f)$都是$G$的边,则该路径是允许的,因此一个允许的路径会诱导出$G$的一个连通子图。中央处理器随后为选定的接口分配一个策略或数值$v$,产生干预候选$r=(\rho,v)$。分层结构缩小了每个阶段的可行选择,并记录了需求如何链接到要修改的特定组件。该构建与Cai等人(2025)中MiniZinc模型的结构化智能体分解相关。
#### 一对多候选生成\.
对于特定需求,图可能允许多条干预路径,反映了可以通过不同模块或修改机制实现需求。这些替代方案可能导致不同的下游结果。令$\mathcal{R}_q$表示为需求$q$保留的干预路径集。它包含一条主路径,对应于中央处理器的首选解释,以及少量结构上不同的替代路径。这些路径诱导出一个特定于需求的子图$G_q$,仅包含与保留替代方案相关的节点和兼容边。一旦确定了$\mathcal{R}_q$,$G_q$就保持固定,并为该需求考虑的干预选择提供了一个紧凑、可检查的表示。
对于每个$\rho\in\mathcal{R}_q$,中央处理器接下来在细粒度接口(路径的叶节点)生成候选值。数值接口接收低、中、高强度值,而策略接口接收其领域智能体暴露的允许策略。将每个路径与其候选值配对,产生可执行组合$\mathcal{C}_q$,它保留了跨重构机制的结构多样性以及每个保留机制内的值多样性。它们的相对质量通过执行来确定。图1的第二部分显示了路径生成和一对多过程。
#### 领域重构与下游选择\.
每个候选$r\in\mathcal{C}_q$被传递给其路径指定的领域智能体,这些智能体在暴露的接口处实例化建议的更改,并生成详细的数学和代码补丁。在执行之前,确定性验证规则$\mathcal{V}_m$验证每个补丁使用的是允许的接口,尊重参数界限和硬约束,并且可以由相应的模块执行。如果验证或执行失败,错误消息和重构上下文将返回给领域智能体进行最多一次修复尝试,该尝试在保持路径和值不变的情况下重新生成补丁。修正后的补丁面临相同的允许性检查,再次失败的候选项将被丢弃。修复周期仅纠正公式或实现错误;候选项质量在执行后评估。
通过模块级验证的候选项通过修改后的模块及其在$\mathcal{S}$中的下游模块执行。令$\mathcal{C}_q^{\mathrm{valid}}\subseteq\mathcal{C}_q$表示那些成功执行并满足所有适用防护栏的候选项。对于每个$r\in\mathcal{C}_q^{\mathrm{valid}}$,令$\bm{y}(r)$表示产生的系统级关键绩效指标向量,$J_q(\bm{y}(r))$表示与需求$q$相关的评估标准,其中判断大语言模型从预定义的关键绩效指标集中识别该标准。然后框架选择$r_q^\star\in\arg\max_{r\in\mathcal{C}_q^{\mathrm{valid}}}J_q(\bm{y}(r))$。在管道执行后评估候选项,考虑了无法从局部有效性推断出的下游效应。相似文章
用于智能供应链分析的混合式智能代理AI框架
本文提出了一种用于供应链分析的混合式智能代理AI框架,该框架使用协调代理和专门代理来改进决策,实现90%的准确率,并将令牌使用量减少四倍。
一种结合大语言模型和思维链的自主AI框架,用于无人机辅助物流调度与移动边缘计算
本文提出了一种自主AI框架,利用大语言模型和思维链推理来优化无人机辅助的物流调度与移动边缘计算,旨在提高制造物流中的效率和资源分配。
供应链管理中自主AI代理的可靠性与有效性
本文利用MIT啤酒游戏研究了多级供应链中的自主生成式AI代理,识别了四个推理时杠杆因素,并引入了代理牛鞭效应的概念。研究表明推理模型可以超越人类表现,并提出了基于GRPO的后训练以提高可靠性。
ShopEase: 基于生成式AI的多智能体框架,用于智能企业客户支持,采用混合检索增强生成
本文介绍了ShopEase,这是一个基于生成式AI的多智能体框架,用于企业客户支持,采用混合检索增强生成。研究评估了检索配置,发现使用FAISS的稠密检索实现了最佳准确率。
直通式承保中的代理型AI与检索增强模型
本文探讨了代理型AI与检索增强模型在直通式承保中的应用,在合成BOP承保环境中比较了单LLM基线、朴素RAG和多代理RAG管道。