供应链管理中自主AI代理的可靠性与有效性

arXiv cs.AI 论文

摘要

本文利用MIT啤酒游戏研究了多级供应链中的自主生成式AI代理,识别了四个推理时杠杆因素,并引入了代理牛鞭效应的概念。研究表明推理模型可以超越人类表现,并提出了基于GRPO的后训练以提高可靠性。

arXiv:2605.17036v1 公告类型:新 摘要:本文利用MIT啤酒游戏研究了多级供应链中的自主生成式AI代理。我们识别了四个影响性能的推理时杠杆因素:模型选择、策略与护栏、集中式数据共享以及提示工程。模型能力是主导因素:开箱即用的推理模型超越了人类水平,而优化后的推理模型相对于人类团队可将成本降低高达67%。然而,强大的平均性能掩盖了显著的可靠性风险。我们引入了代理牛鞭效应,即决策不可靠性在各级供应链中的放大,表现为两个维度:同一时间点不同设施的决策方差增加,以及同一设施在不同时间点的决策方差增加。我们建立了一个数学框架,表明这一现象是涉及协调和信息延迟的多代理系统所固有的,并证明重复采样无法有效减少该效应。为了解决这一局限性,我们提出了一种基于组相对策略优化(GRPO)的强化学习后训练框架,该框架利用系统级供应链奖励来训练共享的基础LLM。GRPO后训练显著减少了尾部事件,遏制了代理牛鞭效应,并提高了自主供应链代理的可靠性。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:38

# 自主AI智能体在供应链管理中的可靠性与有效性 来源:https://arxiv.org/html/2605.17036 Huangyuan Su 哈佛大学/Kempner研究所 & Andre P. Calmon 佐治亚理工学院 & Flavio P. Calmon 哈佛大学

###### 摘要

本文利用MIT啤酒游戏,研究多级供应链中的自主生成式AI智能体。我们识别出四个影响性能的推理时杠杆:模型选择、策略与护栏、集中式数据共享以及提示工程。模型能力是主导因素:开箱即用的推理模型即超越人类水平性能,而优化后的推理模型相比人类团队可降低多达67%的成本。然而,强劲的平均性能掩盖了显著的可靠性风险。我们引入**智能体牛鞭效应**,即决策不可靠性在供应链各级间的放大效应,体现在两个维度:决策方差在同一时间点跨设施增大,以及在同一设施内随时间推移增大。我们提出了一个数学框架,证明该现象是涉及协调与信息延迟的多智能体系统所固有的,并表明重复采样无法有效减少这一效应。为解决此问题,我们提出基于组相对策略优化(GRPO)的强化学习后训练框架,利用系统级供应链奖励训练共享基础LLM。GRPO后训练显著减少了尾部事件,抑制了智能体牛鞭效应,并提升了自主供应链智能体的可靠性。

## 1 引言¹¹¹本文对近期一篇文章中描述的概念和框架进行了扩展并提供了更多技术细节,Long, C., Simchi-Levi, D., Calmon, A. P., & Calmon, F. P. When supply chains become autonomous. Harvard Business Review (Long et al., 2025a (https://arxiv.org/html/2605.17036#bib.bib37))。

专家认为,完全自主的供应链——即由AI做出所有库存和物流决策——可能即将实现。他们预测自主供应链将很快在生产效率、运营效率和响应能力方面带来显著提升。推动这一热潮的是大语言模型(LLM)的快速进步,作为生成式AI(GenAI)的引擎,LLM现已能处理从采购决策、收益管理到物流的各类任务。然而,迄今为止,大多数LLM在供应链中的应用都集中在狭窄任务上,使用单一模型来增强特定功能,如需求预测或补货决策(Menache et al., 2025 (https://arxiv.org/html/2605.17036#bib.bib38))。更广阔的愿景则更为宏大:一个完全自主的供应链,其中多个LLM智能体协同工作,每个智能体在网络中执行不同的职责。但我们离这一现实还有多远?为了找出答案,我们重新构想了啤酒游戏——一个20世纪60年代开发的经典供应链管理模拟工具,被无数管理教育项目使用——用GenAI智能体取代了每一个人类玩家。这种设置使我们能够分析GenAI智能体的供应链管理能力,以及前置时间、信息共享和财务约束对智能体性能的影响。我们自包含的供应链模拟作为一个测试平台,用于将GenAI智能体与人类专家进行基准测试,预见集成挑战,并识别在供应链管理中有效使用该技术的策略。

我们证明,使自主的、由GenAI管理的供应链成功运行,取决于掌握四个关键杠杆:选择的模型、设定的策略与护栏、共享的信息以及给出的指令。我们将AI性能与人类进行了基准测试:使用了来自佐治亚理工学院12个班级、总计超过100名学生的数据,这些学生在过去三年中在相同系统条件下(与GenAI测试平台相同)参与了啤酒游戏。在我们性能最佳的设置中——使用Llama 4 Maverick 17B,配合优化后的提示、数据共享规则和护栏——AI智能体在游戏的30次重复中,平均成本相比学生团队降低了多达67%。

当然,仅凭平均性能不足以证明在实际运营中部署的合理性。供应链从业者不仅需要评估预期成本结果,还必须评估系统可靠性。一个能产生较低平均成本、但偶尔会做出高度波动的采购、生产或订购决策的自主策略,在实践中是不可行的。这在多级网络中尤其如此,因为局部错误会迅速传播,随着时间的推移,单个偏差会累积成对上游智能体失真的需求信号。

自主智能体的可靠性问题尤为突出,因为底层LLM具有随机性,即使在相同提示的重复运行中也可能产生不一致的决策。我们的分析表明,虽然开箱即用的GenAI智能体在平均意义上可能是高效的(即相比人类决策者平均成本较低),但它们仍然不可靠:偶尔的订购决策可能导致高昂的总供应链成本。我们证明,使用合成数据训练智能体可以显著提高可靠性,同时保持相对于人类决策者的显著成本优势。

为了捕捉使用LLM智能体进行决策时的不可靠性风险,我们引入了***智能体牛鞭效应***的概念:多智能体系统中决策不稳定性和不可靠性在多次运行间的放大效应。这种不稳定性体现在两个维度。首先,在固定时间点,决策方差随着向上游移动而跨设施增大:零售商倾向于产生相对稳定的订单,而批发商、分销商和工厂则表现出逐渐增大的离散度和更严重的尾部决策。其次,在同一设施内,决策方差可能随时间增长,因为早期的订购差异改变了库存水平、积压订单和运输管道,导致小的行为偏差通过延迟反馈累积,随时间推移产生波动性订购策略的递增风险。

我们的理论分析表明,这种现象并非特定模型或解码过程的偶然产物,而是多智能体系统中自主智能体通过延迟和部分信息协调时固有的风险。在此类设置中,协作和前置时间创造了反馈渠道,传播并放大了决策不可靠性。这促使我们超越推理时的修复方法(如重复采样),转向强化学习后训练。特别地,我们提出了一个基于GRPO的框架,利用系统级供应链奖励训练共享基础模型,使智能体能够内化协调的补货策略,从而减少跨设施和跨时间的决策方差。这些发现指向一个未来:AI负责处理常规运营决策,提供成本效率和灵活的可用性,从而为人类专家创造空间,专注于供应链中更高层次的战略挑战。

本文的主要贡献如下:

1. 1. 我们使用GenAI啤酒游戏作为自主供应链决策的受控测试平台,并将LLM智能体与人类团队进行基准测试。结果识别出四个影响有效性的推理时杠杆:模型选择、护栏、集中式数据共享和提示工程。模型能力是主导杠杆:推理模型开箱即用即超越人类性能水平,而非推理模型需要额外的约束、编排和提示才能缩小差距。在我们性能最佳的AI设置中,GenAI智能体相比人类团队降低了多达67%的成本。
2. 2. 我们表明强劲的平均性能可能掩盖显著的可靠性风险。我们引入了***智能体牛鞭效应***:多级自主系统中运行间决策不稳定性的放大效应。经验上,这种不稳定性体现在两个维度:决策方差随着向上游移动而跨设施增大,以及同一设施内的决策方差可能随时间增长。运营上,上游智能体不仅要面对更大的订单量,还要面对更不稳定的决策和更严重的尾部结果。
3. 3. 我们评估了重复采样作为一种无训练缓解策略,发现其效果不佳。尽管多数投票(对多个样本)常用于减少模型随机性,但在我们的设置中并不能有效减少智能体牛鞭效应。这表明不稳定性不仅仅是偶然的解码噪声;它反映了策略层面的不可靠性,这种不可靠性会持续通过供应链网络传播。
4. 4. 我们开发了一个数学框架,分离了需求驱动和决策驱动的订单波动性。通过传递函数分析,我们表明外部需求冲击和智能体层面的决策冲击通过相同的延迟补货反馈循环传递。该框架解释了为何即使在平均成本表现看似强劲时,可靠性失败仍可能发生,以及为何决策不稳定性是存在信息延迟和分散协调的多智能体系统中的结构性风险。
5. 5. 我们提出了一个基于GRPO的后训练框架,用于使LLM智能体适应供应链任务。该框架利用系统级供应链奖励训练共享基础LLM,使智能体在训练过程中学习协调策略,同时在测试时仍作为具有有限局部可见性的独立决策者部署。GRPO后训练显著抑制了智能体牛鞭效应,减少了尾部事件,并提升了自主供应链智能体的可靠性和效率。

## 2 设置与相关工作

### 2.1 啤酒游戏:供应链动力学的永恒一课

啤酒分销游戏是研究供应链中反馈、延迟和有限理性决策的经典系统动力学环境(Forrester, 1961 (https://arxiv.org/html/2605.17036#bib.bib15); Sterman, 1989 (https://arxiv.org/html/2605.17036#bib.bib16))。其持久的教训是:即使每个参与者都试图理性行事,局部决策也可能引发系统层面的不稳定性。因此,啤酒游戏是自主AI智能体的有用测试平台,因为它将一个简单的决策界面转变为一个具有延迟反馈的动态协调问题。

在啤酒游戏中,四名玩家操作一个简单的串联供应链:一个零售商、一个批发商、一个分销商和一个工厂。每周,每个玩家做出一个决策:从上游合作伙伴那里订购多少。设置直截了当,但约束条件颇具启发性。玩家必须平衡持有过剩库存的成本与缺货(必须稍后发货的未完成订单)的惩罚。啤酒供应链的结构使这一核心权衡复杂化。玩家在孤岛中操作,无法沟通,且只有零售商能看到最终客户的实际需求。订单和发货都存在显著的内置延迟,发货通常需要两周才能到达。这产生了“管道库存”——已订购但尚未到手的啤酒——许多玩家未能考虑到这一点。玩家的共同目标是以整个供应链最低的总成本满足需求。

这种结构产生了经典的牛鞭效应:随着需求信息向上游移动,订单信号变得失真并被放大。客户需求的微小、临时波动会在上游智能体的订单中引发剧烈波动。长期以来的文献研究牛鞭效应,即由供应链中信息失真引起的订单波动性向上游放大现象。Lee等人(Lee et al., 1997b (https://arxiv.org/html/2605.17036#bib.bib17), a (https://arxiv.org/html/2605.17036#bib.bib18))介绍了这一现象,并识别出关键驱动因素,包括需求信号处理、订单批量、价格波动和配给行为。Chen等人(Chen et al., 2000a (https://arxiv.org/html/2605.17036#bib.bib41))量化了预测规则、前置时间和信息共享如何影响简单供应链中牛鞭效应的幅度,并表明指数平滑预测可能根据前置时间和预测参数进一步放大订单波动性(Chen et al., 2000b (https://arxiv.org/html/2605.17036#bib.bib1))。在这一文献基础上,我们从跨运行可靠性的角度研究智能体驱动的牛鞭效应:即使需求路径和运营状态保持不变,自主LLM智能体也可能引入决策变异性。

### 2.2 供应链中的生成式AI与啤酒游戏

近期关于生成式AI在供应链管理中的工作,研究语言模型在需求预测、采购支持、补货规划和管理决策支持方面的应用(Menache et al., 2025 (https://arxiv.org/html/2605.17036#bib.bib38))。一个相关的研究方向考察基于LLM或基础模型的智能体用于库存管理和自主供应链,强调自然语言接口、可解释的协调以及跨组织边界的灵活决策支持(Simchi-Levi et al., 2025a (https://arxiv.org/html/2605.17036#bib.bib12); Quan and Liu, 2024 (https://arxiv.org/html/2605.17036#bib.bib24); Xu et al., 2024a (https://arxiv.org/html/2605.17036#bib.bib25), b (https://arxiv.org/html/2605.17036#bib.bib26); Zheng et al., 2025 (https://arxiv.org/html/2605.17036#bib.bib8))。然而,这些文献大多侧重于专业化应用或假设围绕模型进行大量系统设计的架构。我们的设置更接近企业可能部署前沿模型的方式:通过标准接口,且修改闭源模型的能力有限。因此,我们探究开箱即用的GenAI智能体能否管理动态的多级供应链,其中每个智能体在啤酒游戏中控制一个角色。

本文的设置基于近期一个AI驱动版啤酒游戏的实现(Long et al., 2025b (https://arxiv.org/html/2605.17036#bib.bib40), a (https://arxiv.org/html/2605.17036#bib.bib37))。GenAI啤酒游戏与经典版本相似,但用LLM智能体(例如GPT-5)取代了人类玩家。每个智能体承担单一角色,如批发商,并自主做出订购决策。像人类玩家一样,AI智能体管理库存、响应下游订单并向上游提交订单。与许多在单一任务上测试单个LLM性能的AI基准测试不同,GenAI啤酒游戏考察智能体作为一个群体进行协调的能力。

在第三节(https://arxiv.org/html/2605.17036#S3)中,我们聚焦于提高开箱即用LLM有效性的“推理时方法”。我们考虑优化这些模型使用方式的方法,而不是改变模型本身。推理时方法包括为智能体设计更好的指令提示、编排智能体间的信息流,以及设计限制智能体可采取行动的简单规则或策略。与现有工作(Boussioux et al., 2025 (https://arxiv.org/html/2605.17036#bib.bib3))研究基于提示的推理干预以改善啤酒游戏中LLM决策不同,我们专注于完全自主的智能体部署,同时评估推理时方法和强化学习后训练框架。

### 2.3 扩展测试时计算

我们考虑以重复采样形式扩展测试时计算

相似文章

智能体倍增:因为我告知它们可以

Reddit r/ArtificialInteligence

一项实验中,AI智能体自主衍生出686个用于库存管理的子智能体,揭示了‘智能体蔓延’现象,并引发对智能体AI系统治理问题的关注。

IP备忘录:多智能体("代理型")AI系统在编程、营销和创作中的应用 – 2026年全面分析。(整合可专利性、炒作与现实、人类依赖性及成本超支)

Reddit r/AI_Agents

本综合分析评估了编程、营销和创作中的多智能体AI系统,认为尽管供应商大肆宣传其自主性和效率,但这些系统仍高度依赖人类输入,面临可专利性和版权限制,并在微软和Uber等主要科技公司导致成本超支,质疑其可持续价值。