一种基于少样本连续上下文多臂老虎机的预测-修正循环需求预测方法

arXiv cs.LG 论文

摘要

该论文提出了一种预测-修正(PtC)框架,利用少样本连续上下文多臂老虎机自适应地修正零售需求预测中的基础机器学习预测,在误差指标和库存成本上相比基线实现了显著改进。

arXiv:2607.16354v1 Announce Type: new 摘要: 零售需求预测仍然困难,尤其是在需求变化速度快于静态预测模型重新训练速度的情况下,特别是早期需求周期中新观察到的标签稀疏。为解决这一问题,本研究旨在改进自适应零售预测,提出了一种预测-修正(PtC)框架,该框架保留第一阶段的机器学习(ML)预测,并应用带有相似SKU增强和top-p掩码更新的少样本连续上下文多臂老虎机修正策略。在沃尔玛零售数据和独家饮料数据集上,PtC在稳定且高销量、稳定且低销量以及不规则和间歇性需求模式下均实现了MAPE、MAE和RMSE的统计显著降低;在消融研究中,与纯ML基线相比,平均RMSE提高了9.52%;并且在测试的提前期设置下,库存成本低于基础库存策略、近端策略优化和软演员-评论家策略。这些结果表明,在线预测修正可以通过适应稀疏反馈来弥合离线需求学习与实时零售决策之间的差距,而无需完全重新训练基础预测模型。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# 基于少样本连续上下文Bandit的预测-校正循环用于需求预测 来源:https://arxiv.org/html/2607.16354 Zhiwei Leia, Benedict Jun Maa and Ilya Jacksonb a智能交通学科,香港科技大学(广州),中国;b运输与物流中心,麻省理工学院,美国; ###### 摘要 零售需求预测在需求变化速度快于静态预测模型重训练速度时仍然困难,尤其是在早期需求周期中新观察标签稀疏的情况下。为解决此问题,本研究旨在通过提出一种预测-校正(PtC)框架来改进自适应零售预测,该框架保留第一阶段机器学习(ML)预测,并应用一种基于少样本连续上下文Bandit的校正策略,结合相似SKU增强和top-p掩码更新。在沃尔玛零售数据和一个独家饮料数据集上,PtC在稳定高量、稳定低量、以及不稳定间歇性需求模式下,MAPE、MAE和RMSE均实现统计显著降低,在消融研究中相比纯ML基线平均RMSE改善9.52%,并且在测试的提前期设置下,比基础库存、近端策略优化和软演员-评论家策略产生更低的库存成本。这些发现表明,在线预测校正能够弥合离线需求学习与实时零售决策之间的差距,通过适应稀疏反馈而无需完全重新训练基础预测模型。 关键词:需求预测;预测-校正;上下文Bandit;少样本学习。 ## 1 引言 零售供应链是高维度、不确定且复杂的决策系统,紧密耦合需求预测、库存控制与多阶段物流运营(Cohen等人,2022(https://arxiv.org/html/2607.16354#bib.bib23))。这种系统层面的复杂性主要由三个相互关联的维度驱动:随机需求、网络结构和动态决策。首先,客户需求是非平稳且波动的,常受到外部市场条件、定价机制和促销活动的影响(Fahimnia等人,2025(https://arxiv.org/html/2607.16354#bib.bib3))。其次,管理跨多级分销网络中的数百万个库存单位(SKU)会引入复杂的产品级关系,例如替代效应、互补性和跨物料资源共享(Ma等人,2016(https://arxiv.org/html/2607.16354#bib.bib26))。第三,关键运营决策,包括库存分配(Khouja和Zhou,2019(https://arxiv.org/html/2607.16354#bib.bib115);Kim等人,2024(https://arxiv.org/html/2607.16354#bib.bib117))、动态定价(Zhong等人,2020(https://arxiv.org/html/2607.16354#bib.bib119))和稳健采购(Wagner,2015(https://arxiv.org/html/2607.16354#bib.bib113);Li等人,2024a(https://arxiv.org/html/2607.16354#bib.bib114)),展现出复杂的时间依赖特性(Huang等人,2019(https://arxiv.org/html/2607.16354#bib.bib28))。因此,不准确的需求预测可能超出预测阶段传播,扭曲下游运营决策,导致严重缺货或昂贵的积压,从而降低整体供应链绩效(Cohen等人,2022(https://arxiv.org/html/2607.16354#bib.bib23))。 随着人工智能(AI)和企业大数据基础设施的快速发展,现代供应链正积极演变为数据驱动的信息物理系统,实现实时感知和动态闭环优化(Punia和Shankar,2022(https://arxiv.org/html/2607.16354#bib.bib6);Mandania和Oliveira,2023(https://arxiv.org/html/2607.16354#bib.bib118))。在此背景下,需求预测构成了此类智能供应链系统的基础分析功能。行业证据表明,AI驱动的预测框架可将预测错误降低20%至50%,降低持有成本5%至10%,并减少高达65%的销售损失(McKinsey,2022(https://arxiv.org/html/2607.16354#bib.bib1))。方法论上,这一发展加速了预测研究从经典参数时间序列模型向监督机器学习(ML)架构的转变,例如长短期记忆网络(LSTM)(Hochreiter和Schmidhuber,1997(https://arxiv.org/html/2607.16354#bib.bib11))、梯度提升机(GBM)(Friedman,2001(https://arxiv.org/html/2607.16354#bib.bib14))、XGBoost(Chen和Guestrin,2016(https://arxiv.org/html/2607.16354#bib.bib12)),以及深度学习(DL)架构如基于Transformer的变体(Zhang等人,2024(https://arxiv.org/html/2607.16354#bib.bib13);Li等人,2024b(https://arxiv.org/html/2607.16354#bib.bib15))。由于非线性映射能力,这些数据驱动方法在大规模预测中已展现出优于传统统计基准的决定性算法优势(Makridakis等人,2022(https://arxiv.org/html/2607.16354#bib.bib17);Lei等人,2024(https://arxiv.org/html/2607.16354#bib.bib16))。 尽管取得这些进展,离线训练的ML模型在快速变化和非平稳的市场环境中部署时仍然存在局限。在新的需求周期或产品上市期间,市场动态往往与历史状态相比出现尖锐的结构性断裂,导致严重的数据稀疏性和突出的“冷启动”挑战(Petropoulos等人,2022(https://arxiv.org/html/2607.16354#bib.bib18))。由于传统的监督学习流程依赖于刚性的、批处理导向的训练,并需要大量数据池进行昂贵的离线重新训练,它们无法无缝地吸收实时需求反馈。因此,实际中预测偏差的校正仍然主要是反应性的(Wang等人,2024(https://arxiv.org/html/2607.16354#bib.bib19))。一旦基础模型训练并部署后,它作为一个开环预测器运行,缺乏针对短期运营波动和并发时间偏移进行实时校准的能力。这揭示了一个关键的方法空白:缺乏一种系统的、样本高效的机制,专门设计用于在线主动学习校正基线预测误差。 为填补这一空白,本研究提出了一种新颖的预测-校正(PtC)循环框架,用于自适应需求校准。我们不将预测误差校正视为被动的标签拟合任务,而是将实时预测调整重新表述为一个上下文Bandit(CB)问题。在所提出的框架中,离线ML模型首先生成基线预测,然后一个在线少样本连续上下文Bandit(FSCCB)策略通过基于即时奖励反馈从流式市场上下文中选择有界、连续的校正动作,动态微调这些预测。该架构的核心优势在于其解耦的闭环设计:它保留了离线基础模型捕获的结构性历史知识,同时使系统能够随着市场观察逐渐展开而具备实时的、逐步响应的能力。为解决早期周期发布中固有的数据稀缺性和稳定性-可塑性困境,该框架进一步集成了特征相似序列数据增强策略和稀疏参数更新机制(Mazumder等人,2021(https://arxiv.org/html/2607.16354#bib.bib61)),该机制仅更新高敏感的策参数,同时冻结主要结构网络。最终,该框架将运营预测范式从静态预测转变为自主、自校准的智能控制。 本文的主要贡献总结如下:(1)我们提出了一个两阶段PtC框架,将AI/ML预测与CB校正模型相结合。这使静态的开环需求预测转变为自适应的闭环系统,显著增强了对市场波动的预测响应能力。(2)为解决实时数据稀缺问题,我们开发了一种少样本连续更新策略。基础模型在历史数据上预训练以进行初始化,然后通过流式数据增强和选择性参数更新机制动态微调,实现对新需求模式的快速适应,同时防止过拟合和灾难性遗忘。 本文其余部分组织如下:下一节回顾相关工作。第3节(https://arxiv.org/html/2607.16354#S3)描述两阶段框架的细节。第4节(https://arxiv.org/html/2607.16354#S4)讨论实验结果。第5节(https://arxiv.org/html/2607.16354#S5)讨论PtC在库存管理系统中的应用。第6节(https://arxiv.org/html/2607.16354#S6)给出结论。 ## 2 文献综述 ### 2.1 传统统计方法用于需求预测 经典需求预测研究首先围绕外推时间序列模型展开。朴素法、移动平均法、指数平滑法和ARIMA族模型仍然广泛使用,因为它们透明、计算高效,并且在需求包含稳定的水平、趋势或季节性成分时有效(Taylor,2003(https://arxiv.org/html/2607.16354#bib.bib120);Nikolopoulos等人,2011(https://arxiv.org/html/2607.16354#bib.bib121);Hyndman和Athanasopoulos,2018(https://arxiv.org/html/2607.16354#bib.bib75))。指数平滑模型对最近观测赋予更大权重,因此提供了一种简单的方法来适应渐进的水平或趋势变化,而ARIMA型模型则使用自回归和移动平均结构来捕捉差分后的序列依赖关系。这些模型在运营环境中尤其吸引人,因为它们易于实施且特征工程需求有限。 零售应用将这些思想扩展到波动性和偏态需求场景:早期关于零售商需求预测的研究识别出促销、竞争对手行动、天气和节假日是重要驱动因素(Geurts和Kelly,1986(https://arxiv.org/html/2607.16354#bib.bib32)),而后续研究开发了区间预测、混合SARIMAX定量方法以及针对不规则到达或厚尾误差需求序列的间歇需求聚合策略(Taylor,2007(https://arxiv.org/html/2607.16354#bib.bib24);Arunraj和Ahrens,2015(https://arxiv.org/html/2607.16354#bib.bib31);Nikolopoulos等人,2011(https://arxiv.org/html/2607.16354#bib.bib121))。这一研究流的优势在于其清晰性:每个预测的来源通常可追溯到水平、季节性、趋势或一小部分滞后项。其局限性同样明显。一旦函数形式被指定,模型表示非线性促销效应、消费者响应变化、跨SKU替代或需求状态的突然转变的能力有限。因此,经典统计模型提供了可靠的基线,但不太适合预测挑战主要是快速适应而非稳定外推的场景。 第二类研究使用因果、多元和计量经济模型将解释性因素纳入需求预测。在零售系统中,需求很少仅由时间驱动。所有价格、折扣、展示活动、节假日、竞争信息、搜索强度、天气、社交媒体信号以及产品属性都可能改变实际销售。因此,运营和预测研究考察了如何将外部信息集成到预测管道中,以及判断性或促销调整如何影响预测质量(Fildes等人,2008(https://arxiv.org/html/2607.16354#bib.bib122);Trapero等人,2013(https://arxiv.org/html/2607.16354#bib.bib123);Steinker等人,2017(https://arxiv.org/html/2607.16354#bib.bib130);Boone等人,2018(https://arxiv.org/html/2607.16354#bib.bib131);Cui等人,2018(https://arxiv.org/html/2607.16354#bib.bib132);Fildes等人,2022(https://arxiv.org/html/2607.16354#bib.bib133))。在快速消费品和SKU级别的零售环境中,变量选择和结构化计量经济模型已被用于解决高维促销变量、竞争效应和时变营销影响(Ma等人,2016(https://arxiv.org/html/2607.16354#bib.bib26);Huang等人,2014(https://arxiv.org/html/2607.16354#bib.bib27),2019(https://arxiv.org/html/2607.16354#bib.bib28);Ye等人,2024(https://arxiv.org/html/2607.16354#bib.bib33))。分层贝叶斯和有限混合扩展进一步考察了商店层面的异质性是否能改善预测和弹性估计(Andrews等人,2008(https://arxiv.org/html/2607.16354#bib.bib34))。这些研究通过将预测与可解释的商业机制联系起来做出了重要贡献:它们展示了观察到的运营杠杆如何提高预测准确性和管理理解,而不是将需求视为自发的时间序列。 然而,这种解释丰富性的增益带来了实际的权衡。因果和多元模型需要良好测量的协变量、协变量与需求之间稳定的关系,以及足够多的观测来可靠地估计效应。当包含许多促销、价格、日历和竞争变量时,模型可能面临稀疏事件覆盖和沉重的变量选择负担(Trapero等人,2015(https://arxiv.org/html/2607.16354#bib.bib124))。这些困难在新产品、短销售窗口和低销量SKU中尤为突出,因为在这些场景中,估计丰富解释模型所需的数据可能尚未存在。大规模实证证据也警告说,模型复杂性并不自动转化为更好的预测。M竞赛表明,统计上复杂的方法可能无法在广泛的预测基准上优于更简单的替代方案(Makridakis等人,1982(https://arxiv.org/html/2607.16354#bib.bib126),1993(https://arxiv.org/html/2607.16354#bib.bib127);Makridakis和Hibon,2000(https://arxiv.org/html/2607.16354#bib.bib128)),相关证据认为过度的模型复杂性会降低准确性、增加错误机会并削弱管理可用性(Green和Armstrong,2015(https://arxiv.org/html/2607.16354#bib.bib125))。这一发现对零售供应链很重要,因为预测不是孤立的统计练习。预测是补货、分配、定价和库存控制决策的输入,因此一种方法即使略微更准确但维护困难,在实际中仍可能不具吸引力。对快时尚库存和在线零售分析的研究表明,需求预测只有在及时且运营上可用时才创造价值(Caro和Gallien,2010(https://arxiv.org/html/2607.16354#bib.bib129);Ferreira等人,2016(https://arxiv.org/html/2607.16354#bib.bib135))。经过漫长重训练周期产生的预测对于订货决策可能为时已晚;需要大量手动特征重新设计的模型对于数千个SKU可能成本过高;而在平均情况下表现良好的方法在早期周期观测稀疏时仍可能失效。 ### 2.2 机器学习与深度学习模型 ML和DL方法通过允许非线性映射、高维协变量和大规模模式学习扩展了预测工具包。综述研究报告了ML工具在供应链需求预测、供应商选择、订单分配及相关运营中的广泛采用。

相似文章

用于离策略时序差分预测的行为感知辅助修正

arXiv cs.AI

本文提出用于离策略时序差分预测的行为感知辅助修正,引入了BA-TDC和BA-TDRC算法,这些算法用行为贝尔曼矩阵替代辅助协方差矩阵,以提高稳定性和收敛性。理论分析和在标准基准上的实验验证了所提方法的有效性。