基于上下文和删失需求的定价与库存学习

arXiv cs.LG 论文

摘要

本文提出了一种结合上下文信息和删失需求的联合定价与库存控制框架,引入了一种高效算法,并证明了其遗憾界。

arXiv:2609.06083v1 Announce Type: new 摘要:制定最优的联合定价与库存控制决策对现代零售商来说是一个关键挑战。在实践中,零售商面临着不断变化的市场条件,需求受到各种上下文因素的影响,同时还要应对销售损失模糊真实需求信息的困难。然而,现有方法往往未能同时考虑上下文信息和删失需求观测。我们通过提出一个框架来解决这一差距,该框架将需求建模为基函数的线性组合,系数未知,从而实现能够响应变化上下文的自适应定价和库存决策。我们提出了一种高效算法,在凹收益条件下实现遗憾界 $\mathcal{O}(K\sqrt{T}\log T)$,在一般情况下实现 $\mathcal{O}(K^{2/3}T^{2/3}(\log T)^{1/2})$,并通过匹配的下界确认了其最优性。在不同场景下的大量数值实验证明了我们算法的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:32

# 学习在上下文信息与删失需求下的定价与库存控制
来源:https://arxiv.org/html/2609.06083
韩泽、丁泽震††thanks:通讯作者。单位:香港科技大学;邮箱:[[email protected]](mailto:[email protected]);张继恒
单位:香港科技大学;邮箱:[[email protected]](mailto:[email protected])

###### 摘要

实现最优的联合定价与库存控制决策是现代零售商面临的关键挑战。在实践中,零售商面对不断变化的市场条件,需求受多种上下文因素影响,同时还要处理因缺货导致真实需求信息被遮蔽的困难。然而,现有方法往往未能同时考虑上下文信息和删失需求观测值。我们通过提出一个框架来弥补这一不足,该框架将需求建模为带有未知系数的基函数的线性组合,从而实现能够响应变化上下文的自适应定价和库存决策。我们提出一种高效算法,在凹收益条件下实现后悔界 \(\mathcal{O}(K\sqrt{T}\log T)\),在一般情况下实现 \(\mathcal{O}(K^{2/3}T^{2/3}(\log T)^{1/2})\),并且匹配的下界证实了其最优性。在各种场景下的大量数值实验证明了我们算法的有效性。

## 1 引言

近年来,联合定价与库存控制引起了学术界和工业界的广泛关注。领先的零售商越来越多地利用数据科学来推动定价策略、库存管理和供应链优化的创新。这种日益增长的兴趣反映在全面的综述文献中(Chen and Simchi-Levi, 2012 (https://arxiv.org/html/2609.06083#bib.bib38);Yano and Gilbert, 2004 (https://arxiv.org/html/2609.06083#bib.bib39);Petruzzi and Dada, 1999b (https://arxiv.org/html/2609.06083#bib.bib40))。然而,一个关键的差距仍然存在:大多数现有模型忽视了删失需求和上下文信息的作用,而这对于自适应决策至关重要。在本文中,我们通过研究考虑上下文信息并带有缺货的最优联合定价与库存控制策略来弥补这一差距,旨在使理论更接近现实应用。

在本文中,我们研究了一个在有限时间 \(T\) 期且带有上下文信息和缺货的联合定价与库存控制问题。在每期开始时,卖方观察影响客户需求的上下文信息。需求函数被建模为 \(K\) 个基函数的线性组合,系数未知,并附带一个独立随机噪声项。使用观察到的上下文和估计的需求函数,卖方同时设定销售价格和库存水平,补货立即生效。决策后,只能观察到删失需求,即实际需求与可用库存的最小值,因为未满足的需求会损失。剩余库存结转至下一期,产生线性持有成本,而未满足的需求则产生线性缺货损失成本。目标是最大化利润,定义为销售收入减去库存持有和缺货成本,在 \(T\) 期范围内。

我们的问题引入了几个相互关联的挑战,使理论分析和实际实施复杂化。首先,删失需求的存在阻碍了对真实需求信号的直接观察,需要开发需求函数的无偏估计器,同时减轻因数据不完整而产生的固有偏差。其次,上下文因素的引入使问题具有动态性,因此导致静态策略的传统优化方法不再适用。定价和库存决策都必须适应上下文信息以实现最优。最后,当我们将方法论应用于基函数组合之外的模型时,由于理想化模型与现实动态之间的结构不匹配,会产生近似误差,需要进行严格的误差量化和鲁棒性保证。这些挑战共同要求将删失数据修正、上下文感知的在线优化、随机库存控制和误差有界近似技术进行新颖的整合。

注意:上述列出的后悔界省略了常数因子和 \(\mathrm{poly}(\log T)\) 项。此处,\(\nu = \frac{1}{\sqrt{3\ln T}} + \frac{0.25}{\sqrt{\ln T}}\)。

表1:联合定价与库存控制问题下的后悔界比较
我们的贡献可总结如下:

1. 1\. **上下文感知的定价与库存优化。** 我们提出了一个用于联合定价和库存管理的框架(参见表1 (https://arxiv.org/html/2609.06083#S1.T1)),其中决策适应上下文信息,定价和库存策略都响应变化的环境。
2. 2\. **算法框架与后悔分析。** 我们提出了一种易于实现的算法,解决删失需求、动态上下文和随机库存动态问题。在凹收益下,我们的方法达到 \(\mathcal{O}(K\sqrt{T}\log T)\) 后悔界,匹配下界。在非凹情况下,我们推导出 \(\mathcal{O}(K^{2/3}T^{2/3}(\log T)^{1/2})\) 后悔界,并在定理4.4 (https://arxiv.org/html/2609.06083#S4.Thmmythm4) 中证明了对于 \(m\) 次可微收益函数的下界 \(\Omega(T^{(m+1)/(2m+1)})\),确立了极小极大最优性(参见表1 (https://arxiv.org/html/2609.06083#S1.T1))。
3. 3\. **库存可行性。** 为解决来自上下文信息的不可行目标库存水平,我们开发了一种基于排队论的方法,使用随机递归来界定库存不匹配导致的后悔,确保在随机性下的稳定性能。

### 1.1 相关工作

**动态定价。** 最初的研究集中在非上下文动态定价(Besbes and Zeevi, 2015 (https://arxiv.org/html/2609.06083#bib.bib22);Cesa-Bianchi et al., 2019 (https://arxiv.org/html/2609.06083#bib.bib18))。Wang et al. (2021b) (https://arxiv.org/html/2609.06083#bib.bib21) 为 \(m\) 次平滑需求函数实现了 \(\tilde{\mathcal{O}}(T^{(m+1)/(2m+1)})\) 后悔界,并有匹配的下界。Bu et al. (2022) (https://arxiv.org/html/2609.06083#bib.bib24) 将其扩展到可加线性上下文效应,建立了实例相关界。其他模型假设伯努利购买决策(Javanmard and Nazerzadeh, 2019 (https://arxiv.org/html/2609.06083#bib.bib16);Golrezaei et al., 2019 (https://arxiv.org/html/2609.06083#bib.bib17);Choi et al., 2023 (https://arxiv.org/html/2609.06083#bib.bib19);Xu and Wang, 2022 (https://arxiv.org/html/2609.06083#bib.bib14);Luo et al., 2024 (https://arxiv.org/html/2609.06083#bib.bib12);Luo et al., 2022 (https://arxiv.org/html/2609.06083#bib.bib13);Fan et al., 2024 (https://arxiv.org/html/2609.06083#bib.bib15))。相关研究(Luo et al., 2024 (https://arxiv.org/html/2609.06083#bib.bib12);Luo et al., 2022 (https://arxiv.org/html/2609.06083#bib.bib13);Fan et al., 2024 (https://arxiv.org/html/2609.06083#bib.bib15))有相似的设定但在噪声分布假设上有所不同,后悔界范围从 \(\tilde{\mathcal{O}}(d_{0}^{2}T^{2/3})\) 到 \(\tilde{\mathcal{O}}((d_{0}T)^{(2m+1)/(4m-1)})\)(Luo et al., 2022 (https://arxiv.org/html/2609.06083#bib.bib13);Fan et al., 2024 (https://arxiv.org/html/2609.06083#bib.bib15))。Gong and Zhang (2024) (https://arxiv.org/html/2609.06083#bib.bib11) 实现了 \(\tilde{\mathcal{O}}(d_{0}^{1/3}T^{2/3})\) 并具有极小极大最优性。

**库存控制。** 经典的库存模型,如报童模型(Petruzzi and Dada, 1999a (https://arxiv.org/html/2609.06083#bib.bib25)),假设需求独立同分布,并使用基于SGD的方法进行优化,扩展到多产品设置、延迟补货(Zhang et al., 2020 (https://arxiv.org/html/2609.06083#bib.bib30))和数量约束(Shi et al., 2016 (https://arxiv.org/html/2609.06083#bib.bib29))。Lyu et al. (2024) (https://arxiv.org/html/2609.06083#bib.bib27) 使用小批量策略解决了SGD的不可行性问题。近期工作纳入了需求特征(Ding et al., 2021 (https://arxiv.org/html/2609.06083#bib.bib26)),而SAA方法从需求样本构建经验分布(Lin et al., 2022 (https://arxiv.org/html/2609.06083#bib.bib28))。

**联合定价与库存控制。** Whitin (1955) (https://arxiv.org/html/2609.06083#bib.bib31) 首次在完全信息下引入了联合定价与库存控制。后续工作(Bensoussan et al., 2019 (https://arxiv.org/html/2609.06083#bib.bib32))使用动态规划,而Qin et al. (2022) (https://arxiv.org/html/2609.06083#bib.bib33) 提出了带有样本复杂性分析的近似方法。在在线学习设定下,Chen et al. (2019) (https://arxiv.org/html/2609.06083#bib.bib34) 考虑了没有历史数据的数据驱动模型。Chen et al. (2021) (https://arxiv.org/html/2609.06083#bib.bib36) 使用样条插值和样本平均方法解决了删失需求问题。Chen et al. (2024) (https://arxiv.org/html/2609.06083#bib.bib35) 提出了用于凸/非凸需求函数的三元/二元搜索方法,建立了理论下界。然而,现有模型忽略了上下文信息;一旦考虑上下文,最优价格和库存随时间变化,使得先前算法不再适用。我们在表1 (https://arxiv.org/html/2609.06083#S1.T1) 中总结了比较。

**上下文老虎机。** 我们的策略与老虎机算法相关(Lattimore and Szepesvári, 2020 (https://arxiv.org/html/2609.06083#bib.bib1);Foster and Rakhlin, 2020 (https://arxiv.org/html/2609.06083#bib.bib9);Abbasi-Yadkori et al., 2011 (https://arxiv.org/html/2609.06083#bib.bib4);Takemura et al., 2021 (https://arxiv.org/html/2609.06083#bib.bib10);Auer, 2002 (https://arxiv.org/html/2609.06083#bib.bib2);Simchi-Levi and Xu, 2021 (https://arxiv.org/html/2609.06083#bib.bib6)),包括线性(Abbasi-Yadkori et al., 2011 (https://arxiv.org/html/2609.06083#bib.bib4))和广义线性老虎机(Li et al., 2017 (https://arxiv.org/html/2609.06083#bib.bib5);Chu et al., 2011 (https://arxiv.org/html/2609.06083#bib.bib3))。近期工作(Foster et al., 2018 (https://arxiv.org/html/2609.06083#bib.bib8);Agarwal et al., 2012 (https://arxiv.org/html/2609.06083#bib.bib7);Foster and Rakhlin, 2020 (https://arxiv.org/html/2609.06083#bib.bib9))通过回归预言机为一般函数类实现了最优后悔界。

**符号。** 在整个论文中,我们使用以下符号。对于任意正整数 \(n\),我们将集合 \(\{1,2,\cdots,n\}\) 记为 \([n]\)。集合 \(A\) 的基数记为 \(|A|\)。我们使用 \(\mathbf{I}_{\{E\}}\) 表示事件 \(E\) 的指示函数。具体地,若 \(E\) 发生,则 \(\mathbf{I}_{\{E\}}\) 取值为 \(1\),否则为 \(0\)。对于范数,我们使用符号 \(\|\cdot\|_p\),其中 \(1\leq p\leq\infty\) 表示 \(\ell_p\) 范数。在全文分析中,符号 \(\tilde{\mathcal{O}}\) 用于隐藏对绝对常数和对数项的依赖。它使我们能够专注于所涉及量的主要行为。

## 2 基本设置

考虑一家公司在 \(T\) 轮时间内销售单一类型的产品。在每轮 \(t\) 开始时,公司观察从未知分布在紧致域 \(\mathcal{X}\) 中独立同分布抽取的上下文 \(x_t\)。利用该上下文,公司确定定价 \(p_t\) 和库存补货至 \(y_t\) 的决策。需求建模为 \(D_t = \lambda(x_t, p_t) + \epsilon_t\),其中 \(\lambda(\cdot,\cdot)\) 是捕捉需求-上下文-价格曲线的确定性函数,\(\epsilon_t\) 是均值为 \(0\) 的独立同分布噪声随机变量。\(\epsilon_t\) 的分布函数和密度函数分别记为 \(F\) 和 \(f\)。公司对函数 \(\lambda(\cdot,\cdot)\) 或分布 \(F\) 没有先验知识,它必须顺序做出定价和库存决策,仅依靠历史数据来最大化 \(T\) 期的总利润。

**决策动态。** 设 \(I_t\) 表示第 \(t\) 轮开始时补货前的库存水平。一个可容许策略表示为 \(\{(p_t, y_t), t \geq 1\}\),其中 \(p_t \in [p_{\min}, p_{\max}]\) 是价格,\(y_t \geq I_t\) 是补货至的库存水平。决策 \((p_t, y_t)\) 仅依赖于轮次 \(t\) 之前可观察的上下文和历史数据。

给定任意可容许策略 \(\{(p_t, y_t), t \geq 1\}\),每轮 \(t\) 的事件序列描述如下:

1. 1\. 在每轮 \(t\) 开始时,公司观察上下文 \(x_t \in \mathcal{X} \subseteq \mathbb{R}^d\) 和初始库存水平 \(I_t\)。
2. 2\. 公司决定下订单将库存水平提高到 \(y_t \geq I_t\),并同时设定销售价格 \(p_t \in [p_{\min}, p_{\max}]\)。我们假设新订购的商品立即到达,即订购提前期为零。
3. 3\. 需求 \(D_t\) 实现并满足可用库存。任何未满足的需求会损失且不可观察。因此,缺货量 \((D_t - y_t)^+\) 不可观察,公司只观察到销售量(删失需求)\(o_t = \min\{D_t, y_t\}\),而非完全实现的需求 \(D_t\)。
4. 4\. 在第 \(t\) 轮结束时,公司获得利润
    \[
    q_t = p_t \min\{D_t, y_t\} - b(D_t - y_t)^+ - h(y_t - D_t)^+ = p_t D_t - (b + p_t)(D_t - y_t)^+ - h(y_t - D_t)^+,
    \]
    其中 \(h\) 和 \(b\) 分别是每单位持有成本和缺货损失成本。
5. 5\. 产品可能是易腐的,具有未知的腐坏率 \(\rho \in [0,1]\),这影响结转至下期的库存。状态转移由 \(I_{t+1} = \max\{\rho (y_t - D_t), 0\}\) 给出。

**完全信息基准。** 公司的目标是通过构建可容许策略 \(\{(p_t, y_t), t \geq 1\}\) 来最大化 \(T\) 期的期望总利润 \(\sum_{t=1}^{T} \mathbb{E}[q_t]\)。这是联合定价与库存控制的基本模型,在各种现实零售场景中具有潜在应用。

假设需求曲线 \(\lambda(\cdot,\cdot)\) 和噪声分布 \(F\) 已知,我们将短视定价与补货策略定义为一个基准。该策略表示为
\[
(p_t^*, y_t^*) = \mathop{\arg\max}_{p,y} Q(x_t, p, y), \quad \text{对于 } t=1,\dots,T,
\]
其中
\[
Q(x, p, y) = p \mathbb{E}_{\epsilon} \left[ \min\{\lambda(x, p) + \epsilon, y\} \right] - h \mathbb{E}_{\epsilon} \left[ (y - \lambda(x, p) - \epsilon)^+ \right] - b \mathbb{E}_{\epsilon} \left[ (\lambda(x, p) + \epsilon - y)^+ \right].
\]

相似文章

优化ARDL模型用于零售销售预测与公平定价

arXiv cs.LG

本文提出了一种针对零售食品的公平感知定价框架,利用自回归分布滞后(ARDL)模型进行销售预测,并通过线性规划与模拟退火算法在基于消费者物价指数(CPI)的边界下优化价格,以防止消费者剥削。