面向动态UBSR度量的MDPs在线策略评估
摘要
本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。
arXiv:2607.23030v1 Announce Type: new
摘要:开发高效的函数近似方法进行策略评估是风险感知强化学习中的一个基本挑战。现有方法要么关注于限制性较强的风险度量类别,要么依赖于对模拟器的访问,这限制了它们在完全在线环境中的适用性。在这项工作中,我们提出了计算高效的在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的马尔可夫决策过程(MDPs)中进行策略评估。具体来说,我们引入了UBSR-TD算法,建立了其几乎必然收敛的条件,并开发了多个旨在加速收敛的变体。我们的公式表明,通过将损失函数纳入时间差分误差,现有的风险中性MDP策略评估算法可以很容易地适应动态UBSR设置。数值实验支持了我们的理论发现,并且在对具有保质期不确定性的易腐库存管理问题的应用中证明了所提方法的实际有效性。
查看缓存全文
缓存时间: 2026/07/28 06:24
# 具有动态UBSR测度的MDP的在线策略评估
**来源:** https://arxiv.org/html/2607.23030
Weikai Wang, Erick Delage
GERAD & Department of Decision Sciences, HEC Montréal, Canada \(weikai\.wang@hec\.ca\)
GERAD & Department of Decision Sciences, HEC Montréal, Canada \(erick\.delage@hec\.ca\)
###### 摘要
为策略评估开发高效函数逼近方法是风险感知强化学习中的一个基本挑战。现有方法要么局限于风险测度的严格类别,要么依赖于模拟器的可用性,这限制了它们在完全在线场景中的适用性。本文针对具有动态基于效用的短缺风险(UBSR)测度的马尔可夫决策过程(MDP),在线性函数逼近下,提出了计算高效的在线学习算法。具体而言,我们提出了UBSR-TD算法,建立了其几乎必然收敛的条件,并开发了多种加速收敛的变体。我们的公式表明,通过将损失函数纳入时序差分误差,现有的风险中性MDP策略评估算法可以轻松适配到动态UBSR设置。数值实验支持了我们的理论发现,并在一个具有保质期不确定性的易逝品库存管理问题中的应用展示了所提方法的实际有效性。
## 1 引言
从AlphaGo击败围棋世界冠军 [15](https://arxiv.org/html/2607.23030#bib.bib15) 到大型语言模型的微调 [109](https://arxiv.org/html/2607.23030#bib.bib109),强化学习(RL)取得了显著成功。RL的核心组成部分之一是策略评估,它对应于评估马尔可夫决策过程(MDP)中的给定策略,其准确性直接影响后续策略改进的效果。理论上,策略评估可以通过动态规划(DP)中的经典值迭代方法实现。然而在实践中,环境很少完全已知,数据收集可能代价高昂或受限,而且维数灾难常常使得精确DP方法在计算上不可行。这些挑战促使了从流式数据或有限数据中估计值函数的高效函数逼近方法的发展,包括时序差分(TD)类算法 [16](https://arxiv.org/html/2607.23030#bib.bib16)。
经典策略评估方法优化期望累积折扣成本,因此隐含地假设决策者是风险中性的。然而,在现实环境中,策略可能导致严重的不利结果,特别是在金融、自动驾驶和机器人等高风险领域 [23](https://arxiv.org/html/2607.23030#bib.bib23) 等。限制此类结果暴露的需求推动了风险感知RL方法的发展,这些方法将风险测度(静态或动态地)纳入其目标。遵循Artzner等人 [18](https://arxiv.org/html/2607.23030#bib.bib18) 的开创性框架,大量文献集中于熵风险测度(ERM)和一致风险测度,主要因为它们的解析可处理性 [107](https://arxiv.org/html/2607.23030#bib.bib107); [116](https://arxiv.org/html/2607.23030#bib.bib116); [34](https://arxiv.org/html/2607.23030#bib.bib34); [110](https://arxiv.org/html/2607.23030#bib.bib110)。尽管取得了这些进展,更一般的风险测度类别仍相对研究不足,这限制了现有方法在决策者试图通过定制损失函数捕捉多样化风险偏好的场景中的能力。
在此背景下,基于效用的短缺风险(UBSR)因其灵活性而吸引了越来越多的兴趣。UBSR根据一般损失函数和规定的可接受阈值来定义,它量化了将风险降低到可接受水平所需的最少额外资本量 [44](https://arxiv.org/html/2607.23030#bib.bib44)。这种一般公式将期望和ERM都作为特例包含在内。经验证据也表明,UBSR可以有效捕捉人类行为中观察到的异质风险偏好 [3](https://arxiv.org/html/2607.23030#bib.bib3)。此外,UBSR非常适合建模极端损失,并且是唯一可激励的凸风险测度,这一特性对于回测特别重要 [4](https://arxiv.org/html/2607.23030#bib.bib4)。
尽管具有若干吸引人的特性,UBSR在RL中受到的关注相对有限,部分原因是其缺乏一致性导致了实质性的分析困难。几项研究考虑了具有一般动态风险测度的MDP的函数逼近方法 [107](https://arxiv.org/html/2607.23030#bib.bib107); [43](https://arxiv.org/html/2607.23030#bib.bib43); [28](https://arxiv.org/html/2607.23030#bib.bib28); [11](https://arxiv.org/html/2607.23030#bib.bib11)。然而,这些方法通常需要采样预言来评估风险测度,因此不适用于在线设置。其他方法使用在线小批量或情节轨迹来估计风险 [114](https://arxiv.org/html/2607.23030#bib.bib114); [24](https://arxiv.org/html/2607.23030#bib.bib24); [25](https://arxiv.org/html/2607.23030#bib.bib25); [112](https://arxiv.org/html/2607.23030#bib.bib112),但其收敛性未得到保证。对于动态UBSR,Shen等人 [3](https://arxiv.org/html/2607.23030#bib.bib3) 开发了一种在线Q学习算法,但其函数逼近版本仍然缺失。据我们所知,对于函数逼近下具有动态风险测度的RL,仍有两个问题未解决:如何执行完全在线的策略评估,以及所得算法能否被证明几乎必然收敛。Basu等人 [113](https://arxiv.org/html/2607.23030#bib.bib113) 针对平均-ERM准则解决了这两个问题,但在此处考虑的折扣MDP设置之外的公式下进行。
受此差距的启发,本文旨在为具有动态UBSR的MDP开发完全在线的策略评估算法,在线性函数逼近下建立其几乎必然收敛性。我们的贡献可描述如下:
- • 我们提出了UBSR-TD,这是第一个用于具有动态UBSR的MDP的完全在线策略评估算法,采用线性函数逼近。该方法可视为经典TD(0)到一般损失函数的自然扩展。我们展示了UBSR-TD求解投影风险感知Bellman方程的不动点,并在适当条件下建立了其几乎必然收敛性。据我们所知,这是折扣MDP中具有动态风险测度的完全在线策略评估的第一个几乎必然收敛结果。
- • TD类算法在没有仔细超参数调整的情况下可能收敛缓慢 [16](https://arxiv.org/html/2607.23030#bib.bib16)。为缓解此问题,我们引入了UBSR-TD的两个扩展,利用历史和梯度信息。我们通过数值方法在不同风险和参数设置下评估了所提方法。结果表明,这些变体可以在广泛场景下改善收敛。我们的公式表明,通过将损失函数纳入TD误差,现有策略评估算法可以轻松适配到动态UBSR框架。
- • 我们将我们的方法进一步应用于具有需求和产品保质期不确定性的易逝品库存管理,这是一个仅在风险中性下研究过的增长领域 [86](https://arxiv.org/html/2607.23030#bib.bib86); [99](https://arxiv.org/html/2607.23030#bib.bib99); [85](https://arxiv.org/html/2607.23030#bib.bib85)。现有的风险感知模型使用条件风险价值或ERM作为风险测度 [102](https://arxiv.org/html/2607.23030#bib.bib102); [104](https://arxiv.org/html/2607.23030#bib.bib104); [103](https://arxiv.org/html/2607.23030#bib.bib103),但没有考虑保质期不确定性。我们在动态UBSR下制定了一个近似动态规划模型,并在策略迭代方案中采用我们提出的策略评估算法。数值实验表明,我们的方法在多种场景下始终优于静态、短视和风险中性基准,凸显了风险感知决策的价值。
本文的其余部分组织如下。第2节 (https://arxiv.org/html/2607.23030#S2) 介绍基本定义,并表述动态UBSR下风险感知MDP的策略评估问题。第3节 (https://arxiv.org/html/2607.23030#S3) 提出UBSR-TD算法,而第4节 (https://arxiv.org/html/2607.23030#S4) 提供其收敛性分析。第5节 (https://arxiv.org/html/2607.23030#S5) 介绍用于加速收敛的UBSR-TD扩展。第6节 (https://arxiv.org/html/2607.23030#S6) 报告了算法收敛性的数值实验,并展示了在易逝品库存管理问题中的应用。最后,第7节 (https://arxiv.org/html/2607.23030#S7) 总结全文并讨论未来研究方向。
## 2 预备知识
**符号说明:** 设 \((\Omega,\mathcal{F},\mathbb{P})\) 为有限概率空间,其中 \(\Omega\) 是有限样本空间,\(\mathcal{F} := 2^{|\Omega|}\) 是 \(\Omega\) 上的 \(\sigma\)-代数,\(\mathbb{P}\) 是 \((\Omega,\mathcal{F})\) 上的概率测度。设 \(\mathcal{L}(\Omega)\) 表示 \((\Omega,\mathcal{F},\mathbb{P})\) 上所有实值可测函数的空间。对于 \(X,Y \in \mathcal{L}(\Omega)\),如果对所有 \(\omega \in \Omega\) 有 \(X(\omega) \ge Y(\omega)\),则记 \(X \ge Y\);如果对所有满足 \(\mathbb{P}(\omega) > 0\) 的 \(\omega \in \Omega\) 有 \(X(\omega) \ge Y(\omega)\),则称 \(X \ge Y\) 几乎必然 (a.s.)。
### 2.1 风险测度
根据Shapiro等人 [73](https://arxiv.org/html/2607.23030#bib.bib73),给定有限概率空间 \((\Omega,\mathcal{F},\mathbb{P})\),风险测度是一个映射 \(\rho: \mathcal{L}(\Omega) \to \mathbb{R}\)。考虑以下性质:
1. (a) **单调性:** 对所有 \(X,Y \in \mathcal{L}(\Omega)\),若 \(X \ge Y\) a.s.,则 \(\rho(X) \ge \rho(Y)\);
2. (b) **平移不变性:** 对任意 \(\lambda \in \mathbb{R}, X \in \mathcal{L}(\Omega)\),有 \(\rho(X+\lambda) = \rho(X) + \lambda\);
3. (c) **归一化:** \(\rho(0) = 0\);
4. (d) **凸性:** 对所有 \(\alpha \in [0,1], X,Y \in \mathcal{L}(\Omega)\),有 \(\rho(\alpha X + (1-\alpha)Y) \le \alpha \rho(X) + (1-\alpha) \rho(Y)\);
5. (e) **正齐次性:** 对所有 \(\lambda \ge 0, X \in \mathcal{L}(\Omega)\),有 \(\rho(\lambda X) = \lambda \rho(X)\)。
满足性质 (a)-(c) 的风险测度称为货币风险测度。额外满足 (d) 的称为凸风险测度,进一步满足 (e) 的称为一致风险测度。我们现在介绍一类具有许多理想性质的特殊风险测度。
###### 定义 2.1. 称 \((\Omega,\mathcal{F},\mathbb{P})\) 上的风险测度为基于效用的短缺风险 (UBSR) 测度,如果它可以表示为:
\[
\SR(X) := \inf\left\{ m \in \mathbb{R} : \mathbb{E}[\ell(X-m)] \le 0 \right\}, \quad \forall X \in \mathcal{L}(\Omega),
\]
其中损失函数 \(\ell: \mathbb{R} \to \mathbb{R}\) 是连续且严格递增的,且 \(\ell(0) = 0\)。
注意,Föllmer和Schied [44](https://arxiv.org/html/2607.23030#bib.bib44) 中UBSR的原始定义仅限于凸损失函数。这里我们采用Shen等人 [3](https://arxiv.org/html/2607.23030#bib.bib3) 的更一般定义,它允许更广泛的损失函数类别,从而允许更广泛的风险测度类别。以下示例表明许多流行的风险测度是UBSR的特例。
###### 示例 2.2 (期望值). 期望对应于由 \(\ell(x) = x\) 诱导的UBSR,我们称之为风险中性的测度。
###### 示例 2.3 (分位数期望). 分位数期望是唯一的一致UBSR [4](https://arxiv.org/html/2607.23030#bib.bib4)。它由损失函数 \(\ell_{\mathrm{EXP}}(x) := \tau x^{+} - (1-\tau) x^{-}\) 诱导,其中 \(\tau \in [0,1]\) 控制风险厌恶。随着 \(\tau\) 从0增加到1,分位数期望从随机变量的本质下确界变化到本质上确界,在 \(\tau=0.5\) 时恢复为期望。
###### 示例 2.4 (熵风险测度). 熵风险测度 \(\rho_{\mathrm{ERM}}(X) := \frac{1}{\beta} \log(\mathbb{E}[\mathrm{e}^{\beta X}])\) 是UBSR,损失函数为 \(\ell_{\mathrm{ERM}}(x) = \mathrm{e}^{\beta x} - 1\),其中 \(\beta > 0\) 表示风险敏感度。
###### 示例 2.5 (软分位数). Hau等人 [74](https://arxiv.org/html/2607.23030#bib.bib74) 引入的软分位数风险测度近似分位数风险测度,同时解决了分位数损失的不连续性和零斜率问题。它通过损失函数定义:
\[
\ell_{\mathrm{SQ}}(x) :=
\begin{cases}
(1-\mu)(\kappa x + \kappa^2 - 1), & x < -\kappa, \\
\frac{1-\mu}{\kappa} x, & -\kappa \le x < 0, \\
\frac{\mu}{\kappa} x, & 0 \le x < \kappa, \\
\mu(\kappa x - \kappa^2 + 1), & x \ge \kappa,
\end{cases}
\]
其中 \(\mu \in (0,1)\) 作为风险水平,\(\kappa > 0\) 作为斜率参数。与分位数损失不同,软分位数损失是连续且严格递增的。
众所周知,UBSR是可激励的,并且可以通过评分函数 \(\psi(y-z)\) 来激励,其中 \(\psi(z) := \int_0^z \ell(\tau) d\tau\) (见Bellini和Bignozzi [4](https://arxiv.org/html/2607.23030#bib.bib4) 的定理4.6),并且 \(\SR(Y)\) 是期望评分函数的唯一最小化器,即
\[
\SR(Y) = \argmin_{z \in \mathbb{R}} \mathbb{E}[\psi(Y-z)].
\]
由微积分基本定理,\(\psi(z)\) 是可微的,且 \(\psi'(y) = \ell(y)\),对所有 \(y \in \mathbb{R}\)。从Emmer等人 [31](https://arxiv.org/html/2607.23030#bib.bib31) 可知,如果 \(\psi\) 是平方误差,则最小化器是期望值。作为UBSR性质的总结,我们给出以下命题。
###### 命题 2.6 (Föllmer和Schied [44](https://arxiv.org/html/2607.23030#bib.bib44) 的定理4.113). 对于定义2.1中定义的UBSR测度,以下陈述等价:对任意有限实值随机变量 \(Y\),有 (i) \(\SR(Y) = m^*\) 和 (ii) \(\mathbb{E}[\ell(Y - m^*)] = 0\)。
### 2.2 风险感知MDP
考虑一个MDP \((\mathcal{X}, \mathcal{A}, P, c, \gamma)\),其中 \(\mathcal{X} = \{1, \ldots, N\}\) 和 \(\mathcal{A}\) 是有限的状态和动作空间,\(P\) 是转移核,\(c\) 是成本函数,\(\gamma \in (0,1)\) 是折扣因子。相似文章
效用约束策略优化
本文介绍了一种简单而强大的方法,用于效用约束马尔可夫决策过程(UCMDPs),该方法无需预先固定约束界限即可实现风险敏感约束,在Safety Gymnasium基准测试中优于基线方法。
通过分位数贝叶斯风险MDP实现在线强化学习中鲁棒性与探索的动态权衡
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。
具有有界采样违规的分布式在线赌博机子模最大化
本文提出了一种统一的算法框架,用于在划分拟阵约束下的分布式在线子模最大化,在完全信息和赌博机反馈两种情况下均实现了次线性 (1-1/e)-遗憾保证。此外,还引入了一种有界随机管道取整方案,以确保累积采样违规保持次线性。
UDM-GRPO:面向均匀离散扩散模型的稳定高效群体相对策略优化
UDM-GRPO 为均匀离散扩散模型提出了一种稳定的强化学习训练框架,将 GenEval 准确率从 69% 提升至 96%,OCR 基准准确率从 8% 提升至 57%。
UP:打破探索-稳定性困境的无界正非对称优化
本文提出无界正非对称优化(UP),一种通用的即插即用目标函数,通过使用停止梯度锚定策略,解决了基于强化学习的大语言模型训练中的探索-稳定性困境,允许对正优势使用无裁剪梯度,同时对负优势进行裁剪。