学习预测性模糊集以用于面向决策的分布鲁棒优化
摘要
提出学习预测性模糊集(LPAS)用于分布鲁棒优化,其中深度上下文模型输出名义情景分布、状态依赖的Wasserstein半径和基础度量,并通过决策损失和校准进行训练。应用于S&P 500数据的投资组合优化,该方法实现了更高的回报和夏普比率,同时相比于固定半径基线减少了保守性。
arXiv:2607.09820v1 公告类型:新
摘要:预测-优化系统通常将不确定性压缩为点预测,然后求解下游优化问题,仿佛该预测是可靠的。分布鲁棒优化(DRO)提供了针对模型误设的保护,但模糊集通常以历史样本为中心并使用固定半径。我们提出\emph{学习预测性模糊集}(LPAS):一个深度上下文模型输出有限的名义情景分布、状态依赖的Wasserstein半径,以及可选各向异性的基础度量。这些输出定义了一个上下文模糊集,供DRO决策层使用。半径通过条件分位数校准、大小正则化和下游决策损失的组合进行训练,使得鲁棒性是自适应的而非全局固定的。我们推导了决策层使用的有限对偶形式,提出了分阶段训练算法,并在2018至2026年间包含20只S&P 500成分股的分布鲁棒投资组合优化上评估了该方法。所提出的方法显著优于等权重、预测-优化和历史Wasserstein DRO基线,实现了26.28%的年化回报、1.30的夏普比率、1.61的最终财富,并且相比深度固定半径DRO基线,在平均半径更小的同时具有更低的尾部损失。结果表明,学习到的模糊半径能够恢复强固定半径DRO的大部分性能,同时减少不必要的保守性并提高机制适应性。
查看缓存全文
缓存时间: 2026/07/14 04:14
## 学习预测模糊集用于以决策为中心的分布鲁棒优化
来源: https://arxiv.org/html/2607.09820
###### 摘要
先预测后优化系统通常将不确定性压缩为一个点预测,然后假设该预测是可靠的基础上求解下游优化问题。分布鲁棒优化(DRO)提供了针对模型误设的保护,但模糊集通常以历史样本为中心并使用固定半径。我们提出*学习预测模糊集*(LPAS):一个深度上下文模型输出一个有限名义场景分布、一个状态依赖的Wasserstein半径,以及可选的一个各向异性的基础度量。这些输出定义了一个上下文模糊集,该模糊集作为DRO决策层的输入。半径通过条件分位数校准、规模正则化和下游决策损失的组合进行训练,使得鲁棒性是自适应的而非全局固定的。我们推导了决策层使用的有限对偶形式,提出了一个分阶段训练算法,并在包含2018–2026年20个S&P 500成分股的分布鲁棒投资组合优化中评估了该方法。所提出的方法显著优于等权重、先预测后优化和历史Wasserstein DRO基线,实现了26.28%的年化收益率、1.30的夏普比率、1.61的最终财富,并且与深度固定半径DRO基线相比,在平均半径更小的情况下实现了更低的尾部损失。结果表明,学习的模糊半径可以恢复强固定半径DRO的大部分性能,同时减少不必要的保守性并提高情景自适应性。
## 1 引言
许多机器学习决策系统采用如下流水线:
$$z_t \longrightarrow \widehat{\xi}_{t+1} \longrightarrow x_t,$$ (1)
其中 $z_t$ 是上下文,$\widehat{\xi}_{t+1}$ 是对未来不确定量的预测,$x_t$ 是下游决策。在投资组合优化中,$\xi_{t+1}$ 代表未来收益率;在库存控制中,代表需求;在网络优化中,代表边成本。这种架构简单,但过度信任预测模型。在预测空间中很小的误差在决策空间可能被放大,特别是当优化器沿着活跃约束或高灵敏度方向放大错误时。
DRO 用模糊集替代单一预测分布,并针对最坏可能分布进行优化。一个常见的公式是
$$\min_{x \in \mathcal{X}} \sup_{Q \in \mathcal{P}} \mathbb{E}_Q [\ell(x,\xi)],$$ (2)
其中 $\ell$ 是下游损失,$\mathcal{P}$ 是模糊集。Wasserstein DRO 具有吸引力,因为它提供了一种几何感知的方式来干扰经验或名义分布,并且通常可转化为可处理的凸优化问题(Mohajerin Esfahani and Kuhn 2018 (https://arxiv.org/html/2607.09820#bib.bib17); Gao and Kleywegt 2023 (https://arxiv.org/html/2607.09820#bib.bib11); Blanchet and Murthy 2019 (https://arxiv.org/html/2607.09820#bib.bib5); Kuhn et al. 2019 (https://arxiv.org/html/2607.09820#bib.bib15))。然而,模糊集通常是手工设计的:中心是历史经验分布,半径是通过验证或统计集中度调整的固定标量。这在上下文环境中可能不匹配。在波动期安全的半径在稳定期可能过于保守,而针对平均验证损失调整的半径可能在状态转换下失效。
本文探讨模糊集本身是否可以预测。给定上下文 $z_t$,一个深度模型输出一个有限名义分布
$$\widehat{P}_\theta(\cdot \mid z_t) = \sum_{i=1}^N p_{\theta,i}(z_t) \delta_{\widehat{\xi}_{\theta,i}(z_t)},$$ (3)
加上一个非负半径 $\rho_\phi(z_t)$。它们定义了上下文 Wasserstein 模糊集
$$\mathcal{P}_{\theta,\phi}(z_t) = \left\{ Q : \mathsf{W}_c \bigl( Q, \widehat{P}_\theta(\cdot \mid z_t) \bigr) \leq \rho_\phi(z_t) \right\}.$$ (4)
然后通过一个 DRO 层计算决策。关键建模原则是:不确定性既应统计校准,又应与决策相关:当预测不可靠或决策对误差敏感时,半径应较大;当鲁棒性主要导致保守性时,半径应较小。
#### 贡献。
本文做出四点贡献。首先,引入了学习预测模糊集,这是概率深度预测与 Wasserstein DRO 之间的上下文桥梁。其次,开发了一个半径学习目标,结合了预测损失、分位数式校准、半径规模正则化和实际决策损失。第三,通过 Wasserstein 对偶给出了一个可处理的 DRO 层,以及一个可实施的分阶段训练算法。第四,提供了一个投资组合优化研究,表明自适应模糊半径可以显著优于非鲁棒和历史DRO基线,并且可以用更小的学习半径匹配深度固定半径 DRO 模型的大部分性能。
## 2 相关工作
#### 鲁棒优化与 DRO。
经典鲁棒优化通过确定性不确定集保护决策,并为许多锥和线性模型提供可处理的重构(Ben-Tal, El Ghaoui, and Nemirovski 2009 (https://arxiv.org/html/2607.09820#bib.bib3); Bertsimas, Brown, and Caramanis 2011 (https://arxiv.org/html/2607.09820#bib.bib4))。DRO 将这一思想从不确定参数扩展到不确定概率定律。基于矩的模糊集提供了早期的数据驱动 DRO 公式(Delage and Ye 2010 (https://arxiv.org/html/2607.09820#bib.bib8); Goh and Sim 2010 (https://arxiv.org/html/2607.09820#bib.bib13)),而现代 Wasserstein 模糊集使用最优输运几何来比较经验分布和扰动分布(Mohajerin Esfahani and Kuhn 2018 (https://arxiv.org/html/2607.09820#bib.bib17); Gao and Kleywegt 2023 (https://arxiv.org/html/2607.09820#bib.bib11); Blanchet and Murthy 2019 (https://arxiv.org/html/2607.09820#bib.bib5))。Wasserstein DRO 也与机器学习中的统计正则化和对抗鲁棒性有关(Shafieezadeh-Abadeh, Mohajerin Esfahani, and Kuhn 2015 (https://arxiv.org/html/2607.09820#bib.bib20); Sinha, Namkoong, and Duchi 2018 (https://arxiv.org/html/2607.09820#bib.bib21); Duchi and Namkoong 2021 (https://arxiv.org/html/2607.09820#bib.bib9); Gao, Chen, and Kleywegt 2022 (https://arxiv.org/html/2607.09820#bib.bib12))。LPAS 保留了 Wasserstein DRO 的可处理最坏情况期望机制,但使中心和半径成为上下文可学习的。
#### 以决策为中心的学习。
智能先预测后优化通过下游决策质量而非标准预测误差来训练预测模型(Elmachtoub and Grigas 2022 (https://arxiv.org/html/2607.09820#bib.bib10))。相关的以决策为中心的方法通过组合或连续优化层进行微分,使得预测器为最终任务优化(Wilder, Dilkina, and Tambe 2019 (https://arxiv.org/html/2607.09820#bib.bib25); Amos and Kolter 2017 (https://arxiv.org/html/2607.09820#bib.bib2); Agrawal et al. 2019 (https://arxiv.org/html/2607.09820#bib.bib1))。LPAS 遵循这一原则,但学习的对象不仅仅是点估计或确定性成本向量。它是一个预测分布加上一个状态依赖的模糊半径,因此下游层可以决定在哪里优化以及需要多少鲁棒性。
#### 学习不确定集与校准。
最近的工作从数据中学习鲁棒不确定集,并通过鲁棒优化问题进行微分(Wang et al. 2023 (https://arxiv.org/html/2607.09820#bib.bib24))。先预测后校准方法在拟合预测器后构建鲁棒上下文可行集(Sun, Liu, and Li 2023 (https://arxiv.org/html/2607.09820#bib.bib22)),而端到端条件鲁棒优化直接训练具有覆盖敏感目标的鲁棒上下文决策(Chenreddy and Delage 2024 (https://arxiv.org/html/2607.09820#bib.bib7))。LPAS 的不同之处在于联合学习一个有限预测分布和一个 Wasserstein 半径。半径学习损失也与分位数回归和保形校准有关,它们提供了自适应预测不确定性的工具(Koenker and Bassett 1978 (https://arxiv.org/html/2607.09820#bib.bib14); Romano, Patterson, and Candes 2019 (https://arxiv.org/html/2607.09820#bib.bib19))。
#### 投资组合优化。
实验任务基于均值-方差投资组合选择(Markowitz 1952 (https://arxiv.org/html/2607.09820#bib.bib16))和风险敏感型投资组合设计。Wasserstein DRO 已被研究用于鲁棒均值-方差投资组合及相关金融决策问题(Blanchet, Chen, and Zhou 2022 (https://arxiv.org/html/2607.09820#bib.bib6))。我们的投资组合层使用预测情景模型估计收益率,使用 Wasserstein 模糊惩罚来抑制激进预测,以及标准的换手率和协方差正则化。由于平均收益率可能隐藏下行风险,我们还报告了 CVaR 等尾部指标(Rockafellar and Uryasev 2000 (https://arxiv.org/html/2607.09820#bib.bib18))。
## 3 问题设定
令 $(z,\xi) \sim P^\star$,其中 $z \in \mathcal{Z}$ 是观测到的上下文,$\xi \in \Xi \subseteq \mathbb{R}^d$ 是决策后实现的不确定量。决策者选择 $x \in \mathcal{X} \subseteq \mathbb{R}^m$ 并承担损失 $\ell(x,\xi)$。目标是学习一个上下文决策规则 $z \mapsto x(z)$,具有较低的样本外损失和稳定的尾部行为。
所提出架构有四个组成部分:一个名义情景模型 $\widehat{P}_\theta(\cdot \mid z)$,一个半径网络 $\rho_\phi(z)$,一个可选的基础度量 $c_\psi(\xi,\xi';z)$,以及一个 DRO 决策层。名义模型返回情景 $\widehat{\xi}_{\theta,i}(z)$ 和概率 $p_{\theta,i}(z)$,满足 $\sum_i p_{\theta,i}(z)=1$。半径网络参数化为
$$\rho_\phi(z) = \rho_{\min} + \operatorname{softplus}(g_\phi(z)),$$ (5)
这保证了非负性。一个有界替代方案为
$$\rho_\phi(z) = \rho_{\min} + (\rho_{\max} - \rho_{\min}) \sigma(g_\phi(z)).$$ (6)
可选度量可以是固定的,例如 $c(\xi,\xi') = \|\xi-\xi'\|_2$,也可以是上下文和各向异性的,例如
$$c_\psi(\xi,\xi';z) = \|A_\psi(z)(\xi-\xi')\|_2.$$ (7)
本文实验使用固定的欧氏输运几何;学习度量的扩展作为模块化组件预留。
## 4 学习预测模糊集
### 4.1 离散名义分布
对于每个上下文 $z_t$,模型输出
$$\widehat{P}_{\theta,t} = \sum_{i=1}^N p_{\theta,i}(z_t) \delta_{\widehat{\xi}_{\theta,i}(z_t)}.$$ (8)
预测均值为
$$\widehat{\mu}_{\theta,t} = \mathbb{E}_{\widehat{P}_{\theta,t}}[\xi] = \sum_{i=1}^N p_{\theta,i}(z_t) \widehat{\xi}_{\theta,i}(z_t).$$ (9)
点预测基线仅使用 $\widehat{\mu}_{\theta,t}$,而 LPAS 使用完整的有限分布作为 Wasserstein 球的中心。
### 4.2 Wasserstein 模糊集
对于分布 $Q \in \mathcal{P}(\Xi)$ 和名义分布 $\widehat{P}_{\theta,t}$,定义
$$\mathsf{W}_{c_\psi}(Q,\widehat{P}_{\theta,t}; z_t) = \inf_{\gamma \in \Pi(Q,\widehat{P}_{\theta,t})} \int_{\Xi \times \Xi} c_\psi(\xi,\widehat{\xi}; z_t) \, \mathrm{d}\gamma(\xi,\widehat{\xi}),$$ (10)
其中 $\Pi(Q,\widehat{P}_{\theta,t})$ 是边际为 $Q$ 和 $\widehat{P}_{\theta,t}$ 的耦合集。学习到的模糊集为
$$\mathcal{P}_{\theta,\phi,\psi,t} = \{ Q \in \mathcal{P}(\Xi) : \mathsf{W}_{c_\psi}(Q,\widehat{P}_{\theta,t}; z_t) \leq \rho_\phi(z_t) \}.$$ (11)
如果 $Q = \sum_{j=1}^M q_j \delta_{\xi_j}$ 也是离散的,那么输运差异是一个线性规划
$$\min_{\pi \geq 0} \sum_{j=1}^M \sum_{i=1}^N c_\psi(\xi_j, \widehat{\xi}_{\theta,i}; z_t) \pi_{ji}$$ (12)
约束为 $\sum_j \pi_{ji} = p_{\theta,i}(z_t)$ 和 $\sum_i \pi_{ji} = q_j$。因此半径控制着从预测情景出发的对抗性质量传输量。
### 4.3 DRO 决策层
给定模糊集,决策为
$$x_t^\star = \arg\min_{x \in \mathcal相似文章
分布鲁棒的列表级偏好优化
本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。
用于LLM强化学习的预测性散度掩码
提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。
面向上下文LLM级联的在线Pandora's Box
本文介绍了一种面向自适应查询和选择LLM API的在线上下文Pandora's Box模型,提出了一种结合GMM估计与UCB风格置信区间的学习方法,并证明了维度相关的遗憾界。
决策聚焦的稀疏切线投资组合优化
本文提出了一种用于稀疏切线投资组合优化的端到端决策聚焦学习框架,该框架用平滑top-k算子替代离散资产选择,使得梯度能够在预测和优化中流动,从而直接最大化夏普比率。
面向稀疏奖励强化学习的不确定性感知LLM引导策略塑形
提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。