基于反事实策略的安全贝叶斯优化
摘要
本文介绍了一种在安全性相对于反事实基线策略定义的情况下进行安全贝叶斯优化的方法。它利用保形预测来估计反事实结果,并以用户指定的违规率提供安全保障。
arXiv:2607.05620v1 公告类型:新论文
摘要:在许多决策场景中,新干预措施只有在不会将结果降低到某个既定阈值以下时才被接受。例如,在临床医学中,新治疗通常只有在不相对于既定标准治疗恶化结果时才被接受。安全贝叶斯优化在满足安全性约束的条件下最大化目标函数。在我们考虑的设置中,安全性是相对于一个已知的基线策略定义的,该策略的结果是反事实的,因此无法观测。因此,必须估计基线策略的反事实结果,并利用这些(不确定的)估计值来安全地优化目标。我们通过使用保形预测来构建反事实基线结果的有效不确定性区间,解决了这一估计问题,并展示了如何将这些区间整合到安全贝叶斯优化中,以确保约束违规率低于或等于用户指定的水平。我们还展示了如何将这些保形估计适应于不同类型的协变量偏移。我们提供了安全性证明、实验证据以及敏感性分析。
查看缓存全文
缓存时间: 2026/07/08 04:44
# 基于反事实策略的安全贝叶斯优化
来源:https://arxiv.org/html/2607.05620
Katherine Avery 马萨诸塞大学阿默斯特分校计算机科学学院 马萨诸塞州阿默斯特 01002 kavery@cs\.umass\.edu &Bruno Castro da Silva 马萨诸塞大学阿默斯特分校计算机科学学院 马萨诸塞州阿默斯特 01002 bsilva@cs\.umass\.edu&David Jensen 马萨诸塞大学阿默斯特分校计算机科学学院 马萨诸塞州阿默斯特 01002 jensen@cs\.umass\.edu
###### 摘要
在许多决策制定场景中,只有当新的干预措施不会将结果降低到某个既定阈值以下时,它们才是可接受的。例如,在临床医学中,新的治疗方法通常只有在相对于既定的标准治疗不会使结果恶化时才被接受。安全贝叶斯优化在满足安全约束的前提下最大化目标。在我们这里考虑的场景中,安全是相对于一个已知的基线策略来定义的,该基线策略的结果是反事实的,因此未被观测到。因此,必须估计基线策略的反事实结果,并且必须利用这些(不确定的)估计来安全地优化目标。我们通过使用共形预测为反事实基线结果构建有效的置信区间来解决这个估计问题,并展示了如何将这些区间整合到安全贝叶斯优化中,以确保约束违反率低于或等于用户指定的水平。我们还展示了如何使这些共形估计适应不同类型的协变量偏移。我们提供了安全性证明、实验证据和敏感性分析。
## 1 引言
在许多序贯决策问题中,我们寻求在确保每个动作安全的同时提升性能。我们可以用绝对术语定义安全,例如将血压保持在阈值以下,但也可以依据既定的基线来定义。例如,在确定一种新抗癌药物的有效性时,我们可能不希望患者的生活质量明显低于他们在先前标准治疗下本应达到的水平。这类安全约束具有挑战性,因为患者服用标准药物时的生活质量并未被观测到,只能进行估计。
我们使用安全贝叶斯优化(SafeOpt)¹¹¹SafeOpt 有时特指 2015 年提出的具体方法 (https://arxiv.org/html/2607.05620#bib.bib7),有时泛指安全贝叶斯优化。本文中取后一种含义。的框架来构建此问题。该框架优化某个目标函数 \(f(\mathbf{x})\)(例如信息增益),并满足如下约束:
\[
\max_{\mathbf{x}\in\mathcal{X}} f(\mathbf{x}) \quad \text{subject to} \quad q(\mathbf{x}) \geq 0.
\tag{1}
\]
SafeOpt 在安全状态集合 \(\mathcal{S}\)(其中 \(\mathcal{X}\subseteq\mathcal{S}\))内优化目标,并随着更多信息的收集而扩展 \(\mathcal{S}\)。我们特别关注结合了在线共形预测的 SafeOpt (Zhang et al., 2024 (https://arxiv.org/html/2607.05620#bib.bib13)),它提供了无分布假设的安全性保证。共形 SafeOpt 确保在 \(T\) 个优化步骤中,约束 \(q(\mathbf{x}) \geq 0\) 被违反的概率低于或等于用户指定的 \(\alpha\)。详见第 3.1 节 (https://arxiv.org/html/2607.05620#S3.SS1)。
潜在的安全 \(\mathbf{x}\) 值通常基于迄今为止观察到的 \(q\) 值来确定。然而,我们感兴趣的是包含反事实的安全约束。例如,我们可能希望某个变量 \(Y\) 在治疗下的值减去在标准治疗下反事实的 \(Y\) 值至少为某个值 \(-\omega\)。由于 \(q\) 依赖于一个未被观察到的反事实,因此很难提供典型的 SafeOpt 风格的安全性保证。仅仅对反事实进行点估计可能导致违反率高于 \(\alpha\)。
因此,我们使用分裂共形预测来估计在标准治疗下反事实 \(\mathbf{x}\) 的结果 (Lei and Candès, 2021 (https://arxiv.org/html/2607.05620#bib.bib10))。分裂共形预测产生的是区间估计而非点估计。反事实的真实值落在该区间内的概率为 \(100(1-\varepsilon)\)%,其中 \(\varepsilon\) 由用户指定。\(\varepsilon\) 可被用于证明 SafeOpt 方法所需的形式化安全保证(第 4.2 节 (https://arxiv.org/html/2607.05620#S4.SS2) 中的证明草图,附录 A (https://arxiv.org/html/2607.05620#A1) 中的完整证明)。
我们在两个场景上进行了主要实验,这两个场景均来自 Zhang et al. (2024) (https://arxiv.org/html/2607.05620#bib.bib13)。第一个使用化学反应模拟器 (Kang et al., 2019 (https://arxiv.org/html/2607.05620#bib.bib18)),这使我们能够访问真实的反事实结果。第二个是 MovieLens 数据集 (Harper and Konstan, 2015 (https://arxiv.org/html/2607.05620#bib.bib17))。在这两种情况下,我们都使用第 4 节 (https://arxiv.org/html/2607.05620#S4) 中的方法来估计具有反事实的不同约束的约束值。我们的基线包括标准的(非安全)贝叶斯优化以及一个完全了解反事实情况的预言机。我们发现,我们的方法在满足第 4.2 节 (https://arxiv.org/html/2607.05620#S4.SS2) 中提供的安全要求的同时,优化了目标函数。
总之,我们的贡献包括以下几点。我们创建了一种方法,确保安全贝叶斯优化采取的动作对于 \(100(1-\alpha)\)% 的样本而言,不会比某个已知的、安全的策略差 \(\omega\) 以上,其中 \(\omega\) 和 \(\alpha\) 由用户指定。在第 4 节 (https://arxiv.org/html/2607.05620#S4) 和附录 C (https://arxiv.org/html/2607.05620#A3) 中,我们展示了该方法在重新加权校准集时对不同类型的协变量偏移具有鲁棒性。我们证明了该方法在最少的假设下满足安全保证,并在附录 B (https://arxiv.org/html/2607.05620#A2) 中界定了假设违反时的共形覆盖差距。第 6 节 (https://arxiv.org/html/2607.05620#S6) 和附录 E (https://arxiv.org/html/2607.05620#A5) 提供了实验证据,表明对于 \(100(1-\alpha)\)% 的样本,安全约束得到满足,并且所提出的方法能够适应不同类型的协变量偏移。我们针对具有一个和两个估计项的约束展示了这一点。最后,我们提供了一个敏感性分析,以检验该方法在不同类型和不同程度的误设下的表现。
### 1.1 动机示例
假设你正在进行一项临床试验,测试一种降低收缩压的新药。你依次给患者进行治疗,共 \(T\) 个时间步。研究中的众多安全约束之一是比较新药 \(Y(\mathbf{x}_t)\) 在时间 \(t\) 对血压的降低效果与标准治疗方案 \(Y(\mathbf{x}_{soc,t})\) 的降低效果。你希望 \(Y(\mathbf{x}_t)\) 至少不差于 \(Y(\mathbf{x}_{soc,t})\),并允许一定的容忍度 \(\omega\)。由于无法确保约束永远不会被违反,你指定了一个较小的违反率 \(\alpha=0.01\)。也就是说,安全约束在 \(T\) 个时间步内最多允许 \(1\%\) 的时间被违反。
你首先收集标准治疗方案下的数据。数据包括你的治疗方式、任何协变量以及治疗下的血压结果。你将数据分成训练集 \(\mathcal{D}_{train}\) 和校准集 \(\mathcal{D}_{cal}\)。\(\mathcal{D}_{train}\) 用于获得 \(Y(\mathbf{x}_{soc})\) 的点估计器,\(\mathcal{D}_{cal}\) 用于创建分位数。然后,你开始生成满足安全约束的新治疗方案,并使用 SafeOpt。对于生成的每个新治疗方案,你估计反事实 \(Y(\mathbf{x}_{soc})\) 的上界,并使用它来计算每个时间步的安全约束 \(q(\mathbf{x}_t)\)。
第 4 节 (https://arxiv.org/html/2607.05620#S4) 更详细地阐述了该方法。我们还描述了如何通过重新加权校准数据,使其看起来像是在 SafeOpt 期间观察到的测试协变量下从标准治疗方案中得到的,从而使该方法适应不同的场景。例如,如果训练数据和校准数据是观测性的,则可以重新加权校准数据,使其看起来像是来自标准治疗方案(场景 1)。或者,假设存在协变量偏移。训练数据和校准数据收集自医院 A。SafeOpt 在医院 B 运行,该医院服务的人群年龄更大。通过观察研究中人群的年龄,我们可以重新加权校准数据(场景 2)。
## 2 相关工作
### 2.1 带噪声约束观测的安全贝叶斯优化
安全贝叶斯优化 (Sui et al., 2015 (https://arxiv.org/html/2607.05620#bib.bib7); Berkenkamp et al., 2023 (https://arxiv.org/html/2607.05620#bib.bib3); Zhang et al., 2024 (https://arxiv.org/html/2607.05620#bib.bib13)) 对标准贝叶斯优化施加了安全约束,如公式 (1) (https://arxiv.org/html/2607.05620#S1.E1) 所示。我们的工作考虑了具有估计分量的安全约束,这意味着安全约束的真实值从未被实际观察到。Bergmann 和 Graichen (2020 (https://arxiv.org/html/2607.05620#bib.bib19)) 考虑了约束观测可能受到已知量高斯测量噪声污染的情况,并将安全约束重新表述为概率形式。除了第 5 节中阐述的确定性设定外,Zhang 等人 (2024 (https://arxiv.org/html/2607.05620#bib.bib13)) 还考虑了约束观测受到已知量测量噪声污染的情况。他们将概率约束重新表述以考虑噪声。约束贝叶斯优化方面的其他工作要么在带噪声约束观测下将硬约束重新表述为概率约束 (Gelbart et al., 2014 (https://arxiv.org/html/2607.05620#bib.bib21)),要么通过更好的约束建模来处理噪声 (Letham et al., 2019 (https://arxiv.org/html/2607.05620#bib.bib20); Wang and Li, 2024 (https://arxiv.org/html/2607.05620#bib.bib22))。我们的工作与众不同之处在于,我们专门考虑了多种设定下估计误差导致的安全约束。
### 2.2 约束多臂老虎机
安全贝叶斯优化与约束老虎机类似。例如,Amani 等人 (2019 (https://arxiv.org/html/2607.05620#bib.bib23)) 和 Moradipari 等人 (2021 (https://arxiv.org/html/2607.05620#bib.bib26)) 在采取满足安全约束的动作的同时学习策略,通过维护一个安全集,这与 SafeOpt 类似。其他类型的约束包括预算约束 (Zhou and Tomlin, 2018 (https://arxiv.org/html/2607.05620#bib.bib25); Agrawal and Devanur, 2016 (https://arxiv.org/html/2607.05620#bib.bib28), 2014 (https://arxiv.org/html/2607.05620#bib.bib29); Wu et al., 2015 (https://arxiv.org/html/2607.05620#bib.bib30)) 和期望约束 (Pacchiano et al., 2021 (https://arxiv.org/html/2607.05620#bib.bib27))。与其他工作相比,我们的设定使用了部分观测的约束。
## 3 背景
在安全贝叶斯优化中,我们在遵守安全约束的同时最大化目标函数 \(f(\mathbf{x})\),如公式 (1) (https://arxiv.org/html/2607.05620#S1.E1) 所示。我们假设公式 (1) 存在最优解,并且初始安全候选解集合 \(\mathcal{S}_0\) 非空。系统做出的所有决策都落在安全集合内,因此 \(\mathcal{S}_0\) 需要非空:\(\mathcal{S}_0 \subseteq \{\mathbf{x} \in \mathcal{X} : q(\mathbf{x}) \geq 0\}\)。
在每个时间步 \(t\),安全集和目标函数的贝叶斯后验都会被更新。我们可以通过为 \(f\) 和 \(q\) 创建置信区间来实现这一点,这些区间利用贝叶斯先验来估计 \(f\) 和 \(q\) 可能值的范围 (Zhang et al., 2024 (https://arxiv.org/html/2607.05620#bib.bib13); Sui et al., 2015 (https://arxiv.org/html/2607.05620#bib.bib7))。Zhang 等人 (2024 (https://arxiv.org/html/2607.05620#bib.bib13)) 使用具有均值 \(\mu\) 和标准差 \(\sigma\) 的高斯过程定义这些区间如下:
\[
\begin{split}
\mathcal{I}_f(\mathbf{x}|\mathcal{O}_t) &= [f_l(\mathbf{x}|\mathcal{O}_t), f_u(\mathbf{x}|\mathcal{O}_t)] \\
&= [\mu_f(\mathbf{x}|\mathbf{X}_t,\mathbf{f}_t) - \beta_{t+1}\sigma_f(\mathbf{x}|\mathbf{X}_t,\mathbf{f}_t), \mu_f(\mathbf{x}|\mathbf{X}_t,\mathbf{f}_t) + \beta_{t+1}\sigma_f(\mathbf{x}|\mathbf{X}_t,\mathbf{f}_t)]
\end{split}
\tag{2}
\]
\[
\begin{split}
\mathcal{I}_q(\mathbf{x}|\mathcal{O}_t) &= [q_l(\mathbf{x}|\mathcal{O}_t), q_u(\mathbf{x}|\mathcal{O}_t)] \\
&= [\mu_q(\mathbf{x}|\mathbf{X}_t,\mathbf{q}_t) - \beta_{t+1}\sigma_q(\mathbf{x}|\mathbf{X}_t,\mathbf{q}_t), \mu_q(\mathbf{x}|\mathbf{X}_t,\mathbf{q}_t) + \beta_{t+1}\sigma_q(\mathbf{x}|\mathbf{X}_t,\mathbf{q}_t)]
\end{split}
\tag{3}
\]
其中 \(\mathcal{O}_t = (\mathbf{X}_t, \mathbf{f}_t, \mathbf{q}_t)\) 是直到时间 \(t\) 的历史记录。\(\mathbf{X}_t\) 是决策历史 \((\mathbf{x}_1, ..., \mathbf{x}_t)\)。\(\mathbf{f}_t\) 是 \(f(\mathbf{x})\) 的历史记录:\((f(\mathbf{x}_1), ..., f(\mathbf{x}_t))\)。类似地,\(\mathbf{q}_t\) 是 \(q(\mathbf{x})\) 的历史记录:\((q(\mathbf{x}_1), ..., q(\mathbf{x}_t))\)。\(\beta_{t+1}\) 控制区间的宽度,其定义见第 3.1 节 (https://arxiv.org/html/2607.05620#S3.SS1)。
然后我们选择一个 \(\mathbf{x}_t\),它要么优化目标函数,要么通过缩小 \(f\) 或 \(q\) 的置信区间来扩展安全集。我们通过找到最能降低我们对 \(f\) 或 \(q\)(其中较不确定的那个)的不确定性的动作,同时最大化 \(f\) 或扩展安全集来实现这一点。\(\mathcal{M}_{t+1}\) 是最大化 \(f\) 的动作集合,\(\mathcal{G}_{t+1}\) 是可能扩展安全集的动作集合:
\[
\mathbf{x}_{t+1} = \underset{\mathbf{x} \in \mathcal{M}_{t+1} \cup \mathcal{G}_{t+1}}{\arg\max} \max\{\sigma_f(\mathbf{x}|\mathcal{O}_t), \sigma_q(\mathbf{x}|\mathcal{O}_t)\}.
\tag{4}
\]
优化器集合 \(\mathcal{M}_{t+1}\) 包括所有可能比已知最佳悲观估计表现更好的安全解:
\[
\mathcal{M}_{t+1} = \{\mathbf{x} \in \mathcal{S}_{t+1} \mid f_u(\mathbf{x}|\mathcal{O}_t) \geq \max_{\mathbf{x}' \in \mathcal{S}_{t+1}} f_l(\mathbf{x}'|\mathcal{O}_t)\}.
\]相似文章
基于非确定性因果模型的鲁棒反事实策略优化
本文形式化了在概率非确定性因果模型下马尔可夫决策过程的反事实策略优化,该模型将潜在混杂因素与固有随机性分开,并提出了一种实用的优化程序来推导鲁棒的反事实策略。该方法在脓毒症治疗模拟器上得到验证,其中糖尿病状态作为未观测的全局混杂因素。
效用约束策略优化
本文介绍了一种简单而强大的方法,用于效用约束马尔可夫决策过程(UCMDPs),该方法无需预先固定约束界限即可实现风险敏感约束,在Safety Gymnasium基准测试中优于基线方法。
CSPO:面向安全强化学习的约束敏感策略优化
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。
基于后验混合贝叶斯信念的正则化离线策略优化
本文介绍了后验混合贝叶斯信念(PhyB),这是一个将贝叶斯强化学习中的期望重新表述为动力学模型的凸组合的框架,从而能够实现具有有界目标差异和最新性能的高效正则化离线策略优化。
通过反事实推理路径减少信用分配方差
提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。