跨域上下文赌博机的离线策略评估与学习
摘要
本文介绍了面向上下文赌博机的跨域离线策略评估与学习(OPE/L),允许利用多个源域的日志数据来改进目标域中的策略评估与学习,这些目标域面临少样本数据、确定性日志策略和新动作等挑战性条件。
arXiv:2607.22012v1 公告类型:新
摘要:上下文赌博机中的离线策略评估与学习(OPE/L)在实际系统中正迅速获得普及,因为可以使用仅有的历史日志数据安全地评估和学习新策略。然而,现有的OPE/L方法无法处理许多具有挑战性但普遍存在的场景,例如少样本数据、确定性日志策略和新动作。在许多应用中,如个性化医疗、内容推荐、教育和广告,我们需要在这些挑战存在的情况下评估和学习新策略。由于众所周知的方差问题或日志数据中的有限探索,现有方法无法在这些情况下有效评估和优化。为了即使在未解决的挑战下也能实现OPE/L,我们提出了一种新的跨域OPE/L问题设置,其中我们不仅可以访问目标域(新策略将在此实施)的日志数据,还可以访问从其他域收集的日志数据集。这种新颖的公式具有广泛适用性,因为我们不仅可以利用目标医院、国家、设备或用户细分的历史数据,还可以利用其他医院、国家、设备或细分的数据。我们开发了一种新的估计器和策略梯度方法,通过利用目标数据集和源数据集来解决OPE/L问题,从而在我们经验评估中之前未解决的情况下显著增强了OPE/L。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 上下文赌博机中的跨域离线策略评估与学习 来源:https://arxiv.org/html/2607.22012 Yuta Natsubori Hakuhodo DY Holdings, Inc. [email protected] & Masataka Ushiku Hakuhodo DY Holdings, Inc. [email protected] & Yuta Saito Cornell University [email protected] ###### 摘要 上下文赌博机中的离线策略评估与学习(OPE/L)在实际系统中正迅速获得关注,因为它能够仅使用历史日志数据安全地评估和学习新策略。然而,现有OPE/L方法无法处理许多具有挑战性但普遍存在的场景,例如小样本数据、确定性日志策略和新动作。在个性化医疗、内容推荐、教育和广告等众多应用中,我们需要在这些挑战存在的情况下评估和学习新策略。由于众所周知的方差问题或日志数据中探索的有限/缺失,现有方法无法在这些情况下有效评估和优化。为了在未解决的挑战下也能实现OPE/L,我们提出了一种新的问题设置——**跨域OPE/L**,在该设置中,我们不仅能够访问新策略将要实施的目标域的日志数据,还能访问从其他域收集的日志数据集。这一新颖的公式化具有广泛的适用性,因为我们通常不仅可以使用来自目标医院、国家、设备或用户细分的历史数据,还可以使用来自其他医院、国家、设备或细分的数据。我们开发了一种新的估计器和策略梯度方法,通过利用目标域和源域数据集来解决OPE/L问题,从而在我们的实证评估中显著增强了之前在未解决情况下的OPE/L性能。 ## 1 引言 许多决策系统(例如推荐、药物治疗、预算分配)通过上下文赌博机过程与环境交互,其中策略观察上下文、采取动作并获得奖励。离线策略评估与学习(OPE/L)作为一种技术受到关注,它可以在不部署新策略的情况下,仅使用历史日志数据估计和学习新策略。由于这些技术不需要昂贵且有风险的在线A/B测试和探索,即可实现数据驱动的策略评估与学习生命周期,因此我们可以找到许多实际应用(Mehrotra等,2018(https://arxiv.org/html/2607.22012#bib.bib37);Gilotte等,2018(https://arxiv.org/html/2607.22012#bib.bib35);Saito等,2021(https://arxiv.org/html/2607.22012#bib.bib32);Kiyohara等,2024a(https://arxiv.org/html/2607.22012#bib.bib34))。 尽管最近的研究进展已开发出许多估计器和策略梯度方法(Saito and Joachims, 2021(https://arxiv.org/html/2607.22012#bib.bib31);Uehara等,2022(https://arxiv.org/html/2607.22012#bib.bib38)),但大多数基于逆概率加权(IPS)、奖励回归或其混合(Dudík等,2014(https://arxiv.org/html/2607.22012#bib.bib25);Wang等,2017(https://arxiv.org/html/2607.22012#bib.bib48);Su等,2020a(https://arxiv.org/html/2607.22012#bib.bib46))。这些估计器严重依赖于一个称为**公共支持**的理论假设,以提供低偏差估计。由于公共支持假设,我们只能评估和学习那些已被日志策略充分探索过的动作的新策略(Sachdeva等,2020(https://arxiv.org/html/2607.22012#bib.bib29);Felicioni等,2022(https://arxiv.org/html/2607.22012#bib.bib30))。因此,在日志策略完全确定性或存在新动作的具有挑战性但实际的情况下,现有方法根本无法评估和选择探索不足及新动作,因为历史数据中缺乏它们的奖励信息(Sachdeva等,2020(https://arxiv.org/html/2607.22012#bib.bib29))。此外,使用重要性加权通常会导致严重的方差问题,尤其是在样本量小(如小样本数据)且动作空间大时(Saito and Joachims, 2022(https://arxiv.org/html/2607.22012#bib.bib28);Cief等,2024a(https://arxiv.org/html/2607.22012#bib.bib42);Sachdeva等,2024(https://arxiv.org/html/2607.22012#bib.bib39))。 已有一些先前的工作尝试在违反公共支持(也称为支持不足)的情况下实现OPE(Felicioni等,2022(https://arxiv.org/html/2607.22012#bib.bib30))和OPL(Sachdeva等,2020(https://arxiv.org/html/2607.22012#bib.bib29)),但它们无法处理确定性日志策略和完全新的动作。利用动作或奖励空间中的某些结构来放松公共支持的要求可能也很有用,如Saito and Joachims(2022(https://arxiv.org/html/2607.22012#bib.bib28));Saito等(2023(https://arxiv.org/html/2607.22012#bib.bib20));Cief等(2024a(https://arxiv.org/html/2607.22012#bib.bib42));Taufiq等(2023(https://arxiv.org/html/2607.22012#bib.bib40));Sachdeva等(2024(https://arxiv.org/html/2607.22012#bib.bib39));Kiyohara等(2024b(https://arxiv.org/html/2607.22012#bib.bib43))所研究,但这种有用的结构并不总是可学习的。 参看图注 Figure 1: 传统OPE/L与跨域OPE/L(我们的方法)的比较。 为了即使在确定性日志策略和新动作存在的情况下也能实现有效的OPE/L,我们提出了一种新的问题公式化,称为**跨域OPE/L**,其中我们旨在评估和优化目标域中新策略的价值,但同时可以访问之前在源域中收集的历史日志数据(如图1(https://arxiv.org/html/2607.22012#S1.F1)所示)。在许多情况下,我们可以访问这样的多日志数据集。在医疗领域,一个示例场景是不同规模和不同患者人口统计的若干医院记录了治疗对患者预后的影响。另一个例子是推荐系统中,新的内容或功能可能在某些国家或一部分用户(例如活跃成员)中可用,当我们针对新国家和其他用户(如相对较新的成员)执行OPE/L时,这些可以作为源域。如果我们能够访问这些在源域中收集的日志数据集(这些源域在动作空间中有更多数据和探索),那么即使目标域的日志数据较少、日志策略确定性且存在现有估计器无法处理的新动作,我们也可以利用这些数据更有效地执行针对目标域的OPE/L。 在正式提出新公式化后,我们提出了一种新的估计器,称为**跨域离线策略评估(COPE)**以及相应的策略梯度方法,通过有效利用来自源域的有用信息来估计和优化目标域中新策略的价值,从而解决OPE/L问题。为了实现从源域的有效迁移,我们的方法基于对期望奖励函数分解为**域-聚类效应**和**域特定效应**。域-聚类效应是同一聚类中的域在奖励函数中共同具有的组成部分,而域特定效应则表示不能仅由域-聚类效应建模的因果效应。COPE估计器通过应用**多重重要性加权**(Owen, 2013(https://arxiv.org/html/2607.22012#bib.bib17);Agarwal等,2017(https://arxiv.org/html/2607.22012#bib.bib45)),利用来自目标域以及目标域所在同一聚类中的源域的数据,无偏地估计域-聚类效应。它还通过使用目标域的日志数据进行奖励回归来处理域特定效应,从而根据回归精度减少估计器的偏差。我们还将COPE估计器扩展为策略梯度估计器,以便同时使用目标域和源域数据执行OPL,从而即使在完全确定性日志和涉及新动作的情况下也能进行策略学习。 理论分析表明,COPE具有可分析的偏差,特别是即使目标域存在确定性日志策略和新动作,COPE也能做到无偏。使用真实世界推荐数据集的实证评估表明,通过适当利用目标域和源域的数据,COPE在目标域数据少且许多动作之前未被探索的情况下,优于现有估计器和策略学习方法。 **关键相关工作。** 本节将我们的工作与两个密切相关的研究区分开来。更全面的相关工作概述见附录A(https://arxiv.org/html/2607.22012#A1)。首先,我们讨论Uehara等(2020(https://arxiv.org/html/2607.22012#bib.bib33))的工作,该工作研究了协变量偏移下的OPE/L,其中日志数据(\(p^{\text{hist}}(x)\))和评估环境(\(p^{\text{eval}}(x)\))之间的上下文分布不同,而奖励分布\(p(r|x,a)\)保持不变。在该设置下,Uehara等(2020(https://arxiv.org/html/2607.22012#bib.bib33))提出了仅使用在历史分布\(p^{\text{hist}}(x)\)下收集的日志数据来估计新策略在评估环境中部署时的价值的方法。相比之下,我们旨在估计相同的目标量,但利用来自目标域和源域(可能多个源域)的数据,每个域都有其独特的上下文和奖励分布。通过利用这种新设置,我们的主要目标是解决目标域中的挑战性场景,如新动作、确定性日志和极小的日志数据,这显然与Uehara等(2020(https://arxiv.org/html/2607.22012#bib.bib33))的动机不同。 我们还将我们的贡献与Saito等(2023(https://arxiv.org/html/2607.22012#bib.bib20))的贡献区分开来,后者开发了OffCEM估计器来处理单个域设置中大动作空间中的OPE。尽管我们奖励函数分解的主要思路受到OffCEM的启发,但如果没有我们独特的公式化,将其应用于解决跨域OPE/L问题是不可能的。此外,我们将我们的估计器扩展为OPL方法,而Saito等(2023(https://arxiv.org/html/2607.22012#bib.bib20))仅关注OPE问题。因此,我们的工作是第一个公式化跨域OPE/L问题,并利用相应版本的奖励函数分解来解决新动作和确定性日志等非平凡挑战的工作,从而从方法论和实证角度提供了若干独特贡献。 最后,我们讨论我们的工作与那些处理有限重叠或支持不足问题(Hansen, 2008(https://arxiv.org/html/2607.22012#bib.bib12);Sachdeva等,2020(https://arxiv.org/html/2607.22012#bib.bib29);Wu and Fukumizu, 2021(https://arxiv.org/html/2607.22012#bib.bib10);Felicioni等,2022(https://arxiv.org/html/2607.22012#bib.bib30))的重要区别。有限重叠指的是新策略下可以采取的某些动作在日志策略下被观测到的概率为零。有限重叠是有问题的,因为如果没有关于日志数据中动作的任何数据,重要性加权技术就会产生偏差。重要的是要注意,与一般的有限重叠问题相比,我们的工作旨在解决更具挑战性的场景,即完全确定性日志和新动作。确定性日志指的是日志策略以概率1选择特定动作,即没有随机性。这更加困难,因为典型的有限重叠问题仍然允许日志策略是随机的。完全新的动作提出了更大的挑战,因为它们指的是对于任何上下文,在日志数据中观测到的概率为零的动作\(a\)。据我们所知,之前没有工作专门解决完全确定性日志和新动作的问题。我们通过新公式化跨域OPE/L问题来应对这些极具挑战性的场景。 ## 2 传统公式化 我们首先描述上下文赌博机设置中OPE的传统公式化。在此,决策者重复观测从未知分布\(p(x)\)中抽取的上下文\(x \in \mathcal{X}\)。给定上下文\(x\),一个固定且可能随机的策略\(\pi(a|x)\)从有限动作空间\(\mathcal{A}\)中选择动作\(a\)。然后根据未知分布\(p(r|x,a)\)观测奖励\(r\),并使用\(q(x,a) := \mathbb{E}[r|x,a]\)表示给定上下文和动作的期望奖励。我们将策略\(\pi\)的性能度量定义为其部署下的期望奖励: \[ V(\pi) := \mathbb{E}_{p(x)\pi(a|x)p(r|x,a)}[r] = \mathbb{E}_{p(x)\pi(a|x)}[q(x,a)], \tag{1} \] 这通常称为**策略值**。 我们可以用于执行OPE/L的日志带数据可以表示为\(\mathcal{D} := \{(x_i, a_i, r_i)\}_{i=1}^n\),其中包含\(n\)个独立观测值,这些观测值由日志策略\(\pi_0\)诱导的数据分布生成,即: \[ p(\mathcal{D}) = \prod_{i=1}^n p(x_i) \pi_0(a_i|x_i) p(r_i|x_i, a_i). \] OPE的目标是开发一个估计器\(\hat{V}\),该估计器仅使用\(\mathcal{D}\)就能准确估计新策略\(\pi\)的策略值。我们通过均方误差(MSE)来衡量\(\hat{V}\)的准确性,定义为: \[ \mathrm{MSE}(\hat{V}(\pi; \mathcal{D})) := \mathbb{E}_{p(\mathcal{D})}[(V(\pi) - \hat{V}(\pi; \mathcal{D}))^2] = \mathrm{Bias}(\hat{V}(\pi; \mathcal{D}))^2 + \mathbb{V}_{\mathcal{D}}[(\hat{V}(\pi; \mathcal{D}))]. \] **现有估计器的局限性。** 作为OPE的现有方法,我们首先描述IPS(Horvitz and Thompson, 1952(https://arxiv.org/html/2607.22012#bib.bib27)),它通过重新加权奖励来估计策略值: \[ \hat{V}_{\rm{IPS}}(\pi; \mathcal{D}) := \frac{1}{n} \sum_{i=1}^n \frac{\pi(a_i|x_i)}{\pi_0(a_i|x_i)} r_i = \frac{1}{n} \sum_{i=1}^n w(x_i, a_i) r_i, \tag{2} \] 其中\(w(x,a) := \pi(a|x)/\pi_0(a|x)\)称为**重要性权重**。众所周知,IPS在公共支持条件下是无偏的,即\(\mathbb{E}_{p(\mathcal{D})}[\hat{V}_{\rm{IPS}}(\pi; \mathcal{D})] = V(\pi)\)。 ###### 条件2.1(公共支持)。 如果对于所有\(a \in \mathcal{A}\)和\(x \in \mathcal{X}\),有\(\pi(a|x) > 0 \implies \pi_0(a|x) > 0\),则称日志策略\(\pi_0\)对策略\(\pi\)具有公共支持。 这个假设对于IPS的无偏性至关重要。
相似文章
基于局部披露的具有策略性主体的离线策略评估
本文研究当决策主体(智能体)为了回应策略而策略性地修改其协变量时的离线策略评估(OPE)。该方法利用事后解释进行局部披露,以揭示智能体的前策略协变量,并构建策略价值的双重稳健估计量。
一种具有双边信息不对称的Contextual-Bandit监督博弈
本文介绍了一种用于AI智能体运行时人工监督的、具有双边信息不对称的Contextual-Bandit团队博弈,刻画了团队最优策略与短视人工监督策略之间的差距。
EDGE-OPD:利用证据引导的在线策略蒸馏内化特权上下文
本文提出了EDGE-OPD,一种针对大语言模型的在线策略自蒸馏改进方法,通过引导式采样和证据掩码来内化特权上下文,同时不损害通用能力,在稀有标记身份设定中取得了成功。
面向鲁棒的上下文学习:利用分布外代理进行目标不可访问的示例检索
本文介绍了DOPA,一种演示搜索框架,该框架在目标领域不可访问时,利用分布外代理为大语言模型检索鲁棒的演示,从而增强在分布偏移下的上下文学习性能。
用于最大化激励口碑回报的上下文多臂赌博机
本文提出了一种上下文多臂赌博机框架,该框架学习社交网络中的个体溢出概率,以优化激励式口碑营销,通过定向关联用户实现更高的回报。