何时可以信任等成本 Top-k 分配的离线评估?一个受控、可复现的基准测试与从业者指南
摘要
一个受控、可复现的基准测试,评估等成本 Top-k 分配的离线估计器,识别何时可以信任离线评估,并提供从业者指南。
arXiv:2608.12489v1 公告类型:新
摘要:组织在预算约束下决定对谁进行干预,并希望在部署目标规则之前了解该规则本可以获得多少收益。离线策略评估(off-policy evaluation)承诺可以通过日志数据实现这一点,但可部署的规则是确定性的 top-k 策略:它消除了对动作的所有平均,因此弱重叠会直接打击估计。我们在五个数据集和两次已知效应扫描(known-effect sweeps)上对六种估计器进行了基准测试,并针对非模拟的配对参考验证了这些机制。首先,弱重叠取决于记录器与目标动作之间的对齐,而非仅仅取决于日志记录的锐度:决定支撑的是记录器赋予目标动作的概率。基于目标自身得分构建的记录器,即使进行锐化,在测试范围内也几乎不会改变重叠;而动作层面的不一致会使其崩溃。有效样本量(effective sample size)能够跨日志环境对该风险进行排序,但在从业者所持有的单个日志内部对候选进行排序时表现较弱,且其截止点不可迁移。其次,优化者的诅咒(optimizer's curse)并不能通过对结果冗余函数进行交叉拟合来修复。当规则是在用于评估它的数据上拟合时,仅对冗余函数进行交叉拟合会保留复用偏差(reuse bias),甚至使其更严重。诚实的策略级拆分通过以学习过程的价值为目标来避免复用——这是估计目标的改变,而不是对全样本策略的去偏。第三,倾向得分估计误差是我们测得的最大退化因素:与我们所施加的任何其他压力相比,折外(out-of-fold)估计对 IPS(逆倾向得分)估计量的伤害更大,几乎不改变双稳健估计,并且可能使重叠诊断本身发生反转。日志是合成生成的,倾向得分被设定了 0.02 的下限,因此所有失败都发生在有界权重下;这一下限也使两个调优后的混合估计器退化为其未调优的父版本,剩下四个实际不同的估计器,并且所有精确值曲面都是合成或半合成的。我们发布了该基准测试;仅包含公开数据。
查看缓存全文
缓存时间: 2026/08/14 09:30
# 何时可以信任等成本 Top-k 分配的离线评估?一个受控、可复现的基准与从业者指南
来源: https://arxiv.org/html/2608.12489
###### 摘要 组织会例行地决定在预算约束下*该*治疗哪些人,并希望在下发部署前知道某个目标规则*本来会*带来多少收益。离线策略评估(off-policy evaluation)承诺可以从记录日志中做到这一点。但可部署的规则是一个*确定性*的 top-kk 策略:它消除了对动作的所有平均,因此弱重叠会直接冲击估计量。我们在五个数据集和两轮已知效应扫描中基准测试了六个估计量,并将这些机制与一个非模拟的配对参照进行了验证。首先,弱重叠由记录器–目标*动作*对齐程度决定,而不仅仅取决于记录锐度(logging sharpness)。温度不是一个有效的重叠参数:真正决定支持域的是记录器对*目标动作*的概率。在测试范围内,将基于目标自身分数构建的记录器变尖几乎不改变重叠;而动作层面上的不一致则会使重叠崩溃。根据记录的动作和倾向得分计算得到的有效样本量(effective sample size)能够*跨*记录环境对这一风险进行排序——这可用于指导日志设计和选择估计量家族,但它在从业者所持有的*单个固定日志内部*对候选策略进行排序的能力较弱,且其截断点不具有可迁移性。其次,优化者的诅咒(optimizer’s curse)并不能通过对结果扰动项进行交叉拟合来解决。当规则是在用于评估它的同一份数据上拟合时,单独交叉拟合扰动项会使重用偏差(reuse bias)保留下来,甚至变得更糟。诚实的策略级拆分通过针对学习过程本身的期望价值来避免重用——这是一种估计目标的改变,而不是对全样本策略的去偏。第三,倾向得分估计误差是我们测量到的最大退化因素。将精确倾向得分替换为折外估计对 IPS 的伤害超过我们施加的任何其他压力,使双稳健估计几乎不变,并且可能反转重叠诊断本身。第 4.1 节(https://arxiv.org/html/2608.12489#S4.SS1)说明了本基准*不能*告诉你的东西。整个过程中的日志都是合成的,且倾向得分都设有 0.020.02 的下限,因此我们记录的每一次失败都是在权重有界的情况下发生的;这个下限也使得两个经过调优的混合估计量在大多数格子中退化为未调优的父版本,从而留下了四个实际上互不相同的估计量。所有精确值表面都是合成或半合成的——因此需要进行非模拟检验。第 6 节(https://arxiv.org/html/2608.12489#S6)提炼出操作性指导。我们发布了基准;仅使用公开数据。 ††脚注文本:大语言模型辅助了写作和代码;作者对全部内容负完全责任(见“生成式人工智能使用声明”)。
## 1 引言
设想一个团队在人群中分配固定预算:向最有响应可能的 20%20\\% 客户发送留存优惠,为治疗最可能受益的患者报名。每一种都是*预算约束分配*:根据估计的处理效应对每个单元评分,并按预算耗尽为止的顺序治疗得分最高的单元。但在部署一个新规则之前,团队希望基于当前规则下已经记录的日志数据,知道它*本来会*取得多少收益——这就是离线策略评估(OPE)\((8 (https://arxiv.org/html/2608.12489#bib.bib5);23 (https://arxiv.org/html/2608.12489#bib.bib8))\)。困难在于弱重叠,而不是确定性本身。
可部署的规则是一个*确定性*的 top-kk 策略:每个单元恰好一个动作,因此 πe\\pi\_\{e\} 在该动作上赋予概率 11。这本身并不违反正性(positivity)——相关条件是 πb\(aπe\(x\)∣x\)\>0\\pi\_\{b\}\(a\_\{\\pi\_\{e\}\}\(x\)\\mid x\)\>0 对 πe\\pi\_\{e\} 选择的动作成立。确定性所消除的是对所有动作的平均:权重变为 πe\(a∣x\)/πb\(a∣x\)∈\{0,1/πb\(a∣x\)\}\\pi\_\{e\}\(a\\mid x\)/\\pi\_\{b\}\(a\\mid x\)\\in\\\{0,\\,1/\\pi\_\{b\}\(a\\mid x\)\\\},因此只要记录器很少采取 πe\\pi\_\{e\} 所要求的动作,权重就会极端,有效样本也会随之崩溃;只要 πb\\pi\_\{b\} 存在结构性零,支持域就真正失效。我们通过构造排除了第二种情况——倾向得分下限设为 0.020.02,因此我们记录的每一次失败都发生在权重以 5050 为上界的情况下,这恐怕是更令人警觉的发现。从业者会感受到某些活动上估计过于乐观,而另一些活动又正常,但又几乎没有什么指导来判断自己处于哪种情况。我们将其视为一个实证的、面向决策的问题。
与其提出新的估计量,我们问的是:等成本 top-kk 分配在其*何时*可以信任离线评估,从业者*应该*使用哪个估计量,以及*能否仅从日志数据自身检测到危险*?每个估计都配有一个明确的参考值——在潜在结果已知时是*精确*真值,在随机试验中则是一个带噪声的已知倾向得分 Horvitz–Thompson*参考估计*——并且这两类参考在整个过程中始终分开。已有工作分别确立了弱重叠不稳定性、双稳健估计、ESS 诊断、样本划分和策略选择评估;我们的贡献是它们在这个估计目标下的整合,外加新的实证证据。我们围绕四个问题组织结果——RQ1 估计量精度、RQ2 重叠诊断、RQ3 策略–评估重用下的优化者诅咒、RQ4 策略选择—并将 RQ2 和 RQ3 作为主要问题,用估计倾向得分边界(贡献 3)来限定第一个问题的适用范围。第 6 节(https://arxiv.org/html/2608.12489#S6)以证据支持的强度陈述仍然成立的结论;只想看结论而不想被限定语纠缠的读者可以先读它;附录 A(https://arxiv.org/html/2608.12489#A1)将每一条主张与支持它的证据和范围制表,是审计主张–证据对齐的最快途径。
#### 贡献。
我们做出三点贡献。
1. 1\.一个设计修正:在 top-kk 分配中,重叠由记录器–目标错位(misalignment)支配,而不是单独由记录锐度决定(RQ2)。论证首先是解析的,其次是实证的。对于确定性目标,权重为 1/πb\(aπe\(x\)∣x\)1/\\pi\_\{b\}\(a\_\{\\pi\_\{e\}\}\(x\)\\mid x\),因此支持域由记录器对目标*动作*的概率决定,而不是由日志的锐度决定。附录 B(https://arxiv.org/html/2608.12489#A2)将此转化为命题 1(第 4 节(https://arxiv.org/html/2608.12489#S4))的精确锐化极限:一个分数对齐的记录器的平坦重叠是一个有限范围内的平台,而一个动作对齐的记录器则会向完全支持域锐化。这是一个预测,我们也检验了它——将记录器按预算截断处重新居中会产生预测中的反转——锐化现在*改善*了重叠,失败梯度也急剧变为 0.0%0.0\\%/1.7%1.7\\%/26.7%26.7\\%(附录 E(https://arxiv.org/html/2608.12489#A5))。我们把这当作对这类基准构建方式的一种修正,而不是一个发现:我们自己最初的设计就是在分数对齐的记录器上扫描温度,从未改变它本打算研究的那个量。实证内容在于幅度。单独的温度只让中位 ESS 从 0.562→0.5220.562\\to 0.522 变化;将温度与对齐交叉变化则让它变为 0.560.56/0.420.42/0.190.19,在最尖温度下 IPS 失败率为 8%8\\%/13%13\\%/32%32\\%。ESS 能够在记录环境之间对这种错误进行排序,但在单个日志内部只有很弱的排序能力(样本内 ROC-AUC0.850.85;在两个保留家族上为 0.830.83 和 0.910.91,其中 0.910.91 是在为该套件错误规模选择的 2%2\\% 错误目标上得到的,而不是为最大化 AUC 而选;表 7(https://arxiv.org/html/2608.12489#A7.T7))。这里有一个注意事项:设计主张和排序主张并非彼此独立,因为错位会压低覆盖率,而覆盖率是 ESS 的一个因素。估计倾向得分边界是贡献 3。
2. 2\.在策略–评估重用下,对仅扰动项拆分和策略级拆分进行估计目标一致的比较(RQ3)。仅对结果扰动项进行交叉拟合并不能消除重用偏差——冻结策略的交叉拟合比普通 DR *更*乐观。诚实的策略级拆分在独立折上评估学习过程,在八个已知效应机制下偏差幅度小 5858–92%92\\%,其中七个共享 IHDP 协变量矩阵(响应曲面,而不是总体)。诚实性和样本划分早已确立((2 (https://arxiv.org/html/2608.12489#bib.bib13);5 (https://arxiv.org/html/2608.12489#bib.bib12);3 (https://arxiv.org/html/2608.12489#bib.bib14)));贡献在于在分配 OPE 设定下进行估计目标一致的演示。
3. 3\.诊断程序的一个经验边界:倾向得分估计占据主导地位,并且可能反转筛子(RQ2 的延续)。将精确的 πb\\pi\_\{b\} 替换为折外估计是我们测量到的最大退化——IPS 失败率从 6.3%6.3\\% 上升到 3737–63%63\\% 的格子,远超因改变记录器制度带来的 2.82.8–11.7%11.7\\%——而且一个糟糕的倾向得分模型不只是削弱 ESS 筛子,而是*反转*它(AUC0.850.85 变成抛硬币,再变成 0.050.05)。该筛子的前提是可信的倾向得分模型;第 5.3 节(https://arxiv.org/html/2608.12489#S5.SS3)给出了机制。
#### 本文确立了什么。
正面表述:在 top-kk 分配中,重叠风险由记录器–目标错位支配,并且可以在事前、跨记录环境而不是在单个日志内、仅凭日志数据对该风险进行排序,*前提是倾向得分模型可信*;在策略–评估重用下,仅扰动项交叉拟合是适得其反的,而诚实的策略级拆分可以在不重用数据的前提下评估学习过程,代价是目标变成了另一个估计目标;双稳健估计是我们在*各个*单独压力下最稳定的估计量,因此在至少一个扰动项模型可信时,它是一个合理默认选择。另外三个发现逻辑上相互独立:估计量排序(RQ1)、负面的模型充分性筛子结果(第 5.3 节(https://arxiv.org/html/2608.12489#S5.SS3.SSS0.Px1))以及策略选择警告(RQ4)——候选对齐日志比较的是策略–记录器*对*,而不是策略——这些对任何构建 OPE 选择基准的人都很重要。支撑所有这些的是一个已发布的基准:在五个数据集上的六个固定策略估计量,外加两个 2,1602\{,\}160 配置的已知效应强化扫描。
## 2 相关工作
#### OPE 估计量与弱重叠。
标准工具箱包括直接方法、逆倾向得分及其自归一化变体((21 (https://arxiv.org/html/2608.12489#bib.bib6))、双稳健估计((8 (https://arxiv.org/html/2608.12489#bib.bib5))以及方差受控的混合方法,如 Switch-DR((24 (https://arxiv.org/html/2608.12489#bib.bib7))和基于收缩的 DR((20 (https://arxiv.org/html/2608.12489#bib.bib11));正式定义见附录 H(https://arxiv.org/html/2608.12489#A8))。这些方法在*随机*目标下的行为已有充分刻画,而有效样本量是公认的弱重叠诊断指标((4 (https://arxiv.org/html/2608.12489#bib.bib21))。确定性和受约束目标受到的基准关注较少((9 (https://arxiv.org/html/2608.12489#bib.bib3);16 (https://arxiv.org/html/2608.12489#bib.bib4);25 (https://arxiv.org/html/2608.12489#bib.bib2)),而本文正是要填补这一空白。最接近的工作是 22 (https://arxiv.org/html/2608.12489#bib.bib1),其中确定性位于*相反*一侧:他们的*记录*策略是确定性的,因此 πb\\pi\_\{b\} 退化,加权只是无法识别而不仅仅是带噪声;他们从用户点击的随机性中恢复出排名板的随机性。我们的确定性在*目标*中,πb\\pi\_\{b\} 是随机且有下限的,因此正性成立,困难在于方差而不是识别——这是互补的问题,而他们*真实的*日志反馈正是我们的合成日志所缺乏的(第 4.1 节(https://arxiv.org/html/2608.12489#S4.SS1))。在设计侧,7 (https://arxiv.org/html/2608.12489#bib.bib22)*选择*记录策略,在收益与对目标动作的覆盖之间权衡——这是我们固定日志对齐轴的设计侧镜像。权重可靠性约束也出现在离线*学习*中((15 (https://arxiv.org/html/2608.12489#bib.bib23));我们的贡献是在事前验证 ESS 作为风险排序工具,而不是诊断本身。
#### 交叉拟合、诚实性与优化者的诅咒。
当策略在同一份样本上拟合并评估时,其样本内价值存在乐观偏差((19 (https://arxiv.org/html/2608.12489#bib.bib15))。交叉拟合可以移除 DML 中的扰动项过拟合((5 (https://arxiv.org/html/2608.12489#bib.bib12)),而诚实性——在拟合策略未使用的数据上评估学习*过程*——是因果森林和策略学习文献中的标准做法((2 (https://arxiv.org/html/2608.12489#bib.bib13);3 (https://arxiv.org/html/2608.12489#bib.bib14))。我们的贡献不是这一原则,而是在该设定下的一个估计目标一致的实证演示,将仅扰动项交叉拟合(冻结策略)与诚实的策略级拆分(每折特定策略,每个策略各自针对本折匹配的参考进行评分)区分开来;前者并不能解决观察到的重用偏差——实际上它比普通 DR *更*乐观(第 5.4 节(https://arxiv.org/html/2608.12489#S5.SS4))。
#### 策略选择与基准。
OPE 被用来在候选中*选择*,并且有专门的指标来量化选择质量((18 (https://arxiv.org/html/2608.12489#bib.bib9);13 (https://arxiv.org/html/2608.12489#bib.bib16))。半合成因果基准提供已知效应数据((11 (https://arxiv.org/html/2608.12489#bib.bib19);6 (https://arxiv.org/html/2608.12489#bib.bib18)),而开放的 bandit 数据集提供真实日志反馈((17 (https://arxiv.org/html/2608.12489#bib.bib10))。在 uplift 建模中,14 (https://arxiv.org/html/2608.12489#bib.bib24) 表明实验内排序指标可能反转由真实效应精度或策略风险给出的顺序——这是我们的上游选择问题:那里是选择评分规则,而这里则是从日志数据来判断所诱导的固定策略的价值是否可信。我们结合了这两种传统,把每个估计都与明确的参考值配对,并且——如第 5.5 节(https://arxiv.org/html/2608.12489#S5.SS5)所示——发现当每个候选都有一个自己的对齐日志时,比较的是策略–记录器*对*而不是策略,从而混淆了选择。
## 3 问题设定
#### 分配价值。
每个单元 ii 有上下文 xix\_\{i\}、二元动作 a∈\{0,1\}a\\in\\\{0,1\\\}(不给/给) 、潜在结果 Yi\(0\),Yi\(1\)Y\_\{i\}\(0\),Y\_\{i\}\(1\),以及单位成本 cic\_\{i\}。一个评分规则 s\(⋅\)s\(\\cdot\) 和预算 k∈\[0,1\]k\\in\[0,1\] 会诱导一个确定性分配 aπ\(x\)a\_\{\\pi\}\(x\):按得分降序处理单元,同时累计成本保持在 k∑jcjk\\sum\_\{j\}c\_\{j\} 之内(在单位成本下,即“处理 top-kk 比例”)。估计目标是该分配下的总期望结果,
V\(πe\)=E\[Y\(aπe\(X\)\)\],V\(\\pi\_\{e\}\)\\;=\\;\\mathbb\{E\}\\big\[\\,Y\\big\(a\_\{\\pi\_\{e\}\}\(X\)\\big\)\\,\\big\],(1)
这是一个价值水平(成本只通过预算约束进入)。一条 top-kk 规则是一个*batch*策略:单元 ii 是否被处理依赖于其他单元,因为经验阈值是数据依赖的。因此我们针对的是*队列条件*价值
V\(πe\)n\(z\)=1n∑iE\[Yi\(zi\)∣X1:n\]V\(\\pi\_\{e\}\)\_\{n\}\(z\)=\\frac\{1\}\{n\}\\sum\_\{i\}\\mathbb\{E\}\[Y\_\{i\}\(z\_\{i\}\)\\mid X\_\{1:n\}\]
对于固定的分配 z=aπe\(X1:n\)z=a\_\{\\pi\_\{e\}\}\(X\_\{1:n\}\)——这正是我们的估计量和参考值所计算的——而不是一个具有预定截断点的人口分位策略。不确定性相应地是有条件的:bootstrap 保留相似文章
当离线评估产生误导:延迟反馈上下文老虎机中奖励与策略选择的诊断协议
本文提出了一种在延迟反馈上下文老虎机中选择奖励与策略的诊断协议,认为标准离线评估可能产生误导,并在基准测试和已部署的推送系统上验证了该方法。
聚合排行榜隐藏系统特定获胜者:离线根因分析基准的报告协议审计
本文对离线根因分析基准进行了审计,发现聚合排行榜隐藏了子系统特定的获胜者,通过对11个子系统的778个案例进行成对比较。它发布了一个320行的审计模块,用于重新计算每个子系统的稳定性检查。
基于成对比较的最优Top-$k$识别
本文研究了基于噪声成对比较的固定置信度top-k识别问题,并开发了一种渐近最优算法,该算法最小化期望比较次数。
未知共享库存的在线分配
本文提出了在线共享库存分配问题,并设计了一种确定性的阈值比例策略(GPA),该策略能达到离线最优解的 4/3 近似比。文章还介绍了一种学习增强型扩展方法,以处理不完美的预测,并在合成数据及真实世界实验中展示了其优越的性能。
轨迹驱动评估何时误导MoE专家缓存?重放语义、工作负载污染与运行区间
本文研究了轨迹驱动评估如何误导对MoE专家缓存的评估,识别出重放语义、工作负载污染和运行区间三个混淆轴,它们可能颠倒策略排名。在纠正这些问题后,研究表明,离线最优差距在很大程度上高估了轻量级因果缓存机制实际恢复的收益。