通过后分层降低排序实验中重尾变现指标的方差

arXiv cs.LG 论文

摘要

研究人员提出了一种实用的方差缩减框架,将后分层与 CUPED 相结合,用于处理排序实验中的重尾变现指标。该框架已在 ShareChat 部署,可在减少 45% 流量的情况下达到同等统计置信度。本文已被 SIGIR 2026 收录。

arXiv:2606.04110v1 公告类型:新论文 摘要:排序与检索系统的在线评估通常依赖下游变现指标,例如应用收入或创作者收益。这类指标通常呈重尾分布,少数用户主导了均值和方差的绝大部分,导致 A/B 实验的统计功效低下、结论不稳定——尤其是在流量有限的情况下。 我们提出了一种在线实验方差缩减的实用框架,将后分层与 CUPED 结合使用。该方法利用实验前的协变量来提升变现实验的灵敏度,无需额外流量。该方法已在 ShareChat 的排序驱动变现实验中落地部署,显著降低了方差并提升了决策稳定性,相比标准指标可减少约 45% 的流量同时达到等效统计置信度。我们还深入探讨了实际设计选择、防护机制与局限性,为何时在真实信息检索与推荐系统中适用后分层提供了指导建议。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:20

# 通过后分层实现排序实验中重尾变现指标的方差缩减
来源:https://arxiv.org/html/2606.04110
\(2026\)

###### 摘要\.

排序与检索系统的线上评估通常依赖下游变现指标,例如应用收入或创作者收益。这些指标通常呈重尾分布,少数用户主导着均值和方差,导致 A/B 实验统计功效低下、结论不可靠——在流量有限的情况下尤为突出。

我们提出了一套结合后分层与 CUPED 的实用方差缩减框架,用于线上实验。该方法利用实验前协变量提升变现实验的灵敏度,无需增加额外流量。该方法已在 ShareChat 的排序驱动型变现实验中落地部署,显著降低了方差并提升了决策稳定性,相比标准指标节省了 45% 的流量即可达到等效的统计置信度。我们进一步讨论了实践中的设计选择、护栏机制与局限性,为信息检索和推荐系统的真实场景提供后分层适用性指导。

A/B 测试;方差缩减;重尾指标;CUPED;后分层;线上实验

††journalyear:2026††copyright:cc††conference:第 49 届 ACM SIGIR 国际信息检索研究与发展会议论文集;2026 年 7 月 20–24 日;澳大利亚维多利亚州墨尔本††booktitle:第 49 届 ACM SIGIR 国际信息检索研究与发展会议论文集(SIGIR '26),2026 年 7 月 20–24 日,澳大利亚维多利亚州墨尔本††doi:10\.1145/3805712\.3808428††isbn:979\-8\-4007\-2599\-9/2026/07††ccs:综合与参考 估计††ccs:综合与参考 指标††ccs:综合与参考 实验††ccs:综合与参考 评估††ccs:信息系统 数据分析††ccs:信息系统 推荐系统

## 1\.引言与动机

线上对照实验是大规模信息检索(IR)平台评估排序与推荐系统的主要手段。由于排序系统控制着曝光与发现,它间接影响下游变现结果,使得对变现敏感的评估成为 IR 度量的核心挑战,而非单纯的业务指标问题。信息流个性化的调整通常通过 A/B 测试进行验证,这要求足够的统计功效\(Kohavi 等,2009 (https://arxiv.org/html/2606.04110#bib.bib2)\)和对处理效应的稳定估计。尽管参与度指标在 IR 评估中已有深入研究,但许多生产系统如今优化的是变现目标——包括广告收入、市场流动性和创作者收益——这引入了独特的统计挑战。

与参与度指标不同,变现结果通常由少数高影响力的用户行为驱动,呈现重尾分布。在实际流量分配下,尾部行为主导方差,使得基于大样本理论的正态近似在实践中不可靠\(Jeunen,2025 (https://arxiv.org/html/2606.04110#bib.bib7)\)。这导致处理效应估计不稳定,在实际流量和时间限制下降低了实验灵敏度,并导致推断不可靠\(Jeunen 等,2024 (https://arxiv.org/html/2606.04110#bib.bib6)\)。

尽管 CUPED(使用实验前数据的受控实验)\(Deng 等,2013 (https://arxiv.org/html/2606.04110#bib.bib1)\)等方差缩减技术可提升估计效率,但其效果受限于实验前信号的预测能力。在实际操作中,这迫使团队延长实验时长或放宽统计阈值,从而拖慢迭代节奏。

后分层是调查抽样中的经典技术\(Valliant,1993 (https://arxiv.org/html/2606.04110#bib.bib3);Miratrix 等,2013 (https://arxiv.org/html/2606.04110#bib.bib4)\),通过将单元划分为同质化层并利用总体层权重聚合各层估计来控制用户行为的异质性\(Xie 和 Aurisset,2016 (https://arxiv.org/html/2606.04110#bib.bib8)\)。将其应用于生产 IR 系统中的重尾变现结果带来了新的挑战,包括鲁棒的分层设计、偏斜分布下的无偏估计,以及与现有实验流水线的无缝集成。

在本文中,我们介绍了一套针对 IR 实验的可投产后分层框架。该框架已在 ShareChat 和 Moj 的 \>40 个排序驱动型变现实验中部署,我们的方法:(i) 分析了流量限制下重尾指标的统计行为;(ii) 将行为后分层与协变量调整相结合;(iii) 展示了持续的方差缩减效果,从而实现可靠决策并加快排序改进的迭代速度。

## 2\.问题陈述与方法论

### 2\.1\.变现指标

ShareChat 的直播平台允许用户购买虚拟货币,并在直播期间将其赠送给内容创作者。GMV(商品交易总额)代表实验窗口期内的总充值金额,是平台数字直播打赏的核心变现指标\(Jeunen 等,2024 (https://arxiv.org/html/2606.04110#bib.bib6)\)。GMV 是多个 IR 组件的下游结果,包括召回、排序、多样化和推荐系统。排序模型的调整直接影响曝光,进而影响变现行为。

线上实验的随机化单元为用户。设 $Y(1)$ 和 $Y(0)$ 分别表示处理组和对照组的实验后 GMV。我们的目标估计量为总体平均处理效应(ATE)$\tau=\mathbb{E}[Y(1)-Y(0)]$。我们寻求一个估计量 $\hat{\tau}$,使其无偏、方差低于均值差,并对实现选择和样本变异具有鲁棒性。

### 2\.2\.变现指标的分布挑战

我们分析了 GMV 的分布,观察到极度偏斜,与用户活跃度和变现数据中常见的重尾或幂律行为一致\(Clauset 等,2009 (https://arxiv.org/html/2606.04110#bib.bib11)\)。如图1 (https://arxiv.org/html/2606.04110#S2.F1)所示,前 0.01% 的用户主导了方差,形成了不符合标准近似的重尾。

参见图注图 1\.实验前原始 GMV 分布(使用实验前数据在用户层面计算的总 GMV)。箱线图(x 轴数值因保密要求已省略)展示了中位数、四分位数和异常值。极端异常值对方差的贡献不成比例,导致统计不稳定性。原始 GMV 箱线图,显示极端异常值为验证统计假设,我们在不同流量水平(1%、5%、10%、20%、30%、50%)下分析了数千次 A/A 模拟运行的 $z$ 统计量分布。尽管中心极限定理(CLT)保证了渐近正态性,但 GMV 的重尾偏斜显著延迟了这一收敛。如图2 (https://arxiv.org/html/2606.04110#S2.F2)所示,在低至中等流量(1–20%)下,$z$ 统计量的经验分布偏离理论标准正态分布。收敛从 20% 开始,但仍不完全;只有在 $\geq$50% 流量下才能观察到令人满意的标准正态近似。

参见图注图 2\.不同流量水平 A/A 测试中 GMV 的 $z$ 统计量(x 轴)经验分布(上:1%、5%、10%;下:20%、30%)。y 轴表示频率。与标准正态分布(橙色曲线)的偏差表明 CLT 失效。$z$ 统计量的经验分布关键在于,这一违反在假设检验中表现为保守性:我们观察到假阳性率(FPR)为 2–4%,而理论预测的名义值为 5%。虽然这意味着任何统计显著结果的可信度极高(低 I 类错误),但也表明检验严重功效不足。在 5–10% 流量下进行标准 A/B 测试时,若不进行方差缩减,检测到真实效应的概率几乎可以忽略不计。实践中,这意味着仅靠延长实验时间或增加流量不足以恢复重尾变现指标的统计可靠性。

### 2\.3\.后分层框架

后分层有助于控制用户行为的异质性,尤其是分布尾部的异质性。其核心思路是根据观测特征(如历史收入活跃度)将用户划分为离散的层,并在每层内计算实验效应。这些层级结果随后使用基于各层在全平台总体中占比的总体层权重进行聚合,而非仅基于实验参与者。这确保了外部有效性,并防止了层内处理-对照不平衡带来的偏差。该方法在不引入偏差的情况下大幅降低残差方差\(Miratrix 等,2013 (https://arxiv.org/html/2606.04110#bib.bib4)\),从而提升统计功效。此外,后分层提升了可解释性,实验负责人可以观察处理效应是集中在尾部用户还是均匀分布于各层。

**关键区别**:分层基于实验前期 GMV 定义,确保处理不会影响层归属。

设 $S=\{1,2,\ldots,k\}$ 表示各层(如尾部用户与非尾部用户)。我们的后分层估计量为:

$$\hat{\tau}_{PS}=\sum_{s\in S}w_{s}\cdot\hat{\tau}_{s}^{CUPED}$$

其中 $w_{s}=N_{s}/N$ 为该层的总体占比,$N_{s}$ 为全平台中层 $s$ 的用户数,$\hat{\tau}_{s}^{CUPED}$ 为层 $s$ 内经 CUPED 调整后的处理效应。

我们的方法遵循随机实验中回归调整的原则,无需正确的模型设定即可提升估计效率\(Lin,2013 (https://arxiv.org/html/2606.04110#bib.bib10)\)。

**无偏性**:

$$\mathbb{E}[\hat{\tau}_{PS}]=\sum_{s\in S}w_{s}\,\mathbb{E}[\hat{\tau}_{s}^{\text{CUPED}}]=\sum_{s\in S}w_{s}\,\tau_{s}=\mathbb{E}_{\mathcal{P}}[\tau]=\tau$$

这是因为 CUPED 是无偏的\(Deng 等,2013 (https://arxiv.org/html/2606.04110#bib.bib1)\),并由全期望定律保证。该结果源自 Miratrix 等\(https://arxiv.org/html/2606.04110#bib.bib4\)\(Miratrix 等,2013 (https://arxiv.org/html/2606.04110#bib.bib4)\)的定理 1。无偏性要求分层仅使用处理前信息定义。由于我们基于实验前期 GMV 构建分层,层归属不受处理分配影响,确保了无偏后分层估计的条件成立。

1. \(1\)**分层**:将高方差用户(尾部)隔离到小权重层中,通过权重的平方因子降低其对总体方差的贡献。对于总体权重 $w\approx 0.0001$ 的尾部层,其对后分层方差的贡献为 $w^{2}\cdot\sigma^{2}_{\text{tail}}/n_{\text{tail}}$。即使 $\sigma^{2}_{\text{tail}}$ 极大,乘以 $\sim10^{-8}$ 也能有效抑制其影响。
2. \(2\)**层内 CUPED**:实验前协变量消除每个同质化层内的可预测变异。

## 3\.实验验证与结果

我们在 40 余个影响直播排序与推荐系统的生产 A/B 测试上验证了我们的方法,每个测试的用户数超过 100 万。结果在 ShareChat 和 Moj 两个平台上保持一致,证明了该方法在不同产品场景下的鲁棒性。

我们的工作流程如下:

1. \(1\)收集每位用户的原始 GMV 和实验前 GMV。
2. \(2\)对超过第 99.999 百分位数的值进行截尾或移除(通常 $<5$ 个用户)。如图1 (https://arxiv.org/html/2606.04110#S2.F1)所示,此举可降低极端高消费用户(如图中可见的 2 个异常值)对方差的影响,同时不对绝大多数用户群体引入偏差。
3. \(3\)使用 30 天历史 GMV 将用户划分为行为层(尾部用户 vs. 非尾部用户 vs. 新用户/非消费用户)。分层阈值从实验前期总体中计算,并在观测到任何实验结果数据之前冻结。
4. \(4\)在每层内计算 CUPED 调整后的 GMV:
$$\text{GMV}_{\text{CUPED}}=\text{GMV}-\frac{\text{cov}(\text{GMV},\text{CentralizedPreGMV})}{\sigma^{2}_{\text{CentralizedPreGMV}}}\cdot(\text{CentralizedPreGMV})$$
其中:$\text{CentralizedPreGMV}=\text{PreGMV}-\mu_{\text{PreGMV}}$
5. \(5\)使用全量流量权重计算 $\text{GMV}_{\text{CUPED}}$ 的后分层均值和方差:
$$\mu_{\text{treatment}}=\sum_{s\in S}w_{s}\cdot\mu_{s}\qquad\sigma^{2}_{\text{treatment}}=\sum_{s\in S}w_{s}^{2}\cdot\frac{\sigma^{2}_{s}}{n_{T,s}}$$
类似地,为对照组计算相同指标。
6. \(6\)计算 $z$ 统计量和 $p$ 值以评估统计显著性:
$$\text{z统计量}=\frac{\mu_{\text{treatment}}-\mu_{\text{control}}}{\sqrt{{\sigma^{2}_{\text{treatment}}}+{\sigma^{2}_{\text{control}}}}}$$

表 1\.GMV 指标变体的方差缩减与 I 类错误对比与原始 GMV 相比,CUPED 将方差降低了约 48%,而结合后分层的 CUPED 在本案例中实现了 $>99\%$ 的方差缩减。这一极端缩减由对少数主导方差的用户(<0.01%)的降权驱动,带来了**更高的灵敏度**(表1 (https://arxiv.org/html/2606.04110#S3.T1)),使得此前被噪声掩盖的细微处理效应得以被检测。两种后分层方案之间可忽略不计的差异(0.4%)证实,隔离尾部用户——而非特定异常值处理——才是方差缩减的主要驱动因素。

在实际意义上,方差缩减转化为显著更低的最小可检测效应(MDE):在 10% 流量分配下,MDE 从约 136% 均值(原始 GMV)降至约 10%(后分层),使得此前不可行的真实处理效应检测成为可能。

除方差缩减外,我们通过衡量固定流量下的**决策时间缩减**、与长期基线的**一致性**以及对尾部事件的**灵敏度**来评估决策质量。在各实验中,后分层能够以少 40–50% 的流量做出可靠决策,同时与长期结果保持一致。

**相对中位 Z 分数的解读**:相对中位 $z$ 分数为 1.36 意味着我们只需 $1.36^{2}=1.85$ 倍少的数据点即可达到与原始指标相同的置信水平($1-\frac{1}{1.85}\approx 45\%$)\(Baweja 等,2024 (https://arxiv.org/html/2606.04110#bib.bib5)\)。作为对比,流量节省...

相似文章

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

Representation Curriculum: 分阶段训练以实现稳健排序与分配

arXiv cs.LG

本文提出Representation Curriculum (RC),一种训练时干预方法,通过分阶段利用特征来减少对曝光混杂历史信号的过度依赖,并改善排序系统中的冷启动泛化能力。该方法经过了理论分析,并在公开基准和大规模eBay搜索实验中得到了验证。