目标加权Neyman分配:人口迁移下异质性处理效应的实验设计
摘要
本文介绍了目标加权Neyman分配(TWNA),一种两阶段分层实验设计,通过优化各组和各处理臂的样本分配,提高人口迁移下目标加权组平均处理效应的估计精度。
arXiv:2608.06512v1 公告类型:新
摘要:随机实验通常在一个总体中运行,以指导另一个总体中的决策。按实验比例分配会在部署中很少出现的组上浪费预算,而按部署比例分配则会对难以精确测量的组取样不足。我们提出\textbf{TWNA}(目标加权Neyman分配),一种两阶段分层设计,利用组-臂结果方差的试点估计来分配最终阶段的样本量和处理概率,以优化目标加权组平均处理效应(GATE)的精度。最优规则具有闭式解,并权衡了部署重要性与统计难度;插件规则在试点方差估计稳定时能够恢复该最优规则。我们还将TWNA扩展到处理部署组成不确定的情况,无论目标混合是大致已知还是完全未知,都能保持稳健。最后,我们将这种权重稳健性与针对偏态、稀有事件或污染结果的试点稳健变体区分开来。模拟和真实协变量基准测试表明,当组既在部署中重要又难以测量时,增益最大。
查看缓存全文
缓存时间: 2026/08/10 08:01
# 目标加权内曼分配:人群偏移下异质性处理效应的实验设计 来源:https://arxiv.org/html/2608.06512 黄当(Hoang Dang) Luan Pham Minh Nguyen 独立研究者 澳大利亚新南威尔士大学 美国佛罗里达大西洋大学 [email protected] [email protected] [email protected] ###### 摘要 随机实验通常在一个总体中开展,却用于指导另一个总体中的决策。按实验比例分配样本会浪费预算在部署中很少出现的组上,而按部署比例分配则会对难以精确测量的组采样不足。我们提出TWNA(Target-Weighted Neyman Allocation,目标加权内曼分配),这是一种两阶段分层设计,利用组–臂结果方差的预试验估计来分配最终阶段的样本量和处理概率,以实现目标加权组平均处理效应(GATE)的精度。Oracle规则具有闭式解,能够在部署重要性与统计难度之间取得平衡;当预试验方差估计趋于稳定时,plug-in规则可以恢复该最优规则。我们还将TWNA扩展以处理部署组成的不确定性,无论目标构成是粗略已知还是完全未知,它都能保持稳健。最后,我们将这种权重稳健性与针对小样本或重尾预试验单元的pilot-robust变体区分开来。模拟和真实协变量基准实验表明,当组既在部署中重要又难以测量时,收益最大。 ## 引言 随机实验通常在一个总体中开展,却用于指导另一个总体中的决策([Dahabreh et al. (2019)](https://arxiv.org/html/2608.06512#bib.bib9);[Cole and Stuart (2010)](https://arxiv.org/html/2608.06512#bib.bib7))。例如在实践中,这意味着针对活跃用户的实验会为所有人(包括行为不同且更难测量的细分人群)的政策提供依据([Wang, Han, and Huang (2025)](https://arxiv.org/html/2608.06512#bib.bib24))。大量工作处理了实验设计([Neyman (1992)](https://arxiv.org/html/2608.06512#bib.bib18);[Cytrynbaum (2023)](https://arxiv.org/html/2608.06512#bib.bib8))、总体推广([Phan et al. (2021)](https://arxiv.org/html/2608.06512#bib.bib19);[Egami and Hartman (2023)](https://arxiv.org/html/2608.06512#bib.bib10);[Shi and Lin (2022)](https://arxiv.org/html/2608.06512#bib.bib22))以及子组估计([Robertson et al. (2024)](https://arxiv.org/html/2608.06512#bib.bib20);[Wei et al. (2023)](https://arxiv.org/html/2608.06512#bib.bib26)),但没有一项直接回答一个实际问题:如果我们关心目标总体中特定组的处理效应,我们应该如何在各组和处理臂之间分配样本?这一空白会产生实际后果:按实验比例分配会浪费预算在部署总体中很少出现的组上,而按部署比例分配则会对难以精确测量的组采样不足,因此单独使用任意一种都不够。行业平台也在操作层面报告了同样的矛盾:Netflix发现先验分层抽样在生产不平衡下会退化,因此依赖事后修正([Xie and Aurisset (2016)](https://arxiv.org/html/2608.06512#bib.bib27));Facebook的实验平台警告称,一个总体中的结果不一定能迁移到另一个总体([Bakshy, Eckles, and Bernstein (2014)](https://arxiv.org/html/2608.06512#bib.bib2))。我们提出TWNA,一种针对这一分配问题的两阶段设计。在第一阶段,一个小型平衡预试验估计每个组和处理臂内结果的变异程度。在第二阶段,最终实验利用这些估计和目标部署份额来分配样本:在部署中出现更频繁且更难精确测量的组获得更多观测值;在每个组内,按照经典内曼分割,更多单元被分配到结果方差较高的处理臂。处理概率非常低的组会被截断以保持正性(positivity)。当部署组成未知时,TWNA仍然能够适应:给定最佳猜测,它以该猜测为目标;给定仅一个最坏情况范围,它以最坏情况为目标;在没有信息时,它无论组成如何都分配以平衡风险。先前的工作只处理了部分,而非整体。分层设计提高了实验样本(而非部署总体)的精度([Zhang, Zhang, and Liu (2025)](https://arxiv.org/html/2608.06512#bib.bib28))。可迁移设计考虑了目标总体,但优化的是总体平均效应而非组特定效应([Phan et al. (2021)](https://arxiv.org/html/2608.06512#bib.bib19);[Shi and Lin (2022)](https://arxiv.org/html/2608.06512#bib.bib22);[Zhang, Zhang, and Liu (2025)](https://arxiv.org/html/2608.06512#bib.bib28))。事后可推广性方法估计人群偏移下的子组效应,但接受已经实施的任何设计([Robertson et al. (2024)](https://arxiv.org/html/2608.06512#bib.bib20);[Dahabreh et al. (2019)](https://arxiv.org/html/2608.06512#bib.bib9))。自适应方法优化的是部署哪个策略,而非每个组效应被估计得多准确([Kasy and Sautmann (2021)](https://arxiv.org/html/2608.06512#bib.bib16);[Wei, Ma, and Wang (2025)](https://arxiv.org/html/2608.06512#bib.bib25))。 ### 玩具示例 考虑两个组。组1占部署总体的80%,但易于测量(结果标准差=1)。组2在部署中稀有(20%)但噪声大(标准差=4)。按部署份额分配将80%的样本放在组1,忽略了组2更难精确估计。按方差分配将80%放在组2,尽管部署后误差的重要性较低。我们的规则平衡两者: \[ \rho_1^\star=\frac{\sqrt{0.8}\cdot 2}{\sqrt{0.8}\cdot 2+\sqrt{0.2}\cdot 8}=\frac{1}{3},\qquad \rho_2^\star=\frac{2}{3}. \] 分子 \(\sqrt{q_k}(\sigma_{1k}+\sigma_{0k})\) 同时捕捉两种力量:通过 \(\sqrt{q_k}\) 捕捉部署重要性,通过总标准差捕捉测量难度。在模拟和两个真实协变量基准中,与标准替代方案相比,TWNA持续降低目标加权组效应的估计误差,并在预试验稳定后接近oracle设计。 本文做出五项贡献。 1. 定义了一个有原则的目标:以每个组在目标总体中出现频率为权重,最小化GATE的估计误差。 2. 推导了一个闭式oracle设计,规定从每个组采样多少单元以及如何在每个组内分配处理,并针对不确定的目标组成给出了权重稳健扩展。 3. 提供了一种实用的两阶段程序,使用小型预试验估计所需输入,并证明随着预试验规模增长,该程序能恢复最优设计。 4. 在模拟和两个数据集上,将该设计与替代方案(包括部署比例、仅方差和标准内曼设计)进行基准比较。 5. 量化了plug-in设计随预试验增长接近oracle的速度,并将一种pilot-robust的方差输入变体与对部署权重不确定性的稳健性区分开来。 ## 相关工作 本文处于三支文献的交汇处:分层与自适应实验设计、目标人群偏移下的设计,以及异质性/子组效应估计。 *分层与自适应设计。*经典的基准是[Neyman (1992)](https://arxiv.org/html/2608.06512#bib.bib18),它在分层抽样下将更多观测分配给噪声更大的层。调查统计学家将同样的拉格朗日逻辑扩展到*多领域调查分配*:选择从每个子总体(领域)中抽取多少单元,使得若干调查变量的估计满足领域层面的精度目标,通常是在变异系数约束下最小化成本,或优化一个加权方差准则([Cochran (1977)](https://arxiv.org/html/2608.06512#bib.bib6);[Bethel (1989)](https://arxiv.org/html/2608.06512#bib.bib3);[Hu et al. (2024)](https://arxiv.org/html/2608.06512#bib.bib12))。这一目标在代数精神上与我们的目标相近:两个问题都会将更多样本分配给在精度目标中权重更大且更难估计的领域。TWNA在两个维度上有别于它们。第一,多领域分配针对的是描述性有限总体量,而TWNA在目标加权损失下针对的是因果GATE。第二,多领域分配没有处理分配维度:它只选择领域样本量,而TWNA联合选择组样本量和组内处理概率。在随机实验中,[Hahn, Hirano, and Karlan (2011)](https://arxiv.org/html/2608.06512#bib.bib11)使用预试验数据调整倾向得分以估计ATE,[Bai (2022)](https://arxiv.org/html/2608.06512#bib.bib1)研究配对最优性,[Tabord-Meehan (2023)](https://arxiv.org/html/2608.06512#bib.bib23)使用第一波来学习分层树和第二波分配概率。分层树设计在给定样本组成下选择划分和层内处理比例——层份额保持在总体频率——因此它优化的维度与本文研究的跨组分配正交;我们的实验将其作为组内细化来实现,并展示这两个维度可以组合。[Cytrynbaum (2023)](https://arxiv.org/html/2608.06512#bib.bib8)在精神上最为接近:他在两阶段调查实验中联合优化抽样和处理分配,得到了相同的层内内曼处理比例和关于ATE目标正比于 \(\sigma_1+\sigma_0\) 的抽样规则。[^1] 我们的规则将这一经典逻辑专门用于不同的损失函数,即固定GATE向量的目标加权MSE,这正是跨组规则中引入 \(\sqrt{q_k}\) 因子的原因。 [^1]: 描述的是该arXiv预印本的v2(2023)。v3(2026年,改题为“Fine Stratification of Survey Experiments”)推广到成本加权目标,并改为固定 \(p=1/2\)。 *目标人群偏移下的设计。*[Phan et al. (2021)](https://arxiv.org/html/2608.06512#bib.bib19)为目标ATE设计可迁移实验,[Shi and Lin (2022)](https://arxiv.org/html/2608.06512#bib.bib22)利用观测数据研究目标PATE的高效RCT抽样,[Egami and Hartman (2023)](https://arxiv.org/html/2608.06512#bib.bib10)给出了外部有效性框架,[Hu et al. (2024)](https://arxiv.org/html/2608.06512#bib.bib12)通过极小极大福利遗憾研究样本选择。这些论文将目标总体纳入设计,但目标函数是ATE、PATE、平衡、福利或遗憾。它们也作用于不同的设计维度。[Phan et al. (2021)](https://arxiv.org/html/2608.06512#bib.bib19)固定 \(n_1=n_0=n/2\),并对*给定*样本的处理分配进行重新随机化,直到重要性加权协变量达到平衡;当固定组作为协变量时,分层分配恰好满足其平衡准则,因此他们的程序是对分配规则的补充,而非竞争。[Shi and Lin (2022)](https://arxiv.org/html/2608.06512#bib.bib22)确实分配RCT样本——正比于目标密度乘以影响函数尺度——但保持处理概率固定;我们的实验评估了他们的规则以及我们针对目标加权GATE目标调整的变体。我们则针对固定GATE向量的目标加权MSE,因此最优设计不必遵循实验总体、部署总体或ATE最优的内曼分配。 *异质性与子组效应估计。*半参数文献发展了子组效应的结果模型和(增广)加权估计量([Robertson et al. 2024](https://arxiv.org/html/2608.06512#bib.bib20))、预先指定子组的有效目标学习([Wei et al. 2023](https://arxiv.org/html/2608.06512#bib.bib26))、异质性效应的通用机器学习推断([Chernozhukov et al. 2018](https://arxiv.org/html/2608.06512#bib.bib5);[Imai and Li 2025](https://arxiv.org/html/2608.06512#bib.bib13))、以及广义平均处理效应([Kallus and Santacatterina 2019](https://arxiv.org/html/2608.06512#bib.bib15))。这些论文在数据收集之后为估计提供方法;它们不会在最终实验之前选择组样本量或处理概率以最小化目标加权GATE方差。一个相关的自适应设计文献针对异质性:[Wei, Ma, and Wang (2025)](https://arxiv.org/html/2608.06512#bib.bib25)开发了用于识别效应最大子组的响应自适应实验。该目标是子组选择,而我们的目标是在部署权重下所有预先指定GATE的精度。 *空白与定位。*相邻工作只覆盖了分层设计、目标人群偏移和子组估计的两两组合。由于plug-in规则依赖预试验方差估计,它继承了[Cai and Rafi (2024)](https://arxiv.org/html/2608.06512#bib.bib4)强调的小预试验问题;因此,在小预试验、重尾结果或近乎同方差的处理臂情况下,稳健或保守版本非常重要。同样的空白也出现在操作层面:生产平台在分配后校正不平衡(事后方差缩减校正、事后分层),而不是在事前将样本分配用于目标加权精度,并报告称先验分层在实践中表现不佳([Xie and Aurisset 2016](https://arxiv.org/html/2608.06512#bib.bib27))。TWNA则将部署权重构建到事前分配规则中。 ## 方法 我们研究一种分层随机实验,用于在可能与实验总体不同的部署总体下估计GATE。设 \(X\in\mathcal{X}\) 表示预处理协变量,令 \(\mathcal{X}_1,\ldots,\mathcal{X}_K\) 为固定的、预先指定的组。记 \(S=s(X)\in\{1,\ldots,K\}\) 为组标签。目标估计量为 \[ \tau_k=\mathbb{E}\{Y(1)-Y(0)\mid S=k\},\qquad k=1,\ldots,K. \] 令 \(q_k=Q(S=k)\) 表示组 \(k\) 在部署总体中的已知份额,满足 \(q_k>0\) 且 \(\sum_{k=1}^K q_k=1\)。我们仅考虑组成偏移:组特定效应从实验总体 \(P\) 迁移到部署总体,因此 \[ \mathbb{E}_Q\{Y(1)-Y(0)\mid S=k\}=\mathbb{E}_P\{Y(1)-Y(0)\mid S=k\}=\tau_k. \] 设计目标为目标加权GATE风险 \[ R_Q(\hat{\tau})=\sum_{k=1}^K q_k\mathbb{E}\{(\hat{\tau}_k-\tau_k)^2\}. \] ### 设计准则与Oracle设计 对于组 \(k\),令 \(m_k\) 表示从该组采样的最终阶段实验单元数,令 \(e_k=P(A=1\mid S=k)\) 表示处理概率。定义 \[ V_k(e_k)=\frac{\sigma_{1k}^2}{e_k}+\frac{\sigma_{0k}^2}{1-e_k}, \] 其中 \(\sigma_{ak}^2\) 是处理臂 \(a\) 在组层面的结果方差。令 \(M=\sum_k m_k\),且 \(\rho_k=m_k/M\)
相似文章
将数据驱动预测与分配对齐:一种以决策为中心的生存分析方法
本文介绍了一种面向决策的生存分析学习方法,该方法通过NDCG优化将预测模型与后续分配决策对齐。应用于美国心脏移植数据后,排名性能提升了50-100%,每年可能带来数千额外生命年。
基于注意力的剂量变化下个体治疗获益概率估计
本文提出Dose-AIPTB,一种使用基于注意力的聚合估计离散剂量分配下个体治疗获益概率的框架,在数值实验中优于核替代方法。
图数据中差异化网络效应的处理效应估计
本文通过建模差异化网络效应解决了从图数据中估计个体处理效应的挑战,提出了一种包含部分注意力和信息放大器的机制,以捕捉邻居的不同重要性和规模。实验表明,该方法性能优于现有方法。
TILT: 协变量偏移下的目标诱导损失倾斜
TILT提出了一种新颖的目标函数,用于在协变量偏移下进行无监督域适应,该函数对未标记目标数据上的辅助组件施加惩罚,隐式实现了具有有界估计量的自定位重要性加权。理论保证和在偏移CIFAR-100上的实验表明,目标域性能优于基线方法。
快速A/B/n测试:通过树耦合反馈共享进行精确多策略比较
介绍树耦合A/B测试(TCAB),一种精确的反馈共享设计,通过更少的奖励查询比较多个自适应策略,同时保留每个策略的轨迹分布。