难民匹配收益对离策略评估选择的鲁棒性
摘要
本文通过逆概率加权(IPW)和增广逆概率加权(AIPW)等离策略方法,展示了难民匹配影响评估的鲁棒性,从而证实了此前关于算法分配难民的研究成果。
arXiv:2605.06686v1 公告类型:新论文
摘要:先前的研究调查了难民匹配在提升难民安置成效方面的潜力,这一概念最早由 Bansak 等人(2018)提出。本文利用多种离策略评估方法,展示了美国难民匹配背景下反事实影响评估结果的稳定性。为了估计反事实影响并测试结果的鲁棒性,我们采用了多种评估方法,包括逆概率加权(IPW)以及增广逆概率加权(AIPW)的多种变体。我们还考虑了各种修改,包括替代性的建模架构和不同的分配程序。在所有场景中,影响估计的幅度均保持一致,且在大多数情况下具有统计显著性。此外,这些估计结果也与 Bansak 等人(2018)最初提出的结果一致。
查看缓存全文
缓存时间: 2026/05/11 06:40
# 难民匹配收益对策略外评估选择的稳健性
来源:https://arxiv.org/html/2605.06686
Kirk Bansak,a,b Elisabeth Paulson,a,c Dominik Rothenhäusler,d Jeremy Ferwerda,a,e Jens Hainmueller,a,f Michael Hotarda
\(a斯坦福大学移民政策实验室 b加州大学伯克利分校政治学系 c哈佛商学院技术与运营管理系 d斯坦福大学统计学系 e达特茅斯学院政府系 f斯坦福大学政治学系\)
###### 摘要
先前的研究探讨了难民匹配在提升难民结果方面的潜力,这一概念最早由 Bansak 等人(2018)提出。本文通过一系列策略外(off-policy)评估方法,展示了在美国背景下难民匹配的反事实影响评估结果的稳定性。为了估计反事实影响并检验我们结果的稳健性,我们采用了多种评估方法,包括逆概率加权(IPW)和多种增强型逆概率加权(AIPW)变体。我们还考虑了各种修改方案,包括替代性的建模架构和不同的分配程序。在所有场景中,影响估计值在幅度上保持一致,且在大多数情况下具有统计显著性。此外,这些估计值也与 Bansak 等人(2018)最初提出的结果一致。
## 1 引言
通过算法化难民分配来改善难民在宿主国家的生活状况这一想法,最初由 Bansak 等人(2018)提出,该研究也展示了初步的反事实影响评估。此后,多项研究考虑了各种扩展(例如 Gölz 和 Procaccia, 2019; Ahani 等人, 2021; Acharya 等人, 2022; Freund 等人, 2023; Ahani 等人, 2024; Bansak 和 Paulson, 2024; Bansak 等人, 2024; Jain 等人, 2025; Rodriguez-Diaz 等人, 2025; Bansak 等人, 2026)。本文扩展了 Bansak 等人(2018)关于美国算法化难民分配潜力的影响评估,通过一系列策略外评估方法展示了结果的稳定性。
在其原始分析中,Bansak 等人(2018)采用了常见的基于模型的政策评估程序。许多研究讨论了基于模型的反事实估计和政策评估中的问题,例如“赢家诅咒”偏差的可能性(例如 Andrews 等人, 2024; Zrnic 和 Fithian, 2025; Bastani 等人, 2026)。例如,Bastani 等人(2026)显示,在合成数据集上,赢家诅咒偏差可能很大。
在本文中,我们采用更稳健的评估方法来估计难民匹配在美国的反事实影响,包括逆概率加权(IPW)和多种增强型逆概率加权(AIPW)变体。我们还考虑了各种修改方案,包括替代性的建模架构和不同的分配程序。在所有场景中,影响估计值在幅度上保持一致,且在大多数情况下具有统计显著性。此外,这些估计值也与 Bansak 等人(2018)最初呈现的结果一致。作为我们的评估场景之一,我们使用了 Bansak 等人(2018)中使用的确切数据和模型,我们稳健的评估方法得出的影响估计值与 Bansak 等人(2018)中最初使用的基于模型的方法得出的估计值相似,证明那些原始结果并非由赢家诅咒偏差驱动。
总之,我们发现使用一系列稳健的评估方法得到的影响评估结果是稳定的。这些结果强调了数据驱动的难民匹配在实质性地改善就业结果方面的潜力。
## 2 设置
我们观察到一个有限的人群,在测试/评估集中索引为 $i=1,\dots,N$。每个个体历史上被分配到 $K$ 个地点中的一个,记为 $A_i\in\{1,\dots,K\}$,并经历了就业结果 $Y_i\in\{0,1\}$。建议的算法匹配将每个个体分配到一个新地点 $g_i\in\{1,\dots,K\}$。我们希望估计如果采用算法分配 $g=(g_1,\dots,g_N)$ 代替历史分配 $A$ 所获得的平均就业率。
我们使用美国最大的安置机构之一的历史难民分配和结果数据。历史分配是准随机的。[^1] 因此,我们考虑两种可能性。第一种是局部层面的分配概率 $\pi_{a,i}$,表示个体 $i$ 被分配到地点 $a$ 的概率,在个体之间是同质的,即 $\pi_{a,i}=\pi(a)$,这是基于历史经验计数已知的。第二,作为稳健性检查,我们也考虑 $\pi_{a,i}$ 依赖于协变量的可能性,即 $\pi_{a,i}=\pi(a|X_i)$,在这种情况下我们估计这些倾向性得分。我们假设没有干扰(SUTVA),并让 $Y_i(a)$ 表示个体 $i$ 在地点 $a$ 下的潜在就业结果。我们观察到 $Y_i=Y_i(A_i)$。
我们感兴趣的是估计政策值
$$
V(g)=\frac{1}{N}\sum_{i=1}^N Y_i(g_i).
$$
为了预测算法中使用的反事实奖励,我们在训练数据集(与评估集分开)上训练监督机器学习模型。令 $\mu_i(a)$ 表示条件期望结果 $\mathbb{E}[Y_i(a)|X_i]$ 的估计值。对于每个个体,定义
$$
\mu_{A,i}=\mu_i(A_i), \quad \mu_{g,i}=\mu_i(g_i), \quad \pi_{A,i}=\pi_{A_i,i}
$$
其中,如上所述,我们考虑了两种可能性,即 $\pi_{A,i}=\pi(A_i)$ 和 $\pi_{A,i}=\pi(A_i|X_i)$。
我们在两个数据设置上执行反事实算法分配。第一个是 Bansak 等人(2018)中使用的确切数据,在这种情况下,我们通过汇集他们从 2015 年第四季度到 2016 年第三季度的评估集来形成我们的分配评估集,并使用他们从预测模型中获得的 $\mathbb{E}[Y_i(a)]$ 的确切估计值,该模型使用先前数据训练随机梯度提升树(SGBT)集成。这里使用了 Bansak 等人(2018)中使用的确切模型、预测和分配,构成了对 Bansak 等人(2018)的复制。
第二个数据设置使用更新的数据,其中我们的分配评估集包括我们的安置合作伙伴在 2016 年全年做出的所有历史分配。在这种情况下,$\mathbb{E}[Y_i(a)]$ 的估计值来自一个预测模型,该模型使用先前数据训练贝叶斯加性回归树(BART)模型。此外,在此设置中,虽然我们对足够大的地点使用特定地点的 BART 模型,但我们为小地点(以特定地点指标作为预测变量)使用聚合的 BART 模型。利用这些预测,我们为评估集制定新的反事实分配。在此过程中,我们考虑离线和在线分配,对于后者,我们实施 Bansak 等人(2026)中提出的在线分配算法。
在这两种数据设置中,当我们考虑 $\pi_{A,i}=\pi(A_i)$ 的可能性时,我们使用历史经验计数来计算已知的倾向性得分(即“经验倾向性得分”)。当我们考虑 $\pi_{A,i}=\pi(A_i|X_i)$ 的可能性时,我们使用随机森林概率模型估计倾向性得分(即“估计倾向性得分”)。此外,为了解决小倾向性得分对我们估计量方差的影响(下文描述),我们还考虑对我们的算法设计进行修改,将小地点(那些 $\pi(a)<0.01$ 的地点)聚合到一个伪地点中。当使用此修改时,聚合适用于匹配和评估程序。有效地,这意味着任何被分配到“小地点”的人都会随机(按比例)分配到伪地点池中的一个地点。这种策略理论上可能会在点估计中引入向下偏差,但应该也能减少方差。这在实践中也是一种有效的程序。
在这两种数据设置中,我们在案例层面(即家庭)进行反事实分配,并基于个体评估影响,正如 Bansak 等人(2018)中所做的那样。
## 3 估计量
我们通过三种不同的估计量来估计算法分配的反事实影响,如下所述。
### 3.1 逆概率加权(IPW)
IPW 估计量仅使用随机化的历史分配,并且*不*使用模型预测。如上所述,令 $\pi_{a,i}$ 表示个体 $i$ 被分配到地点 $a$ 的历史概率。定义指示器 $\mathbf{1}(A_i=g_i)$,如果个体 $i$ 历史上恰好被分配到与算法政策建议相同的地点,则该指示器等于 1。IPW 估计量为
$$
\widehat{V}_{\mathrm{IPW}}=\frac{\sum_{i=1}^N \mathbf{1}(A_i=g_i) \, \dfrac{Y_i}{\pi_{A,i}}}{\sum_{i=1}^N \mathbf{1}(A_i=g_i) \, \dfrac{1}{\pi_{A,i}}}. \tag{1}
$$
IPW 的识别需要满足以下条件:
1. 可忽略性(Ignorability):对于所有 $a$,$Y_i(a) \perp A_i \mid X_i$。
2. positivity(Positivity):如果政策将某些个体分配到 $g_i=a$,则 $\pi_{a,i}>0$。
3. SUTVA:个体之间没有干扰。
IPW 仅使用观察到的结果 $Y_i$,不涉及任何预测模型。然而,已知小倾向性得分的可能性有时会“爆炸”IPW 估计量的方差。为了解决这个问题,我们还考虑了前面描述的聚合修改,即将小地点(那些 $\pi(a)<0.01$ 的地点)聚合到一个伪地点中。
### 3.2 增强型 IPW(AIPW)
AIPW 将逆概率加权与结果回归模型相结合。AIPW 估计量为
$$
\widehat{V}_{\mathrm{AIPW}}=\frac{1}{N}\sum_{i=1}^N \left[ \mu_{g,i} + \mathbf{1}(A_i=g_i) \, \frac{Y_i - \mu_{A,i}}{\pi_{A,i}} \right]. \tag{2}
$$
AIPW 是双重稳健的。如果满足以下任一条件,它是一致的:
1. 历史分配概率 $\pi_{A,i}$ 被正确指定,或者
2. 结果回归模型 $\mu_i(a)$ 被正确指定。
与 IPW 相比,AIPW 还提供了更高的统计效率。对于 AIPW,我们也考虑上述的标准匹配程序和聚合匹配程序。
### 3.3 AIPW-local(AIPWl)
我们还考虑了 AIPW 的一种变体,我们称之为 AIPW-local,或 AIPWl。对于 AIPWl 估计量,增强项将边际倾向性 $\pi_{A,i}$ 替换为地点特定的估计
$$
\pi_{\mathrm{L}}(a) = \Pr(A_i=a \mid g_i=a) \approx \frac{\#\{i: A_i=g_i=a\}}{\#\{i: g_i=a\}}.
$$
定义
$$
\psi_i^{\mathrm{L}} = \mu_{g,i} + \mathbf{1}(A_i=g_i) \, \frac{Y_i - \mu_{A,i}}{\pi_{\mathrm{L}}(g_i)}.
$$
AIPWl 估计量为
$$
\widehat{V}_{\mathrm{AIPWl}} = \frac{1}{N}\sum_{i=1}^N \psi_i^{\mathrm{L}}.
$$
### 3.4 基于模型
作为基准比较,我们还考虑了 Bansak 等人(2018)中采用的基于模型的评估方法,该方法仅使用用于分配决策的 $\mathbb{E}[Y_i(a)]$ 的估计值来计算反事实就业和收益。在后面的结果部分,我们将使用这种方法得到的结果简称为“基于模型”。
## 4 基于设计的_uncertainty_量化
我们感兴趣的是估计,对于给定的人群和给定的匹配/分配,该人群和分配将产生的整体就业率。因此,我们将人群、用于训练 $\mu$ 的历史难民到达以及政策分配 $g$ 视为固定的。我们利用用于评估的历史分配的准随机性进行不确定性量化。也就是说,我们使用 $A_i$ 的变化,其中 $i=1,\dots,N$。在下文中,我们描述准随机情况($\pi_{A,i}=\pi(A_i)$)下的不确定性量化。
### 4.1 AIPW 和 AIPWl 的方差
$$
V - \widehat{V}_{\text{AIPW}} = \frac{1}{N}\sum_{i=1}^N Y_i(g_i) - \mu_{g,i} - \mathbf{1}_{A_i=g_i} \frac{Y_i - \mu_{A,i}}{\pi_{A,i}} = \frac{1}{N}\sum_{i=1}^N (\pi(g_i) - \mathbf{1}_{A_i=g_i}) \frac{(Y_i(g_i) - \mu_{g,i})}{\pi(g_i)}.
$$
然后,
$$
\text{Var}(V - \widehat{V}_{\text{AIPW}}) = \frac{1}{N^2}\sum_{i=1}^N \pi(g_i)(1-\pi(g_i)) \left( \frac{(Y_i(g_i) - \mu_{g,i})}{\pi(g_i)} \right)^2
$$
我们无法直接计算此方差,因为我们没有观察到每个人的所有项。一个无偏估计是
$$
\widehat{\text{Var}}(\widehat{V}_{\text{AIPW}} - V) = \frac{1}{N^2}\sum_{i=1}^N \mathbf{1}_{A_i=g_i} (1-\pi(g_i)) \left( \frac{(Y_i(g_i) - \mu_{g,i})}{\pi(g_i)} \right)^2
$$
[^1]: 基于对安置机构代表的经验评估和访谈,我们知道自由案例的历史分配是以与预期结果无关的方式进行的,尽管一些案件官员可能使用了我们也能够获取的协变量。因此,历史分配满足可忽略性。相似文章
基于局部披露的具有策略性主体的离线策略评估
本文研究当决策主体(智能体)为了回应策略而策略性地修改其协变量时的离线策略评估(OPE)。该方法利用事后解释进行局部披露,以揭示智能体的前策略协变量,并构建策略价值的双重稳健估计量。
面向动态UBSR度量的MDPs在线策略评估
本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。
当检索指标误导时:衡量长期工具使用代理中的政策信号
本文考察了精确匹配检索召回率作为长期工具使用代理下游政策分类性能代理指标的可靠性。在τ-bench上使用Qwen2.5分类器进行的实验表明,低条款召回率并不会显著降低分类器的准确率,这表明单独使用检索指标在评估政策信号时可能会产生误导。
ODRPO:离散奖励的序数分解用于鲁棒策略优化
介绍了ODRPO,一个将离散奖励分解为序数二元指标的框架,旨在提升LLMs中基于AI反馈的强化学习(RLAIF)策略优化的鲁棒性,在最小开销下实现了高达14.8%的相对改进。
绘制评估前沿:十一种评估者-代理条件下偏差-可靠性权衡的实证调查
这项实证调查通过测量11种条件下的评估者耦合、策略多样性和小样本可靠性,扩展了先前关于LLM评估中偏差-可靠性权衡的研究,证实了低评估者影响会导致高测量噪声,而强耦合会降低多样性和噪声。