ProxyGuard:具有共享目标的随机数据发布机制的直接可靠性推断

arXiv cs.LG 论文

摘要

ProxyGuard 引入了一种直接方法,用于推断具有共享目标的随机数据发布机制的可靠性,通过使用有界风险和密封目标来控制错误,并提高研究代理数据集的评估能力。

arXiv:2608.18643v1 公告类型:新 摘要:研究人员经常从众多发布、转换或种子中选择一个代理数据集。搜索可能使无效的发布显得足够,而一个足够的发布并不能证明其生成器是可靠的。ProxyGuard 使用预指定的有界风险和密封目标集来控制这两种错误。命名发布模式纠正多重性并认证特定发布。直接共享目标模式评估在共同目标上的独立机制抽样,下限其有利得分率,并减去由无效发布贡献的有利得分的界限。以目标为条件,发布得分是独立的,从而在无需独立目标批次或对发布级$p$值依赖性假设的情况下,提供有限样本机制可靠性保证。我们表明仅均值惩罚是紧致的,并推导出具有加性目标集中的平滑得分证书。在一项注册的三项要求研究中,直接模式在可靠性0.95时将功效从5.6%提高到64.2%,而命名模式在高信号证据下保持更强。前瞻性审计涵盖全流水线Rice--TVAE,该流水线在每次抽样时重新训练,以及非表格文本机制。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:31

# 共享目标随机化数据发布机制的直接可靠性推断
来源:https://arxiv.org/html/2608.18643

## ProxyGuard:针对共享目标随机化数据发布机制的直接可靠性推断
Dipesh Tharu Mahato  
纽约大学  
[email protected]  
Pramod Dhungana  
皇后学院  
[email protected]

###### 摘要
研究者通常需从众多发布的数据、转换结果或种子中选择一个代理数据集。搜索过程可能导致无效发布的数据显得可用,而一个可用的发布并不能证明其生成器是可靠的。ProxyGuard 通过预定义的边界风险和封闭目标集同时控制这两种错误。命名发布模式可校正多重性并验证特定发布。直接共享目标模式对同一目标上的独立机制抽样进行评估,下界其有利分数率,并减去由无效发布贡献的有利分数边界。在目标条件独立的前提下,发布分数相互独立,从而在无需独立目标批次或发布级 p 值依赖假设的情况下,提供有限样本机制可靠性保证。我们证明了仅均值惩罚是精确的,并推导出具有加性目标集中性的平滑分数证书。在一项注册的三重要求研究中,直接模式在可靠性 0.95 下将统计功效从 5.6% 提升至 64.2%,而命名模式在强信号证据下保持更强优势。前瞻性审计覆盖了完整的流水线 Rice–TVAE(每次抽样均重新训练)以及非表格型文本机制。

00footnotetext: \*通讯作者:[email protected]。代码和实验脚本见 https://github.com/dipeshbabu/ProxyGuard。

## 1 引言
研究团队可能无法共享用于模型开发的原始数据表。他们可能发布合成数据、较旧的队列数据或公共替代数据。接收方则需要判断,在该代理数据上开发的工作流是否仍然支持针对目标人群的特定决策。标准的合成数据评估提供了有用的度量,但这些度量本身并不能为此主张提供依据[1, 24]。

这里存在两个问题:评估者可能筛选许多生成器、隐私设置、转换方式或种子,并保留具有最有利观测结果的发布。在搜索后应用的简单阈值可能因偶然性接受无效的代理。即使所选发布是可用的,它也可能来自不可靠生成器的异常有利抽样。关于单个表格的证据无法说明冻结机制再次成功的频率。

下游的具体要求同样重要。相似的 AUC 值并不意味着相似的校准度、决策成本或推断行为[36, 10]。因此,我们通过研究者在打开目标数据前固定的损失和界限来定义代理的有效性。

相对要求在相同的目标记录上比较代理和源训练的流程。绝对要求限制代理流程的目标风险。审计可能要求任一形式或两者兼具。ProxyGuard 分离了两个推断任务:命名发布模式在密封目标集上测试每个注册的要求,并对发布进行 Holm 校正[15, 2]。它可以识别特定的发布,但未解决的发布不会为机制主张增加正面证据。直接共享目标模式仅回答机制问题。它对同一目标记录上的独立机制抽样进行评分,并估计它们获得有利分数的频率。由于有限目标可能使无效发布显得有利,直接模式减去一个误通过许可。剩余部分下界了新发布真正有效的概率。

#### 贡献
我们的贡献有三方面:
第一,当独立随机化发布共享一个随机目标时,我们建立了机制级别的可靠性。我们推导了同时有限样本下界,该下界将机制抽样不确定性与目标诱导的误通过污染分离开来,无需独立目标批次或发布级 p 值依赖假设。
第二,我们描述了仅期望值的污染控制:平均误通过界限不允许任何均匀更小的目标端校正。然后,我们通过注册的坡度分数添加了有界敏感性结构,并推导了加性目标集中性证书。
第三,我们从经验上刻画了直接机制推断与命名发布认证在何时使用证据存在差异。注册的模拟识别了互补的中等和强信号区间,而前瞻性审计则展示了其在完整流水线神经网络重训练和非表格机制中的适用性。
命名发布推断、分层、规划和来源支持这些贡献,而不是增加单独的新颖性。与固定配置风险控制、部分合取计数和固定误差可靠性演示不同,直接证书控制了跨发布评估共享的目标随机误通过贡献。在可靠性 0.95 下,直接模式在中等证据设置中具有 64.2% 的功效,而命名模式仅为 5.6%;强信号证据则逆转了这一排名。

前瞻性审计涵盖完整流水线的神经网络重训练,包括 Rice–TVAE[8, 40] 和冻结的 20 Newsgroups 文本机制[22]。图 1 概括了命名发布和直接有限样本工作流程。开发在密封目标审计开始前结束。

| 注册审计要求 | 冻结与密封 | 审计一次 | 决策 |
| :--- | :--- | :--- | :--- |
| 机制与可靠性目标 | 模式与误差分配 | 源程序拟合与冻结 | 发布程序抽样、拟合与冻结 | 目标保持密封,保留审计记录 |
| 在一个目标上评估所有发布 | 相对迁移 / 绝对风险 | 构建共享的发布-目标损失矩阵 | 命名发布 | 交集-联合检验 (IUT) → Holm → 二项式 |
| 直接可靠性 | 分数计数 - 误通过许可 | 模式和误差分配在注册表中固定 | 已验证 / 未解决 / 违规 |

图 1:ProxyGuard 工作流程。开发在目标审计开启前结束。命名发布模式识别特定发布;直接共享目标模式在校正无效误通过后利用有利分数频率。

## 2 相关工作
合成数据评估将保真度、下游效用和经验隐私分开[1, 24]。这些度量可以揭示故障,但并未控制在搜索候选发布后产生的误差。先学习后测试将风险要求转化为针对预测配置的同时检验[2]。ProxyGuard 将此逻辑应用于代理诱导的学习过程,然后增加一个关于其发布机制未来抽样的可靠性问题。经典的部分合取检验可以下界多少发布是有效的,而无需识别它们[4]。尾部-Simes 需要独立性或子集正回归依赖(PRDS),而尾部-Fisher 需要独立性;条件变体在进一步假设下获得功效[25]。这些方法本身并不能证明跨所有发布测试重用同一目标样本的合理性。

我们的直接结果则以共享目标为条件,推断平均发布分数,并通过单独的目标污染事件控制无效发布贡献。与不完全检查模型不同,这里的误通过贡献是目标随机的,并且跨发布评估共享,而非固定错误率。命名发布模式保留了经典的二项式可靠性推断[9]。这些方法在估计量和依赖性假设上有所不同。尾部-Simes 使用独立性或 PRDS 来下界计数;不完全检查模型固定误差模型;分层广义线性混合模型假设随机效应分布[7]。命名 ProxyGuard 在共享随机目标上识别发布,而直接 ProxyGuard 放弃它们的身份以获得有限样本可靠性边界。附录 A 回顾了与可靠性演示、不完全检查和生成器评估的联系。

## 3 代理如何支持主张

### 3.1 源、代理和目标
设 $\mathcal{Q}=\{Q_1,\ldots,Q_M\}$ 是候选代理的有限集合。候选 $Q$ 有一个声明的源表 $P_Q$ 和目标分布 $T_Q$。候选者可以共享两者(例如,几个合成器替换一个表格),或者属于一个校正家族中的不同任务。代理可以是合成的、转换的、从另一个站点抽取的,或来自另一个时间段。

学习过程 $S$ 涵盖模型拟合、校准和决策阈值选择。它产生 $f_{P_Q}=S(P_Q)$ 和 $f_Q=S(Q)$。该过程可以使用开发数据从固定的模型库中选择。它必须在研究者检查目标审计结果之前完成。

###### 假设 1(独立目标审计)
研究者在接触目标之前注册审计设计,并从 $T_Q$ 中抽取 i.i.d. 样本。该设计保持完整的审计样本独立于代理构建、模型拟合、校准、阈值选择和要求的选择。研究者可以跨发布和机制共享审计记录。用于调整代理的留出数据是开发数据,不能同时用于证明最终主张。我们将在第 4.4 节核心直接结果之后介绍固定大小的分层设计。

### 3.2 注册的要求
设 $\mathcal{J}$ 索引审计中的主张。相对迁移要求在相同的目标记录上比较代理和源过程:
$$
D_{i,Q,j}=\ell_j(f_Q,Z_{i,Q})-\ell_j(f_{P_Q},Z_{i,Q}),\qquad \Delta_{Q,j}=\mathbb{E}_{T_Q}[D_{i,Q,j}].
\tag{1}
$$
这种配对通常会消除出现在两个测试样本中的变异。仅相对迁移本身并不能证明代理过程是足够的。绝对风险要求则使用:
$$
A_{i,Q,j}=\ell_j(f_Q,Z_{i,Q}),\qquad R_{Q,j}=\mathbb{E}_{T_Q}[A_{i,Q,j}].
$$
一个应用可以注册任一形式或两者兼具。用 $X_{i,Q,j}$ 表示所选的每记录量,$\mu_{Q,j}$ 表示其均值,$\tau_j$ 表示其界限。因此,$(X,\mu,\tau)$ 对于相对迁移是 $(D,\Delta,\epsilon)$,对于绝对充分性是 $(A,R,r)$。注册表必须给出已知边界 $a_j \leq X_{i,Q,j} \leq b_j$。范围在 $[0,1]$ 的损失给出相对遗憾界限 $[-1,1]$ 和绝对风险界限 $[0,1]$。

###### 定义 2(主张有效的代理)
当且仅当对每个 $j \in \mathcal{J}$ 都有 $\mu_{Q,j} < \tau_j$ 时,候选 $Q$ 对于注册的规范是有效的。
$$
\mu_{Q,j} < \tau_{j} \quad \text{for every } j \in \mathcal{J}.
\tag{2}
$$

#### ProxyGuard 不声称什么
ProxyGuard 仅认证注册的损失、界限和目标分布。相对要求不建立绝对充分性,绝对要求不建立迁移。两个结果都不建立分布相似性、因果可迁移性、未注册子组的性能或任意下游分析的推断有效性。研究者必须单独注册任何附加主张,并使用适合该主张的统计量。

### 3.3 从单个发布到发布机制
我们用“代理”表示替代数据集在科学主张中的角色,用“发布”表示从随机化代理机制中实现的一个抽样。设 $G_\theta$ 表示一个固定的发布机制,包括其生成器、隐私设置、预处理和训练过程。对于独立发布 $Q \sim G_\theta$,记
$$
A(Q)=\mathbf{1}\!\left\{\mu_{Q,j}<\tau_{j}\text{ for every }j\in\mathcal{J}\right\},\qquad \eta_{\theta}=\Pr_{Q\sim G_{\theta}}\{A(Q)=1\}.
$$
该主张以已实现的源表、注册的目标、开发分割、模型库和冻结的源过程为条件。可靠性仅对 $G_\theta$ 内部注册的随机性取平均:未来发布主张应泛化的每个随机来源必须在每次机制抽样中独立重新抽取;任何固定的东西都是条件性的。因此,即使共享同一目标审计,独立抽样也具有独立的 $A(Q)$。

###### 定义 3(可靠的发布机制)
对于注册的可靠性目标 $\eta_0 = 1 - \rho$,当 $\eta_\theta > \eta_0$ 时,机制 $G_\theta$ 是可靠的。此主张比验证单个表格更强,但不涵盖在目标审计后重新调整的机制。我们的审计使用 Brier 损失、裁剪归一化对数损失和归一化 5:1 假阴性成本。这些损失都在 $[0,1]$ 范围内,因此配对遗憾在 $[-1,1]$ 范围内;成本比是注册的敏感性选择。AUC 仍然具有诊断性,因为排序可迁移性需要 U 统计量界限。子群主张需要单独注册,小群体通常仍无法解决。

## 4 从目标损失到可靠性
两种操作模式使用相同潜在发布有效性的不同观测汇总。表 1 固定了本节使用的术语。特别是,有利的直接分数不是发布证书。

表 1:潜在和观测对象。“已识别”、“获得有利分数”和“真正有效”指代不同的事件。
| 概念 | 说明 |
| :--- | :--- |
| 已识别发布 | 命名发布程序未拒绝该发布 |
| 获得有利分数 | 直接分数满足发布有效性不等式 |
| 真正有效发布 | 所有注册的损失均低于界限 |

### 4.1 决策语言
在发布级别,“已验证”表示命名发布程序拒绝了无效发布原假设。“检测到违规”表示一个单独校正的下界检验将至少一个风险置于其界限之上。在机制级别,相应的下界或上界可靠性必须跨越 $\eta_0$。我们将所有其他结果称为“未解决”;未能验证不等同于违规的证据。为了解释,我们还报告了同时要求界限,但它们并不替代这些校正后的决策。这种术语区分了单点估计可能模糊的三个问题:数据是否支持有效性,是否支持违规,或者两者都不支持。

### 4.2 测试命名发布
对于候选发布 $Q$ 和要求 $j$,无效发布原假设为:
$$
H_{0,Q,j}: \mu_{Q,j} \geq \tau_j.
\tag{3}
$$
令 $\bar{X}_{Q,j}$ 和 $\widehat{V}_{Q,j}$ 为在 $n=n_Q$ 个目标记录上的样本均值和贝塞尔校正方差。对于 $n \geq 2$,默认上界为:
$$
U_{Q,j}(\delta) = \bar{X}_{Q,j} + \sqrt{\frac{2\widehat{V}_{Q,j}\log(2/\delta)}{n}} + \frac{7(b_j-a_j)\log(2/\delta)}{3(n-1)}.
$$

相似文章

基于生成代理的最佳臂识别

arXiv cs.LG

本文研究了固定置信度下的最佳臂识别问题,其中昂贵的奖励观测与来自生成模型的廉价但相关的代理分数配对。提出了PROBE算法,该算法使用控制变量调整和残差方差的上界证书,以实现接近神谕的样本复杂度。

关于基于代理的测试时对齐的拒绝准则

arXiv cs.CL

本文分析了使用小型对齐模型作为代理来指导大型未对齐模型生成的测试时对齐方法。作者提出了一种基于保守置信赌注的新型拒绝准则,并在多个数据集上展示了相比现有方法的改进效果。