自适应分布外检测中的自我毒化:尖锐阈值理论与有保证的无标签校准

arXiv cs.LG 论文

摘要

本文提出了自适应分布外检测中自我毒化的理论框架,证明了崩溃的尖锐阈值以及一种切断反馈回路的有保证的无标签校准方法。同时,提供了关于在无标签情况下区分漂移与污染的不可能性结果。

arXiv:2607.21673v1 Announce Type: new 摘要:测试时自适应分布外(OOD)检测器从未标记流中更新记忆库。我们证明这种自适应遵循一个可证明的动态规律。将记忆库杂质建模为广义P'olya urn,我们证明了几乎必然收敛到平均场均衡,其斜率作为再生数。当斜率小于1时,杂质保持良性。大于1时,记忆库被完全毒化,检测器崩溃。测量的准入内核是仿射的($R^2 \ge 0.996$),在每个编码器族中斜率略低于1(协议特征),因此这类检测器设计上接近临界,并且在96个设置中,预测阈值与经验崩溃相匹配,其中无门控字典损失高达$0.163$ AUROC。然后我们证明,一个仅读取冻结储备的有保证准入门控切断了反馈回路,并消除了每个污染率下的转变,即使是对抗性的,同时无标签地控制假阳性。对于漂移下互补的静态校准失败,我们提出了CDC,它在所有测试的受漂移影响细胞上无标签地恢复了标称FPR。最后我们证明了一个两世界不可能性定理。漂移和污染在无标签情况下无法区分,迫使我们的方法趋近于一个闭式功率上限。这些共同给出了无标签自适应OOD检测的完全可能性/不可能性刻画。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:41

# 锐阈值理论与认证的无标签校准 来源:https://arxiv.org/html/2607.21673

## 自适应异常值检测中的自毒化:锐阈值理论与认证的无标签校准

\nameVishnu Bindu Balachandran\emailvishnubindubalachandran@outlook\.com \addr独立研究员 \addrwww\.vishnubindubalachandran\.com

###### 摘要

测试时自适应的异常值检测器会根据无标签的数据流更新记忆库。我们证明这种自适应遵循一个可证明的动态规律。将字典杂质度建模为广义Pólya urn,我们证明了其几乎必然收敛到平均场平衡,其中斜率充当再生数。低于1时,杂质度保持良性。高于1时,字典完全被毒化,检测器崩溃。我们测得的接纳核是仿射函数($R^2 \geq 0.996$),在每个编码器家族中斜率略低于1(一种协议特征),因此这类检测器在设计中接近临界状态。在96个设置中,预测的阈值与经验崩溃点匹配,在无门控字典中AUROC最多下降0.163。随后我们证明了一个经过认证的接纳门控,仅读取冻结的储备库,能够切断反馈循环,并在所有污染率下消除相变,即使面对对抗性污染,同时还能以无标签方式控制假阳性率。针对漂移下静态校准失败这一互补问题,我们提出了CDC方法,该方法在所有测试的受漂移影响的单元上,以无标签方式恢复了名义FPR。最后,我们证明了一个双世界不可能性定理:在无标签的情况下,漂移和污染无法区分,这强制设置了一个闭式功率上限,我们的方法已接近该上限。这些共同构成了标签自由自适应OOD检测的完整可能性/不可能性刻画。

关键词:异常值检测,测试时自适应,自训练,数据毒化,共形预测,e值,随机逼近,Pólya urn

## 1 引言

一个部署的OOD检测器面临两个方向相反的要求。它必须将假阳性率控制在名义水平$\alpha$(每个被标记的输入都会带来审查成本,而假阳性率悄然翻倍的检测器在生产中无法使用),同时它必须能够自适应,因为部署时看到的分布内数据和异常值都与训练时可用的任何数据不同。现代测试时自适应文献通过伪标签化解这一矛盾:记忆库检测器将流中最像ID的点追加到ID库中(例如 Zhang 等,2023,AdaODD),或将最像OOD的点追加到OOD字典中(例如 Yang 等,2025,OODD),并基于更新后的库重新评分。这些方法在有利的流混合下报告了显著提升。然而,如我们所示,在现实流混合下,它们会以特定、可预测且严重的方式失败。

#### 自毒化是一个相变,而非噪声。

当流在时间上聚类(突发性)且污染水平较低(生产监控的标准情形)时,一批纯ID数据会迫使无门控的OOD字典接纳ID尾部点。附近ID点的对比得分因此升高,这又使得更多的ID点更可能被接纳(图1a)。这种循环可能造成损害在测试时自适应文献中已是常识。但缺少的是对何时会发生这种损害的预测。我们证明该循环是一个增强型随机过程,其杂质度$\rho_t$(错误接纳点的比例)几乎必然收敛到标量平均场$h(\rho)=q(\rho)-\rho$的稳定平衡点,其中$q$是接纳核,即当前杂质度下下一个被接纳的点是错误点的概率(第4节)。对于我们所有设置中测得的仿射核,斜率$b=q'(\rho)$充当再生数。当$b<1$时,平衡点是良性的,$\rho^*=a/(1-b)$。当$b \geq 1$时,毒化完全发生,$\rho_t \to 1$。饱和核会产生折叠分岔,平衡点在临界污染率$\pi_c$处发生不连续跳跃,并伴随滞后现象。(我们的协议探测的是阈值和拐点,而非滞后现象,后者需要在一次运行中扫描$\pi$。)经验上,预测的$\pi_c$与我们测量的所有96个设置中观察到的拐点匹配,无门控字典在突发性低污染状态下,AUROC比它们自己的冻结基线下降0.163,在近OOD配对上低于随机水平,而它们实现的FPR则任意偏离名义水平。

图1:一张图说明全文。(a) 无门控自适应检测器基于它们将喂给的那个库本身计算接纳证据,因此错误接纳核$q(\rho)$随杂质度上升。总斜率略低于1($R_0 \approx 0.95$,是固定比例接纳协议的特征,附录D),字典饱和(杂质度$>0.9$),排序崩溃(第3节和第4节)。(b) WARDEN切断循环。接纳证据是基于冻结基评分器对冻结储备库进行共形推断,e-BH要求每次接纳的$e \geq 1/\delta$,字典仅提供一个次要决策通道,绝不参与接纳证据(在我们的特征上该通道不提升检测性能,附录D.1;切断接纳才是关键)。因此,错误接纳强度被限制在一个与字典状态无关的常数内,即使面对对抗性选择的污染(引理8,定理9,推论10)。决策通过共形有效性保持FPR$\leq \alpha$(命题7)。测得的杂质度从未超过0.111,AUROC按设计跟踪冻结基线。(c) 互补的失败及其极限。静态阈值漂移至名义FPR的1.94倍,然而良性漂移和尾部型污染会产生相同的无标签流,因此任何在漂移下保持FPR$\leq \alpha$的无标签规则,其在污染下的功率被$\kappa(\pi)$所限制(定理15)。CDC在受污染的流本身上修正校准分位数,在所有测试的受漂移影响的单元上认证FPR$\leq \alpha$,并保留中位数0.63–0.67的预言机功率,接近上限(第5节)。

#### 认证接纳消除相变。

同样的理论提供了修复方法并指明了其工作原理。崩溃循环的存在是因为接纳证据是基于它将喂给的那个库计算出来的。WARDEN切断了循环(图1b)。其接纳e值是基于冻结储备库进行共形推断得到,绝不使用字典,并使用e-BH(Wang and Ramdas,2022)在水平$\delta$上进行门控。每次接纳必须满足绝对阈值$e \geq 1/\delta$,因此错误接纳强度被一个与字典状态无关的常数所限制。增强项在结构上不存在,超临界分支对所有污染率消失(定理9),而e-BH在每个批次中保持期望错误接纳比例为$\delta$,即使面对任意依赖性。没有接纳证据依赖于污染可以影响的任何东西,因此即使污染点是由一个自适应对手选择的,这些保证仍然成立(推论10)。由此产生的检测器准确跟踪其冻结基线AUROC(按设计,它使用基评分进行排序,这是一个设计不变性而非性能声明),在kill、confirmation和grid campaign的标准配置单元(4,800个)中,保持平均实现的FPR为0.056(每个家族均值0.047–0.061;每个单元55–95%范围0.036–0.100,最大0.121),并且其测得的字典杂质度从未超过0.111,而相比之下无门控杂质度超过0.9。

#### 静态校准也会失败,并且无标签修复需要代价。

冻结的替代方案也并不安全。使用训练ID数据校准的检测器(部署时唯一可用的数据)在我们的设置中实现了名义FPR的1.94倍,原因是训练到测试的ID漂移(白化特征空间中每个维度的方差漂移;均值偏移校正无济于事)。我们提出CDC(第5节)。它在受污染的流上直接校准操作阈值,使用一个污染校正的分位数水平$1-\alpha(1-\hat{\pi}_{\mathrm{up}})$加上一个DKW松弛项,其中$\hat{\pi}_{\mathrm{up}}$是基于对冻结储备库的共形p值计算得到的一个Storey型上置信估计。破坏静态校准的漂移会使Storey统计量向上偏,正好是保守方向,我们给出了一个充分条件使其仍然是一个有效上界(定理12)。CDC在任何时候都不需要标签,以高概率认证FPR$\leq \alpha$(定理11),并在经验上认证了所有1,695个测试的受漂移影响单元,平均FPR为0.042,保留预言机TPR的中位数为67%。

#### 保留的功率无法推到100%。

我们的不可能性结果(定理15)构造了两个世界(良性ID漂移 vs. 被分布恰好与ID尾部相同的异常值污染),它们的无标签流规律是相同的(图1c)。任何无标签程序在两个世界中表现相同,因此如果它在漂移世界中保持FPR$\leq \alpha$,它在污染世界中的功率就被限制在$\kappa = \alpha / (\pi + \alpha(1-\pi)) < 1$。因此,无标签自适应校准必须支付一个由可混淆污染质量决定的功率代价。CDC测得的功率保留率(0.67;保留集0.63)接近这个最坏情况上限($\pi=0.05$时为0.69),该上限界定了任何保持证书的无标签方法在对抗性实例上可能添加的内容,尽管在良性实例上上限更高,CDC的部分差距是有限样本松弛(注释16精确说明了比较)。

#### 贡献。

1.  自毒化的锐阈值理论(第4节):字典杂质度几乎必然收敛到平均场平衡点(定理3);仿射核的再生数和临界污染率(推论4);饱和核的折叠分岔和滞后现象(命题5);FIFO淘汰下的有限窗口行为(命题6);以及通过切断反馈的认证接纳在结构上消除相变,对自适应对手鲁棒(引理8,定理9,推论10)。
2.  CDC:认证的去污染校准(第5节):第一个同时处理ID漂移和流污染并恢复名义FPR的无标签程序,具有有限样本有效性(定理11),其污染估计的漂移保守性保证(定理12),以及显式的功率界(定理13)。
3.  一个匹配的不可能性定理(第6节):没有分离假设,任何无标签程序都无法同时控制漂移下的FPR并保留污染下的功率。CDC使用的假设是必要的,其功率损失在数量级上是不可避免的。
4.  迄今为止最大规模的跨家族自适应OOD动态测量:96个设置 × 污染 × 排序 × 随机种子(主要campaign中9,264个流单元,加上一个3,840单元的一次性保留复制实验,确认了所有标题声明)。

#### 我们不声称的内容。

在良好白化的特征上,自适应不会提升排序质量:用数千个真正ID点增长ID库在我们的设置上会使AUROC变化小于0.005,而OOD字典对比得分在干净时反而有害。认证字典决策通道在固定FPR预算下也不改善检测(附录D.1)。因此,我们未在任何地方提出最先进的AUROC声称。贡献在于动态规律、证书和不可能性边界,这些是决定自适应检测器是否可部署的关键量。

## 2 相关工作

#### 测试时自适应OOD检测及其失败。

记忆库和字典方法(AdaODD(Zhang 等,2023),OODD(Yang 等,2025),以及更广泛的测试时自适应路线)通过伪标签从无标签流中自适应。训练时的方法则在部署前利用无标签混合体并需要重新训练(Du 等,2024;Katz-Samuels 等,2022)。自训练在噪声伪标签下的崩溃在定性上有文献记载(长期TTA中的误差累积和模型崩溃(Press 等,2023;Cao 等,2025),以及对抗性测试时毒化(Su 等,2025)),但据我们所知,没有先前工作将该现象识别为具有可证明临界阈值的增强型随机过程,也没有推导出消除它的门控。鲁棒TTA启发式方法(样本选择、重置、抗遗忘)按构造缺乏保证。表1将本文置于该图景中。Su等(2025)的测试时毒化攻击通过其目标在决策时咨询的可变状态进行操作。推论10表明,认证接纳通过构造而不是通过加固来消除这个攻击面。防御哲学——约束流可以接纳的内容以使得毒化有界——可以追溯到Kloft and Laskov (2012),他们在假阳性预算下界定了对手可以迫使在线质心异常检测器产生的位移。WARDEN可以被解读为它的共形补全。

相似文章

基于稳健训练和弃权的公平且校准的毒性检测

arXiv cs.LG

本文研究了毒性分类中的公平性问题,涵盖三个维度:排序、校准和弃权。比较了经验风险最小化(ERM)、加权ERM和群体分布鲁棒优化(Group DRO)方法,并结合后处理干预措施,发现校准差异是一种隐蔽的公平性违反,且弃权本身也可能不公平。

共识作为无标签自蒸馏的特权上下文

arXiv cs.LG

一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。

在线自蒸馏中Thinking Collapse的诊断与缓解

arXiv cs.CL

本文识别了大型语言模型在On-Policy Self-Distillation中的'Thinking Collapse'现象,其特点是中间推理步骤的减少,并提出了AD-OPSD控制框架,通过将高风险抑制令牌锚定到参考先验来缓解这种崩溃。该方法在数学基准测试上实现了高达+4.1%的绝对平均准确率提升。