含污染观测的保形变点定位与根因分析

arXiv cs.LG 论文

摘要

本文提出加权保形方法,用于变点定位与根因分析,通过降低可能受污染数据的权重,利用不确定性信号与元学习,在污染观测下缩减置信集大小。

arXiv:2607.26481v1 公告类型: 新 摘要: 检测工程系统统计行为何时发生变化,并识别出哪个组件负责,是电信网络、机器人平台、安全基础设施和多智能体系统监控中的核心问题。在安全关键和任务关键部署中,此类决策必须伴随统计可靠性保证,而不仅仅是点估计。保形变点定位(CONCH)和保形根因分析(CROC)通过返回包含真实变点或真实根因流的置信集来满足这一需求,其置信度由用户指定,且无需对数据生成过程进行参数假设。然而,在实践中,观测值经常受到污染,例如异常值、传感器故障或对抗性扰动。虽然这些方法的有限样本覆盖在污染下得以保持,但产生的置信集可能变得过大而失去信息性。采用Huber型污染模型,本文提出加权CONCH(W-CONCH)和加权CROC(W-CROC),它们降低可能受污染观测值的权重,目的是在数据可能受污染时减少置信集大小。加权机制来源于对未知污染数据密度的形式化界,利用了现存的基于二阶分类器的不确定性信号,例如由证据深度学习或贝叶斯学习产生的信号。W-CONCH和W-CROC进一步通过引入元学习过程来泛化权重,该过程优化置信集大小的可微替代。在基于图像和真实世界的变点与根因基准上的实验表明,基于不确定性的加权在保持目标覆盖率的同时显著减少了置信集大小。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:58

# 带观测污染的共形变点定位与根因分析
来源:https://arxiv.org/html/2607.26481
Seunghun Yu, Meiyi Zhu, Petar Popovski, Joonhyuk Kang, 和 Osvaldo Simeone
本工作部分受韩国政府(MSIT)下属信息通信技术规划与评估研究所(IITP)的ITRC(信息技术研究中心)资助(IITP-2026-RS-2020-II201787,贡献率:50%);部分受韩国政府(MSIT)下属信息通信技术规划与评估研究所(IITP)的6G·云研究与教育开放中心资助(IITP-2026-RS-2024-00428780,贡献率:50%)。M. Zhu 和 O. Simeone 的工作由 EPSRC 开放奖学金(EP/W024101/1)资助。O. Simeone 的工作还得到了 EPSRC(EP/X011852/1)和 ERC(No. 101198347)的资助。P. Popovski 的工作部分由丹麦 Velux 基金会通过 Villum 研究员资助项目 WATER(编号 37793)资助。(通讯作者:Joonhyuk Kang 和 Osvaldo Simeone。)
Seunghun Yu 和 Joonhyuk Kang 就职于韩国大田韩国科学技术院电气工程系(电子邮件:[email protected]; [email protected])。
Meiyi Zhu 就职于英国伦敦国王学院工程系(电子邮件:[email protected])。
Petar Popovski 就职于丹麦奥尔堡大学电子系统系(电子邮件:[email protected])。
Osvaldo Simeone 就职于英国伦敦东北大学智能网络系统研究所,同时也任职于丹麦奥尔堡大学电子系统系连接分部(电子邮件:[email protected])。

###### 摘要

检测工程系统统计行为何时发生变化,并识别哪个组件是原因,是电信网络、机器人平台、安全基础设施和多智能体系统监测中的核心问题。在安全关键和任务关键部署中,此类决策必须附带统计可靠性保证,而不仅仅是点估计。共形变点定位(CONCH)和共形根因分析(CROC)通过返回置信集来满足这一需求,该置信集以用户指定的概率包含真实变点或真实根因流,且无需对数据生成过程进行参数假设。然而,在实践中,观测值经常被污染,例如由异常值、传感器故障或对抗性扰动造成。虽然这些过程的有限样本覆盖率在污染下得以保持,但由此产生的置信集可能变得过大而失去信息性。本文采用 Huber 型污染模型,提出加权 CONCH(W-CONCH)和加权 CROC(W-CROC),它们降低可能被污染的观测值的权重,目的是在数据可能被污染时减小置信集大小。该加权机制源于对未知污染数据密度的形式化边界,利用了预先存在的基于二分类器的不确定性信号,例如由证据深度学习或贝叶斯学习产生的信号。通过引入一种元学习过程来优化置信集大小的可微代理,W-CONCH 和 W-CROC 得到了进一步泛化。在基于图像的真实世界变点和根因基准上的实验表明,基于不确定性的加权在保持目标覆盖率的同时显著减小了置信集大小。

## I 引言

变点分析为识别有序数据中的结构性变化提供了一个原则性框架(见图1 (https://arxiv.org/html/2607.26481#S1.F1))[47 (https://arxiv.org/html/2607.26481#bib.bib45),1 (https://arxiv.org/html/2607.26481#bib.bib17)],而其多流扩展即根因分析,则试图将观察到的变化归因于引发该变化的组件(见图2 (https://arxiv.org/html/2607.26481#S1.F2))[40 (https://arxiv.org/html/2607.26481#bib.bib50),39 (https://arxiv.org/html/2607.26481#bib.bib12)]。本文在安全关键应用的两个关键要求下研究这两个问题:输出必须带有统计可靠性保证,并且即使在观测值被污染时也必须保持信息量。

### I-A 背景与动机

确定系统行为*何时*发生变化以及*哪个*组件是根本原因,是工程领域中重复出现且通常安全关键的任务。在*电信*领域,流量量或流统计量的突发变化预示着拥塞、设备故障或入侵,检测和定位这些变化是网络管理、安全监控和基于AI的应用生命周期的基础[1 (https://arxiv.org/html/2607.26481#bib.bib17),24 (https://arxiv.org/html/2607.26481#bib.bib4),31 (https://arxiv.org/html/2607.26481#bib.bib16),37 (https://arxiv.org/html/2607.26481#bib.bib15)]。在*网络安全*领域,一大类入侵检测任务自然地被建模为变点检测,其中拒绝服务攻击或受感染主机表现为数据包速率或连接统计量的突然变化[45 (https://arxiv.org/html/2607.26481#bib.bib14)]。在*机器人学*中,故障检测与隔离必须确定传感器或执行器故障的发生时间以及具体的故障组件,以便控制器能在故障通过平台传播之前做出反应[19 (https://arxiv.org/html/2607.26481#bib.bib13)]。在*多智能体和分布式系统*中,从机器人集群到微服务架构,单个智能体或服务的故障可能级联影响整体,诊断问题便是检测异常并追溯至触发该异常的智能体或服务[39 (https://arxiv.org/html/2607.26481#bib.bib12),55 (https://arxiv.org/html/2607.26481#bib.bib71),5 (https://arxiv.org/html/2607.26481#bib.bib70)]。在所有上述领域中,*变点*时间是故障发生时间的代理,而*根因*则是首先发生变化的组件。

参见标题
图1:带污染数据的离线变点定位问题示意图。干净序列 $\widetilde{\mathbf{X}}$ 在真实变点 $\xi$ 处发生变化,从一种图像风格切换到另一种。然而,干净序列 $\widetilde{\mathbf{X}}$ 不可观测,因为变点检测只能访问观测序列 $\mathbf{X}$,该序列是通过以未知概率 $\varepsilon$ 独立污染观测值而获得的。目标是构建一个置信集 $\mathcal{C}_{\alpha}(\mathbf{X})$,使其以不小于 $1-\alpha$ 的概率包含真实变点 $\xi$。

这些应用的一个显著特征是,变点或根因过程的输出会驱动潜在的昂贵下游行动:重新路由流量、隔离主机、停止机器人或隔离微服务。因此,仅报告一个点估计而不附带任何置信度陈述的价值有限,因为操作员无法判断是否应该相信它。最近的工作[21 (https://arxiv.org/html/2607.26481#bib.bib11)]表明,对于*风险规避*的决策者,最优的做法是采用在观测值一致的最坏情况结果下最大化给定效用函数的决策。具体而言,不确定性量化与决策之间的适当接口是一组*结果*,该组结果以至少 $1-\alpha$ 的概率可证明地包含真实结果,而概率 $\alpha$ 则规定了风险容忍水平。因此,返回一组*可能的变点或根因,使决策者能够通过选择对该集合中所有元素都鲁棒的动作来控制风险。例如,操作员可能基于集合预测检查电信网络中故障的所有可能原因。然而,为了使这一过程高效,预测集尽可能小是至关重要的。

参见标题
图2:离线根因定位问题示意图。每个观测流 $\mathbf{X}_{d}$(其中 $d=1,\ldots,D$)在变点 $\xi_{d}$ 处发生分布偏移,而某些观测值可能被污染。目标是构建一个置信集 $\mathcal{K}_{\alpha}(\mathbf{X})$,使其以不小于 $1-\alpha$ 的概率包含具有最早变点的流 $d^{\star}$,从而估计出根因流 $d^{\star}$。

实际观测值经常被异常值、传感器故障、数据包丢失或对抗性扰动*污染*。污染可能掩盖真实的变化信号和变化的真实根因。因此,即使那些在污染下仍能保持覆盖保证的方法(例如*共形变点定位*(CONCH)[14 (https://arxiv.org/html/2607.26481#bib.bib2)] 和*共形根因分析*(CROC)[15 (https://arxiv.org/html/2607.26481#bib.bib37)])也可能被迫返回过大以至于失去信息价值的置信集。本文的目标是引入一种方法论,在 CONCH 和 CROC 的基础上,在污染下保持有效性,同时恢复单流变点定位和多流根因分析的集合预测器的信息量。

### I-B 相关工作

#### I-B1 变点检测
经典的变点方法包括似然比检验、CUSUM 程序、非参数检验和基于核的方法[27 (https://arxiv.org/html/2607.26481#bib.bib46),20 (https://arxiv.org/html/2607.26481#bib.bib47),30 (https://arxiv.org/html/2607.26481#bib.bib48),41 (https://arxiv.org/html/2607.26481#bib.bib69)],涵盖离线与在线设置[47 (https://arxiv.org/html/2607.26481#bib.bib45),1 (https://arxiv.org/html/2607.26481#bib.bib17),33 (https://arxiv.org/html/2607.26481#bib.bib68)]。这些标准方法的理论保证通常依赖于参数假设、渐近近似或结构条件,并且大多数针对检测或点定位,而非变点位置的有限样本置信集。同样,处理污染鲁棒性的研究也存在这些局限,包括在动态 Huber 污染下的对抗性鲁棒离线检测[25 (https://arxiv.org/html/2607.26481#bib.bib43)]以及重尾噪声下的鲁棒在线均值变化检测(带有延迟和虚警分析)[44 (https://arxiv.org/html/2607.26481#bib.bib42)]。与这些研究不同,CONCH[14 (https://arxiv.org/html/2607.26481#bib.bib2)] 在基本的分裂可交换性条件下,无需参数假设,即可生成一组满足有限样本覆盖率的可能变点。

#### I-B2 根因分析
根因分析主要在特定领域内发展[40 (https://arxiv.org/html/2607.26481#bib.bib50),51 (https://arxiv.org/html/2607.26481#bib.bib51)]。例如,在微服务和分布式系统中,因果发现和异常归因方法定位导致失败的服务[39 (https://arxiv.org/html/2607.26481#bib.bib12)],而在机器人故障检测与隔离中,则识别故障组件或异常智能体[19 (https://arxiv.org/html/2607.26481#bib.bib13)]。最近提出的 CROC[15 (https://arxiv.org/html/2607.26481#bib.bib37)] 打破了这一模式,为变点最先发生的流构建了无分布假设的置信集。

#### I-B3 共形预测
CONCH 和 CROC 建立在共形预测的通用方法论之上。共形预测在可交换性条件下提供无分布假设、有限样本的预测推断[50 (https://arxiv.org/html/2607.26481#bib.bib54),36 (https://arxiv.org/html/2607.26481#bib.bib53),34 (https://arxiv.org/html/2607.26481#bib.bib55)]。扩展工作放松了可交换性或适应分布偏移,包括协变量偏移下的加权共形预测[46 (https://arxiv.org/html/2607.26481#bib.bib5),52 (https://arxiv.org/html/2607.26481#bib.bib72)]、超出可交换性的共形预测[2 (https://arxiv.org/html/2607.26481#bib.bib6)],以及用于在线偏移的自适应共形推断[11 (https://arxiv.org/html/2607.26481#bib.bib7),54 (https://arxiv.org/html/2607.26481#bib.bib10)]。除了 CONCH 和 CROC 考虑的离线设置外,共形预测已通过鞅检验适应于在线变点分析[49 (https://arxiv.org/html/2607.26481#bib.bib41)]。

#### I-B4 鲁棒性与不确定性估计
本文采用的污染模型遵循 Huber 框架[17 (https://arxiv.org/html/2607.26481#bib.bib29),12 (https://arxiv.org/html/2607.26481#bib.bib62)],并与数据投毒设置相关[42 (https://arxiv.org/html/2607.26481#bib.bib59)]。加权方案利用分类器不确定性作为观测值是否为干净的代理,借鉴了证据深度学习(EDL)[35 (https://arxiv.org/html/2607.26481#bib.bib20)]、蒙特卡洛 Dropout[9 (https://arxiv.org/html/2607.26481#bib.bib32)]、深度集成[23 (https://arxiv.org/html/2607.26481#bib.bib39)],以及偏移下的校准[16 (https://arxiv.org/html/2607.26481#bib.bib38),38 (https://arxiv.org/html/2607.26481#bib.bib24)]。最后,当污染水平未知时,我们通过元学习[8 (https://arxiv.org/html/2607.26481#bib.bib18),4 (https://arxiv.org/html/2607.26481#bib.bib9)]学习不确定性到权重的映射,遵循共形感知训练的精神优化共形集大小的可微代理[43 (https://arxiv.org/html/2607.26481#bib.bib3),28 (https://arxiv.org/html/2607.26481#bib.bib22)]。

### I-C 主要贡献

本文开发了即使观测值在 Huber 模型下被污染也能保持有效且高效的离线变点检测和根因分析方法。我们的贡献如下。

- **加权共形变点定位**。我们提出了*加权 CONCH*(W-CONCH),它在 CONCH[14 (https://arxiv.org/html/2607.26481#bib.bib2)] 的基础上引入了加权机制,降低可能被污染的观测值的权重。W-CONCH 依赖于一种新颖的变点合理性(CPP)评分,该评分源自对污染边际似然的边界,并通过高效的基于分类器的实现进行实例化。
- **基于不确定性与元学习的权重**。我们引入了基于不确定性的加权规则,利用从 EDL 或贝叶斯学习获得的分类器二阶不确定性信号。我们还提出了一种元学习变体 MW-CONCH,它直接优化置信集大小的可微代理,减少对超参数的依赖。
- **扩展至根因分析**。我们将相同的加权原则扩展到基于 CROC[15 (https://arxiv.org/html/2607.26481#bib.bib37)] 的多流根因定位。这产生了加权 CROC(W-CROC)及其元学习变体 MW-CROC,它们在保持 CROC 无分布假设的覆盖保证的同时,缩小了根因置信集。
- **实证验证**。在基于图像的变点和根因基准测试以及一个真实世界的变点基准测试上,我们展示了基于不确定性的加权在污染下显著减小了置信集大小,同时保持了经验覆盖。

相似文章

在线局部化共形预测

arXiv cs.LG

本文提出了在线局部化共形预测(OLCP),旨在解决在线学习和时间序列设置中的协变量异质性问题。文章引入了用于带宽选择的 OLCP-Hedge 算法,并证明与现有基线相比,该方法在获得更窄预测集的同时,仍能保持有效的长期覆盖率。

保形智能体错误归因

arXiv cs.LG

本文提出了一种基于保形预测的多智能体系统错误归因框架,为识别智能体轨迹中的决定性错误提供统计保证。该方法通过在连续预测集中隔离错误,实现了自动恢复与调试。

超越表面统计:通过内部表示实现LLM鲁棒共形预测

arXiv cs.CL

本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。

基于可微D-vine Copula的局部异常检测

arXiv cs.AI

提出了一种新颖的D-vine copula估计框架,该框架利用基于梯度的最大似然估计和束搜索以获得更好的全局拟合,并给出了一种通过共形预测进行不确定性量化的局部异常检测方法。

基于排序概率分数的有序分类可靠共形预测

arXiv cs.LG

介绍了一种有序分类的共形预测方法,该方法使用排序概率分数作为非一致性函数,生成以中位数为中心的连续预测集,并在预测集宽度与有序错误覆盖之间实现了有利平衡。