EvoCause:LLM引导的因果图演化用于根因分析

arXiv cs.LG 论文

摘要

EvoCause是一篇研究论文,提出了一种LLM引导的方法来优化因果图以进行根因分析,利用专家诊断标签来约束图的编辑,并发布了TeleRCA,这是一个来自生产电信网络的专家标注告警基准。

arXiv:2607.27290v1 公告类型:新 摘要:现代电信、云和微服务系统在组件发生故障时会发出相关的告警级联。根因分析(RCA)旨在识别引发每个级联的一小部分告警。一种常见的方法是从观测日志中学习因果图,并预测每个事件引起的子图中的所有零入度告警。然而,学习到的图是固定的,无法受益于历史事件的专家诊断。我们通过EvoCause来闭环这一过程。专家标签仅约束哪些告警应作为源节点,但未指定满足这些约束所需的边编辑。EvoCause使用大型语言模型(LLM)提出语义上合理的图编辑,同时确定性代码验证节点身份和无环性,并在带标签的对齐集上保留最佳图。在测试时,仅凭优化后的图即可产生透明的预测,而无需调用LLM。我们还发布了TeleRCA,这是一个来自生产电信网络的专家标注基准,包含$485{,}681$个告警事件,涵盖$194$种告警类型,涉及$5{,}621$个资源。在合成数据上,以PC因果发现算法初始化的EvoCause优于未优化的PC基线,其Node F1、Case EM和Graph F1分别提升了$11.59$、$9.40$和$4.59$个百分点,同时nSHD降低了$0.2379$。在TeleRCA上,将人类可读的告警标题替换为匿名标识符会使Node F1和Case EM分别降低$6.12$和$8.04$个百分点,这表明告警名称信息有助于图的优化。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:01

# EvoCause:LLM引导的因果图演化用于根因分析
来源:https://arxiv.org/html/2607.27290

Lei Zan1, Keli Zhang1, Shifeng Xie1, Jiale Zheng1, Zehao Xiao1, Zhiwei Dong1, Ke Zhang1, Ruichu Cai2, Malik Tiomoko1, Lujia Pan1

###### 摘要

现代电信、云和微服务系统在组件发生故障时会发出相互关联的告警级联。根因分析(RCA)旨在识别引发每个级联的那一小部分告警。一种常见的方法是从观测日志中学习因果图,并预测每个事件诱导子图中所有入度为零的告警。然而,学习到的图是固定不变的,无法利用历史事件的专家诊断结果。我们通过 EvoCause 补齐了这一循环。专家标签仅约束哪些告警应为源节点,而不指定满足这些约束所需的边编辑操作。EvoCause 使用大语言模型(LLM)提出语义上合理的图编辑,同时由确定性代码验证节点身份和无环性,并在带标注的对齐集上保留最优图。在测试阶段,仅凭精化后的图即可产生透明可解释的预测,而无需调用 LLM。我们还发布了 TeleRCA,这是一个来自生产电信网络的专家标注基准数据集,包含 485,681 条告警事件,涵盖 194 种告警类型,分布在 5,621 个资源上。在合成数据上,以 PC 因果发现算法初始化的 EvoCause 相比未精化的 PC 基线,将 Node F1、Case EM 和 Graph F1 分别提升了 11.59、9.40 和 4.59 个百分点,同时将 nSHD 降低了 0.2379。在 TeleRCA 上,将人类可读的告警标题替换为匿名标识符后,Node F1 和 Case EM 分别下降了 6.12 和 8.04 个百分点,这表明告警名称信息对图精化有贡献。

## 1 引言

现代电信、云和微服务系统包含许多紧耦合的组件,因此单个故障可能会触发一系列相互关联的告警,即所谓的“告警风暴”(Zhao et al. 2020 (https://arxiv.org/html/2607.27290#bib.bib27))。在此背景下,根因分析(RCA)的任务是在这些告警中识别出最小的可操作事件集合,其修复能够真正解决该事件(Assaad et al. 2023 (https://arxiv.org/html/2607.27290#bib.bib34))。快速诊断至关重要,因为大规模中断可能会影响许多依赖服务(O’Brien and Bajak 2021 (https://arxiv.org/html/2607.27290#bib.bib19))。

一种常见的因果方法将告警类型及其触发关系表示为有向无环图(DAG),并预测每个事件诱导子图中所有入度为零的告警。这种框架提供了可追踪的预测,并通过编码触发关系而非记忆化的案例来跨事件泛化。

手动构建这样的图在大规模场景下是不现实的,因此因果发现算法从观测数据中学习它(Assaad et al. 2022 (https://arxiv.org/html/2607.27290#bib.bib23); Spirtes et al. 2000 (https://arxiv.org/html/2607.27290#bib.bib22))。然而,它们的假设以及对干净数据的依赖,可能导致在生产告警流中出现虚假或缺失的边(Aït-Bachir et al. 2023 (https://arxiv.org/html/2607.27290#bib.bib26))。

关键在于,现有方法忽略了另一种可以纠正这些结构错误的补充信息源,即由站点可靠性工程(SRE)团队整理的历史事件日志,其中将观测到的告警序列与专家标注的根因配对。这些诊断标签稀疏且获取成本高。更重要的是,它们提供的是任务级约束而非直接的边监督:它们可以排除那些事件诱导源节点与专家诊断不一致的图,但通常无法识别唯一的真实 DAG。

这种反馈是间接且欠定的,因为专家标签只指定哪些告警应为源节点,却不指定应该通过哪些边的添加、删除或反转来满足这些约束,同时又不降低对重叠案例的预测性能。语言模型之所以有用,是因为它们能够联合解释来自多个事件、当前图、优化历史以及(在可用时)告警标题等信息的约束。因此,我们提出 EvoCause(Evolve Causal Graph,因果图演化),它使用 LLM 从这一组合空间中排序一组语义上合理的编辑,而不是直接预测根因。确定性程序验证每个编辑,拒绝环状候选,并在对齐集上保留性能最优的图。图是唯一被优化的状态,而由图导出的拓扑序仅作为提示上下文使用,而非预测规则。我们在 TeleRCA 上评估告警标题信息的贡献:仅将提供给 LLM 的标题替换为固定的匿名标识符,同时保持图结构和事件数据不变。我们的贡献总结如下:

- • 在方法层面,我们将事件级专家反馈形式化为事件诱导子图上的*源节点约束*,并刻画了相应的根因一致的因果图集合。基于该形式化,我们提出 EvoCause,这是一个与发现算法无关的因果图精化框架,将 LLM 引导的语义图编辑与确定性结构验证及监督驱动的图选择相结合。EvoCause 可以在不修改其内部学习过程的情况下,精化由不同因果发现算法产生的图,同时确保最终图保持结构有效且与专家 RCA 标注一致。
- • 在数据层面,我们发布 TeleRCA,这是一个源自真实生产电信网络的大规模专家标注 RCA 基准数据集。该数据集包含 10,922 个事件、485,681 条告警事件、194 种告警类型,覆盖数千个网络资源。其生产告警序列与事件级专家根因标注的结合,为推进和评估基于事件序列的 RCA 方法提供了互补的测试平台。
- • 在实验层面,我们在十个合成 DAG 上评估了 RCA(Node F1 和 Case EM)和图重构(Graph F1 和 nSHD)指标,并在 TeleRCA 上评估 RCA 性能。EvoCause 提升了所有三种发现主干算法的表现。在 TeleRCA 上进行的受控名称匿名化消融实验评估了人类可读告警标题信息的贡献,而合成数据上的额外主干算法比较则评估了对 LLM 选择的敏感性。

## 2 相关工作

#### 因果图与专家反馈。

观测数据通常只能在一组标准假设下将因果 DAG 识别到马尔可夫等价类。完全部分有向无环图(CPDAG)表示该等价类。有向边是所有兼容 DAG 共享的,而无向边仍然是不确定的(Chickering 2002 (https://arxiv.org/html/2607.27290#bib.bib35))。一致的边方向背景知识可以定向某些无向边并缩小等价类范围(Fang et al. 2025 (https://arxiv.org/html/2607.27290#bib.bib29))。传播所有隐含的定向结果可得到最大定向部分有向无环图(MPDAG),它表示与数据和背景知识都一致的 DAG(Perković 2020 (https://arxiv.org/html/2607.27290#bib.bib36); Guo and Perković 2022 (https://arxiv.org/html/2607.27290#bib.bib28))。相反,专家根因标签约束的是事件诱导子图中的源节点集合,且可能需要骨架改变,因此 EvoCause 在可能跨越多个等价类的根因一致图集合中进行搜索。只有将事件视为已知干预时,干预等价才适用(Hauser and Bühlmann 2012 (https://arxiv.org/html/2607.27290#bib.bib30))。在电信 RCA 中,Zhang et al. (2021 (https://arxiv.org/html/2607.27290#bib.bib2)) 将霍克斯过程发现、条件独立性检验、传播嵌入和影响力最大化相结合。CCCM(Zhang et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib3))引入了面向基站告警的簇感知发现,而 TTCTH(Li et al. 2025 (https://arxiv.org/html/2607.27290#bib.bib6))将拓扑-时序表示学习与霍克斯过程目标相结合。对于微服务,CIRCA(Ikram et al. 2022 (https://arxiv.org/html/2607.27290#bib.bib7))将故障视为干预,RUN(Lin et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib8))结合了神经 Granger 因果性与对比学习,CausIL(Chakraborty et al. 2023 (https://arxiv.org/html/2607.27290#bib.bib9))则将领域知识融入实例级因果图。对于基于阈值的 IT 系统,Zan et al. (2024 (https://arxiv.org/html/2607.27290#bib.bib33)) 将离线因果发现与在线子图遍历相结合。APGNN(Jiang and Bai 2023 (https://arxiv.org/html/2607.27290#bib.bib4))、Chain-of-Event(Yao et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib11))和 Groot(Wang et al. 2021 (https://arxiv.org/html/2607.27290#bib.bib12))使用学习到的关联、可解释的边参数或运维规则来构建事件或告警图以进行诊断。这些方法提供了图学习和定位机制,但通常不会利用累积的专家根因集合来反复修订告警类型 DAG。HRLHF(Wang et al. 2023 (https://arxiv.org/html/2607.27290#bib.bib25))确实在依赖图发现过程中查询工程师,而 EvoCause 则使用先前标注的事件作为离线任务信号,以精化由任何发现主干算法生成的图。

#### 基于 LLM 的 RCA 与图精化。

已有研究探讨了基于 LLM 的 RCA 系统,用于从云事件文本中推荐根因和缓解措施(Ahmed et al. 2023 (https://arxiv.org/html/2607.27290#bib.bib13))。RCACopilot(Chen et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib14))结合了事件特定诊断信息收集与分类和解释。RCAgent(Wang et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib15))和基于 ReAct 的系统(Roy et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib16))使用工具和检索,而 OpenRCA(Xu et al. 2025 (https://arxiv.org/html/2607.27290#bib.bib5))和 Flow-of-Action(Pei et al. 2025 (https://arxiv.org/html/2607.27290#bib.bib17))提供面向智能体的评估或过程约束诊断。这些方法主要针对单个事件进行预测、解释或行动计划,因此其输出不需要更新共享的因果模型。Cloud Atlas(Xie et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib18))更接近于可复用的图构建,因为它从文档、遥测和部署反馈中合成因果图,然后用数据进行验证。在 RCA 之外,CAMA 使用问答反馈精化数学因果图(Zan et al. 2026 (https://arxiv.org/html/2607.27290#bib.bib21))。EvoCause 则使用专家根因标签精化外部发现的告警图,并在测试时仅用精化后的图进行推断。LLM 提出语义候选,而确定性程序验证节点身份和无环性、选择最优图并执行所有测试时推断。

#### 数据集。

Zhang et al. (2021 (https://arxiv.org/html/2607.27290#bib.bib2)) 使用的电信数据为 6,000 个采样告警事务提供了根因标签,其因果边标注覆盖 78 种告警类型中的 15 种。THPs(Cai et al. 2024 (https://arxiv.org/html/2607.27290#bib.bib24))评估的是事件序列结构学习,而非事件级根因定位。OpenRCA 包含 335 个软件故障以及超过 68 GB 的日志、指标和追踪数据(Xu et al. 2025 (https://arxiv.org/html/2607.27290#bib.bib5))。相比之下,TeleRCA 面向告警序列 RCA,为 10,922 个生产事件提供专家根因标注。它不提供真实传播图,因此我们用它评估 RCA 而非精确图重构。

## 3 EvoCause

本节形式化告警级联上的 RCA,并介绍 EvoCause,它包含学习阶段和推断阶段。第 3.1 节 (https://arxiv.org/html/2607.27290#S3.SS1) 定义问题和假设,第 3.2 节 (https://arxiv.org/html/2607.27290#S3.SS2) 分析根因反馈下的可识别性,第 3.3 节 (https://arxiv.org/html/2607.27290#S3.SS3) 概述框架,第 3.4 节 (https://arxiv.org/html/2607.27290#S3.SS4) 描述图构建和标签反馈对齐,第 3.5 节 (https://arxiv.org/html/2607.27290#S3.SS5) 解释根因推断。

### 3.1 问题设置

#### 数据集描述。

我们考虑一个电信网络,它从有限个告警类型集合(记为 \(\mathbf{A}\))生成告警。数据集包含 \(m\) 个事件序列,\(\mathcal{S}=\{\mathbf{s}_i\}_{i=1}^{m}\),在全局观测窗口 \(\mathbf{T}\) 内收集。每个事件序列 \(\mathbf{s}_i\) 对应单个事件,表示为

\[
\mathbf{s}_i=\left\{(a_j,t_j,l_j)\right\}_{j=1}^{n_i}.
\tag{1}
\]
其中 \(n_i\) 表示事件 \(\mathbf{s}_i\) 中的告警事件数量。每个三元组表示一条告警事件:\(a_j\in\mathbf{A}\) 表示告警类型,\(t_j\in\mathbf{T}_i\) 表示其时间戳,\(l_j\in\{0,1\}\) 是专家提供的标注,指示该事件是否是对应事件的根因。具体而言,\(l_j=1\) 表示根因事件,而 \(l_j=0\) 表示非根因事件。相应的事件级专家根因集合为 \(y_i=\{a_j:(a_j,t_j,l_j)\in\mathbf{s}_i,\ l_j=1\}\),其中同一告警类型重复出现时只计入一次。我们进一步假设在整个观测窗口内,\(\mathbf{A}\) 中各告警类型之间的触发关系保持不变。

#### 告警传播图。

我们用有向无环图 \(\mathcal{G}=(\mathbf{A},\mathbf{E})\) 表示告警类型集合 \(\mathbf{A}\) 之间的触发关系,称之为*告警传播图*(APG)。其节点是告警类型,边 \((a_i,a_j)\in\mathbf{E}\) 表示 \(a_i\) 的一次发生可能触发 \(a_j\)。对于某个事件,RCA 将 \(\mathcal{G}\) 限制到观测到的告警类型上,并将诱导子图中的每个零入度节点预测为根因。图是唯一持久的结构状态。当线性表示有助于提示时,我们确定性地导出拓扑序 \(O(\mathcal{G})=\textsc{TopologicalOrder}(\mathcal{G})\),其中对于每条边 \((a_i,a_j)\in\mathbf{E}\),\(a_i\) 都排在 \(a_j\) 之前。该序为 LLM 提供了图的紧凑线性视图。它由 \(\mathcal{G}\) 导出,既不参与优化,也不用于根因预测。

#### 事件级源算子。

设 \(V_i\subseteq\mathbf{A}\) 表示事件 \(\mathbf{s}_i\) 中观测到的不同告警类型集合。对于候选 APG \(\mathcal{G}\),定义

\[
\operatorname{Src}_{\mathcal{G}}(V_i)=\left\{v\in V_i:\operatorname{Pa}_{\mathcal{G}}(v)\cap V_i=\varnothing\right\}.
\tag{2}
\]
EvoCause 将完整集合 \(\operatorname{Src}_

相似文章

StableRCA: 稳健的图无关机制级根因分析

arXiv cs.LG

StableRCA是一种新颖的根因分析框架,通过估计局部马尔可夫边界并检测条件分布偏移来识别干预目标,避免了全局因果图的发现,在合成和真实数据集上展示了鲁棒性。

根因分析在真实遥测数据上能走多远?

arXiv cs.AI

本文利用OpenRCA基准研究了真实遥测数据上的根因分析,表明现有的经典方法和基于LLM的方法均失败,并提出了一种结构化多智能体RCA流水线,其性能大幅优于现有方法。进一步通过逆向推理揭示,主要瓶颈在于推理能力而非数据访问,并引入了自动化规则挖掘以减少对人工领域知识的依赖。

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。