根因分析在真实遥测数据上能走多远?

arXiv cs.AI 论文

摘要

本文利用OpenRCA基准研究了真实遥测数据上的根因分析,表明现有的经典方法和基于LLM的方法均失败,并提出了一种结构化多智能体RCA流水线,其性能大幅优于现有方法。进一步通过逆向推理揭示,主要瓶颈在于推理能力而非数据访问,并引入了自动化规则挖掘以减少对人工领域知识的依赖。

arXiv:2607.13548v1 公告类型:新 摘要:在生产环境中识别微服务故障的根因需要推理大规模、多模态的遥测数据(涵盖指标、日志和追踪),这一问题对经典方法和基于LLM的方法均构成了挑战。OpenRCA数据集典型地体现了这些困难:它规模大、模态多、缺乏详细的领域知识,且现有方法在其上的准确率普遍较低。我们表明,经典的因果发现方法和现有的基于LLM的多智能体系统无法可靠地在该基准上识别根因,并提出了一个结构化多智能体RCA流水线,该流水线在性能上大幅优于现有的基于LLM和经典的基线方法,同时支持依赖领域知识和无知识两种运行模式。为了诊断失败来源,我们引入了一个逆向推理智能体,该智能体在给定正确答案的情况下,识别提取出的异常中哪些信号支持该答案,并判断Stage~1是否访问了这些信号,将每次失败分类为推理差距(证据存在但未使用)或数据模糊性(证据确实缺失)。该分析表明,在绝大多数失败案例中,所需证据是存在的:瓶颈不在于数据访问,而在于智能体正确推理这些证据的能力。我们还引入了一个自动化规则挖掘流水线,从逆向推理报告中系统地提取判别规则,减少了对人工知识整理的依赖。在所有配置下,模型推理能力和领域知识是主要限制因素:更强的模型蕴含更多领域专业知识,而显式知识注入部分弥补了这一差距。即使证据提取完美,推理性能仍然在实践中受到限制:仅靠脚手架工程和更好的数据流水线无法弥合这一差距;进步需要在模型层面做出改进。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:24

# 遥测数据上的根因分析到底能走多远?
来源:https://arxiv.org/html/2607.13548

###### 摘要

在生产微服务故障中识别根因,需要推理大规模、多模态的遥测数据(涵盖指标、日志和链路追踪),这一问题对经典方法和基于大语言模型(LLM)的方法都构成了挑战。OpenRCA 数据集集中体现了这些挑战:它规模大、多模态、缺乏详细的领域知识,并且所有现有方法在其上的准确率都持续偏低。我们表明,经典的因果发现方法和现有的基于 LLM 的多智能体系统无法可靠地在该基准上识别根因,并提出了一种结构化多智能体 RCA 流水线,其性能大幅优于现有的 LLM 基和经典基线,同时支持领域知识和无知识两种运行模式。为了诊断故障源自何处,我们引入了一个反向推理智能体,该智能体在给定正确答案的情况下,识别提取的异常中哪些信号支持该答案,并确定第一阶段是否访问了这些信号,从而将每个故障分类为推理缺口(证据存在但未使用)或数据歧义(证据确实缺失)。这一分析表明,在绝大多数故障中,所需证据是存在的:瓶颈并非数据访问,而是智能体能否正确推理这些证据。我们进一步引入了一个自动规则挖掘流水线,该流水线从反向推理报告中系统性地提取判别规则,减少了对人工知识整理的依赖。在所有配置中,模型推理能力和领域知识是主要约束:更强的模型蕴含更多领域专长,显式知识注入能部分弥补这一差距。即使证据提取完美无缺,推理性能仍存在实际瓶颈:仅靠脚手架工程和更好的数据流水线无法弥合这一差距;进步需要模型层面的改进。

## 一、 引言

对真实世界遥测数据进行根因分析(RCA)之所以根本困难,是因为数据量庞大、领域知识有限以及格式异构。遥测数据分布在包含指标、日志和链路追踪的众多 CSV 文件中,使得该问题本质上具有多模态特性。这些特征极大地复杂化了数据处理和推理过程。

RCA 方法大致可分为基于 LLM 的方法和非 LLM 方法。对于基于 LLM 的技术,主要挑战在于将输入上下文缩减到模型上下文窗口能容纳的范围,同时控制计算成本。这对于结合了数值信号和非结构化文本的遥测数据尤为困难。相比之下,非 LLM 方法难以跨异构数据源进行推理,通常缺乏有效诊断所需的领域知识。

OpenRCA 数据集 [8 (https://arxiv.org/html/2607.13548#bib.bib1)] 集中体现了这些挑战,是根因分析领域最困难的基准之一。它规模庞大(64 GB)、多模态、缺乏详细的领域知识,导致现有方法在其上的准确率持续偏低。目标是在一个 30 分钟的故障窗口内识别一个或两个根因。然而,仅从所有遥测文件中提取相关的半小时片段就会产生约 2 GB 的数据,远远超出当前 LLM 的上下文容量。因此,RCA 系统必须首先检测该窗口内的异常行为,并依赖这些异常作为压缩后的证据来进行根因预测。

OpenRCA 遥测数据由指标、日志和链路追踪组成,按三个领域特定数据集组织:市场、电信和银行,这些数据集难度各异,并表现出不同的根因特征。与 LO2 [1 (https://arxiv.org/html/2607.13548#bib.bib13)]、RCAEval [5 (https://arxiv.org/html/2607.13548#bib.bib10)] 和 TelecomTS [2 (https://arxiv.org/html/2607.13548#bib.bib14)] 等数据集相比,OpenRCA 更能代表生产环境,因为它结合了规模、模态多样性和有限的可观测性,使其成为 RCA 研究中更真实、更具挑战性的基准。

OpenRCA 智能体通过首先分析指标数据来识别候选根因,然后使用日志和链路追踪进行验证来解决这个问题。在实践中,其性能有限。该智能体往往无法检查所有可用文件,并倾向于过早地选择检测到的第一个异常作为根因。由于它是在同一个推理循环中即时计算异常,而不是基于一个一致的、预先计算的异常集,其检测是临时性的,并且随查询而变化,这进一步限制了准确性。当一个单一智能体被要求在一个 30 分钟窗口内完成数据提取、异常检测和根因推理时,整体性能仍然较差。

非 LLM 的 RCA 方法在这种环境下存在根本性限制。遥测流以不同的时间粒度记录:指标按分钟级,日志按秒级,链路追踪按毫秒级,这使得统一分析变得困难。因此,因果发现算法通常只应用于指标数据。然而,在 OpenRCA 中,每个故障实例只提供 30 个时间戳,这通常不足以进行可靠的因果发现。我们通过将因果发现算法应用于 OpenRCA 数据集来评估这一限制,并观察到其性能持续不佳。

基于 LLM 的方法可以融入隐式的领域知识,但其有效性受到处理真实世界遥测数据所需的大上下文窗口的制约。多智能体框架通过分解上下文缩减、异常提取和推理来缓解这一问题,但它们会增加成本,仍然高度依赖于底层的基础 LLM,并且可能在上下文缩减过程中丢失信息。一种常见的变体是使用 LLM 构建显式的依赖图或因果图,这些图可以直接从原始遥测数据构建,也可以从其衍生的异常构建。两种途径都有问题。从原始遥测数据构建图无法扩展到 OpenRCA 的多模态、多文件数据,其中即使是指标信号也分布在许多 CSV 文件中,难以进行变量对齐;而且无论哪种情况,在没有真实因果结构的情况下,图的构建会累积虚假边和启发式边权重。它们试图捕捉的因果联系往往是双向的,故障在显现之前可能保持沉默,测量噪声会隐藏真实原因,因此生成的图常常增加的确定性还不如它减少的多。

与在推理循环内即时计算异常不同,我们的系统基于一个一致的、预先计算的异常集进行推理:一个离线阶段对每个 KPI 应用固定阈值,将每个 30 分钟窗口压缩成一个紧凑的异常行集;然后,一个结构化的多智能体 RCA 流水线对该证据进行分阶段枚举、聚类、分析、选择和反思,并按需调用日志和链路追踪调查工具以及网格和运行时子智能体来收集辅助证据。该流水线以两种模式运行:一种是领域知识模式,智能体接收结构化的推理规则和组件分类法;另一种是无知识模式,智能体仅从遥测证据推断因果关系,这样我们就可以将显式领域知识的贡献与推理能力分离开来。

除了预测器之外,我们的核心贡献是一种理解 *为什么* RCA 会失败的方法。给定正确答案后,一个反向推理智能体从提取的异常到标记的根因重建证据链,并将每个故障分类为 *推理缺口*(证据存在但系统推理错误)或 *数据歧义*(证据确实不充分)。在我们分析的故障中,绝大多数情况下所需的证据都存在,这表明约束条件并非数据访问,而是正确推理证据的能力。我们进一步引入了一个自动规则挖掘流水线,从这些反向推理报告中提取判别规则,减少了对整理后的领域知识的依赖。

通过实证,我们的研究得出了若干发现。结构化的多智能体流水线在 OpenRCA 上大幅优于现有的基于 LLM 和经典基线,而经典因果发现(格兰杰因果关系、PC、FCI、LiNGAM 和 NTLR)和现有的基于 LLM 的多智能体系统都无法可靠地识别根因:前者由于样本量不足、高维度和多模态异质性;后者由于上下文缩减、链路追踪选择偏差和弱跨层级推理。由于标记的证据已经存在于提取的异常中,仅改进异常提取所提供的提升空间有限;领域知识(尤其是组件分类法和推理规则)仍然是准确性的主要制约因素。综合来看,这些结果表明,真实世界遥测数据上的 RCA 准确性存在实际瓶颈:即使有准确的异常提取,多个解释仍可能成立,弥合剩余差距更多地取决于模型推理和可用的领域知识,而非额外的脚手架或数据流水线工程。

## 二、 相关工作

[3 (https://arxiv.org/html/2607.13548#bib.bib6)] 中的系统(OpsAgent)结合了一个免训练的数据处理器,将指标、日志和链路追踪异常转换为文本证据;三个专门的智能体(异常检测、故障分类、根因定位)进行迭代交叉审查;以及一个自我进化阶段,使用 PPO 优化智能体策略,并通过检索增强生成重用已解决的案例。尽管如此,它严重依赖于自定义的模态特定预处理,并且相对于其复杂性,准确率的提升仅略显微不足道;它仍然是少数专门为 OpenRCA 设计的系统之一。

GALA [6 (https://arxiv.org/html/2607.13548#bib.bib2)] 将统计因果推断与 LLM 推理结合在一个四阶段工作流中:它首先从指标(基于 PC 算法的因果图)和链路追踪(TWIST 跨度异常评分)生成互补的根因排序,组装每个 Pod 的诊断包,然后使用迭代的 LLM 智能体(重新排序、深入分析、修复)完善假设,最后输出一个排序报告。GALA 的准确性受限于其第一阶段排序的召回率:如果真正的根因不在初始的指标/链路追踪候选集中,LLM 阶段就无法恢复。

RCLAgent [9 (https://arxiv.org/html/2607.13548#bib.bib5)] 是一个多智能体框架,通过递归思维模拟 SRE 诊断工作流,在初始推理、审慎反思和最终审查阶段协调数据智能体(链路追踪过滤、n-西格玛检测)和思维智能体(链路追踪树遍历、跨模态推理)。然而,它期望的是干净的单一请求分析,而不是 30 分钟窗口内的并发故障,缺乏对跨窗口污染的处理,并且输出的是排序列表而不是带有硬性排除的约束满足。

传统的因果发现 [5 (https://arxiv.org/html/2607.13548#bib.bib10)] 不太适合容器级别的 RCA。格兰杰因果关系检验时滞预测影响,但粗粒度(60 秒)的指标粒度使得快速效应看起来是同时发生的,因此它捕捉的是统计可预测性而非结构因果关系,并且对混杂因素、非线性和小样本敏感。PC(Peter-Clark)算法使用条件独立性检验,但需要大样本,假设因果充分性,可扩展性差,并且在短、有噪声的窗口上会产生不稳定的图;扩展算法(PCMCI、FCI、φ-PC、LiNGAM、RCD)放宽了个别假设,但并未解决根本的数据稀缺问题。

CCLH [7 (https://arxiv.org/html/2607.13548#bib.bib4)] 使用异构图对高阶服务关系进行建模,但依赖于准确的拓扑结构和稳定的时间模式,在噪声大、窗口短的设置中受限。TAMO [10 (https://arxiv.org/html/2607.13548#bib.bib8)] 使用分阶段扩散架构,但需要在正常数据和大量标记样本(OpenRCA 中缺乏)上进行预训练,在此处退化为一个纯 LLM 智能体。一大类方法(BARO、RCD、NSigma、CloudRanger、EasyRCA、MicroDiag、MicroCause、MicroRank、MSCRED、CausalRCA、CIRCA、TraceRCA)依赖于故障注入时间戳、正常基线、拓扑结构、标记数据或多个 incident,而 OpenRCA 均不提供这些。因此,只有无监督的因果发现(PC、FCI、GES、LiNGAM、格兰杰、NTLR)可以直接应用。

研究《基于因果推断的微服务根因分析:我们走到了哪里?》[4 (https://arxiv.org/html/2607.13548#bib.bib12)] 系统性地评估了基于因果推断的 RCA 方法,表明没有单一方法能在所有数据集上表现一致,基于合成基准的结果可能具有误导性,并且在有效性、效率和鲁棒性方面仍存在显著差距。评估涵盖了四个真实的微服务系统(Online Boutique、Sock Shop 1 和 2、以及 Train Ticket)。

在这些工作路线中,出现了两种模式。基于 LLM 的 OpenRCA 系统(如 OpsAgent、GALA 和 RCLAgent)依赖于特制的预处理、学习的因果或依赖图,或者链路追踪树遍历,其准确性受限于初始候选集的召回率或假设条件(干净的单一请求输入、稳定的长窗口),而这些假设 OpenRCA 都不满足。非 LLM 的因果发现要么由于需要注入时间、正常基线或重复 incident 而无法应用,要么在 OpenRCA 的短窗口、高维度、多模态环境下表现不可靠。我们的工作有三个不同之处。首先,它避免显式地构建图,而是通过结构化的多智能体流水线直接在压缩后的异常证据上进行推理。其次,它在匹配的领域知识和无知识模式下运行,从而分离出困难是由于知识缺失还是推理不足。第三,也是最具特色的一点,我们并非仅提出另一个预测器,而是引入了一个反向推理诊断机制,将每个故障归因于推理缺口或真正的数据歧义。这种分析在先前的 RCA 工作中是缺失的,并且支撑了我们的发现:该基准上的性能受限于推理而非数据访问。

## 三、 方法论

### III-A 问题陈述

在这项工作中,我们分析了现有的基于 LLM 和非 LLM 根因分析方法在大规模、真实世界多模态遥测数据上的局限性,并提出了一种结构化解决方案,该方案在 OpenRCA 数据集上大幅优于现有的基于 LLM 和经典基线。

给定一个在 30 分钟故障窗口内记录的多模态遥测数据(指标、日志和链路追踪),目标是识别出一个或两个根因,每个根因由组件名称、故障原因和时间戳指定。每个窗口中的根因数量(一个或两个)会提供给流水线。

我们试图回答以下研究问题:

- • 非 LLM 的因果发现方法在从 OpenRCA 指标数据中识别根因组件方面有多有效?
- • 现有的基于 LLM 的多智能体 RCA 系统在应用于 OpenRCA 时存在哪些结构性限制?
- • 领域知识对 RCA 准确性的贡献有多大,在没有领域知识的情况下性能下限是多少?
- • 当 RCA 失败时,损失是由于异常提取,还是由于

相似文章

StableRCA: 稳健的图无关机制级根因分析

arXiv cs.LG

StableRCA是一种新颖的根因分析框架,通过估计局部马尔可夫边界并检测条件分布偏移来识别干预目标,避免了全局因果图的发现,在合成和真实数据集上展示了鲁棒性。

EvoCause:LLM引导的因果图演化用于根因分析

arXiv cs.LG

EvoCause是一篇研究论文,提出了一种LLM引导的方法来优化因果图以进行根因分析,利用专家诊断标签来约束图的编辑,并发布了TeleRCA,这是一个来自生产电信网络的专家标注告警基准。

STAR:微服务中RCA Agent的阶段归因分类与修复框架

arXiv cs.AI

STAR是一个阶段归因的分类与修复框架,它将基于LLM的RCA Agent工作流分解为四个结构化阶段,支持分阶段审计、反事实评估以及补丁-重放修复,以改进微服务AIOps中的根因定位和故障类型分类。