TopoEvo:一种面向微服务根因分析、感知拓扑结构且自我进化的多智能体框架
摘要
TopoEvo 是一种面向微服务根因分析、感知拓扑结构且自我进化的多智能体框架,它将图表示学习与结构化、受拓扑约束的推理相结合。在多个数据集上,根因定位准确率绝对提升了 3.44%,故障类型分类性能提升了 4.39% 到 16.81%。
arXiv:2605.15611v1 公告类型:新
摘要:微服务中的根因分析(RCA)面临诸多挑战,包括:(i)嘈杂且异构的多模态可观测性数据(指标、日志、追踪),(ii)级联故障传播会放大下游症状,以及(iii)由自动扩展和滚动更新引起的非平稳拓扑漂移。最近基于 LLM 的 RCA 智能体能够生成基于工具的解释,但它们往往不关注拓扑结构,并且存在 \\emph{症状放大偏差},即将根因错误地归因于显著的下游受害者。我们提出 \\textbf{TopoEvo},一种感知拓扑结构且自我进化的多智能体框架,它将图表示学习与结构化、受拓扑约束的推理相结合。TopoEvo 首先引入 \\emph{指标正交多模态对齐}(MOMA),将指标嵌入分解为互补子空间,并通过对比学习对齐日志和追踪,以减少模态冗余和稀疏性,从而为图编码生成稳定的节点表示。然后,它应用 \\emph{向量量化}(VQ)将拓扑增强状态离散化为可审计的 \\emph{症状令牌},并附带症状词典,实现可靠的检索和令牌级证据接地。在这些离散拓扑线索的基础上,TopoEvo 执行多智能体 \\emph{假设—证据—测试}(HET)工作流,显式验证传播一致的解释,并将初始异常与放大的下游症状区分开。最后,\\emph{自我进化机制}刷新分层事件记忆,并利用高置信度的伪标签进行保守的测试时适应,以在漂移下保持鲁棒性。
查看缓存全文
缓存时间: 2026/05/18 06:33
# 面向微服务根因分析的拓扑感知自进化多智能体框架
来源:https://arxiv.org/html/2605.15611
###### 摘要
微服务中的根因分析(RCA)面临三大挑战:\(i\) 存在噪声且异质的多模态可观测数据(指标、日志、链路追踪),\(ii\) 级联故障传播会放大下游症状,以及 \(iii\) 由自动伸缩和滚动更新引起的非平稳拓扑漂移。最近的基于大语言模型的RCA智能体能够生成基于工具的解释,但它们通常仍然忽略拓扑结构,并且遭受*症状放大偏差*,将根因错误地归因于显著的下游受影响节点。我们提出TopoEvo,一个拓扑感知的自进化多智能体框架,它将图表示学习与结构化的、受拓扑约束的推理相结合。TopoEvo首先引入*指标正交多模态对齐*(MOMA),它将指标嵌入分解为互补子空间,并通过对比学习对齐日志和链路追踪,从而减少模态冗余和稀疏性,为图编码生成稳定的节点表示。接着,它应用*向量量化*(VQ)将拓扑增强的状态离散化为带有症状词典的可审计*症状令牌*,从而实现可靠的检索和令牌级证据扎根。在这些离散拓扑线索的基础上,TopoEvo执行一个多智能体的*假设-证据-测试*(HET)工作流,以明确验证传播一致的因果关系,并将初始异常与放大的下游症状区分开。最后,一个*自进化机制*刷新分层事件记忆,并在漂移下使用高置信度伪标签进行保守的测试时适应,以保持鲁棒性。
我们在公开的AIOps基准和真实生产事件数据集上评估了TopoEvo。与最先进的基线方法相比,TopoEvo在根因定位准确率上实现了高达3.44%的绝对提升,同时在不同数据集的故障类型分类性能上显著提升了4.39%到16.81%。
## I 引言
微服务架构已成为构建大规模云应用的主导范式,因其灵活性、支持独立部署和快速迭代。\[1 (https://arxiv.org/html/2605.15611#bib.bib1),2 (https://arxiv.org/html/2605.15611#bib.bib2),3 (https://arxiv.org/html/2605.15611#bib.bib3)\] 然而,这种架构转变也使现代系统操作日益复杂:故障很少停留在局部,细微的问题会迅速沿着服务依赖关系传播,在下游产生放大的误导性症状\[4 (https://arxiv.org/html/2605.15611#bib.bib4),5 (https://arxiv.org/html/2605.15611#bib.bib5)\]。因此,*根因分析*(RCA)——识别初始故障实体及其故障类型——已成为维护服务可靠性和满足严格QoS/SLA要求的关键能力。
尽管取得了显著进展,现有的RCA解决方案在真实微服务部署中仍面临三个实际局限。首先,微服务产生*多模态可观测数据*(指标、日志、链路追踪),但许多方法未充分利用这种丰富性,或依赖于简单融合\[6 (https://arxiv.org/html/2605.15611#bib.bib6),7 (https://arxiv.org/html/2605.15611#bib.bib7),8 (https://arxiv.org/html/2605.15611#bib.bib8)\]。特别是,异质模态在频率、稀疏性、噪声模式和缺失性上存在差异,使得*有效的跨模态对齐*变得困难;简单的拼接往往导致不稳定的表示和虚假的相关性。其次,随着LLM的兴起,多智能体诊断已成为RCA的一个有前景的方向,能够实现基于工具的检查和人类可读的解释。然而,大多数基于智能体的管道仍然*忽略拓扑*:它们难以内化微服务依赖约束,因此倾向于过度信任最显著的下游症状(症状放大),导致低效的调查和频繁的错误归因\[9 (https://arxiv.org/html/2605.15611#bib.bib9),10 (https://arxiv.org/html/2605.15611#bib.bib10),11 (https://arxiv.org/html/2605.15611#bib.bib11),12 (https://arxiv.org/html/2605.15611#bib.bib12)\]。第三,微服务环境本质上是非平稳的:自动伸缩、滚动更新和不断变化的调用图引入了分布偏移和分布外(OOD)行为。静态RCA模型和固定推理启发式方法在这种漂移下性能急剧下降,缺乏可靠的机制来刷新知识和适应\[13 (https://arxiv.org/html/2605.15611#bib.bib13),14 (https://arxiv.org/html/2605.15611#bib.bib14)\]。
为了解决这些挑战,我们提出TopoEvo,一个拓扑感知、推理增强且自进化的框架,用于联合*微服务根因定位*和*故障类型分类*。TopoEvo系统地将表示学习与拓扑约束推理连接起来:(1) 一个*度量锚定正交多模态对齐*模块为异质信号构建稳定的共享子空间,减轻模态稀疏性和冗余;(2) 一个*拓扑感知增强*模块通过向量量化(VQ)离散化拓扑感知状态,并构建一个*症状词汇表*,将不透明的向量转化为紧凑、可检索和可审计的证据单元供推理使用;(3) 一个*推理增强的多智能体*工作流在拓扑约束下遵循显式的假设-证据-测试循环,减少症状放大错误并提高诊断效率;(4) 一个*自进化机制*持续刷新事件知识,并在漂移下谨慎适应编码器,提高对OOD配置的鲁棒性。
我们的主要贡献总结如下:
- •**度量锚定正交多模态对齐**。我们提出一种以度量为中心的对齐方案,将度量嵌入分解为**正交**子空间,并通过对比学习将日志和链路追踪对齐到补充组件,减少多模态可观测数据中的模态稀疏性和冗余相关性。
- •**用于智能体推理的拓扑感知症状令牌化**。我们引入基于VQ的拓扑感知图状态离散化,并构建一个*症状词汇表*,将离散代码映射到紧凑、可审计的症状令牌,实现受拓扑约束的推理,并减少基于LLM的RCA中的症状放大错误归因。
- •**推理增强的多智能体RCA**。我们提出一个假设-证据-测试(HET)多智能体工作流,明确建模故障传播路径并执行基于工具的证据验证,在噪声多模态遥测下实现更可靠且可解释的RCA。
- •**漂移下的自进化适应**。我们引入一个自进化机制,刷新事件知识并在分布偏移下持续适应图编码器和对齐目标,提高对动态微服务配置和分布外(OOD)事件的鲁棒性。
## II 预备知识与动机
### II-A 微服务的可观测性
微服务可观测性是指从分布式服务发出的外部信号推断内部系统状态并诊断运行时问题的能力。在实践中,可观测数据通常概括为三大支柱:*指标*、*日志*和*链路追踪*。
**指标**是带有时间戳的数值测量(如QPS、延迟百分位数、错误率、CPU/内存使用率),提供了服务健康和资源消耗的紧凑连续视图。
**日志**是由服务和基础设施组件产生的离散事件记录,通常包含半结构化消息、级别和上下文字段;它们捕获有关故障的丰富语义线索,但常常有噪声且异质。
**链路追踪**记录跨服务的端到端请求执行,通常组织为具有父子因果关系*跨度*的追踪图;它们暴露了跨服务传播路径和细粒度延迟分解。给定一个事件时间窗口,我们将节点 \(v\) 的多模态可观测数据表示为 \(\mathcal{O}_{v} = \{\mathbf{x}_{v}^{metric}, \mathbf{x}_{v}^{log}, \mathbf{x}_{v}^{trace}\}\),其中 \(\mathbf{x}_{v}^{metric}\) 是一个指标时间序列片段,\(\mathbf{x}_{v}^{log}\) 是日志片段/集合,\(\mathbf{x}_{v}^{trace}\) 是基于追踪的特征集\[15 (https://arxiv.org/html/2605.15611#bib.bib15),16 (https://arxiv.org/html/2605.15611#bib.bib16)\].
### II-B 向量量化与码本
向量量化(VQ)将连续嵌入映射到一组有限的离散原型,实现紧凑且符号化的表示\[18 (https://arxiv.org/html/2605.15611#bib.bib18)\]。给定一个特征向量 \(\mathbf{z} \in \mathbb{R}^{d}\),VQ 将其分配给可学习码本 \(\mathcal{C} = \{\mathbf{c}_{k}\}_{k=1}^{K}\) 中的最近条目:
\[
k^{*} = \arg\min_{k \in [K]} \|\mathbf{z} - \mathbf{c}_{k}\|_{2}, \qquad \mathrm{VQ}(\mathbf{z}) = \mathbf{c}_{k^{*}}.
\]
(1)
码本可以被视为一个字典,其中包含总结嵌入空间中频繁出现结构的代表性模式。在训练过程中,VQ模块通常通过重构风格的目标(如VQ-VAE)进行优化,该目标将码本条目标向分配的向量,同时鼓励编码器输出承诺选定的原型。一个常见的公式为:
\[
\mathcal{L}_{\mathrm{VQ}} = \underbrace{\|\mathrm{sg}[\mathbf{z}] - \mathbf{c}_{k^{*}}\|_{2}^{2}}_{\text{码本损失}} + \beta \underbrace{\|\mathbf{z} - \mathrm{sg}[\mathbf{c}_{k^{*}}]\|_{2}^{2}}_{\text{承诺损失}},
\]
(2)
其中 \(\mathrm{sg}[\cdot]\) 表示停止梯度算子,\(\beta\) 控制承诺项的强度。通过将密集向量离散化为代码索引,VQ产生可解释的“令牌”,并且可以降低对噪声的敏感性,这在将学习到的潜在模式暴露给下游推理模块时非常有用。
### II-C 动机
微服务事件很少是孤立的。上游组件触发的故障通常沿着依赖图传播,逐渐在下游服务中放大可观察到的症状(如重试、排队和超时)。这种传播性质使得RCA本质上是一个*受拓扑条件限制*的推理问题:最异常的节点不一定是初始原因,而正确的诊断需要推理跨多层实体(节点–服务–Pod)及其交互。
#### II-C1 动机1:不感知拓扑的基于LLM的RCA会遭受症状放大偏差。
参见图1的说明。图1:症状放大偏差的说明。最近的基于LLM的RCA系统在工具使用和解释生成方面显示出有希望的能力,但它们大多仍然*忽略拓扑*。它们通常摄入多模态观察,并通过模式匹配或叙述性推理得出结论,而不强制执行来自微服务依赖图的结构约束。这种遗漏导致了一个系统性故障模式:*症状放大偏差*(如图1 (https://arxiv.org/html/2605.15611#S2.F1) 所示)。当延迟和错误信号沿着调用链累积时,下游服务可能表现出最强的症状,因此不受约束的推理过程倾向于选择最显著的下游节点作为根因,即使它只是上游传播的受害者。
这个挑战因微服务系统的*多层*性质而加剧。根因可能源于Pod级别的资源争用、服务级别的错误配置或节点级别的故障,而可观察到的“峰值异常”可能出现在不同的层级。因此,仅仅向LLM提供原始日志/追踪/指标是不够的:模型需要一个显式机制来*感知*和*操作*层级拓扑证据。这促使TopoEvo将基于GAT的定位器与拓扑感知向量量化(VQ)和症状词典结合,将密集的拓扑感知状态转换为离散、可检索的症状令牌。这些令牌作为紧凑的证据单元,使得推理层能够锚定在传播结构上,明确地将*初始异常*与*放大的下游症状*区分开。
#### II-C2 动机2:动态拓扑需要在OOD漂移下进行推理增强的适应。
微服务环境高度非平稳。自动伸缩不断添加/移除Pod,滚动更新改变服务版本,配置更改改变调用模式和依赖边。这种动态性在图拓扑和可观测性两方面都引入了分布偏移,导致静态RCA模型性能下降——即使故障语义保持不变。在实践中,相同的故障类型在拓扑变化后可能表现不同,以前可靠的模式可能变成分布外(OOD)。
这促使RCA设计需要对拓扑漂移具有鲁棒性。一方面,基于LLM的推理提供了一个自然优势:它可以测试假设,协调不完整的证据,并泛化到精确模式匹配之外。另一方面,仅靠推理不足以维持持续性能:系统必须*保留*经过验证的诊断知识,并快速*适应*新拓扑。因此,TopoEvo引入了一个推理增强的多智能体工作流(假设-证据-测试)来在拓扑约束下明确验证因果解释,以及一个自进化机制,该机制(1)刷新分层事件记忆,(2)使用高置信度伪标签进行保守的测试时适应。这些机制共同使TopoEvo能够利用强大的OOD推理能力,同时持续将其编码器和知识库与不断变化的服务依赖关系对齐。
## III 方法
参见图2的说明。图2:TopoEvo的概述。如图2 (https://arxiv.org/html/2605.15611#S3.F2) 所示,TopoEvo由5个组件组成,支持联合微服务根因定位和故障类型分类:(1)数据处理和依赖图构建,(2)基于细粒度依赖图的度量正交多模态对齐,(3)通过向量量化和症状词典进行拓扑感知增强,(4)通过假设-证据-测试进行推理增强的多智能体诊断,以及(5)使用分层记忆和测试时适应的自进化机制。
### III-A 数据处理和依赖图构建
#### III-A1 多模态数据预处理
对于每个实体 \(v \in V\),指标、日志和追踪被编码为模态嵌入。
- **指标**信号表示为归一化的多变量时间序列 \(\mathbf{M} \in \mathbb{R}^{L \times D}\),并被分割为重叠的时间补丁(宽度 \(w\),步长 \(s\))以捕获局部动态。每个补丁由TCN编码,并通过MLP投影得到指标嵌入 \(\mathbf{x}_{v}^{\text{metric}} \in \mathbb{R}^{E_{m}}\)。
- **追踪**被解析为跨度关系,并为每个实体聚合成窗口级统计量(如延迟、错误率、调用频率),然后进行归一化。1D扩张CNN后接MLP产生追踪嵌入 \(\mathbf{x}_{v}^{\text{trace}}\)。
- **日志**被预处理...相似文章
@tom_doerr: 半自主代理通过并行实验优化代码库 https://github.com/evo-hq/evo
Evo是一个开源工具,提供半自主代理通过并行实验优化代码库,利用树搜索和多个子代理自主发现并改进指标。
MetaEvo: 一种用于经验驱动型智能体持续进化的元优化框架
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
EvoSci:一种受生物启发的多智能体框架,用于科学发现的演化
EvoSci提出了一种受生物启发的多智能体框架,将进化算法与知识图谱建模相结合,以迭代生成、评估和完善研究想法,在同行评审评估中取得了最佳性能。
EvoMaster:构建可进化大规模自主科学智能体的基础框架
# 论文页面 - EvoMaster:构建可进化大规模自主科学智能体的基础框架 来源:[https://huggingface.co/papers/2604.17406](https://huggingface.co/papers/2604.17406) 作者:,,,,,,,,,,,,,,,,,,,,, ## 摘要 EvoMaster 是一个可扩展、自我进化的智能体框架,专为大规模科学发现设计,支持在实验周期中迭代优化假设并持续积累知识。大语言模型与智能体的融合正在催生“智能体科学”新时代。
EvoCause:LLM引导的因果图演化用于根因分析
EvoCause是一篇研究论文,提出了一种LLM引导的方法来优化因果图以进行根因分析,利用专家诊断标签来约束图的编辑,并发布了TeleRCA,这是一个来自生产电信网络的专家标注告警基准。