标签
Loom 提出了一种生成式共识框架,用于通过嵌入空间重加权将噪声文本假设聚合为共识,部署用于真实世界的根因分析,相比传统 LLM 代理提高了效率和准确性。
本文介绍了CoreSec,一个用于超大规模数据中心网络根因分析的生产系统,它使用弃权代数来管理模糊的遥测数据,确保在Clos网络中提供确定性和可解释的结果。
LongRCA Bench 引入了一个用于诊断长时程智能体轨迹失败的基准,RCTA方法改进了责任角色和根本原因步骤的归因。
Introduces ORCA-bench, a production-fidelity benchmark for evaluating LLM agents on oncall root cause analysis, finding that even frontier agents achieve only 25.3% accuracy on medium-difficulty tasks.
EvoCause是一篇研究论文,提出了一种LLM引导的方法来优化因果图以进行根因分析,利用专家诊断标签来约束图的编辑,并发布了TeleRCA,这是一个来自生产电信网络的专家标注告警基准。
本文提出加权保形方法,用于变点定位与根因分析,通过降低可能受污染数据的权重,利用不确定性信号与元学习,在污染观测下缩减置信集大小。
本文在制造业与现代软件工程的可靠性之间建立类比,重点介绍了冗余、根本原因分析和可观测性等原则,以帮助构建弹性系统。
Sentry 发布了一个名为 'Seer' 的 AI 代理,它可以分析后端错误,确定根本原因,草拟修复方案,并自动打开一个拉取请求以供审查。
本文利用OpenRCA基准研究了真实遥测数据上的根因分析,表明现有的经典方法和基于LLM的方法均失败,并提出了一种结构化多智能体RCA流水线,其性能大幅优于现有方法。进一步通过逆向推理揭示,主要瓶颈在于推理能力而非数据访问,并引入了自动化规则挖掘以减少对人工领域知识的依赖。
本文对离线根因分析基准进行了审计,发现聚合排行榜隐藏了子系统特定的获胜者,通过对11个子系统的778个案例进行成对比较。它发布了一个320行的审计模块,用于重新计算每个子系统的稳定性检查。
StableRCA是一种新颖的根因分析框架,通过估计局部马尔可夫边界并检测条件分布偏移来识别干预目标,避免了全局因果图的发现,在合成和真实数据集上展示了鲁棒性。
本文提出了罕见事件因果路径的形式化定义,并讨论了其可检验的含义,将简单口头解释与详细因果模型联系起来。
ORCA 是一款端到端因果分析的副驾驶,利用代理引导用户完成包括因果发现、效应估计和根本原因分析在内的工作流,并生成结构化报告。
TopoEvo 是一种面向微服务根因分析、感知拓扑结构且自我进化的多智能体框架,它将图表示学习与结构化、受拓扑约束的推理相结合。在多个数据集上,根因定位准确率绝对提升了 3.44%,故障类型分类性能提升了 4.39% 到 16.81%。
STAR是一个阶段归因的分类与修复框架,它将基于LLM的RCA Agent工作流分解为四个结构化阶段,支持分阶段审计、反事实评估以及补丁-重放修复,以改进微服务AIOps中的根因定位和故障类型分类。
本指南来自 OpenAI Academy,解释了数据科学团队如何利用 Codex 加速分析工作流程,包括根本原因分析、业务影响报告以及处理模糊请求。