@svpino: 我在6个月后辞职了,因为我不想在半夜接到电话去修复任何发生的问题。我……
摘要
文章讨论了值班事件响应的挑战,并介绍了incident.io的新产品'Investigations',该产品使用AI提供即时根本原因分析和上下文,显著加快了解决速度。
查看缓存全文
缓存时间: 2026/09/10 20:27
我在一份工作上只坚持了6个月就辞职了,因为我实在不想半夜被叫起来处理各种突发故障。
虽然总共只轮值了两次,但那已经够我受的了。
那时候,你得在深夜爬起来翻日志、查仪表盘、翻旧聊天记录,试图搞清楚到底哪里出了问题并找到解决方案。
向每天默默处理这些事务而不抱怨的同行们致敬。
冷启动(Cold start)是排查问题时最耗费心力的环节——光是弄清楚发生了什么就要占用大部分时间。
现在,我和 @incident_io 合作,他们的新一代智能体根因分析产品 Investigations,能在你开始排查前就提供一个初步的工作假设。
这完全是两种体验。
以下是它的工作流程:
- 它从遥测数据、部署记录、提交历史、过往事件、Slack、文档和服务依赖中采集上下文信息。
- 它构建结构化假设,说明出了什么问题、为什么发生,以及下一步该往哪里排查。
- 当你提出问题或进行并行调查时,它会在后台持续分析新信号。
每个假设都链接到其信息来源,方便你验证证据并决定下一步行动。
由于它基于 Nexus 构建——一个对你的系统和历史事件持续建模的动态知识库——它真正理解你的环境,而不是像通用大语言模型那样仅靠猜测日志来推断。
于是你从完全摸不着头脑,到几秒钟内就获得一个极具参考价值的起点。
请查看此链接:https://go.incident.io/0fNPXZ6
感谢团队与我合作撰写本文。
Investigations 应对事件中最棘手的部分,将你的排查与解决速度提升一个数量级。
来源:https://incident.io/investigations?utm_source=x&utm_medium=social&utm_campaign=FY26-Q3-819-INFL-LP-investigations-LearnMore&utm_content=Santiago-Valdarrama&utm_term= Investigations
智能体根因分析
Investigations 直击事件处理中最困难的环节,将你的响应与解决速度提升一个数量级。
生产环境可靠性智能体引擎
Investigations 运行在一个专用引擎上,该引擎会在新信号到来时重新评估状态、基于真实证据构建发现,并通过一个对抗性智能体对每个假设进行压力测试后,再呈现给你。
以根本性不同的速度响应
我们的智能体可以扫描日志、代码和上下文信息,使你的团队能够达到仅靠手动调试无法企及的响应速度。
快速分诊### 快速分诊 在调查开始前,先了解问题严重性、影响范围,判断是否需要上报,还是可以暂缓处理。
即时根因分析### 即时根因分析 当问题严重时,Investigations 已经收集了足够的上下文,能够展示哪里出了问题以及为什么,让你从真实证据出发进行分析。
上下文感知的调试智能体### 上下文感知的调试智能体 我们的智能体将在后续的事件处理中全程与你并肩工作,执行并行分析,并在你想到之前就主动发现关键信息。
降低事件成本
事件的成本远不止宕机时间。它涵盖所有相关方面:工程人力、客户信任以及产品迭代速度。
- 减少需要介入的人数
- 更多时间用于构建
- 降低客户影响
与你技术栈中的任何智能体协作
Investigations 可以无缝对接到你已有的智能体和工具:编码智能体、支持工具,或任何通过 MCP 连接的组件。我们的目标是让人与智能体紧密协作,直至问题解决。
与你技术栈中的任何智能体协作
不再冷启动
当事件被标记的那一刻,Investigations 已经完成了初步分析。在任何人开始深入挖掘之前,你就对面临的问题及排查起点有了清晰的认识。
根因假设
你无需独自调试
你获得了一个完全了解你环境上下文的智能体。它将协助你全程处理事件,回答提问,并进行并行分析。
查询遥测数据
基于 Nexus 的强大能力
Investigations 运行于我们的生产智能模型 Nexus 之上。它能对你的整个环境进行实时推理,因此即使在凌晨3点,它也能基于对系统的深入了解做出高置信度的假设。
了解更多关于 Nexus (https://incident.io/nexus)
- 能访问你的团队产出的所有相关上下文
- 跨遥测数据、部署、代码和事件历史进行推理
- 使用对抗性智能体在分享前挑战自身结论
- 随着每次事件处理而变得更智能,模型能学习哪些模式会重复出现
智能不断累积
每次事件都让它学到新东西。使用得越多,它就越智能。
在关键时刻值得信赖
专为最关键的时刻打造,满足企业团队所需的准确性、透明度和数据隔离要求。查看我们的 Vanta 信任中心 (https://trust.incident.io/)
可验证的准确性### 可验证的准确性 我们每天使用真实历史事件进行回测,并在任何性能下降影响到你之前发出警报。
基于证据的审计追踪### 基于证据的审计追踪 每个假设都链接回其来源,并且事件时间线让你能跟随智能体从首个信号到最终结论的完整推理过程。
你的数据始终属于你### 你的数据始终属于你 每位客户都拥有自己独立的 Nexus 生产智能模型实例,绝不与其他客户共享。
符合 SOC 2 标准### 符合 SOC 2 标准 代码分析在隔离的沙箱容器中运行,使用后立即销毁,并且在数据到达模型之前我们会先进行脱敏处理。
对模型提供商零数据留存### 对模型提供商零数据留存 我们与提供商签订了协议,他们不能为日志记录或训练存储客户数据。
未经你许可绝不采取行动### 未经你许可绝不采取行动 Investigations 对你的系统唯一可能进行的修改是一个需要你自行审核并合并的拉取请求。
效果如此显著,你会想故意制造点事件来试试
准备好让 AI 为你的事件处理效力了吗?今天就与我们的团队预约通话吧。
相似文章
事件响应面临从检测到行动的难题
文章指出,事件响应中的主要瓶颈不是执行时间,而是从检测到行动的差距,并探讨了AI辅助的SRE工具如何发展以关联信号、识别根本原因并建议或触发修复。
@NikkiSiapno: 日志 vs 指标 vs 追踪。日志、指标和追踪都可以指向同一个问题,但它们从完全不同的角度展示该问题。
这篇文章解释了系统可观测性中的日志、指标和追踪,并推广 incident.io 的 Investigations 工具,该工具利用 AI 进行根因分析,以加速事件解决。
花了两年时间部署AI代理来跨团队调查生产事故。技术部分很简单,但组织政治几乎让项目夭折。
作者分享了两年多来跨团队部署AI代理调查生产事故的经验,指出技术实现虽然简单直接,但组织内部的政治因素才是真正的挑战。
AI 代理治理事件响应,你们的方案是什么?
本文讨论了 AI 代理缺乏事件响应计划的问题,并寻求他人关于如何处理故障和访问问题的意见。
AI Agent智能工具 - 事件调试与成本突增检测
构建一个用于AI Agent事件调试和成本突增检测的工具,无需额外检测工具,涵盖提示注入、推理循环、数据泄露等问题。询问生产环境中的客户,这是否是一个值得付费的痛点。