AgentForesight:多智能体系统中用于早期故障预测的在线审计
摘要
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
查看缓存全文
缓存时间: 2026/05/12 06:55
# AgentForesight:多智能体系统中的在线审计与早期故障预测
**来源:** https://arxiv.org/html/2605.08715
Boxuan Zhang¹, Jianing Zhu², Zeru Shi¹, Dongfang Liu³, Ruixiang Tang¹
¹Rutgers University ²The University of Texas at Austin ³Purdue University
{bz362, rt836}@scarletmail.rutgers.edu
###### 摘要
基于大语言模型(LLM)的多智能体系统越来越多地被部署在长视距任务中,但下游代理往往接受单个决定性错误,并导致轨迹级别的级联失败。现有的工作将这个问题框定为*事后故障归因*,即在轨迹结束后诊断负责的代理和步骤。然而,这种范式放弃了在轨迹仍在展开时进行干预的任何机会。在本文中,我们引入了 **AgentForesight**,这是一个将该问题重构为*在线审计*的框架:在展开轨迹的每一步,审计器仅观察当前的前缀,必须在无法访问未来步骤的情况下,要么继续运行,要么在最早的决定性错误处发出警报。为此,我们精心构建了 **AFTraj-22K**,这是一个涵盖编码、数学和智能体领域的智能体轨迹语料库,其中安全轨迹在严格的筛选流程下保留,而危险轨迹则通过多个 LLM 评委的共识在其决定性错误的步骤上进行标注。在此基础上,我们开发了 **AgentForesight-7B**,这是一个紧凑的在线审计器,采用*由粗到细*的强化学习配方进行训练,首先在相邻的安全/不安全前缀对上的故障边界为其配备风险预期先验,然后在针对审计判决的*内容*、*位置*和*责任人*的三维奖励下,将此先验 sharpened(锐化)为精确的步骤级定位。在 AFTraj-22K 和外部 Who&When 基准测试上,**AgentForesight-7B** 超越了包括 GPT-4.1 和 DeepSeek-V4-Pro 在内的领先专有模型,实现了高达 +19.9% 的性能提升和 3× 更低的步骤定位误差,从而开启了从事后故障检测到部署时干预的闭环。
## 1 引言
大语言模型(LLM)已迅速演变为智能体系统,通过协调工具使用和代理间通信,在长视距任务中进行规划、推理和行动 [59, 53, 17, 28]。通过将复杂目标分解为专门的子任务,这些系统现在能够解决曾经被认为遥不可及的问题,涵盖软件开发 [20, 51]、科学发现 [11, 12] 和无限制的网页导航 [66, 33]。然而,这种能力的提升伴随着结构性成本。由于每一步都依赖于之前的输出,单个*决定性错误*(例如格式错误的工具调用或有缺陷的中间推理)很容易被下游代理接受,并级联为整个轨迹的失败 [3, 63, 25]。一旦在可以访问 API 和外部服务的现实环境中部署,此类故障将超出基准准确率的范围,带来意想不到的运营风险 [60, 45],使得可靠性成为 LLM 多智能体系统部署的核心瓶颈。
尽管先前的工作已认识到故障分析是可靠 LLM 多智能体系统的核心关切,但现有方法主要将其框定为*事后故障归因*,即在轨迹已经失败后询问哪个代理或步骤应负责 [63, 62, 67],如图 1 (a) 所示。例如,Who&When [63] 和 AgenTracer [62] 整理失败的轨迹并训练或提示模型在运行结束后 pinpoint(定位)决定性错误步骤,而 AgentDebug [67] 和相关调试框架 [49, 19] 分析完整轨迹以分类故障并为后续重试提供纠正反馈。然而,将故障分析局限于事后阶段,放弃了在轨迹仍在展开时采取行动的任何机会。在诊断结果可用之前,代理已经消耗了更多的工具调用和外部资源,并且在部署设置中可能已经触发了不可逆的副作用。这自然引出了一个根本性的研究问题:
> 我们能否审计展开的前缀而非完整的轨迹,以在传播锁定失败之前捕捉决定性错误?
为了回答这个问题,我们引入了*在线审计*,其中专用的审计器在展开轨迹的每一步提交“继续”或“警报”的判决,如图 1 (b) 所示。具体而言,审计器不再利用完整的事后视野检查已完成的轨迹,而是在每一步仅看到当前的*前缀*,并且必须在无法访问未来步骤、工具响应或最终结果的情况下做出判断。这种重构将故障分析从对已完成运行的被动事后诊断转变为一种主动的安全措施,可以在下游传播锁定失败之前进行干预。实际操作对审计器提出了两个新的要求:1) 它必须可靠地区分仍然安全的前缀和已经越过*决定性错误*的前缀;2) 它必须在错误发生的当下步骤做出承诺,而不是事后诸葛亮。这两个要求都超出了现有故障归因数据或模型所能提供的范围,从而促使我们创建新的数据集和专门的训练配方。
> **图 1:** 相同的多智能体任务上 (a) *事后故障归因* 与 (b) *在线审计* 的比较。(a) 事后故障归因仅在轨迹失败*后*检查轨迹,并回溯性地识别决定性错误,此时下游传播已经锁定了失败。(b) 我们的 AgentForesight 则在轨迹展开时评估每个*前缀*,并在错误发生的当下步骤标记决定性错误,从而在失败被锁定之前打开一个干预窗口(见第 2 节)。
为了实现这一表述,我们开发了 **AgentForesight**,这是一个通过专用数据集和*由粗到细*的训练配方来解决上述两个需求的框架。我们首先构建了 **AFTraj-22K**,这是一个涵盖编码、数学和智能体领域的精心整理的智能体轨迹语料库,将通过严格过滤管道保留的安全轨迹与在多评委投票验证下于*决定性错误*步骤标注的失败轨迹配对。基于精心整理的数据集,我们通过强化学习微调 Qwen2.5-7B-Instruct 以获得 **AgentForesight-7B**,这是一个紧凑的在线审计器,首先在相邻的安全/不安全前缀对上的故障边界配备风险预期先验,然后在针对判决结构(*what*)、警报时机(*where*)和责任代理(*who*)的三维奖励下,将此先验锐化为精确的步骤级定位。**AgentForesight-7B** 与现成的多智能体系统并行运行,对展开的轨迹发出步骤级的继续或警报判决,而无需重新训练底层的智能体系统。
我们在 AFTraj-22K 和外部 Who&When [63] 基准上广泛评估了 **AgentForesight-7B**,结果显示其超越了其 Qwen2.5-7B-Instruct 基础模型以及包括 GPT-4.1 和 DeepSeek-V4-Pro 在内的领先专有评委,相比最强的专有基线,Exact-F1 提高了 +19.9%,步骤定位误差降低了 3×。这些增益证实,我们的由粗到细配方产生了一个紧凑的在线审计器,在受限前缀的在线设置下优于大得多的专有评委。我们将贡献总结如下:
- 我们引入了*在线审计*,这是一种在部署时对智能体故障分析的重构,它逐步审计展开的轨迹,而不是在失败后进行诊断(第 2 节)。
- 我们构建了 **AFTraj-22K**,这是一个涵盖编码、数学和智能体领域的精心整理的智能体轨迹语料库,将严格过滤的安全运行与在多评委验证下于*决定性错误*步骤标注的失败运行配对(第 3.1 节)。
- 我们开发了 **AgentForesight-7B**,这是一个通过*由粗到细*的 RL 配方训练的紧凑在线审计器,首先在其故障边界为其配备风险预期先验,然后在结构、时间和归因优化下将此先验锐化为精确的步骤级定位(第 3.2 节)。
- 我们通过实证表明,**AgentForesight-7B** 在 AFTraj-22K 和 Who&When 基准上超越了其基础模型和领先的专有评委(第 4 节)。
## 2 问题表述
我们在两种设置下形式化了监控多智能体故障的问题:1) *事后故障归因*,这是先前工作中的主流设置 [63, 62, 67];2) *在线审计*,这是我们引入的部署时表述。我们首先定义共享的轨迹模型和*决定性错误*,然后指定每种设置的正式框架,最后以对比结束以澄清我们贡献的范围。
##### 多智能体轨迹
我们将多智能体执行建模为基于回合的系统 $\mathcal{M}=(\mathcal{S}, \mathcal{N}, \pi_{\text{sys}}, \Psi, \Omega)$,其中 $\mathcal{S}$ 是系统状态集,$\mathcal{N}$ 是代理角色的有限集(例如,Planner, WebAgent, CodeWriter),$\pi_{\text{sys}}$ 是给定当前状态产生下一个回合的系统策略,$\Psi$ 是状态更新函数,$\Omega: \mathcal{T} \to \{0,1\}$ 是二元结果函数,用于根据任务规范判断完成的轨迹($\Omega(\tau)=1$ 表示成功,$0$ 表示失败),其中 $\mathcal{T}$ 表示有限轨迹空间。$\mathcal{M}$ 的观测轨迹是回合序列:
$$
\tau=(t_{0},t_{1},\ldots,t_{N-1}), \quad t_{i}=(\mathrm{role}_{i},\mathrm{action}_{i},\mathrm{content}_{i}), \tag{1}
$$
其中 $N$ 是轨迹长度,$\mathrm{role}_{i}\in\mathcal{N}$ 识别回合 $t_i$ 中的代理,而 $(\mathrm{action}_{i},\mathrm{content}_{i})$ 记录其动作以及由此产生的可观察内容。
##### 决定性错误
遵循 [63, 62],我们采用*决定性错误*作为故障分析的操作单元,修正该错误会将轨迹结果从失败翻转为成功。
###### 定义 2.1(决定性错误)
对于结果为 $\Omega(\tau)=0$ 的失败轨迹 $\tau$,令 $\tau^{+}:=\tau_{0:k-1}\oplus\tilde{t}$ 表示将第 $k$ 步替换为可接受修正 $\tilde{t}$ 的前缀。*决定性错误步骤*为:
$$
k^{*} = \min\left\{ k\in[T] : \exists \tilde{t}\in\mathcal{T}_{k}(\tau_{0:k-1}), \; \tilde{\tau}\in\mathcal{R}_{\mathcal{M}}(\tau^{+}), \; \Omega(\tau^{+}\oplus\tilde{\tau})=1 \right\}, \tag{2}
$$
其中 $\mathcal{T}_{k}(\tau_{0:k-1})$ 是位置 $k$ 处可接受的正确回合集合,$\mathcal{R}_{\mathcal{M}}(\cdot)$ 是在系统策略 $\pi_{\text{sys}}$ 下从修正后的前缀可达的后缀轨迹集合。直观上,$k^{*}$ 是最早的步骤,其错误无法通过 $\pi_{\text{sys}}$ 下的任何下游展开来恢复,因此在 $k^{*}$ 处的预言机修正对于挽救轨迹既是必要的也是充分的。我们称 $a^{*}=\mathrm{role}_{k^{*}}$ 为*责任代理*,并用 $(k^{*}, a^{*})$ 标注失败轨迹,用 $(\textsc{SAFE}, \emptyset)$ 标注成功轨迹。
##### 事后故障归因
先前的方法 [63, 62, 67] 将完成的失败轨迹 $\tau$ 及其终端结果 $\Omega(\tau)=0$ 作为输入,并发出单个回溯性预测:
$$
\hat{y}_{\text{post}}=f_{\text{post}}(\tau)=(\hat{k},\hat{a})\in\{0,\ldots,N-1\}\times\mathcal{N}. \tag{3}
$$
该设置具有三个特征:(i) 对 $\tau$ 和 $\Omega(\tau)$ 的*完全事后视野*;(ii) *单次*输出;(iii) 预测发生在故障*之后*,没有留下干预窗口。
##### 在线审计
在线审计将故障分析重构为部署时的决策,其中审计器在每一步与多智能体系统并行运行,并仅根据前缀证据决定是允许执行继续还是停止。
###### 定义 2.2(在线审计)
令 $\tau_{0:k}=(t_{0},\ldots,t_{k})$ 表示 $\tau$ 直到回合 $t_k$ 的前缀。在线审计器是一个函数:
$$
\hat{y}_{k}=f_{\text{online}}(\tau_{0:k}) \in \{\textsc{Continue}\} \cup \left(\{\textsc{Alarm}\}\times\{0,\ldots,k\}\times\mathcal{N}\right), \tag{4}
$$
应用于每一步 $k=0,\ldots,N-1$。*Continue*(继续)判决表示在可见窗口中尚未观察到决定性错误,而 *Alarm*(警报)判决则停止执行,并报告预测的决定性错误步骤 $\hat{k}\in\{0,\ldots,k\}$ 以及预测的责任代理 $\hat{a}\in\mathcal{N}$。该设置反转了事后属性的三点:(i) 仅*前缀受限*信息,无法访问 $t_{k+1:N-1}$ 或终端标签;(ii) *每步*输出,每条轨迹 $N$ 次判决;(iii) 在步骤 $k$ 的 *Alarm* 在 $t_{k+1}$ 提交之前创建了*干预窗口*。
直接将 $f_{\text{post}}$ 应用于每个前缀是不适定的,因为它们是在假设观察到 $\Omega(\tau)=0$ 的情况下训练的,这在实时前缀上会失败。
## 3 方法论
在本节中,我们介绍 **AgentForesight**,这是一个通过 (1) 提供前缀级监督的精心整理语料库 **AFTraj-22K**(第 3.1 节),以及 (2) 产生紧凑在线审计器 **AgentForesight** 的由粗到细训练配方来实现在线审计需求的框架。相似文章
Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。
SearchAuditor:长时程搜索智能体故障的审计与归因
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
@omarsar0: 新论文来自微软及其同事。大规模调试智能体轨迹具有挑战性。这是一个巧妙的方…
本文介绍了OAT,一种用于基于LLM的智能体系统的轻量级故障归因工具。它仅使用成功轨迹进行训练,并利用神经控制微分方程检测错误步骤,在速度和精度上以数量级优势超越昂贵基线。
StepFinder:一种用于多智能体系统故障归因的时间语义框架
StepFinder 是一个轻量级框架,仅在特征构建阶段使用LLM将执行日志编码为时间语义序列,然后应用参数高效的时间与注意力模块进行多智能体系统的故障归因。在Who&When基准测试中,与最快的基于LLM的方法相比,推理时间减少了79%。
保形智能体错误归因
本文提出了一种基于保形预测的多智能体系统错误归因框架,为识别智能体轨迹中的决定性错误提供统计保证。该方法通过在连续预测集中隔离错误,实现了自动恢复与调试。