Who&When Pro: 大语言模型真的能归因AI智能体中的故障吗?
摘要
本文介绍了Who&When Pro,一个用于AI智能体系统中自动故障归因的大规模基准,包含26个基准上的12,326条故障轨迹,并提供了关于大语言模型如何归因故障的见解。
arXiv:2607.09996v1 公告类型:新
摘要:自动故障归因利用大语言模型识别智能体系统在何处以及为何失败。随着智能体变得更为强大,其失败也变得更加微妙,这使得自动归因愈发重要。我们介绍了Who&When Pro,一个用于智能体系统自动故障归因的大规模基准。通过一个严格受控的管道——仅在精确重放成功前缀后才注入故障——我们构建了12,326条带有黄金标签的失败轨迹,涵盖3种模态和26个基准,覆盖多种场景。除基准测试外,我们还进行了广泛的实验和分析,揭示了模型在跨模态、协议和模型家族中归因故障的系统性模式,并为未来的自动故障归因系统提供了经验性指导。
查看缓存全文
缓存时间: 2026/07/14 04:18
# Who&When Pro: 大型语言模型真的能够归因AI代理的失败吗?
来源:https://arxiv.org/html/2607.09996
Huajun Xi, Shaokun Zhang, Yifan Zeng, Tianwei Yue, Chi Wang, Jian Kang, Qingyun Wu, Huazheng Wang
###### 摘要
自动故障归因(Zhang 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib1))利用大型语言模型(LLM)来识别代理系统在何处以及为何失败。随着代理变得越来越强大,它们的失败也变得更加微妙,这使得自动归因变得越来越重要。我们推出了 Who&When Pro,这是一个用于代理系统自动故障归因的大规模基准测试。通过一个严格控制的数据流水线——该流水线仅在完全复现成功前缀后注入一个失败——我们构建了 12,326 条带有黄金标签的失败轨迹,涵盖 3 种模态和 26 个基准测试,覆盖多种场景。除了基准测试本身,我们还进行了广泛的实验和分析,揭示了模型在跨模态、协议和模型家族中归因失败的系统性模式,并为未来的自动故障归因系统提供了经验指导。
机器学习,ICML
## 1 引言
近期研究表明,模型扩展(OpenAI, 2026 (https://arxiv.org/html/2607.09996#bib.bib129); Anthropic, 2026 (https://arxiv.org/html/2607.09996#bib.bib130); Google DeepMind, 2025 (https://arxiv.org/html/2607.09996#bib.bib131))结合精心设计的工程化框架(Lou 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib105); Lin 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib107); Pan 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib106); Lee 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib104))能够产生可在多种数字环境中运行的 AI 代理,并在编码(Gao 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib102); Yang 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib90); Xia 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib101))、科学发现(Ren 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib48); Bran 等人, 2023 (https://arxiv.org/html/2607.09996#bib.bib91); Boiko 等人, 2023 (https://arxiv.org/html/2607.09996#bib.bib93))以及复杂的现实世界问题解决(Mialon 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib103); Liu 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib85); Zhang 等人, 2025a (https://arxiv.org/html/2607.09996#bib.bib87); Liu 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib86); Song 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib84))等领域展现出巨大潜力。然而,随着代理能力的提升,推进代理系统变得越来越具有挑战性:能力更强的代理所发生的失败更加微妙、更难以检测,然而这些失败恰是进一步改进的关键信号。这催生了 *自动故障归因* (automated failure attribution) 这一研究方向,它利用 LLM 来识别代理系统在何处以及为何失败,并将失败转化为可操作的反馈(Zhang 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib1); Cemri 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib2))。其目标是让故障归因能够像代理能力一样从模型扩展中受益:*更强的模型不仅应支持能力更强的代理,还应更好地检测代理日益微妙的失败。* 更广泛地说,这种无需人工的反馈有可能为构建自我进化的代理系统提供主动信号,从而使代理能够从自身失败中学习改进(Gao 等人, 2025a (https://arxiv.org/html/2607.09996#bib.bib8); Fang 等人, 2025a (https://arxiv.org/html/2607.09996#bib.bib94))。作为该方向的早期尝试,Zhang 等人(2025b (https://arxiv.org/html/2607.09996#bib.bib1))推出了 Who&When 基准测试,包含从 127 个 LLM 代理系统中收集的 184 条失败轨迹。每条轨迹以自然语言标识了发生失败的代理、错误步骤以及失败原因,定义了一个识别 *谁* (who) 失败以及 *何时* (when) 失败的任务。然而,Who&When 局限于文本任务,而现实世界中的代理部署跨越了更广泛的模态,如图像/视频推理。其 184 个实例的小规模也不足以反映现实代理场景的广度和复杂性。其核心原因在于,在没有人工干预的情况下获取高质量的失败标注十分困难,而一旦超出文本领域,这一挑战将变得更大。
请参阅图注
Figure 1: Who&When Pro 概述。内环将 26 个源基准测试分组为 9 个任务类别。外环将每个基准测试映射到其模态(文本、图像、视频)。四个角面板展示了跨模态和代理拓扑的故障归因示例。(左上)一个视频代理错误识别了某一帧。(右上)一个多智能体编码流水线采用了次优架构。(左下)一个图像问答代理错误读取了图表趋势。(右下)一个网络代理偏离了用户任务。每个面板中高亮显示了决定性失败步骤。轨迹内容已进行摘要以便于说明,并不反映代理的完整输出。
为解决这些局限性,我们引入了一个可扩展的流水线,用于自动构建故障归因数据。具体来说,我们在更广泛的多模态代理任务上执行代理轨迹,并保留那些成功完成任务的轨迹。对于每条成功轨迹,我们在选定的步骤注入一个错误,然后从该点开始热启动执行以生成失败的延续。由于注入的错误是将成功轨迹转变为失败轨迹的唯一受控变化,因此由此产生的任务失败可以精确归因于注入错误的代理和步骤,从而在 (Zhang 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib1)) 所定义的“决定性错误”框架下获得黄金标签。基于此流水线,我们推出了 Who&When Pro,这是一个用于代理系统自动故障归因的大规模基准测试。它包含 12,326 条失败轨迹,跨越 26 个源基准测试、9 个任务类别和 3 种模态,涵盖从问答(Yue 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib123); Wang 等人, 2024c (https://arxiv.org/html/2607.09996#bib.bib115))到数据科学(Wu 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib118); Hu 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib97); Lai 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib110))、GUI 交互(Xie 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib126); He 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib127))以及视频理解(Wang 等人, 2024a (https://arxiv.org/html/2607.09996#bib.bib128))等任务。与先前的基准测试相比,Who&When Pro 在规模上和模态覆盖面上都有显著扩展,为评估现代代理中的故障归因提供了更真实、更具挑战性的测试平台。除了基准测试本身,我们还进行了广泛的分析,表明归因行为因模态、协议和模型家族而异:视频轨迹对步骤定位尤其具有挑战性,多模态轨迹为故障模式诊断提供了更强的线索,完整轨迹归因优于增量协议,而开放权重模型在成本与性能之间提供了具有吸引力的折衷方案,可作为实用的归因骨干。结合先前的工作,Who&When Pro 为衡量自动故障归因的进展提供了严谨的基础。
Table 1: 与现有故障归因基准测试的比较。拓扑 表示单代理与多代理(MAS)轨迹。模态 表示基准测试是否涵盖文本、图像或视频代理轨迹。
## 2 相关工作
### 2.1 代理故障归因
故障归因旨在回答代理系统在何处、何时以及由谁偏离了给定任务。它已迅速成为一个独立的研究领域,用于理解和优化代理。第一波基准测试形式化了责任代理和决定性步骤的联合预测,并沿专家策划(Zhang 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib1); Cemri 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib2); Deshpande 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib68); Zhu 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib69); Barke 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib112))和 LLM 驱动注入(Kong 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib3); Zhang 等人, 2026a (https://arxiv.org/html/2607.09996#bib.bib7))等互补维度进行扩展。另一条路线将归因视为对执行轨迹的推理,通过分层、基于频谱(Ge 等人, 2025a (https://arxiv.org/html/2607.09996#bib.bib33))、基于表示学习(Zhao 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib37))的方法,以及更轻量级的运行时监控和审计器(Zhu 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib34); Ma 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib35); Yu 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib36); Luo 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib38))进行探索。尽管覆盖广泛,但每个先前的基准测试都仅局限于文本,要么只涉及单代理场景,要么只涉及多代理场景,并且在标签质量与规模之间进行权衡。Who&When Pro 弥合了这些差距:它跨越文本、图像和视频三种模态,涵盖 26 个基准测试,覆盖两种场景,并且与其他自动故障生成流水线相比,生成的标签具有更高的保真度。我们在表 1 (https://arxiv.org/html/2607.09996#S1.T1) 中对 Who&When Pro 与先前的工作进行了比较。
### 2.2 自我进化的代理
自我进化的代理有望在不进行微调的情况下从自身轨迹中学习,这一点已在近期综述中得到阐述(Gao 等人, 2025a (https://arxiv.org/html/2607.09996#bib.bib8); Fang 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib51); Liu 等人, 2025a (https://arxiv.org/html/2607.09996#bib.bib50))。自我优化的经典构建模块包括口头反思(Shinn 等人, 2023 (https://arxiv.org/html/2607.09996#bib.bib20); Madaan 等人, 2023 (https://arxiv.org/html/2607.09996#bib.bib21); Gou 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib22))、自我奖励评判(Yuan 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib23))、优化调整(Fu 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib24); Yuan 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib25); Zeng 等人, 2023 (https://arxiv.org/html/2607.09996#bib.bib27))以及自举多智能体改进(Zhao 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib26))。近期工作更积极地利用归因感知(Zhai 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib52); Yang 等人, 2026 (https://arxiv.org/html/2607.09996#bib.bib58))、轨迹级别(Lin 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib53); Chen 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib54); Ge 等人, 2025b (https://arxiv.org/html/2607.09996#bib.bib55); Acikgoz 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib56); Xia 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib57))或技能级别(Zhang 等人, 2026b (https://arxiv.org/html/2607.09996#bib.bib59), 2024 (https://arxiv.org/html/2607.09996#bib.bib88))的自我进化来闭合循环。一个常见的瓶颈是,反馈信号要么是粗粒度的,要么是自我生成的,而这两者都会传播代理本应学会避免的相同错误。Who&When Pro 提供了缺失的中间信号:大规模、外部验证、步骤级别的故障标签,横跨多种模态,直接适用于驱动自我进化循环,而非仅依赖终端反馈或自我评分。
## 3 Who&When Pro
我们采用 Zhang 等人(2025b (https://arxiv.org/html/2607.09996#bib.bib1))提出的“决定性错误”框架。设 τ = (a₁, ..., a_T) 表示一个代理轨迹,其中 a_t 是步骤 t 处由一个代理产生的动作。决定性步骤 t* 是满足以下条件的首个索引:纠正 a_{t*} 可将失败轨迹转变为成功轨迹。在多代理轨迹中,决定性代理是产生 a_{t*} 的代理。我们通过对热启动轨迹进行受控错误注入,大规模构建决定性错误标签。在本节剩余部分,我们将介绍源轨迹的构建(§3.1 (https://arxiv.org/html/2607.09996#S3.SS1))、故障模式分类(§3.2 (https://arxiv.org/html/2607.09996#S3.SS2))、错误注入流水线(§3.3 (https://arxiv.org/html/2607.09996#S3.SS3))、基准测试统计信息(§3.4 (https://arxiv.org/html/2607.09996#S3.SS4))以及人工验证(§3.5 (https://arxiv.org/html/2607.09996#S3.SS5))。
请参阅图注
Figure 2: Who&When Pro 故障注入流水线。从跨文本、图像和视频模态的基准测试中收集的代理轨迹被分为成功和失败两类,其中失败的轨迹用于构建错误分类体系。对于每条成功的种子轨迹,一个错误生成器会注入一个基于分类体系的错误,然后通过热启动展开收集转向失败的轨迹。(右下角)(a)先前的方法使用重新展开可能导致注入前漂移,从而使得导出的决定性错误标签成为近似值;(b)我们通过基于热启动的展开避免了这个问题。
### 3.1 源轨迹
为了支持现代代理部署多样性下的故障归因,我们从 15 个代理框架和 26 个基准测试中获取轨迹,这些来源跨越文本、图像和视频模态。这些框架范围从单代理 ReAct 循环(Yao 等人, 2022 (https://arxiv.org/html/2607.09996#bib.bib79); Roucher 等人, 2025 (https://arxiv.org/html/2607.09996#bib.bib70))到具有专门角色的多代理流水线(Hong 等人, 2023 (https://arxiv.org/html/2607.09996#bib.bib75); Wu 等人, 2024 (https://arxiv.org/html/2607.09996#bib.bib89); Zhang 等人, 2025c (https://arxiv.org/html/2607.09996#bib.bib71)),覆盖了代码即动作和工具调用两种范式。这些基准测试涵盖 9 个任务类别,从 STEM 问答到数据科学、GUI 交互和视频理解,确保生成的失败轨迹能够反映代理在实际部署中所面临场景的广度。对于每一对(代理,基准测试),我们运行代理并记录完整的执行轨迹,包括任务输入、代理消息、观察结果和中间产物。¹
¹ 有关所使用的代理系统和基准测试的完整列表,请参考附录 G (https://arxiv.org/html/2607.09996#A7) 和 H (https://arxiv.org/html/2607.09996#A8)。
我们尽可能使用每个基准测试的官方评估器来评估每个最终答案。生成的轨迹被划分为成功运行和失败运行。这两部分扮演着互补的角色。成功轨迹被用作 *种子轨迹*:它们提供了已知足以完成任务的行动步骤。失败轨迹不直接用作带标签的基准测试项目。相反,它们用于校准故障分类体系,并确定对于每个(代理,基准测试)设置,哪些错误模式是现实的,如下所述。
### 3.2 故障分类体系
我们根据自然发生的失败轨迹构建故障分类体系。对于每个(代理,基准测试)组合,博士级别的评审员逐步检查采样的失败轨迹,并遵循 Zhang 等人(2025b (https://arxiv.org/html/2607.09996#bib.bib1))的定义,识别最早的决定性错误。评审员随后比较跨基准测试的重复模式,将其整合为一个统一的分类体系,涵盖感知、推理、规划、动作、验证和协调等故障类别。完整的分类体系和定义见附录 C (https://arxiv.org/html/2607.09996#A3)。评审阶段还为每个(代理,基准测试)组合生成了 *故障模式概览*,相似文章
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
StepFinder:一种用于多智能体系统故障归因的时间语义框架
StepFinder 是一个轻量级框架,仅在特征构建阶段使用LLM将执行日志编码为时间语义序列,然后应用参数高效的时间与注意力模块进行多智能体系统的故障归因。在Who&When基准测试中,与最快的基于LLM的方法相比,推理时间减少了79%。
从自信地宣告完成到悄然失败:描述LLM智能体中的虚假成功
本文描述了LLM智能体中的“虚假成功”现象,即智能体声称任务已完成,但环境状态显示并非如此。研究发现,在多个基准测试中,虚假成功占失败的45%-75%。LLM评判器无法可靠检测到这一现象,而轻量级TF-IDF检测器能以更低延迟实现高AUROC,提示生产监控应使用校准检测器而非LLM评判器。
大多数 AI Agent 的失败是组织设计失败,而非模型失败
文章认为,生产环境中 AI Agent 的失败往往归因于糟糕的组织设计和模糊的责任边界,而非模型本身的局限性。文章提出了一种成熟度模型,区分了 AI 助手、自动化流程和 AI 员工,以指导任务所有权的确立。