AgentDebugX:用于LLM Agent故障可观测性、归因和恢复的开源工具包

Hugging Face Daily Papers 论文

摘要

AgentDebugX 是一个面向 LLM Agent 的开源调试框架,将故障调试组织为检测、归因、恢复和重试的闭环。其核心组件 DeepDebug 在基准测试中实现了强大的归因准确性和修复能力。

LLM Agent 的故障难以调试,因为错误显现的步骤往往并非导致错误的根源。现有的可观测性工具虽然能回放执行轨迹,但在识别根本原因或将诊断转化为恢复措施方面支持不足。我们提出了 AgentDebugX,一个开源调试框架,将调试组织为检测(Detect)、归因(Attribute)、恢复(Recover)和重试(Rerun)的闭环。其核心组件 DeepDebug 通过全局轨迹理解、结构引导调查和交叉检验执行多轮根本原因诊断。在 Who and When 基准测试中,DeepDebug 在两种测试的开源骨干网络上均取得了评估方法中最佳的严格归因准确率:在 qwen3.5-9b 上达到 28.8% 的精确 Agent 和步骤准确率,而最强单次通过基线仅为 21.7%。在 GAIA 上,DeepDebug 通过单次重试修复了 73 个失败任务中的 13 个,相比之下三个解耦的自纠正基线修复了 4 到 6 个,整体准确率从 55.8% 提升至 63.6%。AgentDebugX 通过 Python 库、CLI、Web 控制台和可安装的 Agent 技能暴露此工作流,并提供可选的 Error Hub 用于共享经过脱敏处理的故障-诊断-修复包并将其复用为调试记忆。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

Paper page - AgentDebugX: 一款面向 LLM 智能体的开源工具包,用于失败可观测性、归因与恢复

来源: https://huggingface.co/papers/2607.18754 作者:

,

,

,

,

,

,

,

,

,

,

摘要

LLM 智能体的失败难以调试,因为错误显现的步骤往往并非其根本原因所在。现有可观测性工具会重放执行轨迹,但在识别根本原因或将诊断转化为恢复方案方面支持不足。我们提出了 AgentDebugX,一款开源调试框架,将调试组织为“检测、归因、恢复和重跑”的闭环。其核心是 DeepDebug,通过全局轨迹理解、结构引导调查和交叉检查,进行多轮根本原因诊断。在 WhoandWhen 基准上,DeepDebug 在两种测试的开源骨干模型上均取得了最佳严格归因准确率,在 qwen3.5-9b 上达到 28.8% 的精确智能体-步骤准确率,而最强的单次基线为 21.7%。在 GAIA 上,DeepDebug 在单次重跑中修复了 73 个失败任务中的 13 个,相比之下三种解耦的自纠正基线只修复了 4 到 6 个,将总体准确率从 55.8% 提升至 63.6%。AgentDebugX 通过 Python 库、CLI、Web 控制台以及可安装的智能体技能暴露这一工作流,并提供了可选的 ErrorHub,用于共享清洗后的失败-诊断-修复组合以及将其复用为调试记忆。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18754) 查看 PDF (https://arxiv.org/pdf/2607.18754) 项目页面 (https://www.agentdebugx.com/) GitHub5 (https://github.com/AgentDebugX/AgentDebugX) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18754)

在您的智能体中获取此论文:

hf papers read 2607.18754

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.18754 即可从此页面链接它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.18754 即可从此页面链接它。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.18754 即可从此页面链接它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接它。

相似文章

代理失败聚类改变了我对调试的思考方式

Reddit r/AI_Agents

一位开发者分享了在多个代理运行中可视化失败聚类如何改变了他们的调试方法,强调了建立反馈循环的必要性,使代理能够从过去的错误中学习,而不是将失败视为孤立的问题。文章提到了手动变通方法和一个名为BentoLabs的平台,该平台实现了闭环改进。

AgentForesight:多智能体系统中用于早期故障预测的在线审计

arXiv cs.CL

本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。