AgentDebugX:用于LLM Agent故障可观测性、归因和恢复的开源工具包
摘要
AgentDebugX 是一个面向 LLM Agent 的开源调试框架,将故障调试组织为检测、归因、恢复和重试的闭环。其核心组件 DeepDebug 在基准测试中实现了强大的归因准确性和修复能力。
查看缓存全文
缓存时间: 2026/07/22 06:41
Paper page - AgentDebugX: 一款面向 LLM 智能体的开源工具包,用于失败可观测性、归因与恢复
来源: https://huggingface.co/papers/2607.18754 作者:
,
,
,
,
,
,
,
,
,
,
摘要
LLM 智能体的失败难以调试,因为错误显现的步骤往往并非其根本原因所在。现有可观测性工具会重放执行轨迹,但在识别根本原因或将诊断转化为恢复方案方面支持不足。我们提出了 AgentDebugX,一款开源调试框架,将调试组织为“检测、归因、恢复和重跑”的闭环。其核心是 DeepDebug,通过全局轨迹理解、结构引导调查和交叉检查,进行多轮根本原因诊断。在 WhoandWhen 基准上,DeepDebug 在两种测试的开源骨干模型上均取得了最佳严格归因准确率,在 qwen3.5-9b 上达到 28.8% 的精确智能体-步骤准确率,而最强的单次基线为 21.7%。在 GAIA 上,DeepDebug 在单次重跑中修复了 73 个失败任务中的 13 个,相比之下三种解耦的自纠正基线只修复了 4 到 6 个,将总体准确率从 55.8% 提升至 63.6%。AgentDebugX 通过 Python 库、CLI、Web 控制台以及可安装的智能体技能暴露这一工作流,并提供了可选的 ErrorHub,用于共享清洗后的失败-诊断-修复组合以及将其复用为调试记忆。
查看 arXiv 页面 (https://arxiv.org/abs/2607.18754) 查看 PDF (https://arxiv.org/pdf/2607.18754) 项目页面 (https://www.agentdebugx.com/) GitHub5 (https://github.com/AgentDebugX/AgentDebugX) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18754)
在您的智能体中获取此论文:
hf papers read 2607.18754
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.18754 即可从此页面链接它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.18754 即可从此页面链接它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.18754 即可从此页面链接它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接它。
相似文章
代理失败聚类改变了我对调试的思考方式
一位开发者分享了在多个代理运行中可视化失败聚类如何改变了他们的调试方法,强调了建立反馈循环的必要性,使代理能够从过去的错误中学习,而不是将失败视为孤立的问题。文章提到了手动变通方法和一个名为BentoLabs的平台,该平台实现了闭环改进。
AgentX - AI Agent 评估框架
AgentX 是一个 AI Agent 评估框架,帮助定位问题并一键修复。
@omarsar0: 新论文来自微软及其同事。大规模调试智能体轨迹具有挑战性。这是一个巧妙的方…
本文介绍了OAT,一种用于基于LLM的智能体系统的轻量级故障归因工具。它仅使用成功轨迹进行训练,并利用神经控制微分方程检测错误步骤,在速度和精度上以数量级优势超越昂贵基线。
@zxlzr: 介绍 MemTrace:让 LLM 记忆系统终于可调试 记忆正在成为AI智能体的核心组成部分。但…
MemTrace 是一个新工具,通过跨多轮追踪记忆操作,使LLM记忆系统变得可调试,解决了当前记忆增强型智能体的黑箱问题。
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。