SearchAuditor:长时程搜索智能体故障的审计与归因
摘要
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
arXiv:2608.05212v1 公告类型:新
摘要:深度搜索智能体通过长时间跨度的网络交互来应对具有挑战性的问题,这一过程既复杂又脆弱:小的推理错误可能会在漫长而嘈杂的轨迹中传播,最终形成流畅但错误的答案。诊断此类故障十分困难,需要人工检查极其冗长的执行轨迹,这可能超出人类的能力范围。为此,我们引入了SearchAuditBench,一个评估LLM审计员能否定位、归因并修复这些故障的基准,从而减轻人类负担。SearchAuditBench包含1,243条失败轨迹,平均每条轨迹包含73.1条消息和65.1K个token,这些轨迹来自八个开源权重模型在五个深度搜索基准上的运行结果,每条轨迹都有专家标注的关键错误步骤、搜索特定的根本原因以及带评分标准的参考修复方案。我们进一步提出了SearchAuditor,一种多视角审计框架,通过基于证据的裁决来有效定位、归因并修复搜索智能体的故障。实验结果表明,即使是最强的基线方法,在使用GPT-5.5等前沿模型驱动时,端到端通过率也仅为26.6%。相比之下,我们的SearchAuditor在不同前沿模型上均持续优于所有基线,实现了32.3%的端到端通过率,并且使用其修复方案恢复失败的运行,能够帮助智能体更好地从错误中恢复。
查看缓存全文
缓存时间: 2026/08/07 07:45
# 长程搜索智能体中的失败审计与归因 来源:https://arxiv.org/html/2608.05212 Zhixiang Liang\equalcontrib1,2, Yifei Liu\equalcontrib2, Yidan Huang2, Haozhe Zhao1, Beichen Huang1, Jiaqi Wang2, Nan Duan2, Qiong Cao2\corresponding ###### 摘要 深度搜索智能体通过长程网络交互来解答具有挑战性的问题,这一过程既复杂又脆弱:微小的推理错误可能会沿着冗长而嘈杂的轨迹传播,最终形成流畅但错误的答案。
相似文章
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
AgentAudit:一个用于 AI 代理全生命周期信任评估的开放、可扩展框架
AgentAudit 是一个开放且可扩展的框架,用于评估 AI 代理在能力、基础、安全和行为维度的全生命周期,实现精确的故障归因并突出不同语言模型之间的可信度差异。
深度研究Agent在何处出错?Agent轨迹中的跨度级错误定位
本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。
根因归因是一个搜索问题:针对长期代理失败的持续搜索
本文介绍了持续搜索(Continual Search),这是一个迭代框架,通过在长期执行痕迹中搜索诊断证据来增强AI代理失败的根因归因,并在包括MegaRCA-Mix在内的基准测试中进行评估,显示出显著的性能提升。
长周期研究智能体的搜索纪律
本文识别了长周期研究智能体中的一种失败模式:优化聚合指标可能选出提升核心数字但破坏关键子群体(反转)的候选项。它提出了一种搜索纪律协议,该协议使用一个外部控制环路,基于候选项的分解行为而非得分进行审计。