SearchAuditor:长时程搜索智能体故障的审计与归因
摘要
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
查看缓存全文
缓存时间: 2026/08/07 07:45
# 长程搜索智能体中的失败审计与归因 来源:https://arxiv.org/html/2608.05212 Zhixiang Liang\equalcontrib1,2, Yifei Liu\equalcontrib2, Yidan Huang2, Haozhe Zhao1, Beichen Huang1, Jiaqi Wang2, Nan Duan2, Qiong Cao2\corresponding ###### 摘要 深度搜索智能体通过长程网络交互来解答具有挑战性的问题,这一过程既复杂又脆弱:微小的推理错误可能会沿着冗长而嘈杂的轨迹传播,最终形成流畅但错误的答案。
相似文章
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
深度研究Agent在何处出错?Agent轨迹中的跨度级错误定位
本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。
长周期研究智能体的搜索纪律
本文识别了长周期研究智能体中的一种失败模式:优化聚合指标可能选出提升核心数字但破坏关键子群体(反转)的候选项。它提出了一种搜索纪律协议,该协议使用一个外部控制环路,基于候选项的分解行为而非得分进行审计。
LoHoSearch:超越人类难度上限的长时域搜索智能体基准
LoHoSearch是一个用于评估长时域搜索智能体的新基准,基于包含700万维基百科实体的知识图谱构建。它引入了具有大搜索空间和结构复杂性的问题,以超越人类编写的难度上限,并显示出最佳模型仅达到34.74%的准确率。
审计智能体执行框架安全性
本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。