SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI 论文

摘要

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

arXiv:2608.05212v1 公告类型:新 摘要:深度搜索智能体通过长时间跨度的网络交互来应对具有挑战性的问题,这一过程既复杂又脆弱:小的推理错误可能会在漫长而嘈杂的轨迹中传播,最终形成流畅但错误的答案。诊断此类故障十分困难,需要人工检查极其冗长的执行轨迹,这可能超出人类的能力范围。为此,我们引入了SearchAuditBench,一个评估LLM审计员能否定位、归因并修复这些故障的基准,从而减轻人类负担。SearchAuditBench包含1,243条失败轨迹,平均每条轨迹包含73.1条消息和65.1K个token,这些轨迹来自八个开源权重模型在五个深度搜索基准上的运行结果,每条轨迹都有专家标注的关键错误步骤、搜索特定的根本原因以及带评分标准的参考修复方案。我们进一步提出了SearchAuditor,一种多视角审计框架,通过基于证据的裁决来有效定位、归因并修复搜索智能体的故障。实验结果表明,即使是最强的基线方法,在使用GPT-5.5等前沿模型驱动时,端到端通过率也仅为26.6%。相比之下,我们的SearchAuditor在不同前沿模型上均持续优于所有基线,实现了32.3%的端到端通过率,并且使用其修复方案恢复失败的运行,能够帮助智能体更好地从错误中恢复。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:45

# 长程搜索智能体中的失败审计与归因

来源:https://arxiv.org/html/2608.05212

Zhixiang Liang\equalcontrib1,2, Yifei Liu\equalcontrib2, Yidan Huang2, Haozhe Zhao1, Beichen Huang1, Jiaqi Wang2, Nan Duan2, Qiong Cao2\corresponding

###### 摘要

深度搜索智能体通过长程网络交互来解答具有挑战性的问题,这一过程既复杂又脆弱:微小的推理错误可能会沿着冗长而嘈杂的轨迹传播,最终形成流畅但错误的答案。

相似文章

AgentForesight:多智能体系统中用于早期故障预测的在线审计

arXiv cs.CL

本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。

长周期研究智能体的搜索纪律

arXiv cs.AI

本文识别了长周期研究智能体中的一种失败模式:优化聚合指标可能选出提升核心数字但破坏关键子群体(反转)的候选项。它提出了一种搜索纪律协议,该协议使用一个外部控制环路,基于候选项的分解行为而非得分进行审计。

LoHoSearch:超越人类难度上限的长时域搜索智能体基准

arXiv cs.CL

LoHoSearch是一个用于评估长时域搜索智能体的新基准,基于包含700万维基百科实体的知识图谱构建。它引入了具有大搜索空间和结构复杂性的问题,以超越人类编写的难度上限,并显示出最佳模型仅达到34.74%的准确率。

审计智能体执行框架安全性

arXiv cs.CL

本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。