深度研究Agent在何处出错?Agent轨迹中的跨度级错误定位
摘要
本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - 深度研究代理错在哪里?代理轨迹中的跨度级错误定位
来源:https://huggingface.co/papers/2606.02060
摘要
深度研究代理可以通过一种以声明为中心的框架进行审计,该框架能够识别其推理轨迹中的错误跨度,从而超越仅评估最终答案的可靠性评估。
深度研究代理(https://huggingface.co/papers?q=Deep-research%20agents)通过搜索、工具使用、证据审查和答案综合的长轨迹来解决问题。基于最终答案的评估仅能说明代理是否成功,但无法揭示轨迹中哪些部分导致了答案不可靠。我们专门研究深度研究代理(https://huggingface.co/papers?q=deep-research%20agents)的跨度级错误定位(https://huggingface.co/papers?q=span-level%20error%20localization)。我们收集了来自两个代理框架(https://huggingface.co/papers?q=agent%20frameworks)、三种骨干模型(https://huggingface.co/papers?q=backbone%20models)和三个基准测试的2,790条真实轨迹,将原始日志转换为语义跨度,并通过LLM辅助专家审查(https://huggingface.co/papers?q=LLM-assisted%20expert%20review)标注出有害的错误跨度(https://huggingface.co/papers?q=error%20spans)。基于这些标注,我们构建了TELBench(https://huggingface.co/papers?q=TELBench),一个包含1,000个实例的基准测试,用于在正常探索、失败搜索、暂定假设和无害噪声中识别错误跨度(https://huggingface.co/papers?q=error%20spans)。我们进一步提出DRIFT(https://huggingface.co/papers?q=DRIFT),这是一个以声明为中心的审计(https://huggingface.co/papers?q=claim-centric%20auditing)框架,它追踪代理的声明,检查这些声明在轨迹证据(https://huggingface.co/papers?q=trajectory%20evidence)中的支撑情况,并标记那些因未得到支持或相互矛盾的声明而影响答案路径的跨度。跨模型系列和审计框架的实验表明,DRIFT(https://huggingface.co/papers?q=DRIFT)将跨度级错误定位(https://huggingface.co/papers?q=span-level%20error%20localization)和首次错误准确率提升了最高30个百分点。我们的工作为深度研究代理(https://huggingface.co/papers?q=deep-research%20agents)的可靠性提供了过程级视角。
查看arXiv页面(https://arxiv.org/abs/2606.02060)查看PDF(https://arxiv.org/pdf/2606.02060)项目页面(https://nju-link.github.io/DRIFT/)GitHub4(https://github.com/NJU-LINK/DRIFT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.02060)
在您的代理中获取此论文:
hf papers read 2606.02060
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
请在模型README.md中引用arxiv.org/abs/2606.02060以在此页面建立关联。
引用此论文的数据集 1
NJU-LINK/TELBench 更新于27分钟前 • 49 (https://huggingface.co/datasets/NJU-LINK/TELBench)
引用此论文的Space 0
没有Space关联此论文
请在Space README.md中引用arxiv.org/abs/2606.02060以在此页面建立关联。
包含此论文的收藏 1
相似文章
SearchAuditor:长时程搜索智能体故障的审计与归因
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
自主分析代理的新息残差审计:定位、检测极限、错误控制与可辨识性
本文对自主分析代理的新息残差审计进行了理论分析,研究如何定位代理生成的数据分析中的错误、控制误报,并识别错误归因的根本限制。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。