深度研究Agent在何处出错?Agent轨迹中的跨度级错误定位

Hugging Face Daily Papers 论文

摘要

本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。

深度研究Agent通过搜索、工具使用、证据检查和答案合成的长轨迹来解决问题。基于最终答案的评估可以显示Agent是否成功,但无法指出轨迹中哪些部分导致答案不可靠。我们研究了深度研究Agent的跨度级错误定位。我们从两个Agent框架、三个骨干模型和三个基准测试中收集了2790条真实轨迹,将原始日志转换为语义跨度,并通过LLM辅助的专家审查标注了有害的错误跨度。基于这些标注,我们构建了TELBench,一个包含1000个实例的基准测试,用于在正常探索、失败搜索、暂定假设和无害噪声中识别错误跨度。我们还提出了DRIFT,一个以声明为中心的审计框架,该框架跟踪Agent的声明,检查其在轨迹证据中的支持度,并标记那些未支持或相互矛盾的声明影响答案路径的跨度。跨模型家族和审计框架的实验表明,DRIFT将跨度级错误定位和首次错误准确率提高了最多30个百分点。我们的工作为深度研究Agent的可靠性提供了过程级视角。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

论文页面 - 深度研究代理错在哪里?代理轨迹中的跨度级错误定位

来源:https://huggingface.co/papers/2606.02060

摘要

深度研究代理可以通过一种以声明为中心的框架进行审计,该框架能够识别其推理轨迹中的错误跨度,从而超越仅评估最终答案的可靠性评估。

深度研究代理(https://huggingface.co/papers?q=Deep-research%20agents)通过搜索、工具使用、证据审查和答案综合的长轨迹来解决问题。基于最终答案的评估仅能说明代理是否成功,但无法揭示轨迹中哪些部分导致了答案不可靠。我们专门研究深度研究代理(https://huggingface.co/papers?q=deep-research%20agents)的跨度级错误定位(https://huggingface.co/papers?q=span-level%20error%20localization)。我们收集了来自两个代理框架(https://huggingface.co/papers?q=agent%20frameworks)、三种骨干模型(https://huggingface.co/papers?q=backbone%20models)和三个基准测试的2,790条真实轨迹,将原始日志转换为语义跨度,并通过LLM辅助专家审查(https://huggingface.co/papers?q=LLM-assisted%20expert%20review)标注出有害的错误跨度(https://huggingface.co/papers?q=error%20spans)。基于这些标注,我们构建了TELBench(https://huggingface.co/papers?q=TELBench),一个包含1,000个实例的基准测试,用于在正常探索、失败搜索、暂定假设和无害噪声中识别错误跨度(https://huggingface.co/papers?q=error%20spans)。我们进一步提出DRIFT(https://huggingface.co/papers?q=DRIFT),这是一个以声明为中心的审计(https://huggingface.co/papers?q=claim-centric%20auditing)框架,它追踪代理的声明,检查这些声明在轨迹证据(https://huggingface.co/papers?q=trajectory%20evidence)中的支撑情况,并标记那些因未得到支持或相互矛盾的声明而影响答案路径的跨度。跨模型系列和审计框架的实验表明,DRIFT(https://huggingface.co/papers?q=DRIFT)将跨度级错误定位(https://huggingface.co/papers?q=span-level%20error%20localization)和首次错误准确率提升了最高30个百分点。我们的工作为深度研究代理(https://huggingface.co/papers?q=deep-research%20agents)的可靠性提供了过程级视角。

查看arXiv页面(https://arxiv.org/abs/2606.02060)查看PDF(https://arxiv.org/pdf/2606.02060)项目页面(https://nju-link.github.io/DRIFT/)GitHub4(https://github.com/NJU-LINK/DRIFT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.02060)

在您的代理中获取此论文:

hf papers read 2606.02060

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型关联此论文

请在模型README.md中引用arxiv.org/abs/2606.02060以在此页面建立关联。

引用此论文的数据集 1

NJU-LINK/TELBench 更新于27分钟前 • 49 (https://huggingface.co/datasets/NJU-LINK/TELBench)

引用此论文的Space 0

没有Space关联此论文

请在Space README.md中引用arxiv.org/abs/2606.02060以在此页面建立关联。

包含此论文的收藏 1

相似文章

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

AgentForesight:多智能体系统中用于早期故障预测的在线审计

arXiv cs.CL

本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。