SearchAtlas:通过证据查询图分析代理搜索策略
摘要
SearchAtlas 是一个框架,它将LLM搜索代理轨迹转换为证据查询图,以分析搜索策略,揭示过程失败并提高超越最终答案准确性的可解释性。
arXiv:2609.10901v1 公告类型:新
摘要:LLM搜索代理通常基于最终答案准确性进行评估,忽略了过程。分析搜索策略需要理解如何检索可信证据以回答问题约束。这些有价值的信息埋藏在冗长且难以解析的原始搜索轨迹中。我们引入了SearchAtlas,一个将搜索轨迹转换为结构化图的框架,其中边表示证据如何在推理轨迹中传播,从检索它的查询到最终答案。我们的自动解析管线在人类标注图上的平均边F1为86.0%,并在重复运行中保持一致。我们在三个基准测试上分析了五个搜索代理,揭示了搜索规模和证据聚合方面的系统性差异。SearchAtlas暴露了碎片化的答案支持、未到达答案的问题约束以及未验证的参数知识进入响应。这些过程失败与错误答案强烈相关,甚至比LLM评判者在给定原始轨迹或有序查询列表时更为明显,表明构建的图提供了有用的可解释性。此外,对过程诊断分数与最终答案正确性不一致的情况的审计表明,它们捕获了无法简化为答案准确性的信息。
查看缓存全文
缓存时间: 2026/09/11 08:18
# SearchAtlas:通过证据查询图分析智能体搜索策略
来源:https://arxiv.org/html/2609.10901
###### 摘要
大型语言模型搜索智能体通常仅以最终答案准确性作为评估标准,忽略了其推理过程。分析搜索策略需要理解如何检索可信证据以满足问题约束条件,但这些关键信息往往被埋藏在冗长且难以解析的原始搜索轨迹中。我们提出 **SearchAtlas** 框架,可将搜索轨迹转化为结构化图,其中的边表示证据在推理链中的传播路径——从检索该证据的查询直至最终答案。我们的自动化解析流水线在人工标注图上的平均边 F₁ 得分达 86.0%,且在重复运行中保持稳定。通过对三个基准测试中的五类搜索智能体进行分析,揭示了它们在搜索规模和证据聚合方面的系统性差异。**SearchAtlas** 能揭示碎片化的答案支撑、未达答案的问题约束以及未经验证的参数化知识进入响应的情况。这些过程性错误与错误答案高度相关——其关联性甚至强于直接使用原始轨迹或有序查询列表的大型语言模型评判。这表明构建的图提供了有效的可解释性。此外,对过程诊断分数与最终答案正确性不一致案例的审计表明,两者所承载的信息无法归结为答案准确性。代码与数据可在 https://github.com/DukeNLP/SearchAtlas 获取。
## 1 引言
搜索智能体能够规划多步网页查询、访问页面,并在长周期内综合答案(Li 等,2025;Team 等,2025b;Team 等,2025a)。现有评估体系大多关注最终答案的正确性(Wei 等,2025;Du 等,2025;Xi 等,2025;Li 等,2026;Gupta 等,2026),侧重结果而非搜索策略。两个智能体在处理同一问题时可能采用截然不同的路径,却在特定基准测试上获得相同准确率。理解这些策略所需的信息存在于搜索轨迹中——轨迹包含智能体的思考过程、行动步骤以及环境反馈。然而轨迹通常按时间顺序扁平化排列,使信息流难以辨识。例如,智能体常采用分支搜索策略:单个检索证据可能影响多个后续查询;反之,多个早期结果也可能被组合以支持一个集中查询。因此我们需要一种能显式表达证据依赖关系的表征方式,从而追溯答案的支撑依据并定位搜索过程的错误环节。
图 1:**SearchAtlas** 将原始搜索轨迹转换为证据查询有向无环图。(a)按时间排列的事件日志隐藏了重复线索、与最终答案无关的冗余搜索、可能重试的失败查询、无明确来源的查询词项以及最终支撑答案的搜索行为。(b)**SearchAtlas** 通过确定性解析日志,将新查询的各部分归因于早期来源,剪除冗余父节点,并锚定答案事实。生成的有向无环图保留每个查询的同时,暴露通往最终答案的证据流,并将标记的问题转化为显式类型化的边。
我们提出 **SearchAtlas**(图 1),将每条轨迹转化为证据依赖的查询间有向无环图。节点代表每个发出的搜索查询,当某个早期查询的检索结果可观测地支持后续查询的形成时,则添加相应边。我们证明这些图可通过确定性预处理自动生成——该流程先解析每个查询的搜索结果和页面访问形成有序推理节点,再通过基于大型语言模型的归因方法确定支撑后续查询及答案事实的早期证据。在 100 个手工标注图上的测试中,该流水线在四个不同大型语言模型上实现了稳定重构,宏观边 F₁ 分数在 0.814 至 0.860 之间。通过将查询节点和证据边聚合为图级统计量,**SearchAtlas** 提供了智能体策略的紧凑结构化剖面。在三个基准测试中来自五类智能体配置的 1,350 条轨迹分析显示,这些剖面揭示了搜索规模和证据聚合方面的系统性差异。例如在 BrowseComp 基准中,TYDP-Qwen3 的节点和边中位数为 6/7,而 MiroThinker 则达到 103/165,反映出后者显著更大的搜索规模。深度、分支因子以及查询综合多个早期结果的频率在不同配置间也存在差异。MiroThinker 的有向无环图深度中位数为 26,而 TYDP-Qwen3 仅为 2;多源查询率从 TYDP-Qwen3 的 8% 到 WebSailor 和 TYDP 的 39% 不等。
此外,这种结构化图表征有助于诊断智能体相对于问题独特约束结构形成有效支撑证据结构的能力。例如,具有序列约束的问题需要解决后续约束所需的中间不确定性,而并行约束问题则可独立验证各约束条件。因此前者要求证据通过聚焦链式路径流动,后者则更倾向直接的证据-答案支撑。具体而言,我们定义了三种答案支撑诊断指标:
- **答案路径拓扑**:衡量证据是否具有预期结构
- **约束锚定**:检测问题需求是否在支撑最终答案的查询中得到解决(而非仅存在于结果未被使用的废弃查询中)
- **先验知识依赖**:标记盲目依赖未经检索验证的大型语言模型参数知识作为答案支撑证据的情况
这些指标共同定位了失配的支撑结构、未使用的约束条件以及针对特定行为的未验证捷径。在不同配置中,具有对齐答案路径拓扑、更强约束锚定和更低先验知识依赖的轨迹通常对应正确答案。通过使用组合诊断分数对智能体的正确与错误轨迹进行排名,我们在各智能体内部计算得到宏观 ROC-AUC 分数为 0.840–0.856。事实上,这些诊断指标比直接使用原始轨迹或有序查询列表的大型语言模型评判提供了更强的正确性信号。这种关联性源于诊断指标能捕捉证据收集与使用中的具体失败模式,但当过程与结果出现偏差时,它们仍能反映过程质量。我们的审计显示:高分错误案例暴露出连贯但指向错误目标的答案支撑结构,而低分成功案例则揭示了不必要的过度搜索或恰好正确的未经验证先验知识依赖。
#### 贡献。
(1)提出 **SearchAtlas** 证据依赖有向无环图表征及经人工标注验证的自动化构建流水线。
(2)在五类搜索智能体和三个基准测试中,刻画了搜索规模与证据聚合的差异,并定义了三种问题类型条件化诊断指标。
(3)证明这些指标能定位过程性错误,提供强于非结构化轨迹基线的正确性信号,并捕捉与最终答案准确性互补的信息。
## 2 相关工作
#### 搜索智能体基准测试与评估
当前搜索智能体基准测试已涵盖真实网页环境和长周期信息检索任务(Mialon 等,2023;Zhou 等,2024;Krishna 等,2024;Wei 等,2025;Xi 等,2025;Chen 等,2025a)。大多数评估标准针对智能体最终输出结果(如任务完成度、答案正确性、引用质量或报告质量),而非其达成过程(Gou 等,2025;Du 等,2025;Li 等,2026)。近期多项研究从不同目的出发更直接地审视过程维度:在训练场景中,DeSA 发现仅奖励答案正确性会导致跳过检索和冗余查询,因此将搜索优化与答案生成分离;Agent-RRM 和 PPR 则用结构化轨迹级信号替代稀疏的结果反馈(Wang 等,2025;Fan 等,2026a;Xu 等,2025)。RE-TRAC 通过汇总累积证据、不确定性和失败来引导后续探索(Zhu 等,2026),其他诊断方法则评分或定位轨迹变得不可靠的位置,暴露出输出级指标无法检测的弱点(Ye 等,2026;Fan 等,2026b;Wang 等,2026;Kim 等,2025)。这些方法将过程视为训练信号或步骤级质量判断,但未分析检索证据如何在单次运行中流动。
#### 智能体与推理过程的图表征
一类研究规范性地使用图或有向无环图结构作为模型扩展的脚手架或执行调度。在推理领域,思维树(Yao 等,2023a)和思维图(Besta 等,2024)在自生成思维中搜索,而 DAG-Math(Dziri 等,2023;Zhang 等,2025b)将数学推理构建为支持多智能体执行的有向无环图。GPTSwarm 和 MacNet 将智能体系统表示为可优化的图或有向无环图拓扑(Zhuge 等,2024;Qian 等,2024),Plan-over-Graph、Flash-Searcher 和 S-DAG 则使用图或有向无环图调度来并行化执行或跨专业智能体路由推理(Zhang 等,2025a;Qin 等,2025;Dong 等,2026)。
#### 执行轨迹的事后图恢复
另一类描述性方法从执行轨迹中事后恢复图结构。ReasoningFlow(Lee 等,2025)将大型推理模型的推理轨迹解析为语义类型化有向无环图,以刻画规划、反思和回溯等模式;Graph of Verification(Fang 等,2026)从思维链输出中恢复形式化有向无环图,并从最小化论证前提验证每个节点;WebGraphEval(Qian 等,2025)更接近我们的场景,因其处理网页智能体轨迹。但它将多次运行的操作聚合为共识图,而 **SearchAtlas** 一次处理一条搜索智能体轨迹。其边以可归因的检索证据(如重用片段、访问页面或显式失败声明)为依据,这使得图成为外部证据流的归因对象,而非内部推理或共享导航行为的表征。
## 3 SearchAtlas
本节描述 **SearchAtlas** 如何将智能体查询、推理和工具结果的原始搜索日志,转换为编码最终答案证据结构的有向无环图。
### 3.1 图定义
假设轨迹按时间顺序包含 N 个搜索查询。我们将其可观测的证据流表示为类型化有向图 G=(V,E),其中
V={q₀,PK,A}∪Q,
Q={q₁,...,qₙ},
(1)
q₀ 为原始问题,qᵢ 为第 i 个发出的查询及其检索结果和访问页面,PK 是未归因先验知识的源节点,A 为智能体最终答案。每条边 (u,v)∈E 表示 u 处的内容可观测地贡献于 v。这些边可分为四类:
- **约束使用边** (q₀→qᵢ):表示查询 qᵢ 直接针对原始问题的某项要求。
- **证据使用边** (qᵢ→v):标记后续查询或最终答案 v 依赖于 qᵢ 检索的事实。
- **失败响应边** (qᵢ→qⱼ):当查询 qⱼ 响应明确失败或不足的早期搜索 qᵢ 时添加,涵盖零结果、页面拦截等硬性失败及智能体判定检索结果不足的软性失败。
- **先验知识边** (PK→v):标记查询或答案 v 中既非来自 q₀ 也非来自早期查询检索证据的内容,其中 v∈{qᵢ₊₁,...,qₙ,A}。
对于查询间边,仅当早期查询的检索内容有助于形成后续查询时才建立连接。若多个候选提供重叠支撑(即相同事实),则保留能共同解释后续查询受早期检索支持部分的最小集合,避免冗余边。对于指向最终答案的边,我们采用更细粒度的归因:先将 A 拆分为事实单元(如名称、日期、数字、缩写等关键片段),再对每个单元使用类似流程识别最小支撑查询集合。每个保留的查询获得 qᵢ→A 边。我们将这些**直接答案支撑查询**记为 Qₐₙₛ={qᵢ∈Q:(qᵢ,A)∈E}。更广义地,若证据使用边位于通往 A 的有向路径上,则称为**可达答案边**。若答案单元无检索支撑,则连接 PK→A。
### 3.2 自动化解析与验证
为每个搜索轨迹手工构建有向无环图是阻碍大规模评估的繁重劳动。我们证明可通过准确的自动化图解析实现该流程。具体采用两阶段流水线:确定性预处理处理可直接从轨迹提取的信息,基于大型语言模型的归因方法解决需要语义解释的证据依赖问题。
(*译文截断,后续内容待补充*)相似文章
SearchAuditor:长时程搜索智能体故障的审计与归因
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
自主代理搜索模型(5分钟阅读)
自主代理搜索模型是专门为编排搜索任务而训练的LLM,相比GPT-5等通用模型,它们提供更小、更快且领域特定的替代方案。这些模型通过让智能模型管理整个检索过程,解构了传统的单体搜索栈。
迭代优化搜索:用于评估电商中智能搜索架构的双智能体模拟框架
eBay的这篇论文提出了一个模块化的双智能体模拟框架,用于评估对话式购物助手架构,能够对响应器设计进行受控比较。关键发现包括:滚动窗口内存在速度上比意图提取内存快35%,系统性故障分析将故障率降低了62%。
@jerryjliu0: 智能体搜索已从固定的RAG管道转向灵活的智能体框架,并接入一系列搜索工具:k…
LlamaIndex 推出了基于 LlamaParse Index 的智能体检索,结合语义搜索和 grep,构建灵活的智能体框架。6月30日的网络研讨会将演示这些工具。
相同准确率,不同证据:搜索API作为工具型代理的决策表面
本文认为,为工具型代理服务的商业搜索API应被评估为决策表面——即在预获取证据状态下决定代理行为——而非仅仅依据答案准确率。通过固定代理和三个提供商,本文表明,尽管准确率相似,但证据经济性和矛盾比率差异显著,使得提供商选择成为检索预算和政策决策。