搜索代理何时该提问:DiscoBench——面向澄清感知的深度搜索基准

arXiv cs.CL 论文

摘要

DiscoBench 是一个新基准,用于评估基于 LLM 的搜索代理能否主动识别用户查询中的歧义、提出澄清性问题,并通过多轮交互恢复正确的推理路径。

arXiv:2606.27669v1 公告类型:新 摘要:基于大型语言模型(LLM)的搜索代理日益被用于解决复杂的信息查找任务,需要多步检索和推理来满足用户目标。然而,现有基准通常假设用户查询是完整且明确的,忽略了现实中的搜索请求常常模糊、不明确,甚至包含事实性错误。在深度搜索场景中,这种歧义会沿着多步推理链传播,导致代理走向错误的搜索路径。为弥补这一空白,我们提出了 DiscoBench,这是一个面向澄清感知的深度搜索基准,旨在评估搜索代理能否主动识别歧义、提出有效的澄清性问题,并通过用户交互恢复正确的推理路径。DiscoBench 包含 211 个样本和 463 个歧义实例,涵盖 11 个真实世界领域和四种歧义类型。我们还设计了一个面向多轮交互的用户模拟器,并从四个维度评估模型性能:任务效用、歧义检测、交互策略和成本效率。在代表性 LLM 上的实验表明,歧义检测和有效澄清是两种不同的能力,而反复搜索而不请求澄清的表现往往比直接猜测更差,突显了当前搜索代理在检索能力与交互式问题解决之间的关键差距。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:23

# 当搜索代理应主动提问:面向澄清感知深度搜索的DiscoBench基准

**来源**: https://arxiv.org/html/2606.27669

Yiling Tao1,2,\*,§, Shihan Deng1,\*, Meiling Tao, Pengzhi Wei1, Zhichao Hu1,†, Zhihao Zhu1,†  
1Hunyuan, Tencent  
2深圳国际研究生院,清华大学  

###### 摘要

基于大语言模型(LLM)的搜索代理越来越多地被用于解决复杂的信息搜寻任务,需要通过多步检索和推理来达成用户目标。然而,现有基准通常假设用户查询完整且明确,忽视了现实世界的搜索请求常常含糊不清、细节不足甚至事实错误。在深度搜索场景中,这种模糊性会沿着多步推理链传播,导致代理误入错误搜索路径。为填补这一空白,我们提出**DiscoBench**——一个面向澄清感知深度搜索的基准,旨在评估搜索代理是否能主动识别模糊性、提出有效的澄清问题,并通过用户交互恢复正确的推理路径。DiscoBench包含211个样本和463个模糊实例,覆盖11个真实世界领域和四种模糊类型。我们进一步设计了用于多轮交互的用户模拟器,并从任务效用、模糊检测、交互策略和成本效率四个角度评估模型性能。对代表性LLM的实验表明,模糊检测与有效澄清是两种不同的能力;而反复搜索而不主动澄清的效果往往比直接猜测更差,凸显了当前搜索代理在检索能力与交互式问题解决之间存在关键差距。

## 1 引言

近年来,基于大语言模型(LLM)的搜索代理在信息检索领域取得了显著进展(Mialon et al., 2023; Wei et al., 2025; Wong et al., 2025)。搜索范式正从传统的静态语料检索转向能够处理复杂目标的自主网络搜索代理(Xie et al., 2025; OpenAI, 2025; Google, 2025)。这些代理可以模拟人类导航和浏览行为,在动态复杂的互联网环境中实现多步推理和信息整合(Wu et al., 2025; Zhou et al., 2024)。

然而,当前范式通常预设用户的初始查询是完整且明确的。这一假设与真实世界中的信息搜寻行为存在显著偏差——用户常因记忆模糊或认知负荷限制而提出含糊或零散的查询(Aliannejadi et al., 2019; Zamani et al., 2020)。在深度搜索场景中,这种偏差的影响被进一步放大。与传统的单跳检索(Kwiatkowski et al., 2019)不同,深度搜索涉及复杂的多步推理链(Trivedi et al., 2022),初始查询中的任何细微模糊都可能导致后续导航和信息整合中出现级联错误,将昂贵的计算资源浪费在错误路径上。如图1所示,未能主动澄清模糊检查点会进一步将错误传播到整个剩余搜索过程中。因此,引入交互式澄清机制来解决模糊性变得尤为重要。同时,搜索任务天然提供强事实基础,使得交互质量和检索正确性都能通过外部证据进行客观验证。这一特性为评估代理在复杂交互环境中识别和解决模糊性的能力提供了可靠信号。

虽然学术界已经认识到查询模糊性和交互的重要性,但现有基准仍难以评估搜索代理的消歧能力。主流检索基准(例如 GAIA(Mialon et al., 2023)、BrowseComp(Wei et al., 2025)、AgentBench(Liu et al., 2024))大多假设查询明确,聚焦于多跳推理,而忽视了主动交互。以模糊性为重点的数据集(例如 AmbigQA(Min et al., 2020)、DEEPAMBIGQA(Ji et al., 2025))主要包含静态场景,缺乏动态交互模拟;而基于交互的基准(例如 IN3(Qian et al., 2024)、UserBench(Qian et al., 2025))则通常局限于封闭沙盒环境,在Web级开放域知识的深度和广度上有所不足。最近的 INTERACTCOMP(Deng et al., 2025)开始涉足搜索交互,但在任务真实性、模糊性在长链推理中的放大效应以及交互方式的自然性方面仍有限制。

为弥补这些差距,我们提出了**DiscoBench**(深度交互搜索与澄清基准)¹¹,一个用于评估搜索代理在多步搜索过程中是否能主动澄清和解决模糊性的基准。与之前主要关注静态查询理解的基准不同,DiscoBench 将模糊性建模为多步搜索轨迹中动态出现的现象。在每个模糊检查点,代理必须主动识别信息不足,并与用户交互以获得有辨别力的线索,而不是依赖直接猜测或封闭选项选择策略。我们在 DiscoBench 上对一组代表性 LLM 进行了实验。结果表明,当前搜索代理仍难以判断何时需要澄清:即使是更强的模型也常常在搜索过程中未能识别模糊性,或未能提出有效的澄清问题。这表明深度交互搜索不仅需要更强的检索和推理能力,还需要更好的模糊性意识和主动澄清策略。

我们的主要贡献如下:

- 我们构建了 **DiscoBench** 基准,将模糊性建模为沿多步推理链传播的动态现象,而非单个查询的静态属性,覆盖了 11 个真实世界领域的 211 个样本和 463 个模糊实例,包含四种模糊类型。
- 我们提出了一个面向多轮交互深度搜索的模糊感知评估框架,以及一个逐步揭示有辨别力线索的用户模拟器,从而实现对模糊检测、澄清有效性和交互成本的统一评估。
- 通过大量实验,我们揭示了模糊检测与有效澄清是两种不同的能力。我们进一步识别出一个主要的失败模式:模型反复继续搜索而不主动澄清,导致成功率低于直接猜测。这一发现强调了需要建立明确连接检索不确定性与用户交互的机制。

## 2 相关工作

### 2.1 网络搜索基准

对搜索代理进行基准测试的努力通常分为两个维度。一支侧重于推理深度,挑战代理在复杂网络层级中导航以完成多跳任务,例如 GAIA(Mialon et al., 2023)和 BrowseComp 系列(Wei et al., 2025; Zhou et al., 2025a; Chen et al., 2025)。另一支则探索信息广度,需要综合大量横向数据,如 PaSa(He et al., 2025)、SPARS(Shi et al., 2025)和 WideSearch(Wong et al., 2025)。补充性的代理基准如 WebArena(Zhou et al., 2024)、VisualWebArena(Koh et al., 2024)、Mind2Web(Deng et al., 2023)和 WebShop(Yao et al., 2022)在真实环境中进一步评估网络导航能力。最近的工作如 DeepWideSearch(Lan et al., 2025)开始涵盖这两个维度。受限于查询完整的假设,这些基准未探索查询模糊性,而这仍是自主搜索的重要方面。

### 2.2 模糊性基准

关于查询模糊性的研究已发展出多种分类。以 AmbiEnt(Liu et al., 2023)为代表的语义和结构模糊性基准研究由语言属性引起的逻辑分歧。在多答案事实模糊性领域,AmbigQA(Min et al., 2020)和 ASQA(Stelmakh et al., 2022)等数据集侧重于将单个查询映射到多个并发有效事实。此外,以 TempAmbigQA(Piryani et al., 2024)、CondAmbigQA(Li et al., 2025)和 SituatedQA(Zhang & Choi, 2021)为代表的条件和情境模糊性基准处理答案依赖于初始查询中未说明的潜在时间或地理背景的场景。这些基准虽有价值,但依赖于静态评估范式,更注重答案识别而非代理与用户协作解决不确定性所需的动态交互过程。

### 2.3 交互式澄清基准

交互式基准在多轮协作环境中评估代理性能。例如,ColBench(Zhou et al., 2025b)和 UserBench(Qian et al., 2025)分别针对代码生成和旅行计划,而 IN3(Qian et al., 2024)和 GAIA2(Froger et al., 2026)则在本地环境中研究隐式意图理解和冲突请求。在对话式 QA 中,Abg-CoQA(Guo et al., 2021)要求代理澄清指代或语义模糊性。虽然 IDRbench(Feng et al., 2026)最近将交互式澄清引入深度研究,但并非为开放域网络搜索场景设计。最相关的是 InteractComp(Deng et al., 2025),它开创了对搜索代理交互式消歧的评估。然而,它仍然包含更多依赖内部知识而非外部检索的场景,主要关注初始实体模糊性而非深度推理中的级联错误。此外,其二元反馈设置无法完全捕捉真实用户交互的描述性。

## 3 任务形式化

我们将多轮交互式检索形式化为一个顺序问答任务,其中代理通过一系列结构化检查点(\(CP\))解决复杂问题 \(q\),并在遇到模糊性时能与用户交互。如图 2 所示,代理必须判断当前检索状态是否模糊,并决定继续检索还是向用户请求澄清。

#### 问题与检查点
每个问题 \(q\) 被分解为一个有序的 \(n\) 个检查点序列 \(\{CP_1, CP_2, \ldots, CP_n\}\),每个检查点代表一个中间检索子目标。检查点 \(CP_i\) 被分配为两种类型之一:

- **无模糊**:明确的检查点,代理可直接通过检索回答。
- **模糊**:包含四种注入模糊类型之一的检查点,导致检索返回多个候选或无有效结果。

#### 代理动作与用户交互
在每个检查点 \(CP_i\),代理可执行三种动作之一:\(a_i \in \{\textsc{Search}, \textsc{Ask}, \textsc{Answer}\}\)  
(1) 对于明确检查点,代理直接发出 \(\textsc{Search}(q_i)\) 并继续 \(\textsc{Answer}(r_i)\)。对于模糊检查点 \(CP_k\),代理应调用 \(\textsc{Ask}(\cdot)\) 请求补充信息,此时用户释放预定义的线索 \(c\)。然后代理优化搜索并解决模糊性,再发出 \(\textsc{Answer}(r^*)\)。

#### 评估
我们从四个方面评估代理:任务效用、模糊检测、交互策略和成本效率。

## 4 数据集构建方法

我们在图 3 中展示了构建流程的概述。

我们构造了 **DiscoBench**,一个交互式模糊问答(QA)基准,旨在评估 LLM 在多轮开放域搜索任务中能否识别模糊性、主动请求澄清并恢复正确的推理轨迹。如图 3 所示,构建流程包括两个阶段:(1) 种子数据准备,构建高质量的多跳推理链;(2) 模糊数据构建,注入模糊性并生成用于交互式消歧的判别性事实。整个流程采用半自动协作框架。

### 4.1 种子数据准备

阶段 1 的目标是构建高质量的多跳种子问题,作为后续模糊注入的基础。

#### 主题与种子收集
我们首先从 11 个深

相似文章

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。

EvoBrowseComp:面向演进知识的搜索代理基准测试

arXiv cs.CL

本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。