@omarsar0: 一篇令人印象深刻的论文,展示了首次检索步骤对深度研究代理的重要性。它有助于提升 GPT-5.…

X AI KOLs Timeline 论文

摘要

本文介绍了 Question's Gambit,一个首次移动检索模块,通过分解问题并提供排名上下文来提高深度研究代理在迭代搜索前的性能,在 BrowseComp-Plus 上显示出显著的准确率提升。

一篇令人印象深刻的论文,展示了首次检索步骤对深度研究代理的重要性。 它帮助将 GPT-5.5 在 BrowseComp-Plus 上的性能从 83.1% 提升到 90.5%,使用相同的检索器和相同的代理循环。 似乎这种提升来自初始上下文。 作者提出了 Question's Gambit,它在代理开始搜索之前运行一次。 它将问题分解成线索,将每个线索转化为互补搜索,汇集结果并重新排名。 然后,代理在上下文中已有该排名集的情况下开始其循环。 同样的改变将 GPT-5.4-mini 从 68.1% 提升到 79.0%,将 DeepSeek-v4-pro 从 71.4% 提升到 76.9%,并大致将 GPT-5.5 的校准误差减半。每个问题额外花费 2.3 到 5.3 次工具调用。 在错误分析中,79 个剩余的 GPT-5.5 错误中只有 3 个来自从未被检索到的黄金文档。其他 76 个发生在之后,当代理预览、打开或使用证据时。 论文:https://arxiv.org/abs/2609.14412 与论文对话:https://academy.dair.ai/papers/questions-gambit-the-first-move-matters-in-agentic-deep-search-2609.14412…
查看原文
查看缓存全文

缓存时间: 2026/09/22 16:03

这篇令人印象深刻的论文展示了首个检索步骤对深度研究智能体的重要性。

它在不更换检索器和智能体循环结构的前提下,将GPT-5.5在BrowseComp-Plus上的得分从83.1%提升至90.5%。

这种提升似乎源于初始上下文的优化。

作者提出了名为“问题的第一着”的方法,在智能体开始搜索前运行一次。

该方法将问题分解为多个线索,为每个线索设计互补检索策略,合并检索结果后重新排序。

智能体随后基于这个已排序的结果集开始其迭代搜索循环。

同样的改动使GPT-5.4-mini从68.1%提升至79.0%,DeepSeek-v4-pro从71.4%提升至76.9%,并将GPT-5.5的校准误差降低近一半。每增加2.3到5.3次工具调用即可实现这些提升。

在错误分析中,GPT-5.5剩余的79个错误中,仅有3个源于目标文档从未被检索到。其余76个错误发生在后续阶段——智能体预览、打开或使用证据时。

论文地址:https://arxiv.org/abs/2609.14412

对话论文:https://academy.dair.ai/papers/questions-gambit-the-first-move-matters-in-agentic-deep-search-2609.14412…


问题的第一着:智能体深度搜索中的首步定乾坤

来源:https://arxiv.org/html/2609.14412 阿明·比格德利 | 单位:滑铁卢大学;内加尔·阿拉布扎德 | 单位:加州大学伯克利分校;萨贾德·易卜拉欣 | 单位:多伦多大学;查尔斯·L·A·克拉克 | 单位:滑铁卢大学;本杰明·C·M·方 | 单位:麦吉尔大学;易卜拉欣·巴盖里 | 单位:多伦多大学

摘要

深度研究智能体通过搜索、阅读和推理的迭代循环来回答复杂问题。近期在BrowseComp-Plus等推理密集型基准测试的研究表明,配置良好的词汇检索能够呈现高质量证据,但智能体仍可能无法将承载证据的文档与目标文档建立关联。我们发现深度研究智能体的首次检索动作是该场景下的关键设计决策。我们提出了问题的第一着——一个首次检索模块,该模块在智能体开始迭代搜索-推理过程之前,将问题分解为线索集,将其重构为互补检索,合并检索结果,并对候选集进行重排序。这构建了一个初始上下文,旨在支持线索聚合与最终答案验证。我们进一步在MultiHop-RAG上评估,以验证这些优势能否超越BrowseComp-Plus,迁移至更传统的多跳问题结构。BrowseComp-Plus上的实验表明,问题的第一着相比强基线提升了检索召回率和下游智能体准确率,在使用gpt-5.5时,将答案准确率从83.1%提升至90.5%,相比已报告的最强智能体基线Pi-Serini实现了显著提升。我们的结果证实,有效的智能体深度研究不仅依赖于循环内部的可用工具,更取决于首步行动的质量。我们已在以下地址公开实现代码:https://github.com/radinhamidi/Question-s-Gambit。

1 引言

随着大语言模型作为工具使用者的能力日益增强,信息获取正转向迭代式、多步骤的检索工作流。在这些工作流中,LLM智能体交替进行搜索、阅读和推理,基于已收集的证据决定下一步检索内容(Yao等人,2023;Schick等人,2023;Zhang等人,2025a;Chen等人,2026)。这一范式支持着一类日益增长的智能体系统,旨在解决推理密集型任务——对于这类任务,回答单个问题可能需要在大规模语料库上执行数十次搜索和阅读操作(Huang等人,2025;Patel等人,2026;Chen等人,2025)。随着这些系统的成熟,其有效性越来越取决于智能体如何高效利用有限的交互预算来构造成效显著的检索,并收集能导向正确答案的证据。

许多困难源于问题本身的结构。与许多传统的多跳问题不同(Yang等人,2018;Ho等人,2020),后者通常围绕相对清晰的支撑事实序列组织,而推理密集型问题往往是多线索的:它们结合了异构信号,如部分描述、日期、地点、标题和机构信息,这些信号共同约束答案,却不构成线性的推理路径。

我们将这些异构信号形式化为线索:约束答案的不同信息片段,可作为证据检索的独立单元。线索嵌入在原始问题中,它们与答案的相关性以及彼此之间的关系是隐式的。因此,解决这类问题需要广泛的线索覆盖和跨文档验证。智能体必须识别线索,检索支撑证据,连接跨文档信息,并验证候选答案是否满足问题中表达的所有约束。附录A中的表8展示了一些代表性示例问题。

这种结构使得首次检索的上下文显得尤为重要。一组精心策展的种子文档可以覆盖多个线索,早期暴露相关证据,并帮助智能体形成对问题信息需求的初步理解。相反,薄弱的种子会造成冷启动,可能将智能体引向无关的路径。一旦发生这种情况,恢复的成本会越来越高。噪声上下文累积,需要花费额外的搜索和阅读操作来修正轨迹,而答案所需的证据则更难浮现。

重要的是,此场景的瓶颈并非简单在于能否检索到相关证据。例如,在BrowseComp-Plus上,配置良好且深度足够的词汇检索器已经能为强智能体呈现高质量证据(Hsu等人,2026)。挑战在于智能体如何有效地将这种访问转化为有用的证据。先前的轨迹分析显示,智能体常常低效地使用其预算:发出的搜索遗漏了答案相关文档,积累了杂乱的上下文,重复了早期的查询,并在单次宽泛搜索中塞入了太多约束(Yi等人,2026;Hsu等人,2026;Meng等人,2026)。我们通过将线索作为显式检索单元来解决这一冷启动问题。我们不是以单个过载的问题级搜索开始,而是将问题分解为线索,并利用每个线索指导定向的证据收集。

为了减少这种浪费的预算,我们引入了“问题的第一着”,一个为深度研究智能体提供热启动的首次检索模块。它在迭代搜索开始前构建一个紧凑的初始上下文。该模块将问题分解为单个线索,使用基于语料库的反馈扩展每个线索,为每个线索检索单独的候选列表,然后根据完整问题合并并重排得到的候选池。最终的初始上下文是逐个线索收集,但作为一个整体进行评估(图1)。该模块无需重新训练智能体或检索器,也不会改变后续的搜索循环。智能体无需在初始阶段花费时间寻找立足点,而是可以用剩余预算来填补未解决的证据缺口。

这种首步框架将“问题的第一着”与两种相近的替代方案区分开来。循环内规划和查询重构试图通过额外的交互轮次来恢复问题的潜在结构(Meng等人,2026);而“问题的第一着”则在循环开始前以一次性成本揭示该结构。与一次性分解-检索流水线不同,它不会替代迭代搜索。它只改变智能体的初始观察,随后的原始循环照常进行。

我们通过将“问题的第一着”集成到最先进的智能体深度研究框架Pi-Serini(Hsu等人,2026)中,在BrowseComp-Plus上对其进行了评估。在保持底层检索器和框架其余部分不变的情况下,“问题的第一着”将GPT-5.5的答案准确率从83.1%提升至90.5%,绝对增益为7.4个百分点,并且DeepSeek-v4-pro和GPT-5.4-mini也得到了一致的提升。这些提升伴随着整个检索轨迹中更高的召回率,从呈现的证据,到智能体预览的内容,再到最终阅读的内容,并且实现这些提升所需的搜索调用次数与先前强智能体的水平相当。为检验这些优势是否能在BrowseComp-Plus之外保持稳健和稳定,我们进一步在MultiHop-RAG(Tang和Yang,2024)上评估了该模块。总之,我们做出了以下贡献:

  • 我们将线索形式化为推理密集型问题的显式检索单元,并阐述了缺乏此类结构如何导致深度搜索智能体的冷启动效率低下。
  • 我们提出了“问题的第一着”,一个线索感知的首次检索模块,它在无需重新训练或修改后续智能体循环的情况下构建温暖的初始上下文。
  • 我们表明,这种首次检索干预在BrowseComp-Plus上、在不同LLM智能体间以相当的智能体搜索成本产生了巨大且一致的准确率提升,并在MultiHop-RAG控制基准测试上表现出稳健且稳定的迁移效果。

图1:“问题的第一着”概述。该模块作为智能体的首次检索动作运行一次,将问题分解为线索,检索并合并每个线索的结果,重排候选池,并在标准ReAct循环继续之前返回一个精选的前-k初始上下文。文档片段上的勾号表示证据文档,即回答问题所需的文档。

2 相关工作

智能体搜索。

LLM越来越多地被用作结合推理与外部工具使用的智能体,例如ReAct(Yao等人,2023)。最近的基准测试如BrowseComp和BrowseComp-Plus通过需要智能体从大型文档集合中迭代检索、检查和综合证据的复杂搜索任务来评估这种场景(Wei等人,2025;Chen等人,2025)。先前的工作通常通过在智能体循环内添加更强的检索器、重排器或其他工具来改进智能体工作流(Schick等人,2023;Chen等人,2026;Sharifymoghaddam和Lin,2026)。相比之下,“问题的第一着”专注于智能体的首次检索动作:它不是为智能体添加另一个可选的同级工具,而是在迭代过程展开之前准备一个线索感知的候选池。

针对推理密集型查询的重排序。

检索-重排序流水线在RAG中被广泛使用,通常依赖交叉编码器对第一阶段的检索结果进行重排(Nogueira和Cho,2019;Nogueira等人,2020;Zhuang等人,2026;Sun等人,2023;Cai等人,2025)。然而,推理密集型查询通常是长篇的、叙述性的且包含多线索的,因此仅从原始问题检索的候选集可能无法为重排器提供合适的排序池。近期研究表明,重排深度、查询重构和排序配置会对复杂智能体查询的检索和下游答案质量产生显著影响(Sharifymoghaddam和Lin,2026;Meng等人,2026)。我们的工作与这条研究路线相辅相成。我们没有提出新的重排器,而是改变了重排器所看到的内容。“问题的第一着”通过合并从各个线索检索到的候选文档,而非仅从原始问题或单一重构中检索,来扩展重排序池。我们表明,针对完整问题重排这个线索多样化的池子,比仅使用问题级或重构检索能产生更强的初始上下文。

3 方法论

3.1 问题形式化

给定一个复杂问题 (q) 和一个语料库 (\mathcal{D}),任务是生成一个答案 (y),该答案与参考答案 (y^{\star}) 匹配。我们将此类问题描述为固有的多线索:每个问题包含一个潜在的异构信息元素集合,如部分描述、日期、地点、标题或机构信息,这些元素共同约束答案。各个线索可能由不同的文档支撑,所需的证据分散在语料库中。因此,回答需要识别这些线索,检索其支撑证据,并整合跨文档信息,而不是定位直接包含答案的单个段落。

为了解决此任务,深度搜索智能体使用通过其策略 (\pi_{\theta}) 行事的大语言模型 (\mathcal{S}{\theta}),制定自己的文本查询 (x),并将其提交给检索器工具 (\mathcal{R}),后者返回一个文档的排序列表。智能体在ReAct风格的循环中运行(Yao等人,2023),在每一轮 (t) 中,它生成一个关于其剩余信息需求的推理轨迹 (r{t}),选择一个动作 (a_{t}),并接收一个观察 (o_{t})。每个动作都是一个工具调用,例如通过 (\mathcal{R}) 发出搜索或阅读检索到的文档,环境执行该动作并返回 (o_{t})。这些步骤形成交互轨迹: [ H_{t}=(r_{1},a_{1},o_{1},\dots,r_{t},a_{t},o_{t}), ] 其中每一步都基于到目前为止的历史条件从策略中采样: [ (r_{t},a_{t})\sim\pi_{\theta}(\cdot\mid H_{t-1}), ] 且 (H_{0}=\emptyset)。循环持续进行,直到智能体输出最终答案 (y) 或耗尽其预算。

因此,智能体每个问题都从冷状态开始。在空的历史下,其最初的查询仅由问题本身生成,而复杂问题的整体阅读往往会产生混合了多个线索的搜索。如果这些早期搜索仅呈现了部分线索的证据,智能体可能被引向不完整的假设,并花费后续轮次跟踪该假设。由于每个动作都以 (H_{t-1}) 为条件,在大多数相关证据被看到之前,最早的检索就已经塑造了整个轨迹。

3.2 问题的第一着

受到这种冷启动问题的启发,我们引入了“问题的第一着”,一个首次检索模块,旨在为

相似文章