通过并行搜索与显式合并扩展检索增强推理

arXiv cs.AI 论文

摘要

介绍了MultiSearch,一种基于强化学习的框架,该框架在每一步推理中生成多个查询,并显式合并检索到的信息,以提高问答任务中的信噪比和推理准确性。

arXiv:2605.13534v1 公告类型:新 摘要:深度搜索智能体已被证明能通过在多步推理中检索外部知识来有效增强大语言模型。然而,现有方法通常在每一步推理中仅生成单个查询进行检索,这限制了信息覆盖范围并引入了大量噪声。这可能导致搜索中信噪比(SNR)偏低,从而降低推理准确性并产生不必要的推理步骤。本文提出了MultiSearch,一种基于强化学习的框架,通过多查询检索和显式合并检索信息来解决这些局限。在每一步推理中,MultiSearch从多个视角生成查询,并行检索外部信息,从而扩大相关信息范围,并降低对单一检索结果的依赖。随后,智能体在合并过程中整合并精炼检索到的信息,提升信噪比,确保更准确的推理。此外,我们提出了一种结合多进程奖励设计的强化学习框架,以优化智能体同时具备多查询检索与信息整合能力。在七个基准上的大量实验表明,MultiSearch优于基线方法,提升了检索的信噪比,并在问答任务中改进了推理性能。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:16

# 扩展检索增强推理:并行搜索与显式合并 来源:https://arxiv.org/html/2605.13534 Jiabei Liu1\*, Wenyu Mao1\*, Junfei Tan1, Chunxu Shen2†\{\\dagger\}, Lingling Yi2, Jiancan Wu1†\{\\dagger\}, Xiang Wang1†\{\\dagger\}, 1中国科学技术大学 2腾讯微信技术架构部 \* 同等贡献。† 通讯作者。 ###### 摘要 深度搜索代理已被证明能够通过在多步推理过程中检索外部知识来有效增强LLM。然而,现有方法通常在每一步推理中只生成单个查询进行检索,这限制了信息覆盖范围并引入了大量噪声。这可能导致搜索过程中的信噪比(SNR)较低,降低推理准确性并导致不必要的推理步骤。在本文中,我们介绍MultiSearch,一个基于强化学习(RL)的框架,通过多查询检索和检索信息的显式合并来解决这些限制。在每一步推理中,MultiSearch从多个视角生成查询并并行检索外部信息,扩大了相关信息范围并减少了对单一检索结果的依赖。然后,代理在合并过程中整合并精炼检索到的信息,从而提高信噪比并确保更准确的推理。此外,我们提出了一种具有多过程奖励设计的强化学习框架,以优化代理在多查询检索和信息整合方面的能力。在七个基准上的广泛实验表明,MultiSearch优于基线方法,增强了检索的信噪比并提高了问答任务中的推理性能。 ## 1 引言 大型语言模型(LLM)在理解和推理方面表现出了强大的能力[1](https://arxiv.org/html/2605.13534#bib.bib1)。然而,在知识密集型任务中,它们因其对静态内部知识的依赖而受到限制[2](https://arxiv.org/html/2605.13534#bib.bib2), [3](https://arxiv.org/html/2605.13534#bib.bib3)。检索增强生成(RAG)通过使LLM能够在生成过程中访问外部知识来缓解这一限制[4](https://arxiv.org/html/2605.13534#bib.bib4), [5](https://arxiv.org/html/2605.13534#bib.bib5)。对于复杂问题,单次检索步骤通常是不够的,因为回答问题所需的信息可能依赖于中间的推理状态。这促使了深度搜索代理的发展,这些代理在多步推理过程中检索外部知识,并使用检索到的信息支持后续推理[6](https://arxiv.org/html/2605.13534#bib.bib6), [7](https://arxiv.org/html/2605.13534#bib.bib7), [8](https://arxiv.org/html/2605.13534#bib.bib8), [9](https://arxiv.org/html/2605.13534#bib.bib9)。 大多数现有的深度搜索方法遵循ReAct式的“边推理边检索”范式[10](https://arxiv.org/html/2605.13534#bib.bib10), [11](https://arxiv.org/html/2605.13534#bib.bib11), [12](https://arxiv.org/html/2605.13534#bib.bib12), [13](https://arxiv.org/html/2605.13534#bib.bib13), [14](https://arxiv.org/html/2605.13534#bib.bib14), [15](https://arxiv.org/html/2605.13534#bib.bib15)。在每一步推理中,代理根据其当前的推理状态生成一个搜索查询,从外部知识源检索top-k个相关文档,并将检索到的信息整合到上下文中用于后续推理。这个过程重复进行,直到代理收集到足够的信息来给出最终答案。为了优化这个多步骤过程,最近的基于强化学习(RL)的方法将搜索引擎建模为环境的一部分,并在采样的推理和搜索轨迹上训练代理[13](https://arxiv.org/html/2605.13534#bib.bib13), [16](https://arxiv.org/html/2605.13534#bib.bib16)。策略通常通过结果级别的奖励(例如最终答案正确性)进行更新,这促进了更好的查询生成、工具使用和最终问答性能。 尽管有效,但这种范式可能限制用于推理的中间检索的质量。特别是,我们发现了两个关键限制: - **检索信噪比低。** 在每一步推理中,现有方法通常依赖单个检索查询,这仅捕获了当前信息需求的一种表述。对于涉及多个实体、关系或子问题的多跳或复杂问题,这可能只检索到部分信息。此外,如果生成的查询不够明确、模糊或与语料库不匹配,检索到的top-k个文档可能包含不相关或噪声内容。由此导致的有用信息缺乏和噪声存在会降低中间推理上下文中的信噪比(SNR),降低推理准确性或导致不必要的搜索步骤,如图1(a)中单查询失败示例所示。 - **细粒度监督不足。** 最近基于RL的深度搜索方法通常使用结果级别的奖励(如最终答案正确性)进行优化,有时辅以格式或工具使用奖励[12](https://arxiv.org/html/2605.13534#bib.bib12), [13](https://arxiv.org/html/2605.13534#bib.bib13), [16](https://arxiv.org/html/2605.13534#bib.bib16)。然而,这些奖励对“边推理边检索”过程中的中间行为提供的反馈有限。特别是,当引入中间机制来提高检索质量并减少噪声时,仅靠结果级别的监督可能是不够的,因为它提供的指导有限,无法判断代理是否检索到了足够的有用信息,并将其整合为可靠的推理上下文。这促使了一种多过程奖励设计,能够为检索和信息整合提供有针对性的监督,如图1(b)所示。 参见图注 图1:经典深度搜索方法与MultiSearch的比较。(a) 以前串行的单查询检索可能受到噪声信息的影响,并消耗更多推理步骤。MultiSearch采用多查询检索与显式合并,以更少的步骤捕获更全面的信息。(b) 在先前方法的基础上,MultiSearch引入了更具针对性的奖励,以实现细粒度监督。 为了解决这些限制,我们提出了MultiSearch,一个基于强化学习的框架,通过多查询检索和检索信息的显式合并来改进“边推理边检索”。在每一步推理中,MultiSearch从多个视角生成查询,包括改写、概念扩展和问题分解,并并行检索外部信息。这扩大了相关信息范围,并减少了对任何单一检索结果的依赖。然后,代理通过显式的合并步骤整合并精炼检索到的信息,提高中间检索的信噪比,以用于后续推理。为了训练代理有效使用这些机制,我们为强化学习引入了一种多过程奖励设计。除了用于最终答案正确性的结果奖励外,我们还使用一个多查询奖励来鼓励使用多个查询进行检索,以及一个合并奖励来鼓励信息整合以获得高信噪比。这些过程级别的奖励为中间的检索和合并行为提供了有针对性的监督。我们使用组奖励解耦归一化策略优化(GDPO)[17](https://arxiv.org/html/2605.13534#bib.bib17)来优化由此产生的多奖励目标,该方法在将异质奖励信号用于策略优化之前分别对其进行归一化。 我们使用Qwen2.5-3B/7B Base和Instruct骨干训练MultiSearch,并在七个QA基准上进行评估,包括三个单跳数据集[18](https://arxiv.org/html/2605.13534#bib.bib18), [19](https://arxiv.org/html/2605.13534#bib.bib19), [20](https://arxiv.org/html/2605.13534#bib.bib20)和四个多跳数据集[21](https://arxiv.org/html/2605.13534#bib.bib21), [22](https://arxiv.org/html/2605.13534#bib.bib22), [23](https://arxiv.org/html/2605.13534#bib.bib23), [24](https://arxiv.org/html/2605.13534#bib.bib24)。MultiSearch在比较的基线方法[11](https://arxiv.org/html/2605.13534#bib.bib11), [13](https://arxiv.org/html/2605.13534#bib.bib13), [15](https://arxiv.org/html/2605.13534#bib.bib15), [16](https://arxiv.org/html/2605.13534#bib.bib16)中取得了最佳平均性能。实验结果表明,代理逐步学会了发出多个检索查询并生成更高信噪比的合并信息,这表明所提出的奖励设计鼓励了预期的中间行为。消融研究进一步验证了多查询检索、显式合并以及相应奖励对整体性能的贡献。 ## 2 方法 参见图注 图2:MultiSearch的训练框架。(a) 一个问答示例,包括思考、多查询搜索、信息、合并和回答步骤。(b) 策略优化过程的概述,其中模型使用GDPO进行训练。 在本节中,我们全面描述MultiSearch框架。我们首先概述轨迹生成过程,特别强调我们的并行多查询检索机制(§2.1)。接下来,我们介绍我们的多粒度奖励设计,包括答案奖励、多查询奖励和合并奖励(§2.2)。最后,我们详细介绍了基于组奖励解耦归一化策略优化的训练目标(§2.3)。 ### 2.1 带多查询检索的生成 #### 展开(Rollout)生成。对于训练数据集中的每个问题qq,代理迭代地与搜索引擎E\\mathcal{E}交互,并生成推理轨迹oo。具体来说,它生成多个查询(在...内)以触发检索工具,并使用...封装检索到的文档。然后,代理在...内显式提取并合并检索内容中的关键信息。现有的响应与和块连接起来,作为后续生成步骤的输入提示。这个搜索→\to信息→\to合并循环持续进行,直到代理确定有足够的信息并在...内呈现答案(参见图2(a))。 #### 多查询检索。为了从多个视角扩展检索,我们为代理配备了三种查询生成策略:改写、概念扩展和问题分解。改写有助于检索使用不同词汇或句法表达的文档,降低了因措辞不匹配而遗漏相关信息的风险[25](https://arxiv.org/html/2605.13534#bib.bib25)。概念扩展通过添加相关术语、同义词或上位词来扩大搜索范围,这在初始查询过于狭窄时特别有用[26](https://arxiv.org/html/2605.13534#bib.bib26)。问题分解将复杂问题拆分为更简单的子问题,并行解决它们,然后整合检索到的信息以产生最终答案。在每一步检索中,代理生成三个查询用于并行检索,采用一种或多种上述策略,或自主探索替代策略。 #### 显式合并。检索后,移除重复或不相关的文档以消除冗余。代理阅读剩余文档,并在和之间显式放置相关信息。训练模板见附录B。关于不同整合方式的更多分析,请参见附录A.4。 ### 2.2 奖励建模 MultiSearch的奖励系统由三个部分组成:(1) 答案奖励,评估最终预测的准确性。(2) 多查询奖励,鼓励生成多个查询进行检索。(3) 合并奖励,评估信息整合的质量。 #### 答案奖励。我们计算预测答案(在...内)与真实答案之间的词级F1分数,以衡量代理预测的正确性。答案奖励定义为: rans=F1(apred,a)=2nintnpred+ntruthr_{\text{ans}}=\text{F1}(a_{\text{pred}},a)=\frac{2n_{\text{int}}}{n_{\text{pred}}+n_{\text{truth}}} (1) 其中npredn_{\text{pred}}和ntruthn_{\text{truth}}分别是预测答案和真实答案的词数。nintn_{\text{int}}是它们交集的词数。 #### 多查询奖励。我们为所提出的多查询检索机制引入了一个专用奖励。具体来说,我们提取整个展开过程中所有在...块内的查询,并计算每步生成的平均查询数: rquery={0.1,nq>20,otherwiser_{\text{query}}=\begin{cases}0.1,&n_{\text{q}}>2\\ 0,&\text{otherwise}\end{cases} (2) 其中nqn_{\text{q}}是每步的平均查询数。 #### 合并奖励。合并步骤旨在从检索到的文档中移除不相关信息并整合关键证据。为了评估这种整合的质量,我们聚合所有在块内的文本,并验证真实答案是否出现在其中任何一个中: rmerge={0.1,∃Mi∈{M1,M2,...Mn},Mi∩a=a0,otherwiser_{\text{merge}}=\begin{cases}0.1,&\exists\mathcal{M}_{i}\in\{\mathcal{M}_{1},\mathcal{M}_{2},...\mathcal{M}_{n}\},\mathcal{M}_{i}\cap a=a\\ 0,&\text{otherwise}\end{cases} (3) 其中{M1,M2,...Mn}\{\mathcal{M}_{1},\mathcal{M}_{2},...\mathcal{M}_{n}\}表示单个展开中的nn个合并步骤。 多查询奖励和合并奖励仅在答案正确时应用。特别地,最终奖励定义如下: (Rans,Rquery,Rmerge)={(rans,rquery,rmerge),rans>0(0,0,0),otherwise(\mathcal{R}_{\text{ans}},\mathcal{R}_{\text{query}},\mathcal{R}_{\text{merge}})=\begin{cases}(r_{\text{ans}},r_{\text{query}},r_{\text{merge}}),&r_{\text{ans}}>0\\ (0,0,0),&\text{otherwise}\end{cases} (4) ### 2.3 强化学习 组奖励解耦归一化策略优化(GDPO)[17](https://arxiv.org/html/2605.13534#bib.bib17)被提出来解决组相对策略优化(GRPO)[27](https://arxiv.org/html/2605.13534#bib.bib27)在多奖励RL中的一个关键限制。与GRPO直接将所有奖励分量求和为单个展开奖励不同,GDPO在组内独立地对每个奖励进行归一化。然后聚合产生的优势并进行批归一化。这种解耦设计保留了单个奖励的独特贡献,使模型能够获得更细粒度和更具信息性的优势信号。我们采用GDPO作为RL训练的学习算法。具体来说,对于每个输入问题,给定策略模型πθ\pi_{\theta}和参考模型πref\pi_{\text{ref}},GDPO采样一组展开{oi}i=1G\{o_{i}\}_{i=1}^{G}。代理通过最大化以下目标进行优化:

相似文章

多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习

arXiv cs.CL

本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。

RL-Index: 强化学习的检索索引推理

Hugging Face Daily Papers

RL-Index 提出了一种基于强化学习的智能索引框架,通过用LLM生成的解释来扩充文档,将推理从查询阶段转移到索引阶段,从而提升检索效果并降低在线延迟。