缓解上下文干扰以实现可靠高效的搜索智能体
摘要
本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。
arXiv:2608.10743v1 公告类型:新
摘要:近期研究使大型语言模型(LLMs)能够作为多轮搜索智能体,通过迭代检索和生成输出来解决复杂任务,直到任务完成。然而,多轮搜索智能体的上下文冗长且复杂。例如,每一轮检索到的文档集合不可避免地会引入无关信息,从而分散LLMs的注意力,即\textit{context interference},这可能阻碍搜索智能体的可靠性和效率。因此,我们对多轮搜索智能体中的上下文干扰进行了系统研究,重点探讨:i) 搜索智能体上下文的哪些部分会导致上下文干扰;ii) 如何精炼搜索智能体的上下文以缓解干扰;以及 iii) 将上下文精炼纳入搜索智能体训练是否能带来进一步改进。我们发现干扰主要来自最新检索到的文档。基于上述发现,我们引入了一种基于蒸馏的上下文精炼器,以动态缓解多轮搜索智能体的上下文干扰。最后,我们验证了将上下文精炼纳入搜索智能体的RL训练流程可显著提升其可靠性和效率。这项研究强调了缓解搜索智能体上下文干扰的重要性,并为AI智能体启发了``先精炼上下文,再生成''的新范式。
查看缓存全文
缓存时间: 2026/08/12 08:37
# 缓解上下文干扰以实现可靠高效的搜索智能体
来源:https://arxiv.org/html/2608.10743
Boyang Xue1,6, Bin Wu2, Shuofei Qiao3, Sheng Wang4, Rui Wang1,6, Yiming Du1,6, Hongru Wang5, Jeff Z. Pan5, Emine Yilmaz2∗, Kam-Fai Wong1,6∗, Aldo Lipani2
1香港中文大学,2伦敦大学学院
3浙江大学,4香港大学,5爱丁堡大学
6教育部高可信软件技术重点实验室
\{byxue, kfwong\}@se.cuhk.edu.hk
###### 摘要
近期研究赋予大语言模型(LLMs)作为多轮搜索智能体的能力,通过迭代检索和生成直至解决复杂任务。然而,多轮搜索智能体的上下文冗长且复杂。例如,每一轮中检索到的文档集合不可避免地会引入干扰LLMs的无关信息,这被称为上下文干扰(context interference),可能阻碍搜索智能体的可靠性和效率。因此,我们对多轮搜索智能体中的上下文干扰进行了系统性研究,重点探究:i)搜索智能体上下文的哪些部分会导致上下文干扰;ii)如何精炼搜索智能体的上下文以缓解干扰;iii)将上下文精炼纳入搜索智能体训练是否能带来进一步改进。我们发现干扰主要源自最新检索到的文档。基于上述发现,我们引入了一个基于蒸馏的上下文精炼器,以动态缓解多轮搜索智能体的上下文干扰。最后,我们验证了将上下文精炼纳入搜索智能体的强化学习(RL)训练流程可以显著提升可靠性和效率。本研究强调了缓解搜索智能体上下文干扰的重要性,为 AI 智能体启发了一种“先精炼上下文,再生成”的新范式。
# 缓解上下文干扰以实现可靠高效的搜索智能体
Boyang Xue1,6, Bin Wu2, Shuofei Qiao3, Sheng Wang4, Rui Wang1,6, Yiming Du1,6,Hongru Wang5††thanks:共同通讯作者., Jeff Z. Pan5, Emine Yilmaz2∗, Kam-Fai Wong1,6∗, Aldo Lipani2
1香港中文大学,2伦敦大学学院
3浙江大学,4香港大学,5爱丁堡大学
6教育部高可信软件技术重点实验室
\{byxue, kfwong\}@se.cuhk.edu.hk
## 1 引言
大语言模型(LLMs)凭借其预训练知识在处理复杂任务方面展现出强大的性能(gpt5; deepseekai2025deepseekr1incentivizingreasoningcapability)。近期工作进一步赋予它们调用搜索引擎获取外部知识的能力,本质上将它们训练为多轮搜索智能体,在检索和生成之间迭代,直至任务得到解决(wang2025theoryagentstoolusedecisionmakers; jia2025fastslowtoolaugmentedthinking; huang2025reinforcedinternalexternalknowledgesynergistic)。
参见图1:上下文干扰如何影响基于LLM的搜索智能体性能的演示。(“召回率”=Nr/NN_{\text{r}}/N表示所有问题(NN)中检索文档包含正确答案的问题比例(NrN_{\text{r}})。“召回准确率”=Nrc/NN_{\text{rc}}/N表示在NrN_{\text{r}}中正确回答的问题比例(NrcN_{\text{rc}}),相对于所有问题(NN)。“准确率”表示所有问题(NN)中正确回答的问题比例NcN_{\text{c}}。)
然而,多轮搜索智能体的上下文冗长且复杂,涵盖问题、多轮搜索查询、检索文档和推理步骤(jin2025search),其中可能包含无关信息。例如,检索器总是返回一组文档以确保搜索查询的覆盖率,这也会将噪声或不相关文档引入上下文(dong2025understand)。这被称为上下文干扰,它指的是“输入过多不相关上下文可能使LLMs困惑,转而关注错误信息(coleman2023incontextinterferencechatbasedlarge; haseeb2025contextengineeringmultiagentllm; gupta-etal-2024-llm; jiang2025enhancingrobustnesslargelanguage)。”每一轮中出现的上下文干扰可能使LLMs被无关信息分散注意力,并持续损害后续的生成质量(li2025singleturnsurveymultiturninteractions; laban2025llmslostmultiturnconversation),从而阻碍搜索智能体的效率和可靠性。如图1(https://arxiv.org/html/2608.10743#S1.F1)所示,“召回率”和“召回准确率”之间的差距表明,搜索智能体总是检索到包含有用信息的文档,但未能生成正确答案,突出了上下文干扰对搜索智能体准确知识表达的影响。
以往缓解上下文干扰的研究主要集中在对话系统(jacqmin-etal-2022-follow)和检索增强生成(RAG)(glass-etal-2022-re2g; nguyen2025maragmultiagentretrievalaugmentedgeneration; yu2024rankragunifyingcontextranking),而在很大程度上忽视了多轮搜索智能体场景中的技术。因此,本工作针对搜索智能体的上下文干扰问题进行了系统性研究,提出三个研究问题(RQ):i)多轮搜索智能体上下文的哪些部分会导致上下文干扰?ii)如何精炼搜索智能体的上下文以缓解此类干扰?iii)在搜索智能体的RL训练流程中利用上下文精炼是否能带来进一步的性能提升?
参见图2:搜索智能体的示例,其中(a)检索文档中存在上下文干扰,(b)精炼后的上下文包含最关键的相关信息。问题来自PopQA(mallen2022not),我们使用Qwen2.5-7b-Instruct(yang2024qwen2)作为搜索智能体的基础LLM。我们在附录中提供了更多关于上下文干扰缓解的多轮问答示例。
鉴于上述问题,我们在一系列封闭式问答基准上,从可靠性和效率两个角度研究了多轮搜索智能体的上下文干扰效应。针对RQ i,我们通过掩码历史上下文的特定部分,比较了不同输入下多轮搜索智能体的性能。结果表明,上下文干扰主要源自搜索智能体最新检索到的文档,其次来自之前的搜索查询和文档。针对RQ ii,我们首先基于RQ i的结论探索了一系列上下文干扰缓解策略。基于这些探索,我们提出蒸馏一个包含检索文档和精炼文本的上下文精炼数据集,其中包含文档中与搜索查询最相关的关键信息。然后我们使用该数据集训练一个上下文精炼器,它可以缓解多轮搜索智能体的上下文干扰,如图2(https://arxiv.org/html/2608.10743#S1.F2)所示,并同时提升效率和可靠性。针对RQ iii,我们进一步将上下文精炼器纳入搜索智能体的强化学习(RL)训练流程。实验表明,使用动态精炼上下文训练多轮搜索智能体,在可靠性和效率方面均显著优于其他训练基线。
本工作的贡献如下:(1)本工作首次研究多轮搜索智能体上的上下文干扰问题,强调了上下文精炼对于提升搜索智能体效率和可靠性的必要性,为AI智能体启发了“先精炼上下文,再生成”的新范式(我们已在https://github.com/AmourWaltz/CRRL.git发布了本工作的代码)。(2)本工作揭示上下文干扰主要源自多轮搜索智能体中的最新文档,因此引入了一个基于蒸馏的上下文精炼器,以动态消除搜索智能体的上下文干扰,这同样可适用于其他搜索智能体场景中的上下文干扰缓解。(3)本工作进一步将上下文精炼纳入搜索智能体的RL训练流程,能够进一步增强可靠性和效率,为未来在搜索智能体训练期间进行上下文精炼提供了见解。
## 2 搜索智能体预备
为了建立分析上下文干扰问题的理论基础,我们介绍搜索智能体的内部/外部知识、马尔可夫决策过程(MDP)以及多轮搜索智能体的实践设置。本工作的符号定义见附录A(https://arxiv.org/html/2608.10743#A1)。相关工作见附录B(https://arxiv.org/html/2608.10743#A2)。
#### 搜索智能体的内部/外部知识
先前工作为LLM智能体定义了内部/外部知识的概念(wang2025theoryagentstoolusedecisionmakers; jia2025fastslowtoolaugmentedthinking),其中内部知识KI\boldsymbol{\mathcal{K}}_{I}是从预训练语料中学习并编码在模型参数中的,而外部知识KE\boldsymbol{\mathcal{K}}_{E}则通过外部工具(如搜索引擎)获取。对于参数为θ\theta的基于LLM的搜索智能体M\boldsymbol{\mathcal{M}},其输出y\boldsymbol{y}由内部参数知识KI∈θ\boldsymbol{\mathcal{K}}_{I}\in\theta、外部检索文档d∈KE\boldsymbol{d}\in\boldsymbol{\mathcal{K}}_{E}以及输入任务x\boldsymbol{x}共同决定,即y=Mθ(x,d)\boldsymbol{y}=\boldsymbol{\mathcal{M}}_{\theta}(\boldsymbol{x},\boldsymbol{d}),其中x\boldsymbol{x}通常指查询及顺序拼接的历史输出。由于嵌入在参数θ\theta中的KI\boldsymbol{\mathcal{K}}_{I}无法直接访问,KI\boldsymbol{\mathcal{K}}_{I}的体现依赖于x\boldsymbol{x}和d\boldsymbol{d}的上下文。检索器通常返回一组文档(d∈KE\boldsymbol{d}\in\boldsymbol{\mathcal{K}}_{E}),旨在全面覆盖搜索查询,但这不可避免地引入冗余和噪声。这些额外内容反过来可能扭曲对KI\boldsymbol{\mathcal{K}}_{I}和KE\boldsymbol{\mathcal{K}}_{E}的利用,并损害搜索智能体的可靠性。在图1(https://arxiv.org/html/2608.10743#S1.F1)中,“召回率”表示调用KE\boldsymbol{\mathcal{K}}_{E}并包含有用信息的问题,而“召回准确率”指利用KE\boldsymbol{\mathcal{K}}_{E}实际解决的问题,“准确率”表示通过KI\boldsymbol{\mathcal{K}}_{I}和KE\boldsymbol{\mathcal{K}}_{E}结合使用成功回答的问题。 “召回率”与“召回准确率”/“准确率”之间的差距体现了上下文干扰的负面影响。此外,无关信息的干扰会带来额外的检索和推理成本,降低搜索智能体的效率。
#### 智能体的马尔可夫决策过程
LLM智能体Mθ\boldsymbol{\mathcal{M}}_{\theta}(其中KI∈θ\boldsymbol{\mathcal{K}}_{I}\in\theta)与环境E\boldsymbol{E}(即KE\boldsymbol{\mathcal{K}}_{E})交互以完成任务的过程可以被视为马尔可夫决策过程:(S,A,T,O,R)\left(\boldsymbol{\mathcal{S}},\boldsymbol{\mathcal{A}},\boldsymbol{\mathcal{T}},\boldsymbol{\mathcal{O}},\boldsymbol{\mathcal{R}}\right)。最初,特定任务x\boldsymbol{x}作为初始环境状态提供。假设交互进行NN轮,并且在第nn轮(n)(\boldsymbol{\tilde{d}}_{i},\text{<}\boldsymbol{d}_{i},\boldsymbol{q}_{i-1}\text{>})并使用一个蕴含模型验证\boldsymbol{\tilde{d}}_{i}完全包含在\boldsymbol{d}_{i}之内,且不引入额外知识。最后,所有合格的数据点被重新格式化并纳入上下文精炼数据集Dc={d~j,di,qi}i=1M\boldsymbol{\mathcal{D}}_{\text{c}}=\{\boldsymbol{\tilde{d}}_{j},\boldsymbol{d}_{i},\boldsymbol{q}_{i}\}_{i=1}^{M}。给定Dc\boldsymbol{\mathcal{D}}_{\text{c}},我们使用监督微调(SFT)训练模型Mπ\boldsymbol{\mathcal{M}}_{\pi}以使其具备上下文精炼能力,如下所示。
π∗\displaystyle\pi^{*} =argminπLπSFT\displaystyle=\arg\min_{\pi}\mathcal{L}^{\text{SFT}}_{\pi} (1)
LπSFT\displaystyle\mathcal{L}^{\text{SFT}}_{\pi} =−1M∑i=1ME(d~i,di,qi)∼DcLπ(i)\displaystyle=-\frac{1}{M}\sum_{i=1}^{M}\mathbb{E}_{(\boldsymbol{\tilde{d}}_{i},\boldsymbol{d}_{i},\boldsymbol{q}_{i})\sim\boldsymbol{\mathcal{D}}_{c}}\mathcal{L}^{(i)}_{\pi} (2)
Lπ(i)\displaystyle\mathcal{L}^{(i)}_{\pi} =logMπ(d~i∣di,qi)\displaystyle=\log\boldsymbol{\mathcal{M}}_{\pi}(\boldsymbol{\tilde{d}}_{i}\mid\boldsymbol{d}_{i},\boldsymbol{q}_{i}) (3)
Mπ\boldsymbol{\mathcal{M}}_{\pi}被训练生成精炼文档\boldsymbol{\tilde{d}}_{i},从而得到一个上下文精炼器F=Mπ∗\boldsymbol{\mathcal{F}}=\boldsymbol{\mathcal{M}}_{\pi^{*}},用于多轮搜索智能体中的动态上下文精炼(本工作中的教师模型MT\boldsymbol{\mathcal{M}}_{T}为GPT-4,上下文精炼器F\boldsymbol{\mathcal{F}}的基础模型Mπ\boldsymbol{\mathcal{M}}_{\pi}为Qwen2.5-7b-Instruct或Qwen2.5-3b-Instruct,与其各自的推理模型相同)。
#### 上下文精炼方法
我们采用若干现有上下文精炼方法作为对比:1)我们利用GPT-4(gpt4)总结先前上下文的压缩方法(GPT-Compress);2)我们使用GPT-4在每一轮基于搜索查询\boldsymbol{q}_{i}动态精炼最新的Top-KK检索文档\boldsymbol{d}_{i}(GPT-Refine)。3)我们还使用基础LLM本身Mπ\boldsymbol{\mathcal{M}}_{\pi},利用\boldsymbol{q}_{i}动态精炼最新文档\boldsymbol{d}_{i}(Self-Refine)。
#### 结果与分析
如表2(https://arxiv.org/html/2608.10743#S3.T2)和图5(https://arxiv.org/html/2608.10743#S3.F5)所示,我们同时展示IRCoT基线,以便直观比较上下文干扰缓解效果。GPT-Refine在可靠性方面持续优于GPT-Compression,但在搜索次数和上下文长度上略逊,这表明提取并保留与搜索查询相关的关键信息比通用摘要更能有效缓解上下文干扰。这两个基线相对于IRCoT,能够有效减少搜索智能体在上下文中对无关信息的检索浪费。相比之下,Self-Refine没有带来性能提升,甚至未能减少上下文长度,这可归因于基础模型Mπ\boldsymbol{\mathcal{M}}_{\pi}缺乏信息提取能力。相比之下,在上下文精炼数据集上训练的Context Refiner取得了与GPT-Refine接近的性能,表明即使相对较弱的LLM也能在某种程度上实现上下文精炼能力。相似文章
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。
面向智能体与多模态大语言模型的上下文感知强化学习
介绍了ContextRL,一种强化学习方法,教会大语言模型识别哪些上下文支持答案,在智能体和多模态基准上取得了性能提升。
多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习
本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。
面向长周期任务的智能体兼容上下文管理
介绍AdaCoM,一种基于外部LLM的上下文管理器,适用于冻结的智能体。通过保留任务约束和修剪过时内容,利用强化学习提升长周期任务性能,并在网络搜索和深度研究基准上进行了实验。
为何重试会失败:LLM 智能体流水线中的上下文污染
本文提出了上下文污染重启模型(Context-Contaminated Restart Model, CCRM),以形式化分析 LLM 智能体流水线中失败的尝试如何污染上下文并在重试期间增加错误率。文章提供了理论证明,并针对 SWE-bench 数据验证了该模型,结果显示其与标准独立模型存在显著差异。