将搜索与推理解耦:一种供应商无关的LLM智能体接地架构
摘要
本文介绍了去耦搜索接地(DSG)——一种供应商无关的架构,它将搜索检索与LLM推理分离,从而能够对提供商路由、缓存和输出合约进行显式控制。实验表明,DSG在成本降低91%和延迟降低68%的情况下,几乎达到了原生搜索的准确率。
arXiv:2606.18947v1 公告类型:新
摘要:生产级LLM智能体越来越依赖实时搜索,然而原生搜索接地将检索策略、提供商选择、证据注入、成本、延迟和生成行为捆绑在单个模型-提供商的边界之后。这种耦合使得接地难以检查、调优、重用或移植,并可能引发搜索引发的冗长,从而破坏严格的输出合约。我们提出去耦搜索接地(DSG)——一种供应商无关的边界,通过MCP兼容的网关将接地移出推理模型,将提供商路由、源感知上下文渲染、配置回退、检索深度控制以及精确和语义缓存作为一等控制暴露出来。在SimpleQA、FreshQA和HotpotQA上的五个前沿模型中,原生搜索在对时效敏感的FreshQA上领先,但当控制重要时,DSG展现出更强的前沿性:在SimpleQA上,它几乎达到原生准确率(86.1%对比87.7%),搜索成本降低91%,保持简洁的答案合约,并以68%的更低延迟达到99.4%的热缓存命中率。作为大规模可互换模型智能体工作负载的共享生产接地层部署,DSG在电商查询理解(QIU)工作负载上匹配或略微超过原生搜索准确率,同时将搜索成本降低超过98%。实时接地最好被视为一个可优化的接口边界,而不是一个固定的模型特性。
查看缓存全文
缓存时间: 2026/06/18 05:41
# 将搜索与推理解耦:面向LLM智能体的供应商无关型知识溯源架构
来源:https://arxiv.org/html/2606.18947
Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das DoorDash, Inc. \{e.aboahboateng, kyle.macdonald, amardeep.kumar, siddharth.kodwani, sudeep.das2\}@doordash.com
###### 摘要
生产环境中的LLM智能体越来越依赖实时搜索,然而原生的搜索知识溯源机制将检索策略、供应商选择、证据注入、成本、时延以及生成行为捆绑在单个模型供应商的边界之内。这种耦合使得知识溯源难以检查、调优、复用或迁移,并且可能引发“搜索诱导的冗长输出”——这会破坏严格的输出契约。我们提出解耦搜索知识溯源(Decoupled Search Grounding,DSG),这是一种供应商无关的边界,通过一个兼容MCP的网关将知识溯源从推理模型中剥离出来,并将供应商路由、源感知的上下文渲染、可配置的回退、检索深度控制,以及精确和语义缓存作为首要的控制手段。在SimpleQA、FreshQA和HotpotQA上对五个前沿模型进行的评估中,原生搜索在对时效性敏感的FreshQA上表现领先,但当控制能力至关重要时,DSG展现出了更强的适用性:在SimpleQA上,DSG以比原生搜索低91%的搜索成本,几乎匹配原生准确率(86.1% vs. 87.7%),保留了简洁的答案契约,并实现了99.4%的缓存命中率,时延降低68%。作为大规模智能体工作负载中可互换模型的共享生产级知识溯源层部署,DSG在电商查询理解(QIU)工作负载上与原生搜索的准确率相当甚至略有超出,而搜索成本降低了超过98%。实时知识溯源最好被视为一个可优化的接口边界,而非固定的模型特性。
## 1 引言
参考图注图1:解耦搜索知识溯源(DSG)将检索与模型原生生成分离开,使供应商选择、缓存和输出控制变得显式化。大语言模型(LLM)在生产环境中的部署越来越聚焦于智能体任务:多步骤工作流中,模型对中间状态进行推理,决定何时调用外部工具,并且常常利用搜索来将行为锚定在最新证据上。这些系统必须满足严格的成本、时延、可靠性和输出契约约束(Schick 等,2023 (https://arxiv.org/html/2606.18947#bib.bib1);Mialon 等,2023 (https://arxiv.org/html/2606.18947#bib.bib4);Yao 等,2023 (https://arxiv.org/html/2606.18947#bib.bib5);Li 等,2023 (https://arxiv.org/html/2606.18947#bib.bib6);Qin 等,2024 (https://arxiv.org/html/2606.18947#bib.bib7))。随着静态的检索增强生成(RAG)流水线演变为动态、使用工具的工作流(Lewis 等,2020 (https://arxiv.org/html/2606.18947#bib.bib9);Karpukhin 等,2020 (https://arxiv.org/html/2606.18947#bib.bib10);Izacard 和 Grave,2021 (https://arxiv.org/html/2606.18947#bib.bib11);Jiang 等,2023 (https://arxiv.org/html/2606.18947#bib.bib12);Asai 等,2024 (https://arxiv.org/html/2606.18947#bib.bib14)),推理模型与实时搜索之间的接口成为一个首要的系统设计决策。已部署的NLP系统已经表明,在实践中,检索设计、评估、时延和服务成本往往支配着模型选择(Murtaza 等,2025 (https://arxiv.org/html/2606.18947#bib.bib30);Chen 等,2025 (https://arxiv.org/html/2606.18947#bib.bib32);González Juclà 等,2026 (https://arxiv.org/html/2606.18947#bib.bib33);Li 等,2025 (https://arxiv.org/html/2606.18947#bib.bib31))。
一种常见的集成路径是原生搜索知识溯源:一种模型供应商特性,模型API会调用供应商管理的搜索栈,并将检索到的证据注入生成过程。原生集成方便且通常效果优异,尤其是在对时效性敏感的问题上。团队也可以直接集成外部供应商,但它们的API、定价、结果格式、排序和失败表现差异显著,这促使工程师选择默认的原生路径,即使生产系统需要对供应商选择和检索行为进行显式控制。这种耦合隐藏了生产团队通常需要控制的决策:查询哪个供应商、检索多少上下文、成本如何限定、重复查询能否被缓存,以及工具输出如何与下游模式约束交互。
我们直接研究这个接口边界。先前的工作将冗长的LLM响应与不确定性联系起来,并研究了搜索增强系统中的过度搜索(Zhang 等,2025 (https://arxiv.org/html/2606.18947#bib.bib25);Xie 等,2026 (https://arxiv.org/html/2606.18947#bib.bib26));这里我们分离出一个接口特定的故障模式,即“搜索诱导的冗长输出”,在这种模式下,尽管有严格的输出指令,原生搜索仍会改变响应风格。诸如“仅提供最终答案实体”这样的严格提示可能会产生解释性的段落,这对生产系统至关重要——在这些系统中,LLM经常作为中间节点,其输出会被下游服务解析、分类、缓存或路由。
我们提出了一种供应商无关的解耦搜索知识溯源(DSG)架构,通过一个兼容MCP的网关实现。DSG不将搜索视为一个不透明的模型特性,而是将其暴露为一个结构化的工具层,能够规范化供应商输出、路由请求、缓存重复查询,并保持检索与推理之间的分离。核心贡献在于可控的边界本身:DSG将供应商策略、缓存复用、回退和源感知的上下文渲染外部化,同时保持推理模型可互换。
我们在五个前沿模型(GPT-4o、GPT-4o-mini、Gemini 2.5 Flash、Gemini 2.5 Pro 和 Claude Sonnet 4)、公开的QA基准(SimpleQA、FreshQA、HotpotQA)以及专有的电商查询意图理解(QIU)数据集上对DSG与原生搜索进行了对比评估。我们的贡献如下:
1. 1. 为知识溯源定义系统边界:我们将搜索知识溯源形式化为一个解耦的、供应商无关的层,该层保持推理模型可互换,同时将检索策略、缓存和供应商选择暴露为显式的系统控制。
2. 2. 搜索智能与标准化框架:我们将DSG实现为一个兼容MCP的网关,为智能体提供稳定的搜索接口,将异构的供应商输出规范化为源感知的上下文,并支持缓存门控检索以及跨搜索后端配置供应商回退。
3. 3. 关于行为、质量和运营的证据:我们识别出由搜索诱导的冗长输出是原生搜索知识溯源中提示合规性的风险,并展示了DSG的结构化工具边界如何帮助缓解这一风险,同时在公开的QA基准和生产工作负载上量化了准确率、成本、时延、检索深度和缓存复用之间的权衡。
DSG将知识溯源变为一个接口决策:供应商选择、成本策略、缓存复用、上下文渲染、回退和输出契约行为成为首要的控制手段,而推理模型则保持可互换。原生搜索与解耦搜索展现了不同的权衡;DSG的价值在于将这些选择暴露为显式的、可控的决策。
## 2 相关工作
Toolformer(Schick 等,2023 (https://arxiv.org/html/2606.18947#bib.bib1))、ReAct(Yao 等,2023 (https://arxiv.org/html/2606.18947#bib.bib5))、API-Bank(Li 等,2023 (https://arxiv.org/html/2606.18947#bib.bib6))、ToolLLM(Qin 等,2024 (https://arxiv.org/html/2606.18947#bib.bib7))和 WebGPT(Nakano 等,2021 (https://arxiv.org/html/2606.18947#bib.bib8))确立了LLM可以使用外部工具和API。这些工作主要研究智能体能力和基准性能;我们则专注于搜索接口在模型栈中的位置对生产带来的影响。
RAG已成为提升事实准确性的标准机制(Lewis 等,2020 (https://arxiv.org/html/2606.18947#bib.bib9);Karpukhin 等,2020 (https://arxiv.org/html/2606.18947#bib.bib10);Izacard 和 Grave,2021 (https://arxiv.org/html/2606.18947#bib.bib11)),后续工作探索了动态检索以及检索与推理的交互,包括FLARE(Jiang 等,2023 (https://arxiv.org/html/2606.18947#bib.bib12))、RARR(Gao 等,2023 (https://arxiv.org/html/2606.18947#bib.bib13))、Self-RAG(Asai 等,2024 (https://arxiv.org/html/2606.18947#bib.bib14))、Adaptive-RAG(Jeong 等,2024 (https://arxiv.org/html/2606.18947#bib.bib15))和IRCoT(Trivedi 等,2023 (https://arxiv.org/html/2606.18947#bib.bib16))。在已部署的工作流中,这些检索选择与上下文构建、提示优化(Zhou 等,2023 (https://arxiv.org/html/2606.18947#bib.bib38);Boateng 等,2026a (https://arxiv.org/html/2606.18947#bib.bib35))以及较小推理模型的强到弱适应(Hsieh 等,2023 (https://arxiv.org/html/2606.18947#bib.bib39);Aboah Boateng 等,2025 (https://arxiv.org/html/2606.18947#bib.bib36);Boateng 等,2025 (https://arxiv.org/html/2606.18947#bib.bib37))相互作用;DSG是互补的,因为它固定了知识溯源接口,同时保持推理模型可互换。行业应用如多品类电商意图理解进一步推动了多源知识溯源(Boateng 等,2026b (https://arxiv.org/html/2606.18947#bib.bib27))。我们的贡献是正交的:我们研究搜索是作为不透明的供应商行为嵌入,还是作为一个显式的、可控的子系统暴露出来。
我们的评估结合了短形式事实性(SimpleQA;Wei 等,2024 (https://arxiv.org/html/2606.18947#bib.bib17))、多跳压力测试(HotpotQA;Yang 等,2018 (https://arxiv.org/html/2606.18947#bib.bib19))和时效性知识溯源(FreshQA/FreshLLMs;Vu 等,2024 (https://arxiv.org/html/2606.18947#bib.bib18)),与对动态评估(如Dynabench;Kiela 等,2021 (https://arxiv.org/html/2606.18947#bib.bib24))的呼吁一致。对于可扩展评估,我们借鉴了LLM-as-judge和RAG评估工作,包括G-Eval(Liu 等,2023 (https://arxiv.org/html/2606.18947#bib.bib22))、MT-Bench / Chatbot Arena分析(Zheng 等,2023 (https://arxiv.org/html/2606.18947#bib.bib23))、ARES(Saad-Falcon 等,2024 (https://arxiv.org/html/2606.18947#bib.bib20))、RAGAs(E 等,2024 (https://arxiv.org/html/2606.18947#bib.bib21))以及智能体任务完成评估(Bhonsle 等,2025 (https://arxiv.org/html/2606.18947#bib.bib34))。
工业界的追踪工作越来越多地记录了已部署场景中的检索权衡,例如企业支持、动态向量存储和时延受限的搜索(Murtaza 等,2025 (https://arxiv.org/html/2606.18947#bib.bib30);González Juclà 等,2026 (https://arxiv.org/html/2606.18947#bib.bib33);Chen 等,2025 (https://arxiv.org/html/2606.18947#bib.bib32);Li 等,2025 (https://arxiv.org/html/2606.18947#bib.bib31))。MCP已成为连接模型与工具和数据的一种实用标准;早期工作研究了工具描述质量和生产设计模式(Hasan 等,2026 (https://arxiv.org/html/2606.18947#bib.bib28);Srinivasan,2026 (https://arxiv.org/html/2606.18947#bib.bib29))。我们使用MCP作为DSG的连接基础,并将解耦的搜索知识溯源与专有原生搜索进行对比评估。与这些工作线不同,我们将实时搜索知识溯源本身视为一个可控的、供应商无关的接口,并在多个前沿模型和一个生产工作负载上,衡量它相对于专有原生搜索所暴露出的成本、时延、缓存和输出契约权衡。
## 3 原生搜索的挑战
原生搜索是供应商管理的知识溯源:模型API调用搜索并通过供应商特定的上下文处理注入证据。这种单次调用抽象对智能体很有吸引力,但它将检索策略移到了供应商边界之内。当更好的推理模型或搜索供应商出现时,开发者失去了对供应商选择、结果规范化、缓存、工具输出格式化和迁移路径的控制。
当模型调用是自动化流水线中的中间步骤时,这种耦合造成了四个部署挑战:模型-供应商锁定、不透明的时延、固定的成本结构,以及我们称之为“搜索诱导的冗长输出”的指令遵循退化。
参考图注图2:HotpotQA上的提示合规性诊断。原生搜索可能将简洁的答案提取转变为解释性输出,而DSG则保留了下游解析器所需的仅答案接口。
### 3.1 搜索诱导的冗长输出
生产流水线通常将LLM用作中间推理节点,其输出必须解析为JSON、布尔标志或简短实体。因此,提示规定了严格的输出契约,例如“仅提供最终答案实体”。
我们观察到,即使最终答案指令是显式的,原生搜索也可能将模型从简洁的提取转变为解释性总结。答案可能包含在内,但多余的散文可能破坏精确匹配评估或下游解析器。
示例:提示合规性失败
指令:“仅提供最终答案实体。”
问题:“200 West Street 的建筑比 888 7th Avenue 高吗?”
原生搜索输出:“根据搜索结果,我可以比较两栋建筑的高度:200 West Street 高749英尺……而 888 7th Avenue 高628英尺……”245个字符
DSG输出:“是”3个字符
我们将其视为部署风险诊断,而非声称原生搜索总会改变输出风格。在评估的案例中,原生搜索有时会在严格最终答案指令下,将模型从简洁提取转变为解释性总结。在我们的HotpotQA诊断中,一个受影响的Claude Sonnet 4原生搜索次中有78.1%的预测以“根据搜索结果……”开头;在精确匹配失败中,62.3%仍包含正确答案作为子串。表8 (https://arxiv.org/html/2606.18947#A7.T8)报告了诊断摘要。
当语义正确的答案由于违反了精确实体、JSON、布尔或分类输出契约而无法使用时,这一点就很重要。总体准确率使用任务级裁判/分类器评分,而格式合规性则作为单独诊断报告。DSG通过将检索保持为具有稳定输出边界的结构化工具响应来缓解这一问题;未来使用供应商端遥测的工作可以进一步隔离内部触发因素。
参考图注图3:解耦搜索知识溯源架构。DSG通过稳定的工具接口、缓存门控的搜索智能、供应商抽象、运营控制和规范化的模型面向知识溯源上下文,将智能体应用和可互换的推理模型与外部搜索供应商分离开。
## 4 面向LLM智能体的解耦搜索知识溯源
我们实现了解耦搜索知识溯源(DSG),作为一个兼容MCP的网关,位于智能体应用、可互换的推理模型和供应商无关的搜索后端之间(图3 (https://arxiv.org/html/2606.18947#S3.F3))。
### 4.1 源感知的工具格式化
与将检索隐藏在供应商特定API中的原生集成不同,我们的架构通过显式的、可配置的工具模式暴露搜索。工程师在网关层指定一次查询接口和供应商选项,这样每个智能体都能继承它们,而无需。相似文章
上下文收集决策过程:用于智能体搜索的POMDP框架
本文引入了上下文收集决策过程(CGDP),这是一个用于建模LLM智能体搜索行为的POMDP框架,提出了能够提升多跳推理能力并降低Token消耗且不影响性能的干预措施。
SGR:一种基于外部子图生成的LLM逐步推理框架
介绍SGR,一种逐步推理框架,通过从外部知识库生成查询特定子图来增强LLM推理,提升准确性与事实可靠性。
密集检索的检索锚定潜在推理
提出检索锚定潜在推理(RGLR),一种面向密集检索的潜在推理框架,它显式地将中间潜在转移与检索改进联系起来,在推理密集型任务上优于基线方法。
基于外部子图生成的大语言模型逐步推理增强
本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。
通过并行搜索与显式合并扩展检索增强推理
介绍了MultiSearch,一种基于强化学习的框架,该框架在每一步推理中生成多个查询,并显式合并检索到的信息,以提高问答任务中的信噪比和推理准确性。