Grep 就足够了吗?智能体工具如何重塑智能体搜索
摘要
这项实证研究比较了 LLM 智能体工作流中的 grep 与向量检索策略,发现在不同的智能体工具和工具调用风格下,grep 通常能获得更高的准确率,而性能在很大程度上取决于工具选择与上下文设计。
暂无内容
查看缓存全文
缓存时间: 2026/06/10 00:23
# grep 就够了吗?智能体框架如何重塑智能体搜索 来源:https://arxiv.org/html/2605.15184 Akhil Kasturi,普华永道,美国。[email protected] (https://arxiv.org/html/2605.15184v1/mailto:[email protected]) Elias Lumer,普华永道,美国。[email protected] (https://arxiv.org/html/2605.15184v1/mailto:[email protected]) Anmol Gulati,普华永道,美国。 Vamse Kumar Subbiah,普华永道,美国。 ###### 摘要 近期大语言模型(LLM)智能体的进展,使得复杂的智能体工作流成为可能——模型能够自主检索信息、调用工具,并在大型语料库上进行推理,从而代表用户完成任务。尽管检索增强生成(RAG)在智能体系统中日益普及,但现有文献缺乏对检索策略选择如何与智能体架构及工具调用范式相互作用的系统性比较。重要的实践维度,包括工具输出如何呈现给模型,以及当搜索必须应对更多无关上下文文本时性能如何变化,在智能体循环中仍未被充分探索。本文报告了一项包含两个实验的实证研究。实验1在 LongMemEval 的 116 题样本上比较了 grep 和向量检索,使用了自定义智能体框架(Chronos)和提供商原生 CLI 框架(Claude Code、Codex 和 Gemini CLI),涵盖了内联工具结果和基于文件的工具结果(模型需单独读取)。实验2仅比较 grep 和向量检索,同时逐步混入额外的无关对话历史,使每个查询都嵌入更多干扰材料中(与关键段落一同出现)。在 Chronos 和提供商 CLI 之间,实验1中 grep 在准确率上通常优于向量检索;同时,整体得分仍强烈依赖于所使用的框架和工具调用风格,即使底层对话数据相同。 智能体搜索,语义搜索,词汇搜索,上下文工程,智能体框架,LLM 评估,grep ††版权:无 ## 1. 引言 现代 LLM 智能体越来越多地依赖 RAG 在推理时获取外部知识(Lewis 等,2020 (https://arxiv.org/html/2605.15184#bib.bib1);Gao 等,2024 (https://arxiv.org/html/2605.15184#bib.bib2)),从而能够对远超其上下文窗口的语料库进行推理。通过工具调用,智能体发出搜索查询,接收排序结果,并迭代地完善理解后生成答案(Yao 等,2023 (https://arxiv.org/html/2605.15184#bib.bib13);Schick 等,2023 (https://arxiv.org/html/2605.15184#bib.bib10);Qin 等,2023 (https://arxiv.org/html/2605.15184#bib.bib14))。两种检索范式主导着这一领域:语义向量搜索,它将查询和文档嵌入共享的潜在空间,进行近似最近邻匹配(Karpukhin 等,2020 (https://arxiv.org/html/2605.15184#bib.bib5));以及词汇搜索(如 grep、BM25、正则表达式),它在原始文本上进行精确或模式匹配。尽管向量搜索已成为大多数 RAG 系统的默认选择(Gao 等,2024 (https://arxiv.org/html/2605.15184#bib.bib2);Wang 等,2024 (https://arxiv.org/html/2605.15184#bib.bib3)),但词汇搜索因其简单、稳定和低嵌入成本在实践中仍被广泛使用(Lin, 2019 (https://arxiv.org/html/2605.15184#bib.bib6);Thakur 等,2021 (https://arxiv.org/html/2605.15184#bib.bib4))。然而,检索策略如何与智能体架构及工具调用范式在端到端智能体工作流中相互作用,仍知之甚少。尽管智能体搜索的采用日益增长(Asai 等,2024 (https://arxiv.org/html/2605.15184#bib.bib17);Jiang 等,2023 (https://arxiv.org/html/2605.15184#bib.bib18);Trivedi 等,2023 (https://arxiv.org/html/2605.15184#bib.bib19)),现有研究主要孤立地评估检索策略,而未考虑智能体架构。信息检索领域已广泛对词汇和稠密检索方法进行了基准测试(Thakur 等,2021 (https://arxiv.org/html/2605.15184#bib.bib4);Luan 等,2021 (https://arxiv.org/html/2605.15184#bib.bib28);Formal 等,2021 (https://arxiv.org/html/2605.15184#bib.bib8)),并在独立流水线中研究了检索质量、分块和重排序(Gao 等,2024 (https://arxiv.org/html/2605.15184#bib.bib2);Wang 等,2024 (https://arxiv.org/html/2605.15184#bib.bib3))。然而,这些评估通常假设一个固定流水线——将检索到的文档拼接成提示词,忽略了现代智能体系统中以工具为媒介的迭代检索循环(Qin 等,2024 (https://arxiv.org/html/2605.15184#bib.bib11);Patil 等,2023 (https://arxiv.org/html/2605.15184#bib.bib12))。在实践中,智能体接收排序列表,但不会将其视为最终结果:它们决定搜索什么、发出多少次查询,以及检索结果是否足够或需要进一步优化——所有这些都通过智能体框架及其工具调用接口来协调(Somers 等,2023 (https://arxiv.org/html/2605.15184#bib.bib16);Wang 等,2023 (https://arxiv.org/html/2605.15184#bib.bib15))。此外,工具结果如何呈现给模型——是直接注入上下文窗口,还是写入文件供智能体显式读取——引入了一个先前工作未考察的额外架构因素。与此同时,提供商原生 CLI 智能体的出现,如 Claude Code(Anthropic)、Codex(OpenAI)和 Gemini CLI(Google),创造了一类与自定义框架截然不同的智能体系统(Yang 等,2024 (https://arxiv.org/html/2605.15184#bib.bib25))。这些提供商框架将工具调用嵌入到基于 Shell 的接口中,模型可以直接访问命令行执行工具(如 grep),而自定义框架和智能体 SDK 则提供对工具调用循环、上下文构建和结果格式化的细粒度控制。检索策略的有效性如何在不同架构的框架类别间变化,尚未被研究。此外,检索质量的一个较少被考察的维度是对语料噪声的鲁棒性:随着无关文档与相关文档的比例增加,不同检索策略可能会以不同速率退化(Liu 等,2024 (https://arxiv.org/html/2605.15184#bib.bib21)),理解这种缩放行为对于在大型、有噪声的语料库上部署 RAG 系统至关重要。本文旨在通过一项针对配备工具的 LLM 智能体的检索策略实证研究来填补这些空白,该研究按实验组织(第4节 (https://arxiv.org/html/2605.15184#S4))。我们在自定义框架(Chronos (Sen 等,2026 (https://arxiv.org/html/2605.15184#bib.bib32))和提供商原生 CLI 框架(Claude Code、Codex、Gemini CLI)上,评估词汇搜索和语义向量搜索,涵盖标准的内联上下文交付和程序化的基于文件的结果交付。我们在 LongMemEval 基准(Wu 等,2025 (https://arxiv.org/html/2605.15184#bib.bib24))的 116 题子集上评估了多个 LLM,该子集涵盖六类信息检索任务。本文的贡献体现在三个方面: - • **检索、框架与呈现**:关于词汇搜索与稠密搜索的选择如何与智能体编排层以及工具输出是内联呈现还是基于文件呈现相结合的实证证据。 - • **噪声与规模**:对端到端行为如何随无关上下文内容相对于任务相关材料的增长而演变的刻画,包括检索器行为与更广泛智能体循环之间的交互。 - • **智能体栈的异质性**:一项直接比较表明,即使底本文本语料固定,检索有效性在不同架构框架(自定义 vs. 提供商原生 CLI)之间并不稳定。 ## 2. 智能体系统中检索概述 智能体系统中的检索是指 LLM 智能体识别、执行并消费对语料库的搜索操作以回答用户查询的过程。与独立检索流水线不同——其中固定查询与文档索引匹配,并将 top-k 结果拼接成提示词(Lewis 等,2020 (https://arxiv.org/html/2605.15184#bib.bib1);Gao 等,2024 (https://arxiv.org/html/2605.15184#bib.bib2))——智能体检索是迭代且由智能体驱动的:模型决定搜索什么、发出多少次查询,以及检索结果是否足够或需要优化(Yao 等,2023 (https://arxiv.org/html/2605.15184#bib.bib13);Jiang 等,2023 (https://arxiv.org/html/2605.15184#bib.bib18);Asai 等,2024 (https://arxiv.org/html/2605.15184#bib.bib17))。这一过程由两个设计维度共同决定端到端有效性:检索策略(词汇、语义或混合)和智能体框架(自定义或提供商原生)。 ### 2.1. 检索策略 智能体搜索系统的检索策略分为三大类:词汇、语义和混合。每种策略在准确性、延迟、成本和查询公式化的鲁棒性方面都有不同的权衡。 #### 2.1.1. 词汇搜索 词汇检索方法在原始文本上进行精确或模式匹配。经典方法如 BM25 (Lin, 2019 (https://arxiv.org/html/2605.15184#bib.bib6)) 根据词频和逆文档频率对文档打分,而 grep 搜索使用正则表达式或子串匹配来定位包含特定关键词的段落(Lumer 等,2025a (https://arxiv.org/html/2605.15184#bib.bib29))。词汇方法不需要嵌入模型或向量索引,除了文本扫描本身外,计算成本几乎可以忽略。BEIR 基准表明,BM25 在各种检索任务中仍然是一个有竞争力的基线,在零样本设置中通常优于早期的稠密检索模型(Thakur 等,2021 (https://arxiv.org/html/2605.15184#bib.bib4))。学习的稀疏表示如 SPLADE (Formal 等,2021 (https://arxiv.org/html/2605.15184#bib.bib8)) 通过学习词汇表扩展查询和文档术语,在精确匹配和语义理解之间架起桥梁,同时保留了稀疏表示的可解释性和效率。 #### 2.1.2. 语义搜索 语义或稠密检索将查询和文档编码为共享嵌入空间中的稠密向量,并检索最近邻,最常见的方式是近似最近邻(ANN)搜索(Karpukhin 等,2020 (https://arxiv.org/html/2605.15184#bib.bib5))。稠密段落检索(DPR)通过在问答对训练双编码器确立了这一范式,使得检索基于含义而非表面层次的术语重叠(Karpukhin 等,2020 (https://arxiv.org/html/2605.15184#bib.bib5))。RAG 系统通过将稠密检索与生成模型结合扩展了这一点,使得检索器和生成器可以联合优化(Lewis 等,2020 (https://arxiv.org/html/2605.15184#bib.bib1))。现代 RAG 流水线通常使用预训练的嵌入模型在索引时编码文档,在推理时编码查询,并可选地在检索后进行重排序以优化初始候选集(Gao 等,2024 (https://arxiv.org/html/2605.15184#bib.bib2);Wang 等,2024 (https://arxiv.org/html/2605.15184#bib.bib3))。虽然语义搜索在处理释义和语义相似性方面表现出色,但它引入了对嵌入模型质量、向量索引基础设施和索引延迟的依赖,而词汇方法则避免了这些。 #### 2.1.3. 混合方法 混合检索结合词汇和语义信号,以发挥两种范式的优势。互惠排名融合(RRF)(Cormack 等,2009 (https://arxiv.org/html/2605.15184#bib.bib27);Gulati 等,2026 (https://arxiv.org/html/2605.15184#bib.bib30)) 合并来自独立词汇和稠密检索器的排序列表,无需校准分数。晚期交互模型如 ColBERT (Khattab and Zaharia, 2020 (https://arxiv.org/html/2605.15184#bib.bib7)) 计算查询和文档表示之间的细粒度词元级相似性,在单向量检索的效率和交叉编码器重排序的表达力之间取得了折中。对稀疏和稠密表示互补性的研究表明,词汇和语义方法通常检索到不同的相关文档,因此它们的组合比单独使用任何一种都更有效(Luan 等,2021 (https://arxiv.org/html/2605.15184#bib.bib28))。在智能体设置中,当智能体可以同时访问词汇和语义搜索工具并根据查询在两者之间选择时,混合检索也可以有机地出现。 ### 2.2. 智能体框架 智能体框架是管理工具调用循环的环境层:它构建提示词、调度工具调用、接收结果,并决定是继续迭代还是生成最终答案。我们区分两类在对此过程控制程度上根本不同的框架。 #### 2.2.1. 自定义框架 自定义框架由开发者使用智能体框架、提供商开放 SDK 或自定义代码构建(Yao 等,2023 (https://arxiv.org/html/2605.15184#bib.bib13);Somers 等,2023 (https://arxiv.org/html/2605.15184#bib.bib16))。它们在智能体循环的每个阶段提供细粒度控制:系统提示词、工具定义、上下文构建、结果格式化和迭代终止条件。ReAct 范式(Yao 等,2023 (https://arxiv.org/html/2605.15184#bib.bib13))将推理轨迹与工具动作交错进行,是自定义框架中最广泛采用的模式。开发者可以实现领域特定的优化,例如动态提示(根据查询定制系统提示词)、结果截断策略和检索段落的重新排序。自定义框架还允许显式管理上下文窗口,例如通过总结或丢弃较早的工具结果以应对对话增长(Lumer 等,2025b (https://arxiv.org/html/2605.15184#bib.bib31);Packer 等,2023 (https://arxiv.org/html/2605.15184#bib.bib23))。其代价是开发开销:构建和维护自定义框架需要大量的工程努力以及提示工程、工具接口设计和上下文管理方面的专业知识。 #### 2.2.2. 提供商原生 CLI 框架 提供商原生 CLI 框架将工具调用嵌入到基于 Shell 的接口中,模型可以直接访问系统实用程序(Yang 等,2024 (https://arxiv.org/html/2605.15184#bib.bib25);Chen 等,2021 (https://arxiv.org/html/2605.15184#bib.bib26))。在这些环境中,智能体可以执行任意 bash 命令,包括 grep、find、cat 等 Unix 工具,作为原生工具动作。框架根据提供商的内部实现管理上下文构建和迭代控制,这对用户来说基本不透明。提供商原生框架设置成本极低,并利用提供商优化的上下文工程,但牺牲了自定义框架中可用的细粒度控制。值得注意的是,当 grep 作为原生 bash 工具可用时,“检索策略”和“智能体能力”之间的界限变得模糊:智能体可以构建自己的 grep 命令,选择搜索词、标志和文件模式。
相似文章
@omarsar0: // Is Grep All You Need? // 注意了,AI开发者们。(收藏起来)他们发现,grep风格的文本搜索,当…
PwC的一篇研究论文发现,当正确集成到代理框架中时,grep风格的文本搜索在编码代理任务上可以匹配或超越基于嵌入的检索,这表明向量数据库对许多用例可能并非必需。
@jerryjliu0:关于grep是否是智能体搜索所需的全部工具,这个问题尚无定论。@PwCUS(Sen等人)最近的这篇论文似乎……
最近的一篇论文研究了在智能体检索中,grep是否优于向量搜索,发现grep在对话记忆测试中具有更高的准确性,但也指出了在企业文档语料库方面的局限性。
分享灵感:Grep 在智能体搜索中为我们带来了颠覆性的改变。
描述了一种改进智能体记忆搜索的方法:受一篇论文启发,将基于 grep 的精确匹配与向量嵌入相结合;在其记忆层中实现了显著的召回率提升。
GrepSeek:训练直接语料交互的搜索代理
GrepSeek 训练大型语言模型搜索代理,使其能够通过使用 grep 等 shell 命令直接与文本语料库交互。它采用两阶段训练流程:冷启动数据集构建和 GRPO 微调,在开放域问答基准测试中取得了优异的 F1 和 Exact Match 分数。
@jerryjliu0: 智能体搜索已从固定的RAG管道转向灵活的智能体框架,并接入一系列搜索工具:k…
LlamaIndex 推出了基于 LlamaParse Index 的智能体检索,结合语义搜索和 grep,构建灵活的智能体框架。6月30日的网络研讨会将演示这些工具。