哪种RAG范式在大规模下胜出?检索增强生成范式的规模化研究
摘要
本文通过控制变量,对词汇型、密集向量型、图基型和智能体型RAG范式在从1,000到512,000篇文档的语料规模范围内进行了规模化比较研究。研究发现BM25在准确性与成本之间取得了最佳平衡,而图基型RAG面临高昂的构建成本,限制了其扩展性。
arXiv:2607.26497v1 公告类型: 新提交
摘要: 检索增强生成(RAG)方法涵盖从词汇检索、密集向量检索到图基索引和智能体搜索。这些方法通常在不同基准上、在单一语料规模下进行评估,导致其准确性与成本的扩展性关系不明确。为弥补这一空白,我们对这四种范式进行了一项受控的语料规模扩展研究。通过28个严格嵌套的层级,将语料从约1,000篇文档逐步扩展到512,000篇文档,同时保持问题集以及一组固定的相关文档和对抗性文档不变。在统一的阅读器和评判协议下,我们测量了官方的准确性、构建和查询的token数以及延迟。实验结果表明,在该受控环境中,BM25的扩展性最佳:它在每个测量层级都定义了Pareto前沿中低成本的一端,并从中间规模开始领先于准确性,且无需基于LLM的构建。文件系统智能体在最小规模层级与BM25持平或略优,但在固定基岩上每个答案的查询token数多出39倍,且在全规模下准确性落后近20个百分点。通过匹配的检索替换可以逆转这一失败:Agent+BM25在全规模下150个问题上的得分为69.4,而纯文件系统智能体为36.9,原生BM25为54.8。图基型RAG面临构建瓶颈:其最重的构建器对每个索引的语料token使用高达24.6个生成式LLM token,却仅覆盖全语料的2%以内,而可扩展变体在相同层级上的准确性仍然低于BM25。
查看缓存全文
缓存时间: 2026/07/30 09:58
# 哪种RAG范式在大规模下表现最佳?检索增强生成范式的规模扩展研究 来源:https://arxiv.org/html/2607.26497 \\providecommand\\paperoptions ustc,normalcite1\]中国科学技术大学,合肥,中国 2\]墨石科技,北京,中国 3\]信息技术研究中心,北京农林科学院,北京,中国\\contribution\[†\]项目负责人 Benfeng Xu Shaohan Wang Xin Zeng Huarui Wu Lei Zhang Licheng Zhang\\\[[zlczlc@mail\.ustc\.edu\.cn (https://arxiv.org/html/2607.26497v1/mailto:[email protected]) (2026年7月28日) ###### 摘要 检索增强生成(RAG)方法涵盖从词汇检索和稠密检索到基于图的索引和智能代理搜索。它们通常在不同基准上、针对单一语料规模进行评估,因此其准确性与成本之间的扩展关系尚不明确。为弥补这一空白,我们对这四种范式开展了一项受控的语料规模扩展研究。一个包含28个严格嵌套层级的阶梯,从一个约1,000份文档的规模增长至512,000份文档,同时问题集以及一个固定的基础文档集(包含相关文档和对抗文档)保持不变。在统一阅读器和评判协议下,我们测量了官方准确率、构建/查询令牌数及延迟。实验结果表明,在此受控设置中,BM25的扩展性最佳:它在所有测定的层级上都定义了帕累托前沿的低成本端点,并在中等规模后引领准确率,且无需基于LLM的构建。文件系统智能代理在最小层级上匹配或略优于BM25,但在基础文档集上每个答案消耗的查询令牌数多出39倍,在完整规模下准确率落后近20个百分点。通过匹配的检索替换可逆转这一失败:Agent+BM25在完整规模下得分为69.4,而原始文件智能代理为36.9,原生BM25在同一150题上为54.8。基于图的RAG面临构建瓶颈:其最重的构建器在索引的每个语料令牌上最多使用24.6个生成式LLM令牌,却仅能覆盖完整语料的前2%,而可扩展变体在共同层级上的准确率仍低于BM25。 \\correspondence Licheng Zhang 联系方式 ## 1 引言 检索增强生成将大语言模型的输出植根于外部语料,从而减轻幻觉现象(Lewis等人,2021 (https://arxiv.org/html/2607.26497#bib.bib15))。其方法已分化为不同范式,这些范式的成本出现在不同阶段、以不同形式体现。词汇检索(Robertson and Zaragoza, 2009 (https://arxiv.org/html/2607.26497#bib.bib23))和稠密检索(Karpukhin等人,2020 (https://arxiv.org/html/2607.26497#bib.bib12))准备成本极低:索引只需在语料上进行一次嵌入计算。基于图的RAG,包括MS-GraphRAG(Edge等人,2025 (https://arxiv.org/html/2607.26497#bib.bib3))、LightRAG(Guo等人,2025 (https://arxiv.org/html/2607.26497#bib.bib5))和HippoRAG 2(Gutiérrez等人,2025a (https://arxiv.org/html/2607.26497#bib.bib6),b (https://arxiv.org/html/2607.26497#bib.bib7)),在索引阶段投入巨大:它对每个块运行LLM以提取实体和关系,从而在查询时利用该结构;LinearRAG(Zhuang等人,2025 (https://arxiv.org/html/2607.26497#bib.bib34))则使用轻量级命名实体识别器和嵌入构建同类图。 文件系统智能代理在查询时消耗成本,它通过迭代的文件系统工具调用,利用LLM搜索语料(Yao等人,2023 (https://arxiv.org/html/2607.26497#bib.bib32))。每次调用均基于先前的结果,使工具循环成为顺序检索策略。相同的文件和命令接口在编码智能代理系统中已建立(Jimenez等人,2024 (https://arxiv.org/html/2607.26497#bib.bib10);Yang等人,2024a (https://arxiv.org/html/2607.26497#bib.bib30);Wang等人,2025 (https://arxiv.org/html/2607.26497#bib.bib29)),并被Claude Code和Codex等领先的工业智能代理所使用。我们在语料的原始按源文件树上实例化此接口,无需检索索引。在图上操作的智能代理则属于我们访问层实验的范畴。 然而,关于这些范式如何扩展,目前所知甚少。每种范式通常在其自身的基准上、在单一语料规模下进行评估,而企业知识库等已部署的语料包含数十万份文档且持续增长。所谓扩展,是指在工作负载固定的情况下,语料增长时范式的行为表现。 ![[无标题图片]](https://arxiv.org/html/2607.26497v1/x1.png) 图1:在六个共同层级上,覆盖调整后的准确率与分摊令牌成本的关系。不支持图的层级在本预览中计为零;成本取已完成层级的平均值。 从最小层级开始,问题相关的证据和对抗证据也是固定的。我们从三个维度进行测量:答案准确性、离线构建成本(生成式令牌和嵌入令牌)以及在线查询令牌成本和延迟。准确测量具有挑战性,因为准确率差异容易受到阅读器模型、评判器、问题集以及语料难度等因素的干扰。现有的比较通常固定语料规模为单一大小,并自由改变这些因素,因此扩展问题一直悬而未决。 为弥补这一空白,我们在EnterpriseRAG-Bench(Sun等人,2026 (https://arxiv.org/html/2607.26497#bib.bib27))上开展了一项受控的语料规模扩展研究。该基准包含511,959份文档、500个问题以及每个问题对应的对抗干扰项。规模通过一个28个严格嵌套层级的阶梯来变化,每级增长1.25倍,从1,144份文档增长至511,959份文档(170万至6.01亿令牌),所有层级均包含相同的问题相关文档和干扰项。新增文档遵循固定的、按来源和噪声分层的顺序。每个范式通过同一阅读器回答相同的问题,并进行令牌级成本计量,所有预测均按基准官方协议评分,并通过独立评判器和二进制协议检查鲁棒性。结果预览如图1 (https://arxiv.org/html/2607.26497#S1.F1)所示,一致表明:BM25在每个测定层级上都定义了成本-准确率前沿的低成本端点,并在中等规模后引领官方综合得分。文件系统智能代理是最强的替代方案,在最小层级上匹配或略优于BM25,但在基础语料上每个答案的查询令牌消耗多出39倍,在完整语料上准确率落后近20个百分点。基于图的RAG面临困境:其最重的构建器很快达到构建上限,而可扩展变体在共同层级上的准确率仍低于BM25。 我们的贡献如下: - •一个可重用的28级语料阶梯,规模增长约450倍,而问题、黄金文档和干扰项保持不变。 - •对四种RAG范式下的七个原生流水线进行统一的规模扩展评估,包含令牌级成本计量、交叉验证评判以及匹配的检索、框架和基底控制。 - •机制分析将BM25的优势归因于全局候选项发现能力:Agent+BM25在完整语料的匹配问题上将同一框架从36.9提升至69.4。 - •一个智能代理访问层,通过类型化工具暴露每个图索引,将结构与智能代理行为分离。 ## 2 相关工作 **检索增强生成。** RAG通过学习的或固定的阅读器,将生成过程植根于检索到的文本(Lewis等人,2021 (https://arxiv.org/html/2607.26497#bib.bib15);Guu等人,2020 (https://arxiv.org/html/2607.26497#bib.bib8);Ram等人,2023 (https://arxiv.org/html/2607.26497#bib.bib22));自适应变体进一步决定何时检索或批判证据(Asai等人,2023 (https://arxiv.org/html/2607.26497#bib.bib1);Jiang等人,2023 (https://arxiv.org/html/2607.26497#bib.bib9))。检索范围从词汇BM25(Robertson and Zaragoza, 2009 (https://arxiv.org/html/2607.26497#bib.bib23);Lin等人,2021 (https://arxiv.org/html/2607.26497#bib.bib16))扩展到学习型稀疏、稠密和延迟交互模型(Formal等人,2021 (https://arxiv.org/html/2607.26497#bib.bib4);Karpukhin等人,2020 (https://arxiv.org/html/2607.26497#bib.bib12);Khattab and Zaharia, 2020 (https://arxiv.org/html/2607.26497#bib.bib13))。我们使用BM25和紧凑的块嵌入作为代表性的词汇和稠密接口,同时保持阅读器固定。 **基于图的RAG。** 这些方法在回答问题之前构建显式结构。MS-GraphRAG构建层次化的实体社区和报告(Edge等人,2025 (https://arxiv.org/html/2607.26497#bib.bib3));LightRAG索引实体和关系(Guo等人,2025 (https://arxiv.org/html/2607.26497#bib.bib5));HippoRAG 2通过查询链接的事实和个性化PageRank进行检索(Gutiérrez等人,2025a (https://arxiv.org/html/2607.26497#bib.bib6),b (https://arxiv.org/html/2607.26497#bib.bib7))。LinearRAG则使用轻量级NER和嵌入构建实体共现图,无需生成式构建调用(Zhuang等人,2025 (https://arxiv.org/html/2607.26497#bib.bib34))。该家族还包括基于树、策展KG和GNN的索引(Sarthi等人,2024 (https://arxiv.org/html/2607.26497#bib.bib24);Chen等人,2024 (https://arxiv.org/html/2607.26497#bib.bib2);Mavromatis and Karypis, 2024 (https://arxiv.org/html/2607.26497#bib.bib17);Peng等人,2024 (https://arxiv.org/html/2607.26497#bib.bib19)),但已发表的评估通常仍停留在固定、相对较小的语料规模。 **智能代理检索。** 第三种方向将一次性流水线替换为LLM智能代理,它交织推理和工具调用(Yao等人,2023 (https://arxiv.org/html/2607.26497#bib.bib32);Schick等人,2023 (https://arxiv.org/html/2607.26497#bib.bib25);Qin等人,2023 (https://arxiv.org/html/2607.26497#bib.bib21)),搜索开放网络(Nakano等人,2022 (https://arxiv.org/html/2607.26497#bib.bib18)),在多步推理中自适应检索(Trivedi等人,2023 (https://arxiv.org/html/2607.26497#bib.bib28);Press等人,2023 (https://arxiv.org/html/2607.26497#bib.bib20)),反思失败(Shinn等人,2023 (https://arxiv.org/html/2607.26497#bib.bib26)),或通过强化学习学习搜索策略(Jin等人,2025 (https://arxiv.org/html/2607.26497#bib.bib11))。这些系统同时改变了控制器和检索基底,而我们的扩展问题要求控制器保持固定。因此,我们按照编码智能代理建立的形式来实例化该范式:一个通过纯文件系统操作导航语料的相同工具循环(Jimenez等人,2024 (https://arxiv.org/html/2607.26497#bib.bib10);Yang等人,2024a (https://arxiv.org/html/2607.26497#bib.bib30);Wang等人,2025 (https://arxiv.org/html/2607.26497#bib.bib29))。我们的文件系统智能代理将此接口应用于原始企业语料;基底实验则保持其策略模型、提示、工具循环和预算固定,同时将原始文件替换为图索引。 参见说明图2:评估方法。四种范式访问相同的嵌套语料阶梯(T0⊂⋯⊂T27T_0⊂⋯⊂T_27),每级增长1.25倍,同时保留固定的1,144份文档基础。500个问题分为470个基于源文档、10个由支架支持的高层问题和20个未找到问题。每个范式使用相同的阅读器,并计量构建/查询令牌、延迟和官方准确率。**基准与评判。** 现有RAG基准在固定语料规模下评估答案质量,很少计量离线成本(Yang等人,2024b (https://arxiv.org/html/2607.26497#bib.bib31))。我们将EnterpriseRAG-Bench的多源语料和官方评估(Sun等人,2026 (https://arxiv.org/html/2607.26497#bib.bib27))扩展为嵌套规模扩展、统一成本核算和跨范式比较。通过双协议和测量的交叉评判一致性,限制评判器依赖性(Zheng等人,2023 (https://arxiv.org/html/2607.26497#bib.bib33))。 ## 3 基准与规模扩展方法论 本节描述语料、嵌套规模扩展阶梯以及统一的回答和计量框架。图2 (https://arxiv.org/html/2607.26497#S2.F2)总结了完整流水线。 **语料与问题。** EnterpriseRAG-Bench模拟了一家为LLM推理提供服务的企业。语料包含511,957份文档,总计6.008亿令牌,来自九个来源,包括维基页面、聊天记录、工单、电子邮件、会议记录、CRM记录和代码审查。加上基准的两个组织概述页面(我们将其作为支架),完整评估层级包含511,959份文档。该基准提供500个问题,涵盖十种类型,从基本查询到完整性、冲突信息及高层问题。每个问题都标注有黄金文档、黄金答案和原子答案事实列表,共722份黄金文档。语料中7.7%的文档被原生标记为噪音(误归入错误来源或路径,或与过时事实近似重复),这构成了现实的归档噪音。根据类型不同,问题从源文档生成,或由探索语料的智能代理生成。已发布的黄金集随后通过汇集BM25、稠密检索和文件智能代理搜索的候选证据进行完善;因此标签构建并非仅依赖BM25。 **基础文档集。** 最小层级通过确定性方式构建,包含标注为500个问题中任何一个的黄金文档的722份文档、326个挖掘的陷阱、99个诱饵以及语库自身的两个组织页面(公司概述和项目索引,作为支架)。去除五个跨类别重复项后,得到1,144份文档。陷阱通过方法盲过滤挖掘:对于每个目标问题,BM25贡献其全语料前10项,而稠密检索对BM25前200池(未找到问题为前1000)进行重排序并贡献10个候选。LLM过滤器保留每个与黄金文档涉及相同实体或主题但报告了错误版本、日期或决策的候选。此步骤在单一主题性加错误事实标准下产生326个陷阱。诱饵服务于信息未找到问题:每个问题中过滤器验证无法回答的五个最相似候选,从而使得无法回答的问题不能仅因检索文本缺失而解决。BM25前10和BM25前200池的稠密重排序各贡献10个候选;不涉及任何评估系统的得分或答案判断。直接的全语料DenseRAG审计独立测试对该候选池的敏感性。由于每个对抗文档都位于基础文档集中而非逐步引入,当语料通过新增非基础文档增长时,问题特定的证据和对抗集保持不变。 **嵌套层级。** 设π\\pi表示非基础语料库的一个固定、按来源和噪声分层的排序。层级tt由基础文档集加上π\\pi的前nt-1,144n_t-1,144份文档组成。每个新增前缀的来源和噪声分布近似全局背景语料。规模满足nt+1≈1.25*ntn_{t+1}≈1.25*n_t,从而产生28个层级。前缀构建保证了T1⊂T2⊂⋯T_1⊂T_2⊂⋯精确成立,并通过清单校验和验证,允许增量构建器将索引从一个层级扩展到下一个层级,这也是边际构建成本的计量方式。我们报告语料令牌规模而非文档数量,因为不同来源的文档长度不同。
相似文章
BM25在大规模下胜出:检索增强生成范式的规模扩展研究
一项对检索增强生成范式的受控扩展研究发现,BM25词汇检索在大规模下优于智能体检索和图检索,而智能体搜索仅在小型语料库上领先。
ScalableRAG:零摄入成本的高质量RAG
本文介绍了ScalableRAG,一种检索增强生成方法,通过基于正则表达式的集合创建和聚合推理,在无需任何摄入成本(无需向量数据库或知识图谱)的情况下实现高准确率。它在多个数据集上优于基线方法,并提出了一个有限摄入变体以进一步提升准确率。
检索增强生成解决了大多数团队实际上并不存在的问题
文章论点是检索增强生成(RAG)在AI系统中经常被误用,真正的问题在于上下文策展而非检索。它表明RAG仅对大规模、频繁变化的语料库真正有益。
ContextRAG:面向检索增强生成的无抽取层次图构建
ContextRAG引入了一种无抽取方法,用于构建面向检索增强生成的层次图索引。该方法利用残差量化K均值(Residual-Quantization K-Means)和形式概念分析(Formal Concept Analysis),将大语言模型(LLM)调用和Token数量减少数个数量级,同时在多跳问题上保持具有竞争力的F1分数。
LightRAG:简单高效的检索增强生成框架
本文介绍了 LightRAG,这是一个开源框架,通过整合图结构来提升检索增强生成(RAG)的上下文感知能力与信息检索效率。