文本块大小对检索增强生成性能的影响
摘要
本文研究了检索增强生成系统中文本块(句子、段落、章节)大小对生成质量、检索精度和计算效率的影响,实验采用了相同的教科书,按不同粒度进行分割。
arXiv:2607.24767v1 公告类型: cross
摘要:检索增强生成(RAG)系统已成为一种强大的方法,允许大型语言模型(LLMs)在文本生成过程中检索相关信息作为源材料。这些系统的一个关键但尚未充分探索的组件是源文档分割成可检索块的粒度。这些块的大小有可能显著影响生成质量、上下文正确性、检索精度和计算效率。尽管其重要性,但块大小的选择往往没有对其对生成质量的影响进行适当评估。较小的块,如单个句子,可以通过缩小每个块的焦点来实现精确检索。然而,它们包含的信息较少,这可能限制模型生成连贯响应的能力。较大的块,如整个章节,包含大量广泛信息,可能提高正确性,但也会引入额外噪声并增加计算成本。由于较大的块包含更多信息,还需要考虑返回给模型的块数量。本文评估了块大小以及检索到的段数如何影响生成质量和检索效果。通过比较这些配置,本研究旨在更好地理解文档分割如何影响检索增强生成系统的性能和效率。文档分割如何影响检索增强生成系统的性能和效率。
查看缓存全文
缓存时间: 2026/07/29 09:56
# 1 源文档管道的流程图 来源:https://arxiv.org/html/2607.24767 文本分块大小对检索增强生成性能的影响 德国·加里多-莱斯塔什·贝林琼,乌戈·加里多-莱斯塔什·贝林琼 计算机科学与软件工程系 密尔沃基工程学院 密尔沃基,威斯康星州,美国 [email protected] 检索增强生成(RAG)系统已成为一种强大的流程,允许大语言模型(LLM)在文本生成过程中检索相关信息作为源材料使用。这些系统的一个关键但尚未充分探究的组件是源文档被分割成可检索分块的粒度。这些分块的大小有可能显著影响生成质量、上下文正确性、检索精度和计算效率。尽管其重要性,但通常在选择分块大小时缺乏对其生成质量影响的恰当评估。 本文旨在通过使用同一完整本科教材的多个表示(每个表示被分割成不同大小的分块,例如句子、段落或章节)来探讨文本大小对生成质量的影响。由于所有分块都使用相同的源材料,因此分块粒度被作为主要变量。这些分块使用密集嵌入模型进行嵌入,并索引到向量数据库中用于语义检索。通过余弦相似度搜索确定相关性,将与用户提示最相似的文本分块检索出来,作为上下文输入提供给LLM以生成响应。 较小的分块(如单个句子)可能通过缩小每个分块的聚焦范围来实现精确检索。然而,它们包含的信息较少,可能会限制模型生成连贯响应的能力。较大的分块(如整个章节)包含大量广泛的信息,可能会提高正确性,但也会引入额外的噪声并增加计算成本。由于较大的分块包含更多信息,因此还必须考虑返回给模型的分块数量。 本文评估了分块大小以及检索到的分块数量如何影响生成质量和检索效果。通过比较这些配置,本研究旨在更好地理解文档分割如何影响检索增强生成系统的性能和效率。 引言 LLM在多种格式和上下文中生成连贯、相关的文本方面非常有效。尽管乍看之下它们生成的文本可能看似合适,但仔细检查后会发现常常充满过时、虚构且通常不正确的信息。这是LLM众所周知的问题,但在每个可想象的topic上训练它们将非常耗时且计算成本高昂,那么如何让这些模型产生事实准确且智能的响应呢? 检索增强生成(RAG)系统通过将外部知识检索与文本生成相结合来解决这一限制。这些模型将使用一个大型数据库来存储信息性文本分块,然后RAG模型在给定提示后,找到相关的源信息并在文本生成过程中提供它们,以生成准确的事实性响应。这个流程当然高度依赖于模型检索相关信息的能力。 在将文档嵌入并索引到向量数据库之前,必须将其分割成可检索的分块。这些分块的粒度存在权衡。较小的分块提高了检索速度和计算能力,但缺乏生成连贯响应所需的上下文深度。较大的分块可能为LLM提供更多上下文参考,但会引入噪声,降低检索效率,并增加计算开销。这些分块的大小(无论是句子还是段落)通常在选择时缺乏对其如何影响整体生成质量的恰当评估。 分块大小对上下文检索和连贯文本生成有着明显的影响。尽管如此,很少有研究将分块大小作为一个变量来隔离。本文旨在通过评估文本分块粒度如何影响RAG框架中的检索效果和生成质量来解决这一问题。通过比较使用同一源材料的多种分块大小,这项工作旨在为检索增强生成系统中一个重要但经常被忽视的组件提供见解。 相关工作 检索增强生成已成为通过使用外部源改善大语言模型响应准确性的基础方法。早期的RAG解决方案侧重于检索架构和嵌入质量,同时采用固定的文档分割策略(Lewis 等,2020)[6 (https://arxiv.org/html/2607.24767#bib.bib5)]。以检索为重点的生成模型(如Fusion-in-Decoder)进一步证明了检索与生成之间的集成可以显著提升响应质量,但仍将文档分块视为一个静态预处理步骤(Izacard 等,2021)[4 (https://arxiv.org/html/2607.24767#bib.bib7)]。 最近的工作改进了检索信息的结构化和利用方式。RAPTOR框架(Sarthi 等,2024)[7 (https://arxiv.org/html/2607.24767#bib.bib1)]引入了基于大文档集合递归摘要的层次检索。类似地,Self-RAG(Asai 等,2023)[1 (https://arxiv.org/html/2607.24767#bib.bib2)]实现了迭代式生成-批评循环,允许模型优化检索决策和生成输出。这些方法强调,改进检索和生成流程可以显著提升RAG系统的性能。 其他研究通过检索后精炼来解决检索噪声和上下文相关性问题。Corrective RAG(Yan 等,2024)[9 (https://arxiv.org/html/2607.24767#bib.bib3)]引入了过滤和纠正机制来减轻无关检索内容的影响,而ChunkRAG(Singh 等,2024)[8 (https://arxiv.org/html/2607.24767#bib.bib10)]在生成前应用基于LLM的相关性过滤。尽管有效,但这些方法主要在检索后起作用,并假设源文档是固定分割的,侧重于精炼检索到的内容,而非检查文档结构如何影响性能。 与本研究更为密切相关的是检查RAG流程中文档分块的研究。(Hladena 等,2025)[3 (https://arxiv.org/html/2607.24767#bib.bib4)]证明分块大小显著影响检索效率、生成质量和计算成本。其他研究跨数据集和嵌入分析分块大小(Bhat 等,2025)[2 (https://arxiv.org/html/2607.24767#bib.bib9)]或在特定领域上下文中利用文档结构(Yepes 等,2025)[5 (https://arxiv.org/html/2607.24767#bib.bib8)],尽管这些工作主要强调检索效果。相比之下,我的工作将分块大小作为主要变量,使用来自相同源内容的有意义边界(句子、段落、页面和章节),并在受控的嵌入、检索和生成条件下进行评估。这使我们能够同时检查检索效果和下游生成质量,提供对文档分块如何影响RAG系统性能的更全面视角。 实现 RAG流程首先从源文档逐页加载并提取文本。它提取原始文本并去除诸如多余换行、页码和连字符分词等伪迹。这将产生一个适合分块的干净连续文本体。 然后,文档使用不同级别的粒度进行分割,包括基于正则的章节级分割,以及代理性的段落和句子级分割,其中LLM从滑动文本窗口中迭代提取第一个段落。这允许更自然的分割,而不是仅依赖格式,使得分块能够适用于任何类型的源文档。 分割完成后,每个分块使用预训练的嵌入模型嵌入为向量表示,并存储到每个分块粒度对应的不同向量数据库中。在检索时,用户的提示使用相同的模型嵌入,并使用余弦相似度搜索来找到n个最相似的文本分块。 然后,系统将检索到的分块与用户查询拼接起来,作为源信息。这个增强后的提示被传递给LLM以生成事实准确、有依据的响应。 总体而言,此实现支持在不同分块大小和检索配置下进行受控实验,从而能够直接比较它们对生成质量、相关性和效率的影响。 参考图注1:源文档管道流程图 参考图注2:RAG管道流程图 实验 首先为了确保程序能够有效检索到相关的源分块,我使用ChatGPT生成了一组100个提示,这些提示旨在模拟真实提示,涵盖不同范围、特异性和复杂度。对于每个提示,我测试了所有分块策略下的检索效果。检索效果使用倒数排名(Reciprocal Rank)来评估,该指标衡量第一个相关结果在检索分块排名列表中的位置高低。如果检索到的分块包含正确回答提示所需的信息,则视为相关。相关性通过使用LLM进行代理验证来确定,即检查答案是否能在检索文本中找到。这确保了所有分块策略的一致性。通过对所有提示的倒数排名分数取平均值,我得到了一个可以比较每种分块方法的检索分数。此外,我绘制了每个提示下每种分块策略的分数图,以分析模型在哪些特定提示上难以检索。 结果与分析 参考图注3:分割数学教科书的结果 参考图注4:分割数学教科书的结果 结果表明,分块策略对检索性能有显著影响,尽管这取决于底层文本的结构。对于数学教科书,段落级分块取得了最高平均检索分数,紧随其后的是句子级分块。这表明,对于结构化、信息密集的内容,中等大小的分块(如段落)在精度和上下文完整性之间提供了最佳平衡。句子级分块虽然精确,但偶尔缺乏足够的上下文,而章节级分块则过于宽泛,引入了噪声并降低了检索精度。 参考图注5:分割叙事文本的结果 参考图注6:分割叙事文本的结果 叙事文本的结果显示出非常不同的模式。句子级分块显著优于所有其他方法,平均检索分数达到0.294,而章节、页面和段落级分块的性能都非常差。这表明,对于叙事驱动的内容,其中相关细节通常局限于特定的对话或描述行,较小的分块更为有效。在这种背景下,较大的分块似乎稀释了相关信息,使得检索系统更难隔离有用内容。这些结果强化了这样的结论:最佳分块大小高度依赖于源材料的结构和写作风格。 尽管有这些发现,仍需考虑几个局限性。虽然较小的分块大小通常能提高检索精度,但它们会导致存储的嵌入数量显著增加,从而增加存储需求和索引时间。另一方面,较大的分块减少了存储开销,但可能引入无关上下文,对检索质量产生负面影响,并在生成过程中带来不希望的噪声。此外,使用代理性分块会引入额外的计算成本,因为它需要预处理的LLM。这使得它对于大规模系统来说不太实用,尽管它有潜力产生更有意义的文本分块。 结论 本研究旨在探究文档分割分块大小如何影响RAG系统的性能。结果表明,分块策略在检索和生成中扮演着重要角色。然而,没有一种分块大小在所有媒介中始终优于其他方法。相反,给定分块大小的有效性与文本结构密切相关。 一个关键发现是,不同的文本媒介表现出不同的最佳分块行为。更结构化或叙事驱动的文档往往受益于较大的分块,其中更广泛的上下文提高了模型生成连贯且准确响应的能力。相比之下,更碎片化或信息密集的文本可能受益于较小的分块,这些分块允许更精确的检索,但代价是上下文完整性降低。这突显了精度与上下文之间的重要权衡,表明分块大小不应被视为固定参数,而应作为系统设计的可配置方面。 这些结果指出了未来研究的几个有前景的方向。一个特别引人注目的方向是进一步探索代理性或自适应分块,其中分块根据文档结构、查询意图或检索反馈进行动态分割。这样的系统可以在索引时或检索时调整分块粒度,为基于事实的查询选择较小的分块,为需要大量推理的提示选择较大、上下文更丰富的片段。此外,结合多种分块大小或从原子单元动态组装上下文的混合方法,可能进一步缓解静态分块方案中观察到的精度-上下文权衡。 总体而言,这项工作强化了这样的观点:有效的RAG系统需要仔细考虑如何分割源文档,而不是依赖一刀切的方法。通过更好地将分块方法与源材料的结构对齐,有可能以更一致和高效的方式提高检索质量和生成性能。 ## 参考文献 - [1] (2023)Self-rag: learning to retrieve, generate, and critique through self-reflection. External Links: 2310.11511, Link (https://arxiv.org/abs/2310.11511) 被引用于:p13.1 (https://arxiv.org/html/2607.24767#p13.1) 。 - [2] S. R. Bhat et al. (2025) Rethinking chunk size for long-document retrieval: a multi-dataset analysis. arXiv preprint arXiv:2505.21700. 被引用于:p15.1 (https://arxiv.org/html/2607.24767#p15.1) 。 - [3] 被引用于:p15.1 (https://arxiv.org/html/2607.24767#p15.1) 。 - [4] G. Izacard and E. Grave (2021) Leveraging passage retrieval with generative models for open domain question answering. In ACL, 被引用于:p12.1 (https://arxiv.org/html/2607.24767#p12.1) 。 - [5] A. Jimeno Yepes et al. (2024) Financial report chunking for effective retrieval augmented generation. arXiv preprint arXiv:2402.05131. 被引用于:p15.1 (https://arxiv.org/html/2607.24767#p15.1) 。 - [6] P. Lewis, E. Perez, A. Piktus, et al. (2020) Retrieval-augmented generation for knowledge-intensive nlp tasks. Advances in Neural Information Processing Systems. 被引用于:
相似文章
低资源语言农业文档中有效文本嵌入的分块策略评估
本文评估了四种用于高棉语农业文档检索增强生成(RAG)的文本分块策略,发现基于字符的递归分块(300字符)在检索和相关性方面表现最佳。
面向检索增强生成的查询自适应语义分块:一种结合上下文窗口扩展的动态策略
提出了一种面向检索增强生成的查询自适应语义分块方法,通过上下文窗口扩展动态调整分块边界,以提升检索精度。
德国法律法规的分块策略
本文评估了针对德国法律法规的检索增强生成中的多种分块策略,发现与结构对齐的方法(如基于章节的检索)优于更复杂的方案。
BM25在大规模下胜出:检索增强生成范式的规模扩展研究
一项对检索增强生成范式的受控扩展研究发现,BM25词汇检索在大规模下优于智能体检索和图检索,而智能体搜索仅在小型语料库上领先。
哪种RAG范式在大规模下胜出?检索增强生成范式的规模化研究
本文通过控制变量,对词汇型、密集向量型、图基型和智能体型RAG范式在从1,000到512,000篇文档的语料规模范围内进行了规模化比较研究。研究发现BM25在准确性与成本之间取得了最佳平衡,而图基型RAG面临高昂的构建成本,限制了其扩展性。