文档检索感知分块(D-RAC):通过 PDF 标准化和多模态 Markdown 转换实现企业文档的通用检索感知摄入

Hugging Face Daily Papers 论文

摘要

文档检索感知分块(D-RAC)是一种方法,它将企业文档标准化为 PDF,使用多模态 LLM 将其转换为检索优化的 Markdown,并进行高效分块,与代理分块相比,显著降低了 token 使用量和成本。

基于企业知识库的检索增强生成(RAG)系统必须摄入异构文档格式——PDF、Word 文档、演示文稿和扫描件——其内容被锁定在复杂的视觉布局、多列页面和密集表格中。基于规则的提取和 OCR 破坏阅读顺序、扁平化表格并丢失标题层次结构,而基于提取文本的完全代理分块会导致高 token 成本和幻觉风险。我们提出文档检索感知分块(D-RAC),这是我们 Web 检索感知分块(W-RAC)框架向任意文档格式的扩展。D-RAC 首先将任何输入文档标准化为 PDF,利用几乎每种格式都有忠实、确定性的 PDF 渲染这一事实。然后,通过一次多模态 LLM 处理将渲染后的页面转换为检索优化的 Markdown——将表格重写为自包含的散文陈述并保留标题层次结构——之后,分块过程与 W-RAC 完全相同:确定性解析为可通过 ID 寻址的单元,然后是基于标识符而非文本的轻量级 LLM 分块规划。在分块过程中永远不会重新生成源文本,保留了 W-RAC 的成本、确定性和可观察性优势,同时将每种可渲染格式解锁为一等输入。在涵盖五个企业领域的 RAG-Multi-Corpus 基准测试的 236 篇文档、795 页 PDF 子集上,D-RAC 在 72 分钟内无错误地转换和分块整个语料库,生成 1,748 个检索就绪的块。与使用前沿 LLM 的代理分块相比,D-RAC 将分块阶段输出 token 减少了 95.7%,分块成本降低了 77.8%(GPT-4.1 定价)到 85.6%(Gemini 2.5 Pro 定价),分块时间减少了 75%。D-RAC 可线性扩展到 500 页以上的文档。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:25

论文页面 - 文档检索感知分块 (D-RAC):基于PDF标准化与多模态Markdown转换的企业文档通用检索感知摄取

来源:https://huggingface.co/papers/2609.24220

摘要

检索增强生成(RAG)系统在处理企业知识库时,必须摄取异构的文档格式——PDF、Word文档、演示文稿和扫描件——其内容被锁定在复杂的视觉布局、多栏页面和密集的表格中。基于规则的提取和OCR会破坏阅读顺序、扁平化表格并丢失标题层级结构,而完全基于智能体的分块方法则在处理提取出的文本时会产生高昂的token成本和幻觉风险。我们提出文档检索感知分块(D-RAC),这是我们将网页检索感知分块(W-RAC)框架扩展到任意文档格式的方案。D-RAC首先将任何输入文档标准化为PDF格式,这利用了几乎所有格式都具有忠实、确定性PDF渲染这一事实。随后,通过一次多模态大语言模型的处理,将渲染后的页面转换为检索优化的Markdown格式——将表格重写为自包含的散文式陈述并保留标题层级结构——之后分块过程则与W-RAC完全一致:通过确定性解析得到可按ID寻址的单元,然后基于标识符(而非文本)进行轻量级大语言模型分块规划。在整个分块过程中,源文本从未被重新生成,这保留了W-RAC的成本、确定性和可观察性优势,同时将所有可渲染格式解锁为一等输入格式。在涵盖五个企业领域的RAG-Multi-Corpus基准测试的236份文档、795页PDF子集上,D-RAC在72分钟内完成整个语料库的转换与分块,零错误,生成了1,748个检索就绪的块。与使用前沿大语言模型的智能体分块相比,D-RAC将分块阶段的输出token减少了95.7%,分块成本降低了77.8%(基于GPT-4.1定价)至85.6%(基于Gemini 2.5 Pro定价),分块时间缩短了75%。D-RAC可线性扩展至500页以上的文档。

查看arXiv页面 (https://arxiv.org/abs/2609.24220)查看PDF (https://arxiv.org/pdf/2609.24220)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24220)

通过代理获取此论文:

hf papers read 2609\.24220

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到本文

在模型 README.md 中引用 arxiv.org/abs/2609.24220 以从此页面链接。

引用本文的数据集 0

没有数据集链接到本文

在数据集 README.md 中引用 arxiv.org/abs/2609.24220 以从此页面链接。

引用本文的Spaces 0

没有Space链接到本文

在Space README.md 中引用 arxiv.org/abs/2609.24220 以从此页面链接。

包含本文的收藏夹 0

没有收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Adaptive Chunking:为RAG优化分块方法选择

Papers with Code Trending

介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。