文档检索感知分块(D-RAC):通过 PDF 标准化和多模态 Markdown 转换实现企业文档的通用检索感知摄入
摘要
文档检索感知分块(D-RAC)是一种方法,它将企业文档标准化为 PDF,使用多模态 LLM 将其转换为检索优化的 Markdown,并进行高效分块,与代理分块相比,显著降低了 token 使用量和成本。
查看缓存全文
缓存时间: 2026/09/22 07:25
论文页面 - 文档检索感知分块 (D-RAC):基于PDF标准化与多模态Markdown转换的企业文档通用检索感知摄取
来源:https://huggingface.co/papers/2609.24220
摘要
检索增强生成(RAG)系统在处理企业知识库时,必须摄取异构的文档格式——PDF、Word文档、演示文稿和扫描件——其内容被锁定在复杂的视觉布局、多栏页面和密集的表格中。基于规则的提取和OCR会破坏阅读顺序、扁平化表格并丢失标题层级结构,而完全基于智能体的分块方法则在处理提取出的文本时会产生高昂的token成本和幻觉风险。我们提出文档检索感知分块(D-RAC),这是我们将网页检索感知分块(W-RAC)框架扩展到任意文档格式的方案。D-RAC首先将任何输入文档标准化为PDF格式,这利用了几乎所有格式都具有忠实、确定性PDF渲染这一事实。随后,通过一次多模态大语言模型的处理,将渲染后的页面转换为检索优化的Markdown格式——将表格重写为自包含的散文式陈述并保留标题层级结构——之后分块过程则与W-RAC完全一致:通过确定性解析得到可按ID寻址的单元,然后基于标识符(而非文本)进行轻量级大语言模型分块规划。在整个分块过程中,源文本从未被重新生成,这保留了W-RAC的成本、确定性和可观察性优势,同时将所有可渲染格式解锁为一等输入格式。在涵盖五个企业领域的RAG-Multi-Corpus基准测试的236份文档、795页PDF子集上,D-RAC在72分钟内完成整个语料库的转换与分块,零错误,生成了1,748个检索就绪的块。与使用前沿大语言模型的智能体分块相比,D-RAC将分块阶段的输出token减少了95.7%,分块成本降低了77.8%(基于GPT-4.1定价)至85.6%(基于Gemini 2.5 Pro定价),分块时间缩短了75%。D-RAC可线性扩展至500页以上的文档。
查看arXiv页面 (https://arxiv.org/abs/2609.24220)查看PDF (https://arxiv.org/pdf/2609.24220)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24220)
通过代理获取此论文:
hf papers read 2609\.24220
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到本文
在模型 README.md 中引用 arxiv.org/abs/2609.24220 以从此页面链接。
引用本文的数据集 0
没有数据集链接到本文
在数据集 README.md 中引用 arxiv.org/abs/2609.24220 以从此页面链接。
引用本文的Spaces 0
没有Space链接到本文
在Space README.md 中引用 arxiv.org/abs/2609.24220 以从此页面链接。
包含本文的收藏夹 0
没有收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
Web Retrieval-Aware Chunking (W-RAC):高效且经济高效的检索增强生成系统分块方法
W-RAC 提出了一种针对 RAG 系统中网页文档处理的经济高效的分块框架,通过结构化内容表示和检索感知的分组决策,将 LLM 令牌使用量降低一个数量级。该方法将文本提取与语义分块规划解耦,在实现与传统分块方法相当或更好的检索性能的同时,最大限度地降低了幻觉风险。
Adaptive Chunking:为RAG优化分块方法选择
介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。
MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。
@GithubProjects:Chunkr 是一个开源文档智能服务,可将 PDF、PPT、Word 文档和图像转换为结构化…
Chunkr 是一个开源文档智能服务,将 PDF、PPT、Word 文档和图像转换为结构化块,用于 RAG 和 LLM 流水线。它具有 OCR 布局分析、结构化 HTML/Markdown 输出、视觉语言模型处理,以及通过 Docker Compose 自托管部署,可配置 LLM 提供商。
LFRAG:面向布局的多模态文档理解细粒度检索增强生成
LFRAG提出了一种面向布局的细粒度检索增强生成框架,该框架在多模态文档中从页面级检索转向块级检索,在新提出的LFDocQA基准上实现了最先进的性能,并将令牌数量减少了73%。