HC-RAG:面向异构财务申报文件的以证据为中心的检索增强生成

arXiv cs.CL 论文

摘要

本文介绍了HC-RAG,一个面向10-K文件的以证据为中心的金融问答的分层跨模态检索增强生成框架,以及一个新的基准Multi-Doc-2025。它在金融问答基准上优于RAPTOR和GraphRAG,尤其是在长文档和表格相关查询方面。

arXiv:2608.12335v1 公告类型:新 摘要:年度报告的金融问答不仅仅需要检索语义相似的段落。它通常涉及识别相关公司和财政年度,定位标准化文件章节,收集文本和表格证据,并对照原始文件检查答案。然而,现有的RAG系统通常将长文件展平为无序块,对财务报告的类型化结构关注有限,并使用固定的文本-表格融合策略而不考虑查询意图。为了解决这些局限性,我们提出了 \textbf{HC-RAG},一个面向以证据为中心的金融QA的分层跨模态检索增强生成框架。HC-RAG将文件组织为带有文档、章节、文本单元、表格单元和元数据节点的类型化金融证据图。它通过文档-章节-单元路径检索证据,在共享检索空间中对齐文本和表格证据,并根据四种语义意图(计算、趋势、事实和比较)路由证据。我们进一步引入了 \textbf{Multi-Doc-2025},一个包含来自87家S&P 500公司的179份SEC 10-K文件的2,327个专家验证的QA对的基准,覆盖2022--2024财年,带有意图、难度和结构证据属性标签。在公开金融QA基准和Multi-Doc-2025上的实验表明,HC-RAG提高了答案质量和证据定位,尤其是在长文档、表格相关和跨文档设置中。HC-RAG在DocFinQA上比RAPTOR高6.6个F1点,在Multi-Doc-2025上比GraphRAG高10.9个F1点。证据级分析和消融研究表明,改进主要来自更准确的章节定位、表格基础、跨文档证据聚合和意图感知的文本-表格路由。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:24

# HC-RAG:面向异构财务申报文件的证据中心检索增强生成
来源:https://arxiv.org/html/2608.12335
陈思远 中山大学 珠海 [email protected] &谭华烨 中南大学 长沙 [email protected] &李悠 中山大学 珠海 [email protected] &梁家俊 中山大学 珠海 [email protected]

###### 摘要

年度报告上的金融问答不仅仅需要检索语义相似的段落。它通常还涉及识别相关公司和财年、定位标准化的申报文件章节、收集文本和表格证据,以及对照原始文档核验答案。然而,现有的RAG系统通常将长申报文件平铺为无序的块,对财务报告的类型化结构关注有限,并且使用固定的文本-表格融合策略而不考虑查询意图。为了解决这些局限性,我们提出了HC\-RAG,一个面向证据中心金融问答的层次化跨模态检索增强生成框架。HC\-RAG将申报文件组织为带类型的财务证据图,包含文档、章节、文本单元、表格单元和元数据节点。它通过文档-章节-单元路径检索证据,在共享检索空间中对齐文本和表格证据,并根据四种语义意图(计算、趋势、事实和比较)路由证据。我们进一步引入了Multi\-Doc\-2025,一个包含来自87家标普500公司2022–2024财年179份SEC 10\-K申报文件的2,327个专家验证问答对的数据集,并带有意图、难度和结构性证据属性标签。在公开金融问答基准和Multi\-Doc\-2025上的实验表明,HC\-RAG在答案质量和证据定位方面均有提升,尤其是在长文档、表格相关和跨文档场景中。HC\-RAG在DocFinQA上比RAPTOR高6.6个F1点,在Multi\-Doc\-2025上比GraphRAG高10.9个F1点。证据层面的分析和消融研究表明,改进主要来自更准确的章节定位、表格依据、跨文档证据聚合以及意图感知的文本-表格路由。

*关*键词异构图挖掘⋅\\cdot财务文档智能⋅\\cdot层次化证据检索⋅\\cdot多模态数据挖掘⋅\\cdot检索增强生成

## 1引言

目前,全球大多数金融机构都在设计自己的AI代理。虽然面向公众的智能客服工具已经相当成熟,但面向分析师和从业者的专业分析工具仍然相对较少。财务报表是金融专业人士最重要的分析材料,而专注于财务报表分析的智能代理和AI赋能工具正在不断发展。特别是金融问答,具有显著的实用价值和生产价值。年度报告上的金融问答依赖于找到可在原始申报文件中核验的证据。与普通文本文档不同,年度报告通常较长、有结构,并且同时包含叙述性文本和财务表格。一份10\-K表格申报文件往往有数万个token,并按业务概述、风险因素、MD&A、财务报表和附注等章节组织。这些章节之间密切相关。例如,叙述性解释可能引用表格中的数值,风险披露可能依赖于会计信息,许多分析师式问题需要跨公司或跨财年进行比较。RAG是让大语言模型基于外部证据回答问题的一种有用方式[14 (https://arxiv.org/html/2608.12335#bib.bib3),6 (https://arxiv.org/html/2608.12335#bib.bib4)],但财务申报文件带来的检索问题比普通开放域语料库更具结构性,因为支持证据是层次化的、跨文档的、跨年份的,并且是文本-表格混合的[28 (https://arxiv.org/html/2608.12335#bib.bib1),11 (https://arxiv.org/html/2608.12335#bib.bib2)]。

当前的RAG系统在这种场景下仍存在几个问题。首先,许多方法将长申报文件拆分为扁平的块,并将它们作为独立候选进行检索。这破坏了年度报告原有的文档-章节-单元结构,也可能使重要证据在长文档中更难找到,尤其是在“中间迷失”问题下[17 (https://arxiv.org/html/2608.12335#bib.bib12)]。其次,文本描述和财务表格提供不同但相关的信息。文本通常解释业务背景或会计含义,而表格提供精确的数值。简单的表格序列化或单一检索编码器可能无法很好地对齐这两种证据形式[3 (https://arxiv.org/html/2608.12335#bib.bib9),32 (https://arxiv.org/html/2608.12335#bib.bib10),18 (https://arxiv.org/html/2608.12335#bib.bib14)]。第三,不同问题依赖于不同类型的证据。计算问题通常需要精确的表格值,趋势问题需要时间证据,事实问题往往依赖于特定陈述,比较问题则需要来自不同主体或时期的证据。如果系统总是使用相同的文本-表格融合策略,它可能会引入不相关的证据,而不是选择查询所需的信息。

为了解决这些问题,我们提出了HC\-RAG,一个面向多文档金融问答的层次化跨模态检索增强生成框架。HC\-RAG将金融问答视为在异构财务证据图上的证据检索问题。在该图中,申报文件以类型化的文档、章节、文本单元和表格单元节点表示。因此,检索不是在扁平块上的全局最近邻搜索,而是通过有效图路径选择证据的过程。HC\-RAG还通过非对称的离线-在线设计对齐文本和表格表示,并使用基于四种语义意图类别(计算、趋势、事实和比较)的查询感知特征路由。我们进一步引入了Multi\-Doc\-2025,一个包含来自87家标普500公司2022–2024财年179份SEC 10\-K申报文件的2,327个问答对的数据集。该数据集使用主公司不相交划分,并提供跨文档、跨年份、混合模态、难度级别和意图感知评估的标签。

我们的贡献可总结如下:

- •我们从证据检索的角度研究年度报告上的金融问答。我们不仅关注最终答案是否正确,还强调系统能否从结构化财务申报文件中定位可验证的证据。
- •我们提出了HC\-RAG,它使用类型化财务证据图、层次化证据检索和意图感知的文本-表格路由,以支持跨文档和跨模态的金融推理。
- •我们发布了Multi\-Doc\-2025,一个基于SEC 10\-K申报文件构建的数据集。它涵盖涉及不同公司、财年和混合文本-表格证据的金融问题。
- •我们在答案层面和证据层面评估了HC\-RAG。结果表明,更好的最终答案与更准确的文档、章节、表格和跨文档证据检索密切相关。

## 2相关工作

### 2\.1长上下文和图增强RAG

RAPTOR、GraphRAG和HippoRAG是代表性层次化或图增强RAG系统。这些方法使用树或图结构来帮助跨步骤检索证据[23 (https://arxiv.org/html/2608.12335#bib.bib5),5 (https://arxiv.org/html/2608.12335#bib.bib6),8 (https://arxiv.org/html/2608.12335#bib.bib38)]。HippoRAG还表明检索系统可以借鉴人类记忆机制的思想。HC\-RAG遵循类似思路,但专注于金融问答场景。HC\-RAG不建模通用记忆,而是尝试建模分析师如何在年度报告中寻找证据。它在申报文件、章节、文本单元、表格、公司和财年之上构建类型化证据图,从而使检索过程能更好地遵循财务文档的结构。

### 2\.2金融和多模态文档问答

金融问答已从金融语言理解发展到需要数值推理、表格-文本理解和长文档证据检索的任务。FinBERT及后来的金融大语言模型改进了金融领域的语言建模[1 (https://arxiv.org/html/2608.12335#bib.bib20),16 (https://arxiv.org/html/2608.12335#bib.bib23),26 (https://arxiv.org/html/2608.12335#bib.bib24),31 (https://arxiv.org/html/2608.12335#bib.bib25),29 (https://arxiv.org/html/2608.12335#bib.bib26)]。FinQA、ConvFinQA、TAT\-QA、FinanceBench和DocFinQA进一步表明,金融问答需要算术推理、事实依据和财务报告中的证据定位[3 (https://arxiv.org/html/2608.12335#bib.bib9),4 (https://arxiv.org/html/2608.12335#bib.bib21),32 (https://arxiv.org/html/2608.12335#bib.bib10),11 (https://arxiv.org/html/2608.12335#bib.bib2),22 (https://arxiv.org/html/2608.12335#bib.bib13)]。关于文档和表格理解的研究也引入了布局感知模型、多页文档问答方法、表格线性化方法以及TAPAS和TAPEX等表格模型[19 (https://arxiv.org/html/2608.12335#bib.bib28),10 (https://arxiv.org/html/2608.12335#bib.bib29),24 (https://arxiv.org/html/2608.12335#bib.bib30),20 (https://arxiv.org/html/2608.12335#bib.bib31),27 (https://arxiv.org/html/2608.12335#bib.bib32),9 (https://arxiv.org/html/2608.12335#bib.bib33),18 (https://arxiv.org/html/2608.12335#bib.bib14)]。这些研究为财务文档问答提供了有用的基础。大多数现有基准和系统仍聚焦于单文档、单表格或局部表格-文本上下文。在实际财务分析中,问题往往涉及跨公司比较、跨财年跟踪,以及将叙述性解释与财务报表结合使用。这促使我们构建一个能在同一场景下评估这些需求的基准和检索框架。

### 2\.3自适应融合与查询感知路由

多模态融合研究如何将不同信息源结合使用而不相互削弱。混合专家架构、自适应门控和统一多模态编码器提供了稀疏激活和动态加权的机制[7 (https://arxiv.org/html/2608.12335#bib.bib34),15 (https://arxiv.org/html/2608.12335#bib.bib35),30 (https://arxiv.org/html/2608.12335#bib.bib36)]。许多现有融合方法主要从输入表示或检索上下文中决定模态权重。对于金融问答,查询本身也应发挥重要作用。关于计算流动比率的问题通常更依赖于表格单元格,而关于流动性风险的问题通常更依赖于解释性文本,即使这两个问题来自同一份申报文件。HC\-RAG将计算、趋势分析、事实查找和比较作为查询意图类别,并使用预测的意图在文本和表格候选之间路由证据。

## 3方法

### 3\.1分析师启发的证据工作流

HC\-RAG的设计基于金融分析师通常在年度报告中查找证据的方式。在回答关于申报文件的问题时,分析师通常不会将报告视为一组不相关的段落。分析师通常从相关公司、财年和同行群体开始,然后转向MD&A、风险因素、财务报表和附注等标准章节。之后,分析师收集所需的数值或叙述性解释,并检查这些证据是否可以支持最终答案。

这一过程带来了几个对检索的要求。系统应保留年度报告的层次结构,因为文档级和章节级信息可以在检索细粒度证据单元之前帮助缩小搜索范围。系统还应区分不同类型的证据,因为文本描述、表格、公司元数据、财年和财务指标在金融问答中扮演着不同角色。检索过程还需要考虑问题的意图。计算、趋势、事实和比较问题通常依赖不同的证据模式,不应在所有情况下使用相同的文本-表格融合策略。

HC\-RAG通过财务证据图和意图感知的证据路由模块实现这些想法。证据图保留申报文件的层次结构以及文档间的关系。路由模块根据查询的语义意图选择和组合文本与表格证据。

### 3\.2问题定义与证据图

HC\-RAG将申报文件语料组织为财务证据图,如图1 (https://arxiv.org/html/2608.12335#S3.F1)中第一个蓝色框所示。该图用简单形式表示为

G=\(V,E,X\),\\mathcal\{G\}=\(\\mathcal\{V\},\\mathcal\{E\},\\mathbf\{X\}\),\(1\)
其中V\\mathcal\{V\}表示所有节点,E\\mathcal\{E\}表示节点间的关系,X\\mathbf\{X\}存储每个节点的文本、表格内容和元数据。在本文中,节点主要包括文档节点、章节节点、文本单元节点、表格单元节点和元数据节点。文档节点对应年度报告。章节节点对应MD&A、风险因素、财务报表和附注等标准申报文件章节。文本单元节点存储叙述性证据,表格单元节点存储表格证据,元数据节点存储公司、财年、行业和财务指标等信息。

图中的边用于描述申报文件内部和跨申报文件的基本关系。包含边连接文档与章节,并连接章节与证据单元。顺序边保留申报文件中章节和证据单元的原始顺序。跨边连接相关的公司、财年、行业或财务指标。模态边连接叙述性描述与相关的表格证据。这样,图保留了财务报告的阅读结构:从公司和年份到申报文件,从申报文件到章节,从章节到文本或表格证据。对于基于申报文件的问题,一个简单的证据路径可以写成:

P:vD→vS→vU,P:v\_\{D\}\\rightarrow v\_\{S\}\\rightarrow v\_\{U\},\(2\)
其中vDv\_\{D\}是文档节点,vSv\_\{S\}是章节节点,vUv\_\{U\}是文本或表格证据单元节点。该路径意味着系统首先定位相关申报文件,然后找到相关章节,最后检索可能支持答案的证据单元。跨文档和跨年份边允许系统在问题涉及比较或趋势分析时,从一个申报文件移动到相关申报文件。因此,HC\-RAG不会以扁平方式从所有块中检索证据。它沿着财务报告的结构检索证据,这使得检索到的证据更容易追溯到源文档。这种设计与RAPTOR、GraphRAG和HippoRAG等图增强检索系统相关[23 (https://arxiv.org/html/2608.12335#bib.bib5),5 (https://arxiv.org/html/2608.12335#bib.bib6),8 (https://arxiv.org/html/2608.12335#bib.bib38)]。主要区别在于,HC\-RAG根据财务申报文件的结构构建图,而不是仅依赖语义相似性或LLM生成的关系。

参见图1:HC\-RAG的索引与检索框架。索引层构建

相似文章

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。