HIRA: 用于受监管行业文档分类的人机协同检索增强级联系统
摘要
HIRA 是一种免训练、本地部署的检索增强级联系统,用于受监管行业的文档分类。它利用人工反馈和本地部署的大语言模型(LLM)来提高准确性,同时减少模型重新训练和 LLM 调用次数。
arXiv:2608.21792v1 Announce Type: new
摘要:受监管行业的文档分类受到数据驻留、冷启动标签有限、审查能力不足以及模型治理程序昂贵的限制。我们提出了 HIRA,一种免训练、本地部署的检索增强级联系统,用于受监管环境中的文档分类。它通过验证校准的加权倒数排名融合,结合了基于 OCR 文本的 BM25、密集文本嵌入和图像级表示。自信的文档直接由检索分类;不确定或视觉上易混淆的文档被传递给本地托管的 LLM 验证器,验证器接收 OCR 文本、检索到的示例、标签描述和混淆特定术语。当验证器仍不确定时,文档被发送人工审查。每个校正存储为边缘加权的检索示例,并更新一个 Dirichlet 平滑的混淆图,使系统无需更新模型权重即可改进。
在一个私有的 80 类贸易金融语料库上,HIRA 处理了全部 30,233 个文档的生产流,同时仅请求人工校正 1,945 个文档(6.4%),将 Macro-F1 从 0.6218 提高到 0.8548。在修正的 Tobacco-3482 基准测试上,HIRA 使用本地托管的 DeepSeek-R1-Distill-Qwen-32B 验证器达到了 0.9423 Macro-F1,比零样本 LLM 基线高出 17.4 个百分点,同时仅对大约 40% 的文档调用验证器,并将 LLM 调用次数减少了约 60%。通过 518 次人工校正(占池的 24.8%),HIRA 与完全标记的池预言机匹配,其中所有 2,086 个池文档都以其真实标签被索引。这些结果表明,选择性的人工反馈和检索记忆适应可以作为受监管环境中长尾文档分类的实用替代方案,替代重复的模型重新训练。
查看缓存全文
缓存时间: 2026/08/25 04:26
# 面向受监管行业文档分类的人机协同检索增强级联系统 来源:https://arxiv.org/html/2608.21792 ## HIRA:面向受监管行业文档分类的人机协同检索增强级联系统 会议:第35届ACM国际信息与知识管理大会论文集;2026年11月7–11日;意大利罗马 第35届ACM国际信息与知识管理大会论文集 (CIKM '26),2026年11月7–11日,意大利罗马 DOI:10.1145/3799682.3840098 (https://doi.org/10.1145/3799682.3840098) ISBN:979-8-4007-2539-5/2026/11 CCS:计算方法学 分类与回归树 CCS:信息系统 信息检索 **尚宣天 (Shangxuan Tian)** 注:部分研究工作在作者任职于华侨银行期间完成。 单位:渣打银行,中国广州 邮箱:[[email protected]](mailto:[email protected]) **陈延辉 (Yanhui Chen)** 单位:华侨银行,新加坡 邮箱:[[email protected]](mailto:[email protected]) **卡洛斯·克维罗斯 (Carlos Queiroz)** 单位:华侨银行,新加坡 邮箱:[[email protected]](mailto:[email protected]) 2026; © cc ###### 摘要 受监管行业的文档分类受制于数据驻留、有限的冷启动标注、稀缺的审查能力以及高昂的模型治理流程。在此场景下,实际目标不仅是获得高准确率,还在于减少大语言模型调用、避免频繁的模型重训练,并将最具歧义的案例送交人工审查。我们提出了HIRA,一种无需训练、可在受监管部署环境中本地运行的检索增强级联文档分类系统。HIRA首先通过基于验证集校准的加权倒数排名融合(RRF),结合基于OCR文本的BM25、稠密文本嵌入和图像级表征进行融合。置信度高的文档通过检索直接分类。不确定或视觉易混淆的文档则传递给本地部署的大语言模型验证器,该验证器接收OCR文本、检索到的示例、标签描述以及易混淆对特有的术语。当验证器仍不确定时,文档将被送交人工审查。每次纠正都会作为基于边界加权的检索示例存储,同时更新一个狄利克雷平滑的混淆图,使系统能够在不更新模型权重的情况下持续改进。 在私有80类贸易金融语料库上,HIRA处理了完整的30,233份文档生产流,仅请求人工纠正1,945份文档(6.4%),将宏平均F1分数从0.6218提升至0.8548。在经过纠正的Tobacco-3482基准测试集上,HIRA使用本地部署的DeepSeek-R1-Distill-Qwen-32B验证器达到了0.9423的宏平均F1分数,比零样本大语言模型基线高出17.4个百分点,同时验证器调用率仅为约40%,从而减少了约60%的大语言模型调用。通过518次人工纠正(占总样本池的24.8%),HIRA的性能与将全部2,086份池中文档都以真实标签索引的“完全标注池预言机”相当。这些结果表明,选择性的人工反馈和检索记忆适应,为受监管部署环境中长尾文档分类问题提供了一种替代重复模型重训练的实用方案。 ###### 关键词: 检索增强分类、人机协同、数据驻留、无需训练适应、大语言模型 ††cc-许可:by ## 1. 引言 细粒度文档分类支撑着受监管行业的信息系统,包括金融服务后台、医疗记录、法律取证和政府档案。文献大多收敛于单一方案:预训练一个布局感知的骨干网络,在有标注的训练集上微调,然后部署。大语言模型和视觉-语言模型的出现,进一步促进了将分类任务委托给前沿API的零样本默认做法。 在受监管部署中,这两种方法都不易于直接应用。金融和医疗领域的文档不能离开部署环境,排除了使用云端托管的大语言模型API。冷启动时,客户的分类体系通常是定制的,文档是机密的,因此用于微调的有标注训练集不可用。部署后,文档模板会漂移,新的子类别会出现,人工标注成为主要的边际成本。这种场景并非假设:本工作的主要动机来自一个生产贸易金融系统,该系统需要在严格的数据驻留要求下,将30,233份文档分类到80个类别(包括许多近义词类别)。 图1. 提出的HIRA级联框架。 我们提出了**HIRA**,一种为此类场景设计的、无需训练的检索增强分类级联系统。其流程如图1所示。HIRA融合三种检索信号(基于OCR文本的BM25、稠密句子嵌入和图像级表征),使用基于验证集校准的加权倒数排名融合(RRF),仅将不确定或视觉易混淆的案例路由至验证器大语言模型。验证器接收OCR文本、检索到的排名靠前的示例、标签描述,以及从历史错误分类中挖掘的区分性术语,并产生一个带有序数置信度区间的结构化预测。低置信度的验证结果会进入人机协同队列,每次纠正会从两个方面更新系统:作为检索索引中基于边界加权的条目,以及作为更新狄利克雷平滑混淆图的条目,该图用于增强后续的验证提示。在任何环节都不会更新模型参数;只有检索记忆和轻量级混淆图是可变的。 在私有80类贸易金融语料库(Financial-80)上,HIRA处理了完整的30,233份文档生产流,仅请求人工纠正1,945份文档(6.4%),将宏平均F1分数从0.6218提升至0.8548。在经过纠正的Tobacco-3482基准测试集上,HIRA使用本地部署的DeepSeek-R1-Distill-Qwen-32B验证器达到了0.9423的宏平均F1分数,比大语言模型零样本基线高出17.4个百分点,且验证器调用率仅为约40%;在标注了流入文档的24.8%后,其性能与完全标注池预言机相当。 #### 贡献 本文有三项贡献: - 在小标注预算下的冷启动适应。在Financial-80(80个类别,30,233份生产文档)上,HIRA仅通过1,945次纠正(占总流的6.4%)就达到了0.8548的宏平均F1分数,并且随着索引增长,队列率降至6.2%。在Tobacco-3482上,仅标注样本池的24.8%就足以匹配完全标注的预言机。 - 一种超越大语言模型零样本性能的、无需训练的检索增强生成级联系统。HIRA在纠正后的Tobacco-3482上达到0.9423的宏平均F1分数,比本地部署的DeepSeek-R1-Distill-Qwen-32B零样本基线高出17.4个百分点,验证器调用率约为40%。 - EDRM(进化文档相关性记忆),一种双信号人机协同记忆。每次纠正都更新一个基于边界加权的检索索引和一个狄利克雷平滑的混淆图;该混淆图将区分性术语提供给用于混淆对的第二层验证器提示。 ## 2. 相关工作 现有的文档分类研究可分为两类:(i)微调的文档图像分类方法,以及(ii)检索增强与级联推理方法。 #### 微调的文档图像分类 像LayoutLM、LayoutLMv2、LayoutLMv3、DiT、Donut和UDOP这样的布局感知、无需OCR的文档模型已成为文档理解的监督学习基线标准。在我们的场景下,存在两个结构性限制:(i)它们需要有标注的训练集,这在冷启动时不可用;(ii)适应分类体系变化需要一个重微调周期,这增加了GPU计算量和合规审查。HIRA的不同之处在于其运行机制——它不更新权重,只更新检索索引——从而避免了这两点。 #### 检索增强分类 检索增强生成和稠密段落检索表明,非参数的检索组件可以补充用于知识密集型任务的学习参数。对于分类,kNN-LM从冻结语料库索引的近邻聚合标签,kNN-Prompting将其扩展到大语言模型上下文学习,Class-RAG将检索与用于内容审核分类的大语言模型验证器结合,SRA将检索增强应用于长尾法律文本分类。我们的EDRM通过每次纠正在线更新此索引:一个基于边界加权的示例加上一个狄利克雷平滑的混淆图,该图将区分性术语反馈到验证器的提示中,用于已知的混淆对。 #### 级联推理与成本感知路由 使用容量递增的级联模型来平衡成本和质量是一种经典技术。FrugalGPT将级联路由构建为优化问题,通过仅将不确定的查询推迟到更强模型来减少大语言模型调用。CALM通过单一模型内的早期退出置信度信号实现类似的成本降低。这些方法假设没有检索或使用固定的检索阶段。在HIRA中,第一层和第二层的阈值在验证集上校准,但底层的检索索引随着纠正的融入而演进。 ## 3. 问题设定 令X表示文档空间,Y = {1, ..., C}为客户特定的标签分类体系。给定受监管部署环境(金融服务、医疗保健、法律取证)中的一个文档x ∈ X(扫描件或数字PDF),目标是预测其类别y ∈ Y。四个约束条件共同排除了监督微调和云端大语言模型的默认做法: 1. **漂移下的冷启动**。部署时,每个类别只有数十个有标注的文档。每个客户都有自定义的分类体系,且数据呈长尾分布。随着文档模板的变化,一个固定的分类器可能逐渐失去准确率,却无法立即被发现。 2. **数据驻留**。文档不能离开部署环境,排除了将云端大语言模型API作为运行时依赖。此约束源于金融服务和医疗保健领域常见的数据驻留和银行保密法规,并且适用于管道的每个阶段,而不仅仅是最终分类器:OCR、嵌入和验证都必须在客户控制的基础设施上运行。 3. **合规约束下的重训练**。在受监管的银行中,重新训练和部署模型会触发模型治理审查,这增加了显著的流程延迟和非平凡的成本。基于权重更新的适应很少被允许达到漂移所需的频率。治理审查通常包括对照留出的合规测试集重新验证模型,并获得风险和法律利益相关者的批准,即使对于小的权重更新,此周期也可能耗时数周。 4. **审计追踪与有限的标注预算**。每个决策都必须能够通过参考已有类似文档来解释,这有利于检索式架构,而非其预测无法追溯到具体先例的不透明端到端分类器。人机协同审查是管道中最慢且最昂贵的步骤,审查能力是固定的,与文档量无关;因此,合适的指标是每人工标签的准确率,而非原始准确率。 检索增强分类自然契合:只有检索记忆和轻量级混淆图从人机协同纠正中更新,不涉及模型权重。 ## 4. HIRA系统 HIRA是一个带有HITL反馈循环的两阶段检索增强级联系统。图1展示了其架构。所有组件在部署后都是无需训练的;在整个部署生命周期中唯一变化的状态是检索索引和一个狄利克雷平滑的混淆图,两者均由4.3节描述的**进化文档相关性记忆**维护。 图1跟踪一个文档通过级联的过程:第一层通过加权RRF融合三个检索器,并在最高类别得分超过阈值τ_{t1}时短路;否则,第二层升级至本地部署的大语言模型验证器,当其置信度超过阈值τ_{t2}时接受该标签,否则将文档路由至人机协同队列。每次人工纠正都会反馈至EDRM,更新检索索引和混淆图,从而为未来决策提供信息,且从不更新模型权重。 ### 4.1 第一层:基于RRF融合的多模态检索 第一层并行运行三个检索器,每个检索器返回一个top-k列表: - 在原始OCR文本(由PaddleOCR生成)上运行**BM25**。 - 在OCR文本上运行**MiniLM嵌入**(使用all-MiniLM-L6-v2)。 - **SigLIP2图像嵌入**。 三个排序列表通过**加权倒数排名融合**融合: (1) score(d) = Σ_{r ∈ R} w_r · 1 / (k_{rrf} + rank_r(d)) 其中R = {BM25, MiniLM, SigLIP2}是检索器集合,k_{rrf} = 10是抑制较低排名结果贡献的秩常数,w_r是每个检索器的权重,通过在验证集上扫描单特征宏平均F1为每个部署进行校准。RRF融合优于任何单一检索器,如第6节所述。 #### 按类别聚合与第一层门控 每个文档的分数被聚合为每个类别的分数,EDRM条目权重调节每个索引示例的贡献。对于具有索引示例集I_c的类别c, (2) S(c) = Σ_{d ∈ I_c} w(d) · score(d), s(c) = S(c) / Σ_{c'} S(c') 其中w(d)是示例d的边际权重(在4.3节定义),s(c)是类别c的归一化分数。第一层的决策门控基于置信度阈值τ_{t1}:如果最高类别s(c*) > τ_{t1},则直接输出c*;否则,文档进入第二层。
相似文章
HC-RAG:面向异构财务申报文件的以证据为中心的检索增强生成
本文介绍了HC-RAG,一个面向10-K文件的以证据为中心的金融问答的分层跨模态检索增强生成框架,以及一个新的基准Multi-Doc-2025。它在金融问答基准上优于RAPTOR和GraphRAG,尤其是在长文档和表格相关查询方面。
Inject, Align, Recover: 用于无检索文档知识内化的分阶段后训练
IAR 是一个三阶段后训练框架,将结构化文档知识内化到语言模型中,用于无检索问答,提升特定领域准确性和通用模型性能。
HPC-LLM:面向HPC支持的实用领域自适应与检索增强生成
本文介绍了HPC-LLM,一个面向HPC工作流的检索增强与领域自适应助手,基于HPC文档使用QLoRA微调Llama 3.1 8B模型。实验表明,该模型在资源需求显著降低的情况下,性能与更大的通用模型相当。
DHRCL:训练代码LLM的密集分层奖励与课程学习
DHRCL提出了一种结合密集分层奖励与课程学习的强化学习框架,用于训练代码LLM。该框架在三个阶段的课程中,利用语法验证、执行成功、单元测试通过率和AST结构相似性作为反馈信号。
检索即足够:使用工具代理的无训练可解释性
HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。