CoAL-RAG: 一种复杂度感知的法律检索增强生成方法

arXiv cs.CL 论文

摘要

CoAL-RAG 介绍了一种用于法律咨询的复杂度感知检索增强生成方法,该方法根据问题复杂度动态选择检索策略,在中文和英文法律基准测试中实现了显著改进。

arXiv:2608.17536v1 公告类型:新 摘要: 法律咨询问题表现出多层次的复杂性。单一检索策略往往导致对简单问题的过度推理和对复杂问题的可解释性差,使得在高风险场景中难以同时满足答案质量和效率的要求。为了解决这个问题,本文提出了CoAL-RAG,一种复杂度感知的法律检索增强生成方法,该方法基于“问题本质”和“检索一致性”构建多维评估机制,以实现检索策略的自适应路由。首先,根据问题的逻辑结构量化推理需求。然后,利用语义检索和关键词检索之间的差异间接反映问题复杂度,从而选择最合适的检索策略并动态过滤上下文信息。实验结果表明,该方法不仅在中文法律基准测试(SocialLawQA、LawBench)上显著优于基线模型,而且在英文数据集(LexGLUE、CaseHold)上展现出强大的跨管辖区泛化能力。具体而言,在中文数据集上,BLEU分数提高了42.5%,ROUGE-L达到基于知识图谱方法的3.6倍。在英文基准测试上,CoAL-RAG保持了高度竞争力的准确性,在不同法律体系中实现了生成质量、深度逻辑推理和系统效率之间的最佳平衡。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:59

# CoAL-RAG:一种复杂度感知的法律检索增强生成方法  
来源:https://arxiv.org/html/2608.17536  
**作者**  
苏锦  
单位:北方工业大学,北京 100144,中国  
单位:人工智能+领域应用关键技术北京市重点实验室,北京 100144,中国  
赵作峰(致谢:通讯作者)  
单位:北方工业大学,北京 100144,中国  
单位:人工智能+领域应用关键技术北京市重点实验室,北京 100144,中国  
王欢欢  
单位:北方工业大学,北京 100144,中国  
单位:大规模流数据集成分析北京市重点实验室,北京 100144,中国  
电子邮箱:[[email protected]](mailto:[email protected])  
陈浩(致谢:同等贡献)  
单位:北方工业大学,北京 100144,中国  
单位:大规模流数据集成分析北京市重点实验室,北京 100144,中国  
电子邮箱:[[email protected]](mailto:[email protected])  

###### 摘要  
法律咨询问题呈现多层次复杂性。单一的检索策略往往导致简单问题过度推理、复杂问题可解释性差,难以满足高风险场景下对回答质量和效率的双重要求。针对这一问题,本文提出了 CoAL-RAG——一种复杂度感知的法律检索增强生成方法。该方法构建了基于“问题本质”和“检索一致性”的多维评估机制,以实现检索策略的自适应路由。首先,根据问题的逻辑结构量化推理需求;其次,利用语义检索与关键词检索的差异间接反映问题复杂度,从而选择最合适的检索策略并动态过滤上下文信息。实验结果表明,所提方法不仅在中文法律基准测试(SocialLawQA、LawBench)上显著优于基线模型,而且在英文数据集(LexGLUE、CaseHold)上也展现出强大的跨司法管辖区泛化能力。具体而言,在中文数据集上,BLEU 分数提升 42.5%,ROUGE-L 达到基于知识图谱方法的 3.6 倍。在英文基准测试中,CoAL-RAG 保持了高度竞争力的准确率,在不同法律体系下实现了生成质量、深度逻辑推理和系统效率的最佳平衡。  

###### 关键词  
法律问答;检索增强生成;复杂度感知;自适应检索;知识图谱  

## 1 引言  
在大语言模型(LLMs)于自然语言处理(NLP)领域取得突破性进展的推动下[38 (https://arxiv.org/html/2608.17536#bib.bib1), 4 (https://arxiv.org/html/2608.17536#bib.bib2)],智能法律问答正转向语义生成的新范式。鉴于高风险法律场景对准确性和可追溯性的严格要求[35 (https://arxiv.org/html/2608.17536#bib.bib3)],整合外部知识库能有效缓解模型幻觉和知识过时问题[16 (https://arxiv.org/html/2608.17536#bib.bib4)]。然而,法律咨询查询的复杂度差异显著。诸如“法定退休年龄是多少?”之类的问题仅涉及单一法律规定且推理需求较少,复杂度相对较低。而诸如“我在工伤后用人单位未签订劳动合同就逃跑了。这违反了哪些法律?我该如何维权?”之类的查询则涉及密集的法律知识、强条件约束和多步推理,导致复杂度大幅增加[6 (https://arxiv.org/html/2608.17536#bib.bib5)]。  

参见标题(a) 复杂推理问题中的证据缺口  
参见标题(b) 简单事实问题中的噪声引入  
参见标题(c) 检索冲突  
**图 1**:现有方法的局限性  

现有法律领域的检索策略中,基于纯向量的检索缺乏深层关系推理,仅能提供零散的法律规定(图 1a (https://arxiv.org/html/2608.17536#S1.F1.sf1))。相反,不加区分地应用图推理会导致计算冗余和噪声干扰(图 1b (https://arxiv.org/html/2608.17536#S1.F1.sf2))。此外,两者的直接混合往往导致检索结果不一致和推理冲突(图 1c (https://arxiv.org/html/2608.17536#S1.F1.sf3))。为解决这些缺陷,本文提出了 CoAL-RAG(复杂度感知的法律 RAG)。该方法利用 LangGraph 构建了一个以“问题本质”和“检索一致性”为核心的多维评估机制。首先,通过五维指标体系量化查询的内部逻辑需求;其次,利用语义检索与 BM25 的差异间接反映复杂度;最终,根据复杂度分数选择最佳检索策略并动态过滤上下文,有效平衡了响应速度与深层逻辑准确性。  

本文的主要贡献总结如下:  
1) **多维度复杂度感知机制**。我们提出了一种通过整合查询内部逻辑与检索外部一致性来跨多维度评估查询复杂度的机制。此外,我们设计了基于竞争函数的“检索一致性”算法,提供了兼具数值稳定性和概率可解释性的自适应路由标准。  
2) **CoAL-RAG 方法**。我们引入了 CoAL-RAG 方法,它协同了复杂度感知、混合检索和知识图谱协调。在多维评估机制的驱动下,该框架动态定制检索策略,以实现法律问答的高度高效和准确生成。  
3) **广泛的跨司法管辖区验证与性能权衡**。在中文民事法数据集(SocialLawQA、LawBench)和英文普通法基准测试(LexGLUE、CaseHold)上进行的实验表明,我们的方法显著优于现有基线。CoAL-RAG 成功弥合了不同法律司法管辖区之间的推理鸿沟,在保持低延迟响应的同时,提升了复杂查询的准确性。  

## 2 相关工作  
### 2.1 法律大模型  
通用大语言模型[1 (https://arxiv.org/html/2608.17536#bib.bib6), 7 (https://arxiv.org/html/2608.17536#bib.bib7)]常受法律幻觉困扰。早期领域模型[2 (https://arxiv.org/html/2608.17536#bib.bib8), 32 (https://arxiv.org/html/2608.17536#bib.bib9), 26 (https://arxiv.org/html/2608.17536#bib.bib10)]优化了理解能力但缺乏生成能力。后续的指令微调模型[5 (https://arxiv.org/html/2608.17536#bib.bib11), 40 (https://arxiv.org/html/2608.17536#bib.bib12), 20 (https://arxiv.org/html/2608.17536#bib.bib13)]和知识增强模型[13 (https://arxiv.org/html/2608.17536#bib.bib14), 33 (https://arxiv.org/html/2608.17536#bib.bib15)]改善了意图识别和推理能力。然而,它们在解决高度复杂、多步的法律咨询方面仍显不足。  

### 2.2 检索增强生成  
RAG[19 (https://arxiv.org/html/2608.17536#bib.bib16)]通过混合检索[23 (https://arxiv.org/html/2608.17536#bib.bib17)]、重排序[24 (https://arxiv.org/html/2608.17536#bib.bib18), 9 (https://arxiv.org/html/2608.17536#bib.bib19)]以及基于 token 置信度的动态路由(如 FLARE[17 (https://arxiv.org/html/2608.17536#bib.bib20)])或通用复杂度分类器(如 Adaptive-RAG[14 (https://arxiv.org/html/2608.17536#bib.bib21)])来缓解知识滞后问题。尽管这些方法在开放域任务中取得了成功,但将其应用于法律查询时暴露出关键局限性。基于 token 的置信度指标无法捕捉严谨的司法演绎,而一维复杂度分类器则忽略了法律查询的多面性。与 Adaptive-RAG 的黑盒路由不同,CoAL-RAG 引入了一种透明的、多维度的复杂度评估机制,该机制明确针对法律文本分层“章节条款”结构进行定制,从而实现与法律推理相契合的精确动态路由。  

### 2.3 知识图谱  
知识图谱(KGs)通过基于路径的显式链(如 RoG[22 (https://arxiv.org/html/2608.17536#bib.bib24)]、ToG[28 (https://arxiv.org/html/2608.17536#bib.bib25)])或基于子图的结构提取[12 (https://arxiv.org/html/2608.17536#bib.bib26), 8 (https://arxiv.org/html/2608.17536#bib.bib27), 25 (https://arxiv.org/html/2608.17536#bib.bib28)]增强了 RAG 中的复杂推理能力[15 (https://arxiv.org/html/2608.17536#bib.bib22), 30 (https://arxiv.org/html/2608.17536#bib.bib23)]。虽然通常有效,但将图结构直接应用于法规任务引入了两个主要挑战:(1) 不加区分的检索引入了噪声和延迟[27 (https://arxiv.org/html/2608.17536#bib.bib29), 29 (https://arxiv.org/html/2608.17536#bib.bib30)];(2) 通用模型(如 HAKE[36 (https://arxiv.org/html/2608.17536#bib.bib31)])无法捕捉法律文本的分层“章节条款”结构,导致细粒度司法逻辑的丢失[37 (https://arxiv.org/html/2608.17536#bib.bib32)]。  

参见标题  
**图 2**:CoAL-RAG 总体框架  

## 3 方法  
为处理具有不同复杂度水平的查询,我们提出了 CoAL-RAG。该框架建立在分层法律知识图谱之上,并融入了复杂度感知建模和自适应上下文驱动路由,以实现检索策略的动态选择。整个系统使用 LangGraph 实现,如图 2 (https://arxiv.org/html/2608.17536#S2.F2) 所示。  

### 3.1 问题描述  
为处理法律查询的多样化复杂度,本文提出了 CoAL-RAG,它通过复杂度感知机制实现动态路由。输入形式化定义为 \( T=\{Q,D,G\} \),其中 \( Q \) 表示用户的自然语言法律查询,\( D=\{d_1,d_2,...,d_n\} \) 表示非结构化法律语料库,\( G=\{E,R\} \) 是法律领域的分层知识图谱。该方法根据查询特征和检索一致性计算复杂度分数 \( C_{\text{final}} \in [0,1] \)。在阈值 \( \theta \) 的指导下,它动态选择检索策略 \( S \),构建相应的上下文 \( C_S \),并生成答案 \( A=\arg\max_{A'} P(A' \mid Q,C_S) \)。  

### 3.2 分层法律知识图谱构建  
我们构建了一个包含约 4.2k 个节点、约 11.5k 条边的知识图谱 \( G \),涵盖 16 部法律法规,定义了实体(法律、章节、条款、概念)和关系(包含、引用、冲突)。构建流程包括:  
1) **提取**:LLMs 从语料库 \( D \) 中提取三元组 \( (e_s,r,e_o) \),保留元数据。  
2) **融合**:LLMs 通过将不同实体合并为统一节点来解决矛盾。  
3) **聚类**:使用 BGE-M3 和 GMM-UMAP 对条款进行层次化分组(条款→节→领域),以反映法规分类结构。  
4) **部署**:知识图谱采用双索引(Milvus 和 MySQL),支持版本控制的增量更新。  

### 3.3 多维复杂度感知机制  
该机制通过跨多维度评估查询复杂度来动态整合现有检索方法,从而激活相应的定制检索策略。它确保复杂查询的深度推理,同时最大化简单查询的响应效率。  

#### 问题内在评估  
简单法律查询通过模式匹配被分配较低的基线复杂度 \( C_{\text{base}} \in [0.1,0.2] \),其内在复杂度定义为 \( C_{\text{intrinsic}} = C_{\text{base}} \)。对于复杂法律查询,使用语义特征将其分为六类:“场景推理”、“条件判断”、“多条件组合”、“权益保护”、“跨域”和“复杂列举”。为这些类型预定义了基线复杂度 \( C_{\text{base}} \in [0.4,0.6] \),并根据“核心特征优先原则”分配权重向量 \( \boldsymbol{\omega} \)(例如,对于“场景推理”,优先考虑逻辑维度)。类型确定后,LLM 将查询分解为一组子查询 \( Q_{\text{sub}} \),并通过结构化提示方案评估五个复杂度维度。¹  
> ¹ 提示引导 LLM 提取子查询、实体和约束以量化五个维度(通过 \( n=4 \) 进行归一化)。  

推理链长度(RCL)、知识整合需求(KIR)和领域跨度(DS)均相对于单个单元进行测量,复杂度随着单元数量的增加呈线性增长。计算公式定义在等式 1 (https://arxiv.org/html/2608.17536#S3.E1):  
\[ \mathrm{Score}_{i}=\min\!\left(1.0,\;\frac{V_{i}-1}{n}\right). \quad (1) \]  
其中 \( V_i \) 代表每个维度的统计基线:  
- • RCL 使用 \( V_i = \lvert Q_{\text{sub}} \rvert \),反映回答所需的逻辑跳跃;  
- • KIR 使用 \( V_i = \max(\lvert C\rvert,\lvert Q_{\text{sub}} \rvert) \),其中 \( C \) 是提取的显式实体集合,反映法律知识整合的密度;  
- • DS 采用 \( V_i = \lvert D_{\text{aug}} \rvert \),表示识别的增强领域集的大小,反映跨领域整合的难度。  

当 \( V_i \geq n+1 \) 时,达到饱和值 1.0,并且都被判定为复杂。关系推理复杂度(RRC)和条件约束密度(CCD)的初始值设为 0,随着特定逻辑结构或约束的出现,分数累加递增。计算公式定义在等式 2 (https://arxiv.org/html/2608.17536#S3.E2):  
\[ \mathrm{Score}_{i}=\min\!\left(1.0,\;\frac{V_{i}}{n}\right). \quad (2) \]  
其中 \( V_i \) 代表每个维度的统计基准:  
- • RRC 取 \( V_i = \lvert R_{\text{aug}} \rvert \),即显式逻辑与隐式场景关系之间的联合数量,反映逻辑纠缠程度;  
- • CCD 使用 \( V_i = \lvert C_{\text{const}} \rvert \),表示数值或时间约束的数量,指示边界确定的精确性。  
RRC 和 CCD 均从 0 开始。当 \( V_i \geq n \) 时,达到饱和值 1.0,并且都被判定为复杂。  

基于多维评估,五维加权分数 \( C_{\mathrm{5D}} \) 由各维度分数 \( \mathrm{Score}_{i} \) 及其动态分配的权重 \( \omega_i \) 得出,公式如等式 3 (https://arxiv.org/html/2608.17536#S3.E3):  
\[ C_{\mathrm{5D}}=\sum_{i\in\{\mathrm{RCL,KIR,RRC,DS,CCD}\}}\omega_{i}\cdot\mathrm{Score}_{i} \quad (3) \]  
结合基线复杂度 \( C_{\mathrm{base}} \),最终内在复杂度通过等式 4 (https://arxiv.org/html/2608.17536#S3.E4) 计算:  
\[ C_{\text{intrinsic}}=\alpha C_{\text{base}}+\beta C_{\mathrm{5D}} \]

相似文章

CanLegalRAGBench: 评估加拿大判例法上的检索增强生成

arXiv cs.CL

介绍了CanLegalRAGBench,这是一个基于真实查询和专家标注答案来评估加拿大判例法上检索增强生成的基准。评估显示对设计选择敏感、开源嵌入模型具有竞争力,以及生成答案中持续存在的幻觉问题。