PRecG: 基于图神经网络与修辞角色分割的法律先例检索
摘要
PRecG 提出了一种新颖的法律先例检索流程,通过将文档分解为修辞段落,为每个段落构建知识图谱,并利用图神经网络学习层次化表示。在印度法律数据上的实验证明了其相对于基线方法的有效性。
arXiv:2607.09094v1 公告类型: 新
摘要: 法律先例检索是案件准备、规划、诉讼策略和法律研究中的基础任务。当前自动先例检索的方法将法律文档映射到低维语义空间,并根据表示之间的邻近性计算相似度。这些方法将法律文档视为整体文本,忽略了法律技术细节的修辞组织。因此,它们忽视了微妙的法律含义,未能区分法律实体和概念基于其在文档中的修辞角色而变化的上下文重要性。
为解决这一不足,我们提出了 PRecG 流程,通过层次化学习法律判决对之间的相似性。该流程首先基于句子的修辞角色将每个文档分解为不同的语义单元(段落)。对于每个修辞段落,构建一个知识图谱以捕获该段落内的法律实体及其关系。然后学习实体的上下文表示,并聚合以生成段落级嵌入。这些嵌入进一步整合以产生统一的文档级表示,最后计算文档对之间的语义相似性。我们通过在基准印度法律数据集上进行的广泛实验验证了所提方法的性能,并与最先进的基线进行了比较,以证明其有效性。
查看缓存全文
缓存时间: 2026/07/13 07:57
# PRecG:基于图神经网络与修辞角色分割的法律先例检索
来源:https://arxiv.org/html/2607.09094
###### 摘要
法律先例检索是案件准备、规划、诉讼策略及法律研究中的基础任务。当前的自动先例检索方法将法律文档映射到低维语义空间,并根据其表征的邻近性计算相似度。这些方法将法律文档视为整体文本,忽略了法律技术细节的修辞组织。因此,它们忽视了细微的法律含义,且无法区分法律实体和概念在不同修辞角色下的语境重要性。
为解决这一不足,我们提出了PRecG流程,通过分层学习法律判决对的表征来计算其相似度。该流程首先根据句子的修辞角色将每个文档分解为不同的语义单元(段落)。对于每个修辞段落,构建一个知识图谱以捕捉该段落内的法律实体及其关系。随后学习实体的上下文表征,并聚合得到段落级嵌入。这些嵌入进一步整合以生成统一的文档级表征,最后计算文档对之间的语义相似度。我们通过在基准印度法律数据集上进行大量实验,与最先进的基线方法比较,验证了所提方法的有效性。
###### 关键词:
法律文本分析,先例检索,相似案例检索,修辞角色
## 1. 引言
法律体系旨在确保社会中的行为有序可控,是国家文化、文明、历史及人民日常生活的重要组成部分。世界各国存在不同的法律体系,包括民法、普通法、习惯法、宗教法和混合法。印度特别采用混合法律体系,其中普通法占据重要地位。该体系遵循遵循先例原则,对成文法规和先前判例同等重视[16](https://arxiv.org/html/2607.09094#bib.bib2)。基本原则是:事实和情形相似的案件应根据先前相似案件或先例的判决一致裁决。
先例案件是普通法体系的核心,构成司法决策的基础[9](https://arxiv.org/html/2607.09094#bib.bib3)。借鉴先前判决作出裁决可促进法律程序的连贯性、透明性和公正性[16](https://arxiv.org/html/2607.09094#bib.bib2)。因此,确保先例的相关性和可靠性至关重要,必须严格遵守。通常,先例选择过程始于从法律案例电子库中进行关键词搜索,由专业人员手动选择一组相关关键词作为查询来检索候选案例集。搜索引擎从库中检索出可能相关的文档,法律专家仔细审查并排序检索到的案例。通常,通过咨询过程最终选定先例案件。此过程如图1 (https://arxiv.org/html/2607.09094#S1.F1) 所示,本质上非常耗时,且易受限于人类在关键词选择、手动索引和检索文档排序方面的专业知识。
自动化先例案件文档检索任务可在裁判和裁决的各个阶段极大帮助法律专业人员。对于律师而言,它有助于通过从大量判例库中高效识别相关先例,为新案件奠定坚实基础。对于法官而言,自动化先例检索通过确保与每个相关裁决的一致性,辅助作出有理有据的判决。自动化先例检索任务还有助于减轻先例选择中的人为偏见,从而提升司法结果的一致性和可靠性。
参考图标题
图1:查找有效可靠引用的手动程序。
早期的自动先例检索方法主要依赖于基于词袋表示的统计和机器学习方法[14](https://arxiv.org/html/2607.09094#bib.bib38),[20](https://arxiv.org/html/2607.09094#bib.bib13)。这些方法依赖于表层词汇特征,需要大量手动特征工程。虽然它们在检索相关先例方面展现出初步潜力,但因其无法捕捉法律语言中更深层的语义或上下文细微差别,性能常受限制[1](https://arxiv.org/html/2607.09094#bib.bib25)。
自然语言处理(NLP)和深度学习(DL)的最新进展推动了更精确高效的自动先例检索方法。给定一个查询和文档库,这些方法通过将查询和库中文档嵌入同一潜在空间并计算它们之间的相似度,来从库中选择相关先例[21](https://arxiv.org/html/2607.09094#bib.bib19),[10](https://arxiv.org/html/2607.09094#bib.bib10),[5](https://arxiv.org/html/2607.09094#bib.bib11)。现有方法学习文档在潜在语义空间中的统一表征,并捕捉法律概念的上下文语义。然而,这些方法通常将文档作为一个整体来处理以学习表征,由于法律文本的长度和语言复杂性,这容易导致不准确性。此外,法律术语通常根据其出现的部分传达不同含义。例如,术语“疏忽”在不同语境中具有不同功能。在“事实背景”部分,原告可能将被告未能维护安全场所描述为“疏忽”,指代一个特定行为;但在“法律推理”部分,法院可能将其视为一个更广泛的法律标准,要求证明被告违反了其对原告所负的注意义务。这些语境差异可能导致自动先例检索系统在两种关键场景下性能不佳:(i) 当查询和先例引用相似术语但语境(即语义角色)不同时;(ii) 当冗长且结构复杂的法律文档的表征稀释了局部相关概念,从而损害检索准确性时。
在本文中,我们解决了现有自动先例检索模型将法律文档视为整体文本[5](https://arxiv.org/html/2607.09094#bib.bib11),[14](https://arxiv.org/html/2607.09094#bib.bib38),[20](https://arxiv.org/html/2607.09094#bib.bib13)的局限性。我们的方法通过首先学习案例文档对在更细粒度上的表征,再聚合这些表征以构建文档级嵌入,从而对它们之间的相似度进行建模。具体来说,我们首先根据句子的修辞角色自动将每个文档分解为段落。对于每个段落,我们构建一个段落级知识图谱,并使用图神经网络学习法律实体及其上下文依赖关系的表征。然后使用基于注意力的池化聚合这些学习到的实体表征,以构建段落级嵌入。段落级嵌入通过基于Transformer的机制进行聚合,形成案例文档的统一表征,并计算文档对之间的相似度分数。训练期间,预测的文档对相似度分数中的任何误差通过更新模型参数进行修正。推理时,从学习到的模型中获得给定查询文本的嵌入,并计算其与候选文档的相似度。最相似的 top-k 个文档被确定为最相关的先例。
我们将本文的贡献总结如下:
1. i. 我们整理了一个针对印度法律领域的法律本体(第4节 (https://arxiv.org/html/2607.09094#S4))。
2. ii. 我们提出了一个端到端学习框架,该框架首先根据句子的修辞角色将法律文档分解为语义段落,学习每个段落的表征,然后使用基于注意力的聚合机制将它们聚合成统一的文档级嵌入(第5节 (https://arxiv.org/html/2607.09094#S5))。
3. iii. 我们利用大型语言模型自动提取法律实体及其关系,以自动构建段落级知识图谱(第5.2节 (https://arxiv.org/html/2607.09094#S5.SS2))。
4. iv. 我们使用图神经网络来增强每个段落级知识图谱中法律实体的表征(第5.3节 (https://arxiv.org/html/2607.09094#S5.SS3))。
5. v. 我们在第6节 (https://arxiv.org/html/2607.09094#S6) 中描述了实验设置,并在第7节 (https://arxiv.org/html/2607.09094#S7) 中报告了结果。
第2节 (https://arxiv.org/html/2607.09094#S2) 描述了相关工作,随后是第3节 (https://arxiv.org/html/2607.09094#S3) 中的背景和基础知识。第8节 (https://arxiv.org/html/2607.09094#S8) 给出了结论和未来工作展望。
## 2. 相关工作
法律文本表征是评估案例相似性的基础步骤。我们回顾了自动先例检索任务中使用的现有方法,并将我们的方法与使用知识图谱进行法律文本分析的现有工作联系起来。
### 2.1 法律文本表征
先例检索的一个关键挑战是以机器可读的形式表示法律判决,同时保留其语义、上下文和特定领域的法律细节。早期方法将法律文档视为词袋,并依赖 TF-IDF 和主题建模等统计方法进行表征[14](https://arxiv.org/html/2607.09094#bib.bib38),[20](https://arxiv.org/html/2607.09094#bib.bib13)。然而,这些方法不足以表征法律文本丰富的语义和上下文深度[1](https://arxiv.org/html/2607.09094#bib.bib25)。
神经网络方法如 Word2Vec[28](https://arxiv.org/html/2607.09094#bib.bib4) 和 GloVe[22](https://arxiv.org/html/2607.09094#bib.bib9) 通过捕捉语义改进了统计方法。Transformer 模型如 BERT[6](https://arxiv.org/html/2607.09094#bib.bib8) 进一步推进了上下文表征。然而,这些通用嵌入缺乏忠实表示法律文档中复杂细微信息所需的专门法律知识。
为解决这一差距,研究人员提出了领域增强模型,融合法律知识以进行法律文档表征。Hong 等人[10](https://arxiv.org/html/2607.09094#bib.bib10) 引入了法律特征增强语义匹配网络 (LFESM),该网络使用基于正则表达式的法律特征提取来改进语义匹配。尽管这种方法受益于集成领域线索,但编码法律特征的范围和深度仍然有限。最近,Bi 等人[5](https://arxiv.org/html/2607.09094#bib.bib11) 提出了 L-HetGRL,一种基于异构图的汉语法律文档表征模型,通过法律知识图谱整合语言和结构信息。
尽管在法律知识增强的上下文表征方面取得了进展,现有方法仍使用法律案例的全文进行表征,忽略了其内部结构和修辞组织。这对于印度法律文档尤其成问题,这些文档通常冗长、重复且缺乏一致结构。这些特征使得难以通过算法区分法律上重要的内容与通用文本[3](https://arxiv.org/html/2607.09094#bib.bib16)。因此,上述方法存在遗漏上下文重要信息的风险,从而降低了它们在先例检索中的有效性。
### 2.2 法律领域的知识图谱
知识图谱 (KG) 是信息的结构化表示,包含实体、关系和语义描述。实体代表现实世界对象或抽象概念,而关系定义了这些实体如何相互连接。
在法律文本分析中,KG 为表示法律文本固有的关系知识提供了一种原则性方法。通过捕捉实体(如法规、法律原则、案件事实和法律参与者)之间的复杂联系,它们有助于结构化法律文档。这种结构化表示增强了对案例文档的上下文理解和可解释性,并在法律问答[11](https://arxiv.org/html/2607.09094#bib.bib7)、法律推理[26](https://arxiv.org/html/2607.09094#bib.bib5) 等应用中已被证明有价值。
法律文本通常复杂、冗长且充满领域特定术语,这使得知识图谱 (KG) 构建成为一项非平凡任务。构建有效的法律 KG 需要复杂的流程来准确识别和链接重要的法律实体及关系,同时过滤掉冗余或无关内容。解决这些挑战对于充分实现基于 KG 的方法在法律应用中的潜力至关重要。
## 3. 问题描述与关键概念
法律先例检索 (LPR) 任务旨在找出给定的一组先前案例中哪些应与给定查询案例相关或需予以考虑[23](https://arxiv.org/html/2607.09094#bib.bib39)。该目标通过分析案例集,识别那些与给定查询案例共享事实、法律原则或语境元素的案例来实现。查询案例,记为 Q,是指法律专家正在为其搜索相关先例案例的法律情境的事实和语境描述。先前案例集,记为 J = {J_1, J_2, ..., J_N},由法律专家手动或使用关键词搜索(或两者结合)整理而成。LPR 任务的目标是促进检索 P ⊆ J,即与 Q 最相关的有序子集。P 中的案例根据相关性分数 ρ 排序,该分数量化了它们与查询的法理重要性和语境对齐程度。
### 3.1 关键概念与符号
在本节中,我们介绍构成所提方法论基础的基本概念和组成部分,为我们的方法奠定清晰且精确的基础。
1. i. **法律本体**:法律本体将法律认知表示为法律领域内一组结构化的概念和关系。它定义了法律实体及其类型和属性,以及它们之间的关系及其关系类型。法律实体类型的示例包括个体、公司、政府机构、法院和合同等。法律实体之间的法律关系类型示例包括雇佣、监管和起诉案件等。
###### 定义 1. 给定一组法律实体类型 T_E 和一组法律关系类型 T_R,法律本体 O相似文章
图原生强化学习通过概念重组实现可追溯的科学假设生成
本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。
面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析
本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。
GraphReAct:面向多步图推理的推理与行动
本文介绍了 GraphReAct,这是一个将推理与行动范式扩展到图结构数据以进行多步推理的框架。它结合了拓扑检索、语义检索以及上下文精炼,以提升在图学习基准测试上的性能。
GRACE-RAG:规范证据合成的受控检索架构,支持在封闭领域机构环境中轻量化部署
本文介绍了 GRACE-RAG,这是一种检索受控、图增强的 RAG 架构,它将结构推理从生成过程外化到结构化的检索层,从而能够在封闭领域的机构环境中实现轻量化部署。实验表明,在中规模模型上质量提升高达 20%,同时减少了计算和延迟开销。
NOWJ@COLIEE 2026: 面向法律检索与推理的自适应流水线
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。