通过检索、聚类和生成从案例数据库生成法律评注
摘要
本文提出了一种完全自动化的流程,通过提取、聚类和总结段落级块(使用LLM),将法院判决转化为法律评注,并在德国民法典案例上进行了评估。
arXiv:2605.24534v1 公告类型:新
摘要:我们提出了一种完全自动化的流程,将大量法院判决转化为法律法规评注——无需提供任何手工构建的教义框架。我们使用德国联邦最高法院引用德国民法典(BGB)第242、280、812和823条的4,555份判决,提取段落级块,总结其推理过程,并推导出关键词,这些关键词被嵌入并聚类。对于每个聚类,LLM生成标题并综合引用丰富的章节,然后由四种最先进的LLM合并成连贯的评注。我们使用人类专家和LLM评判员,从五个维度(主题相关性、标题匹配、引用忠实度、聚类区分度和逻辑顺序)进行评估。我们的结果表明,从法院判决中进行类似评注的论证挖掘以生成报告是可行的,且可以在几分钟内以最低成本更新,但同时也突出了因来源受限和法律推理规范性而产生的局限性。
查看缓存全文
缓存时间: 2026/05/26 09:03
# 通过检索、聚类和生成从案例数据库自动生成法律评注 来源:https://arxiv.org/html/2605.24534 \copyrightclause 本文版权归作者所有。根据 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可使用。 \conference 第一届论证挖掘与实证法律研究研讨会(AMELR 2025)论文集,2025年6月20日,美国芝加哥 \tnotemark [1] [orcid=0009-0005-7066-996X, [email protected], ] [orcid=0009-0008-6459-721X, [email protected], ] [orcid=0000-0001-6586-2486, [email protected], url=https://www.cs.cit.tum.de/lt/tum-legal-tech-working-group/, ] Niklas Wais Matthias Grabmair (2025) ###### 摘要 我们提出一个全自动流水线,能够将大量法院判决转化为成文法的法律评注——无需提供任何手工构建的理论框架。利用德国联邦最高法院引用《德国民法典》(BGB)第242、280、812和823条的4,555份判决,我们提取段落级别的文本块,对其论证进行摘要,并提取关键词,然后进行嵌入和聚类。针对每个聚类,LLM 生成标题并合成引用丰富的章节,再由四个最先进的 LLM 将这些章节合并成连贯的评注。我们采用人类专家和“LLM 评委”两种方式,从五个维度(主题相关性、标题匹配度、引用忠实度、聚类区分度和逻辑顺序)进行评估。结果表明,从法院判决中进行类似评注的论证挖掘,以生成可在几分钟内以极低成本更新的报告是可行的,但也突显了由于来源受限和法律推理规范性所带来的局限性。 ###### 关键词: 论证挖掘 \sep 法律评注 \sep 生成式 NLP ## 1 引言 大陆法系与英美法系常被对比,前者依赖先例而后者以成文法为中心。尽管大陆法系的法官在形式上不受判例约束,并以成文法为起点,但法官仅仅是“法律之口”的观点早已被证明是20世纪初自称反形式主义运动的有意歪曲。司法决策必然涉及解释,而先前的判决——尽管通常不具有约束力——为成文法的一致适用提供了参考。法律评注将这一实践系统化:它们收集并分析法院对成文法的适用,以及来自论文、书籍和其他评注中关于其适用的建议。换句话说,它们从法院判决和法律文献中**挖掘论证**。 ### 1.1 法律评注的结构 评注通常聚焦于某一部法典,例如《德国民法典》(BGB),并遵循其结构。以 BGB 评注为例,每个法律条款(§1 至 §2385)对应一个“章节”。在复述相关法律条款的措辞后,每个章节围绕该条款适用(即解释)过程中产生的问题进行组织。例如,当面对一个可能涉及 §823(1) BGB 下的伤害责任案件时,法官可能会质疑:目睹创伤性事件是否构成该条款意图下的“健康”侵犯?由于成文法措辞本身留有解释空间,法官将寻求支持或反对将目睹事件的心理创伤视为 §823(1) BGB 意义上的健康侵犯的论证。这包括识别法律学者提出的定义或法院裁决确立的关于 §823(1) BGB 中“健康”概念的定义,也涉及审查处理类似情况的先前法院判决。针对该问题,评注的 §823 BGB 章节中会收集并系统化支持与反对的论证。 ### 1.2 计算机生成的评注 法律评注是由多位作者撰写的巨著,其创作过程复杂且成本高昂。随着 LLM 带来的自然语言处理最新进展,研究人员已开始探索基于法院判决集合自动生成此类评注。Engel 和 Kruse 提出了一个自动流水线的原型,让 GPT-4 起草关于德国宪法第8条的评注。Python 代码获取德国联邦宪法法院的125份判决,提取提及第8条的段落,并附上包含宪法学理论的精心设计的提示,供给 GPT-4 进行分类、摘要和分组,将每条引用归入典型标题下。与五部领先的手写评注相比,机器生成的版本引用了更多判决,提供了精准的引用位置,并且可以在数小时内以约33美元的成本进行更新,但仍存在部分材料聚类错误以及遗漏理论演变的问题。该流水线使用了高度工程化的提示,为模型提供了德国宪法的理论框架,从而将生成过程组织成与手写评注可比的形式。作者将其定位为补充,而非替代品。他们还采用了类似方法处理欧洲人权法院(ECtHR)的判决。 Santosh 等人开发了“LexGenie”模型,该模型未明确作为法律评注,而是一个交互式工具,可根据用户提供的关键词从 ECtHR 判决生成结构化报告。离线阶段,他们通过 Mistral-7B 关键词短语嵌入在段落级别建立索引,并存储在 FAISS 数据库中。在线阶段,他们通过最大边际相关性(MMR)检索与关键词相关的段落,并使用 BERTopic 和 HDBSCAN 进行组织。随后,GPT-4o-mini 优化标题并逐步起草引用丰富的文本,以构建多案例法律指南。局限性包括偶尔的聚类错误和稀疏的跨章节链接。类似功能现在正被 OpenAI 的 Deep Research 等系统探索,这些系统提供基于证据的多文档综合,以支持高级学术工作流。与 Santosh 等人的方法类似,它们在生成法律报告时不依赖硬编码的法律知识,也不遵循法律评注的结构。与他们的一个关键区别是:前者先生成一个结构化的计划,然后检索文档,而不是从检索到的文档中生成结构。 ### 1.3 我们的贡献 我们结合了 Santosh 等人和 Engel 与 Kruse 的方法:不提供理论背景,仅依赖法院判决和成文法的文本,针对法律条款(而非像 Santosh 等人的关键词)生成类似评注的报告。这种通用化使得我们的方法易于推广到任意数量的法律条款。为演示目的,我们聚焦于《德国民法典》(BGB),该法典规定了私法的核心方面,包含两千多个条款。与德国宪法或欧洲人权公约相比,BGB 具有极高的实践重要性,且由于引用它的法院判决数量庞大而特别具有挑战性。我们还比较了多个最先进模型在该任务上的表现,引入了一个精密的流水线,并提供了定量与定性评估。最后,我们为关于计算机生成评注的益处与局限性的法理论讨论做出了贡献。 ## 2 数据与方法 请参见图1的说明。 图1:我们的流水线。在聚类步骤(6)中,绿色圆圈代表用于生成标题的文本块,棕色圆圈代表用于为每个标题生成章节文本的更广泛的聚类。红色圆圈被视为噪声。 图1 (https://arxiv.org/html/2605.24534#S2.F1) 展示了从下载法院判决到生成最终评注的步骤。 在步骤1中,我们选择一组具有实践重要性的 BGB 条款:§242(诚实信用)、§280(因违反义务的损害赔偿)、§812(不当得利)和 §823(侵权责任)。它们是法院判决中引用最多的条款,且具有一定多样性:§§280, 812, 823 BGB 构成了义务相关损害赔偿和侵权请求权的基础;§242 BGB 作为诚实信用和公平交易的一般指导原则,适用于合同法和义务法的所有方面。我们依赖德国联邦最高法院(BGH)的判决,BGH 是德国民事和刑事案件的最高法院,审理下级法院的上诉以确保法律解释的统一。我们从德国“在线判例”门户网站¹ 下载了所有4,555份公开的 BGH 判决,这些判决至少引用了一个 BGB 条款。¹https://www.rechtsprechung-im-internet.de/ 每个条款平均被约11份判决引用,但中位数仅为3,即一半的 BGB 条款出现在≤3份判决中。所选四个条款被引用的频率远高于此:§823(509份)、§280(484份)、§242(357份)、§812(260份判决)。 在步骤2中,我们从每份判决中提取“判决理由”部分,拆分为段落级别的文本块,并过滤掉长度小于100个字符的段落(主要包含签名或标题)。得到的语料库大小如下:§280(3,191个段落;927,333个标记)、§242(2,872;824,678)、§823(2,513;785,704)、§812(2,390;663,587)。 在步骤3中,我们使用 GPT-4o 对每个段落进行摘要,指示模型关注该段落如何应用被引用的条款。我们的流水线自动添加该条款的文本作为上下文;若引用多个条款,则提供所有文本以使模型能够判断该文本块是否实际处理该条款。 从摘要中,我们使用 GPT-4o 提取反映条款适用步骤的关键词,同样自动提供该条款的文本作为上下文(步骤4)。关键词通过 text-embedding-3-large 进行嵌入(步骤5),然后针对每个条款使用 HDBSCAN[Campello] 进行聚类(步骤6)——这一方法受 Santosh 等人启发。构成聚类的记录结构为:<摘要, 关键词>。聚类在嵌入空间中进行,基于关键词的语义相似性形成。每个聚类必须包含至少20条记录,无法分配到聚类的记录(图1中显示为红点)被视为离群点,不再进一步处理。每个聚类有一个质心,标记为黑色十字。橙色点代表普通聚类成员,绿色点突出显示关键词最接近质心的五条记录。这些关键词用于生成标题,而聚类内所有记录的摘要则用于生成该章节的段落(步骤7)。 所有标题-段落对被输入生成模型 GPT-4o、GPT-4.1、GPT-4.5 以及推理模型 o3,并附上指令将其合并为结构良好的评注(步骤8)。详细信息见附录中的提示1。 我们应用此流水线为每个模型生成了四份评注(§§242, 280, 812, 823 BGB);然而,该框架普遍适用于所有 BGB 条款,并且可以轻松扩展到其他法典。 ## 3 评估 我们使用 LLM 作为评委(见附录中的提示2)和人工评估两种方式来评估生成评注的总体质量(3.1节)。此外,我们还对生成文本进行了深入的(定性)法律分析(脚注2)。 ### 3.1 总体质量 我们基于五个标准评估总体质量:第一,考察主题相关性,验证各章节是否与法律条款一致。第二,检查标题匹配度,确保每个标题准确反映其章节内容。第三,测试引用忠实度,确认每条引用确实支持其后的陈述。第四,检查聚类区分度,评估各章节是否保持清晰分离、无重叠。第五,审查逻辑顺序,判断文档是否保持连贯、连续的叙述。 LLM 作为评委的评分由 Gemini 2.5 Flash 提供,该模型未参与生成。人工评估由我们团队中一位受过法律教育的成员以盲评方式进行。两者的结果见表1。 表1:§242 BGB、§280 BGB、§812 BGB、§823 BGB 的评估得分及其总体平均值(1-5分,越高越好)。对于每个模型-标准对,左侧为人工评分,右侧为 LLM 评分(人类 | LLM)。 (注:为节省空间,表格内容以文字形式呈现) GPT-4.5-preview 在所有标准和法律条款中的人工平均评估得分为4.4,领先于其他模型,紧随其后的是 o3(4.2),而 GPT-4o 在每个类别中均落后,平均得分为3。人工评委在主题相关性方面给予 GPT-4.5-preview 最高分,并在标题匹配度、聚类区分度和逻辑顺序方面给予 GPT-4.5-preview 和 o3 4至5分。然而,所有模型在引用忠实度方面均徘徊在3.5左右。Gemini 2.5 Flash 在主题相关性、聚类区分度和顺序方面给出的评分普遍高出约0.5分。模型与人工评估之间最接近的吻合出现在引用忠实度上,自动化模型得分略低。人工评分与自动化评分之间差异最大的类别是……
相似文章
基于思维树启发的混合方法:使用大语言模型进行法律案件判决摘要生成
提出一种基于思维树的抽取-生成混合方法,利用大语言模型进行法律案件判决摘要,在DeepSeek和LLama上的实验表明,该方法生成的摘要优于单独的抽取式或生成式方法。
德国法律法规的分块策略
本文评估了针对德国法律法规的检索增强生成中的多种分块策略,发现与结构对齐的方法(如基于章节的检索)优于更复杂的方案。
从判决到争议点:带有引用幻觉控制的法律推理的结构化提取
本文介绍了一条自动化流水线,该流水线使用 DeepSeek V3 模型将意大利税务法院判决分解为各个法律争议点,并按照 IRAC 框架以 XML 格式结构化表示,同时包含一个使用 Linkoln 解析器验证引用的幻觉检测过滤器,该过滤器已由专家注释者验证。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.