从判决到争议点:带有引用幻觉控制的法律推理的结构化提取
摘要
本文介绍了一条自动化流水线,该流水线使用 DeepSeek V3 模型将意大利税务法院判决分解为各个法律争议点,并按照 IRAC 框架以 XML 格式结构化表示,同时包含一个使用 Linkoln 解析器验证引用的幻觉检测过滤器,该过滤器已由专家注释者验证。
arXiv:2607.03325v1 公告类型:新
摘要:我们介绍了一条自动化流水线,该流水线将意大利税务法院判决分解为各个法律争议点,并针对每个争议点提取基于 IRAC 框架和法律三段论的结构化 XML 表示。该流水线针对约 330,000 份意大利税务法院一审和二审判决的语料库,围绕一个能力强且成本效益高的通用模型(DeepSeek V3)构建,这一选择是出于以可持续成本处理数十万份文档的需求。为了解决大型语言模型在法律引用方面众所周知的不可靠性,我们将提取步骤与自动幻觉检测过滤器相结合,该过滤器将模型生成的引用与专用解析器(Linkoln)在判决文本中识别出的引用进行比较,并标准化为标准标识符(URN-NIR、ECLI、CELEX)。我们在由两位税法博士注释的 50 份判决上验证了该流水线,计算了在争议点提取和法律引用方面的注释者间一致性和 LLM 与专家间一致性,以及对幻觉过滤器的独立评估。据我们所知,这是首个针对意大利税务法院判决的、带有幻觉控制且经过专家验证的逐争议点结构化提取流水线,它为下游应用(如逐争议点检索、引用网络分析以及大规模法律推理数据集的构建)提供了一个具体的起点。
查看缓存全文
缓存时间: 2026/07/07 04:37
# 从判决到法律争点:具有引用幻觉控制的法律推理结构化抽取 **来源:** https://arxiv.org/html/2607.03325 Giovanni Piccioli\ Quantitative and Digital Law Laboratory\ King’s College London\ Strand, London WC2R 2LS\ giovannipiccioli@gmail\.com & Alessia Fidelangeli\ CIRSFID \- Alma AI, Faculty of Law\ University of Bologna\ Bologna, Via Zamboni 27/29 & Piera Santin\ Robert Schuman Centre\ European University Institute\ Fiesole, Badia Fiesolana \- Via dei Roccettini 9 & Pierpaolo Vivo\ Quantitative and Digital Law Laboratory\ King’s College London\ Strand, London WC2R 2LS ###### 摘要 我们提出了一种自动化流水线,能够将意大利税务法院的判决分解为独立的法律争点,并针对每个争点提取结构化的XML表示,该表示基于IRAC框架和法律三段论。该流水线针对约330,000份意大利税务法院一审和二审判决语料,采用能力强且成本效益高的大模型(DeepSeek V3),这一选择源于需要以可持续的成本处理数十万份文档。为了解决大语言模型在法律引用方面众所周知的不可靠性,我们将提取步骤与自动幻觉检测过滤器结合,该过滤器将模型生成的引用与专用解析器(Linkoln)在判决文本中识别出的引用进行比较,并统一标准化为标准标识符(URN-NIR, ECLI, CELEX)。我们使用由两位税法博士标注的50份判决验证了该流水线,计算了在争点提取和法律引用上的标注者间一致性及大模型与专家间一致性,并对幻觉过滤器进行了独立评估。据我们所知,这是首个针对意大利税务法院判决的、经过专家验证的、具有幻觉控制的结构化争点级抽取流水线,为下游应用(如争点级检索、引用网络分析以及构建大规模法律推理数据集)提供了具体起点。 ## 1 引言 现代司法系统产生的法院判决规模早已超过法律专业人士逐一阅读的能力。在意大利,仅税务法院一审和二审判决的数据库就包含近百万份判决,且每年还以数十万份的速度增长。这一海量判决的实际价值几乎完全在于二次利用:执业律师的判例检索、引用网络分析、司法行为评估,以及构建用于训练和评估法律NLP系统的大规模数据集。然而,这些用途都要求将判决表示为比法院原始PDF更紧凑且结构化的形式。本文的核心问题是如何自动、大规模且以可量化的可靠性获得这种表示。 意大利税务法院判决是检验此问题的极好试验场。一方面,该领域对任何声称通用的抽取流水线都构成严峻考验。税务争议金额从几十欧元到数千万欧元不等,且解决单一案件时通常需要援引民法、商法、刑法、程序法以及欧盟法。一审和二审由包含非职业名誉法官的合议庭审理,其撰写风格比上级法院明显更不标准化:甚至判决结构部分的名称和顺序也因案而异。另一方面,该领域也使问题变得可行:存在官方开放数据库,规模足够大使统计评估有意义,且当事人始终是同一对(纳税人和税务机关)。因此,在此领域表现良好的流水线既可作为方法论贡献,又可作为实用的工具,因为该司法管辖区的判例法目前尚未受到法律NLP文献的足够关注。 本工作的核心方法论选择是将**法律争点**(*questione giuridica*)而非判决本身作为表示单元。这一选择与长期以来对司法论证的分析一致,这些分析将裁判视为通过基于事实和法律规范的推理来解决一个或多个法律问题的过程(MacCormick, 1994 (https://arxiv.org/html/2607.03325#bib.bib64); Bench-Capon et al., 2024 (https://arxiv.org/html/2607.03325#bib.bib62))。一份判决通常解决多个争点,这些争点除了同属一个案件外几乎没有共同之处:法院可能首先决定上诉的可受理性,然后处理实体问题,最后决定费用分配。对于我们所考虑的所有二次用途,争点都是自然的分析单元:判例检索是搜索已就特定问题作出裁决的案件;引用图的价值在于其边反映了实际用于解决争议点的引用,而非偶然提及;法律推理数据集的有用性在于其示例隔离了单一的论证链。因此,我们设计流水线将每份判决分解为一系列自主争点,以便独立处理这些争点。 我们为每个争点提取的结构受到两种广泛使用的司法推理分析框架的启发:IRAC(Issue, Rule, Application, Conclusion)和法律三段论。这些模型施加了足够的结构,使表示具有机器可读性,并锚定在公认的理论传统中,同时又足够粗粒度,使得语言模型能够可靠提取。具体而言,每个争点被编码为一个XML记录,包含疑问句形式的问题陈述、事实前提列表、法律引用及其引用理由列表、法官推理、结论以及抽象摘要。该模式有意设定了用户易于理解且语言模型能在语料库中风格各异的判决间一致填充的粒度。结构丰富性与可靠可提取性之间的权衡本身就是一个设计选择,详见第3.4节 (https://arxiv.org/html/2607.03325#S3.SS4)。 流水线的其余部分受两个实际限制的约束。第一个是成本。在完整数据库规模上进行提取,要求模型的单文档成本能够承受处理数十万份判决;这促使我们使用DeepSeek V3,每份判决的成本约为0.0035美元。相比之下,顶级专有模型的费率可能高出二十倍。第二个是可靠性。LLM应当足够强大,能够正确将判决分割为争点,并填充相应的XML字段,使其达到税法专家可接受的程度。此外,模型的幻觉率应尽可能低。这是LLM已知的失败模式,表现为编造出看似合理但实际上不存在的法规和判例引用(Dahl et al., 2024 (https://arxiv.org/html/2607.03325#bib.bib65); Han et al., 2026 (https://arxiv.org/html/2607.03325#bib.bib19))。由于成本效益和可靠性是相互竞争的目标,我们进行了多模型非正式比较评估,并选择了成本效益最高且能为法律专家提供可接受结果的模型;详见附录J (https://arxiv.org/html/2607.03325#A10)。为了缓解幻觉风险,我们在提取之后增加了一个显式验证层。我们使用Linkoln库(Bacci et al., 2019 (https://arxiv.org/html/2607.03325#bib.bib1))解析判决文本和LLM输出中的法律引用,将其标准化为标准标识符(URN-NIR, ECLI, CELEX),并删除输出中无法在原文中找到的任何引用。该过滤器在设计中是保守的:它保留流水线可靠的引用,移除不可靠的引用。 我们在一个手动标注的50份判决子样本上评估了最终流水线。两位专家(税法博士)在双盲条件下双重标注了其中20份,并对剩余30份按不重叠的半数进行了标注,遵循他们在另一组判决上共同制定的指南。该协议使我们能够报告大模型与专家在争点提取、法律引用提取以及自由文本字段的定性评分上的一致性,以及标注者间一致性。第6节 (https://arxiv.org/html/2607.03325#S6) 详细报告了结果;我们还评估了幻觉过滤器作为独立分类器的性能,并按引用类型分析了残余幻觉。 ### 1.1 贡献 本文的贡献有三方面。首先,我们提出了一种结构化的XML模式,用于表示法院判决,该模式明确基于IRAC和法律三段论,以法律争点为单位,同时便于人工查阅、可机器读取用于下游任务,并能由中端LLM可靠实例化。其次,我们开发了一个基于成本效益高的大模型(DeepSeek V3)的抽取流水线,并将其与法律引用上的自动幻觉检测步骤结合。通过Linkoln库(Bacci et al., 2019 (https://arxiv.org/html/2607.03325#bib.bib1))对判决文本和LLM输出进行归一化,并比较两组集合,我们删除模型编造的引用,同时保留其余部分。该流水线已在约330,000份已处理(从401,349份检索中)的意大利税务法院判决上运行并改进。第三,我们在两位法律专家标注的50份意大利税务法院判决语料上评估了该流水线,报告了标注者间一致性以及大模型与专家在争点提取、法律引用和自由文本字段定性维度上的一致性,并结合幻觉过滤器的独立分析。 论文其余部分组织如下:第2节 (https://arxiv.org/html/2607.03325#S2) 回顾了法院判决结构化抽取、基于IRAC和三段论的流水线、引用处理以及基于LLM的法律标注相关工作。第3节 (https://arxiv.org/html/2607.03325#S3) 介绍了基于争点的XML模式及其设计需求。第4节 (https://arxiv.org/html/2607.03325#S4) 描述了语料和抽取流水线,包括幻觉检测步骤。第5节 (https://arxiv.org/html/2607.03325#S5) 阐述了验证协议,第6节 (https://arxiv.org/html/2607.03325#S6) 报告了评估结果。第7节 (https://arxiv.org/html/2607.03325#S7) 以局限性和未来工作方向的讨论结束。 ## 2 相关工作 我们的工作处于法律NLP若干研究方向的交叉点:(i) 司法推理的形式模型,(ii) 法院判决的结构化抽取,(iii) 法律引用的提取、归一化与幻觉控制,以及 (iv) 使用LLM对法律语料进行提取和标注。 #### IRAC、法律三段论与结构化司法推理 AI与法律领域的第一类工作旨在以支持计算分析、法律知识提取和决策支持的结构化形式表示法律推理(Ashley, 2017 (https://arxiv.org/html/2607.03325#bib.bib63))。在此传统中,近期若干工作沿着IRAC框架或法律三段论的思路形式化司法推理,并在基于LLM的流水线中利用这些结构(Bench-Capon, 2020 (https://arxiv.org/html/2607.03325#bib.bib72))。Jiang和Yang (2023 (https://arxiv.org/html/2607.03325#bib.bib49)) 提出了*法律三段论提示*,指示LLM阐述大前提、小前提和结论以进行判决预测;Yu等人 (2022 (https://arxiv.org/html/2607.03325#bib.bib20)) 类似地表明,IRAC风格的提示在COLIEE竞赛(Rabelo et al., 2022 (https://arxiv.org/html/2607.03325#bib.bib52))的法律蕴含任务上优于通用思维链。Kang等人 (2025 (https://arxiv.org/html/2607.03325#bib.bib11)) 将马来西亚合同法场景的IRAC基准与半结构化知识库结合,在问题识别和规则检索上显示出显著改进。Holzenberger和Van Durme (2023 (https://arxiv.org/html/2607.03325#bib.bib60)) 通过将法定推理视为流水线(先通过信息抽取将法律文本转换为结构化表示,然后由基于Prolog的符号推理器处理)扩展了该方法,表明推理精度取决于提取结构质量。虽然这些工作使用IRAC或三段论来引导提示或为LLM提供法律推理框架,但我们从中汲取灵感来设计抽取模式(Ruf and Yin, 2024 (https://arxiv.org/html/2607.03325#bib.bib73))。 #### 判决的结构化抽取与分解 一个密切相关的研究方向使用LLM提取判决的结构化表示用于二次利用。Grundler等人 (2025 (https://arxiv.org/html/2607.03325#bib.bib25)) 从CJEU关于VAT的判决中提取司法解释公式,结合了基于LLM的标注、微调BERT和专家验证;他们的税法焦点和专家验证设置与我们的相似。Adhikary等人 (2024 (https://arxiv.org/html/2607.03325#bib.bib10)) 为印度刑事案件定义了细粒度属性,并通过少样本LLM提示进行提取,表明属性级表示有助于判决和法规预测。Costa等人 (2024 (https://arxiv.org/html/2607.03325#bib.bib30)) 生成了带有*ratio decidendi*和结果的巴西司法判决结构化标注;Westermann等人 (2025 (https://arxiv.org/html/2607.03325#bib.bib28)) 使用LLM将法院判决映射到“规则树”(对索赔必须满足条件的逻辑分解),识别法官认为满足的条件并解释推理;Janatian等人 (2023 (https://arxiv.org/html/2607.03325#bib.bib29)) 将立法转换为计算机系统可用于回答法律问题的结构化if-then规则。Belfathi等人 (2023 (https://arxiv.org/html/2607.03325#bib.bib35)) 和Lombardi等人 (2023 (https://arxiv.org/html/2607.03325#bib.bib36)) 使用LLM将判决分割并标注为逻辑部分。判决中论证的标注以及随后用于NLP任务的研究在Habernal等人 (2024 (https://arxiv.org/html/2607.03325#bib.bib22)) 和Santi等人 (2023 (https://arxiv.org/html/2607.03325#bib.bib27)) 中进行了探索。最后,Openjustice倡议(Dahan et al., 2023 (https://arxiv.org/html/2607.03325#bib.bib61); Bhambhoria et al., 2026 (https://arxiv.org/html/2607.03325#bib.bib67))旨在通过众包事实、逻辑条件和结果组成的推理流来构建法律推理的结构化数据集。与这些工作相比,我们的贡献在于:(i) 将提取模板锚定在IRAC/三段论中,而非平坦属性列表;(ii) 将每份判决分解为自主*争点*;(iii) 整合了对法律引用的显式幻觉检查。 #### 法律判决要旨与摘要(聚焦意大利) 判决要旨、*massime*、*Leitsätze*以及结构化摘要的提取与我们的工作密切相关。Licari等人 (2023 (h
相似文章
NOWJ@COLIEE 2026: 面向法律检索与推理的自适应流水线
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。
基于思维树启发的混合方法:使用大语言模型进行法律案件判决摘要生成
提出一种基于思维树的抽取-生成混合方法,利用大语言模型进行法律案件判决摘要,在DeepSeek和LLama上的实验表明,该方法生成的摘要优于单独的抽取式或生成式方法。
本地LLM在适配法律文档时持续自信地产生虚构引用——是否有接地/模型/流水线的思路?
用户报告称,本地LLM在适配法律文档时以高自信度虚构引用,并寻求关于如何通过接地、模型或流水线思路来缓解此问题的建议。
通过检索、聚类和生成从案例数据库生成法律评注
本文提出了一种完全自动化的流程,通过提取、聚类和总结段落级块(使用LLM),将法院判决转化为法律评注,并在德国民法典案例上进行了评估。
LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI
本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。