NOWJ@COLIEE 2026: 面向法律检索与推理的自适应流水线
摘要
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。
查看缓存全文
缓存时间: 2026/07/21 06:42
# 法律检索与推理的自适应流水线 来源:https://arxiv.org/html/2607.16603 ,Hoang-Trung Nguyen(越南国立大学工程与技术大学,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected])),Huu-Dong Nguyen(越南国立大学工程与技术大学,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected])),Xuan-Bach Le(越南国立大学工程与技术大学,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected])),Le-Dung Nguyen(越南国立大学工程与技术大学,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected])),Quang-Thanh Tran(越南国立大学工程与技术大学,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected])),Ha-Thanh Nguyen(法学信息学中心,ROIS-DS;VinUniversity工程与计算机科学学院,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected]))以及 Thi-Hai-Yen Vuong(越南国立大学工程与技术大学,河内,越南,[email protected] (https://arxiv.org/html/2607.16603v1/mailto:[email protected]))(2026)###### 摘要。本文介绍了NOWJ团队参与COLIEE 2026竞赛全部五项任务的方法与结果。针对任务1(法律案例检索),我们提出了一个四阶段流水线,包括候选过滤、结合互补嵌入模型的稠密检索、通过微调生成式重排序器和基于MLP的成对分类进行的交叉编码器重排序,以及自适应查询特定截断预测。针对任务2(法律案例蕴含),我们结合了BM25过滤、T5重排序、基于LLM的蕴含验证与共识集成。针对任务3(成文法检索与蕴含),我们采用检索增强生成框架,包含稠密检索、基于注意力的重排序以及少样本提示的LLM推理。针对任务4(法律文本蕴含),我们引入了一个动态路由流水线,对查询难度进行分类,并将案例分派给平衡的少样本求解器或结构化的零样本思维链求解器。针对试点任务(法律判决预测),我们结合了层次化Transformer与CRF层、论点关系挖掘以及概率论证图推理。法律信息处理,文档检索,文本蕴含,多阶段,嵌入模型,LLMs ††版权:权利保留††期刊年份:2026††会议:COLIEE 2026研讨会;2026年6月12日;新加坡††论文集:COLIEE 2026研讨会论文集,2026年6月12日,新加坡††ccs:应用计算 法律††ccs:计算方法 自然语言处理## 1. 引言 法律文本处理是一个需要法律和信息科学专业知识的特殊领域。随着人工智能(AI)和大语言模型(LLMs)在司法流程中的日益普及,人们对自动化核心法律任务(如案例检索、法规推理和判决预测)的兴趣不断增长。法律信息抽取与蕴含竞赛(COLIEE)(Rabelo等人,2024 (https://arxiv.org/html/2607.16603#bib.bib16))是一个年度共享任务,旨在推动该领域研究,涵盖从文档检索、文本蕴含到判决预测的挑战。COLIEE 2026是该竞赛的第十三届,包含五项任务,涵盖判例法、成文法与侵权法。任务1(法律案例检索)要求从判例法文档语料库中检索出支持给定查询案例(其引用已被删除)的被引用案例。任务2(法律案例蕴含)要求识别被引用案例中蕴含查询案例判决部分的段落。任务3(成文法检索与蕴含)要求系统针对给定法律查询,联合返回蕴含判决及来自日本民法典文章集合的支持条款。任务4(法律文本蕴含)要求确定一组给定的黄金相关条款是蕴含还是矛盾于法律查询。试点任务(LJPJT26)要求预测侵权是否被确认,并提取原告诉求与被告抗辩中已被采纳的论点。本文介绍了NOWJ团队参与全部五项任务的方法。对于任务1,我们提出了一个四阶段流水线:候选过滤、稠密检索、两种互补方法的交叉编码器重排序,以及自适应查询特定截断预测。对于任务2,我们采用BM25过滤、T5重排序以及基于LLM的蕴含验证与共识集成。对于任务3,我们采用检索增强生成框架,结合稠密检索、基于注意力的重排序和少样本提示的LLM推理。对于任务4,我们引入了一个动态路由流水线,对查询难度进行分类并将案例分派给专门的求解器。对于试点任务,我们结合了层次化Transformer与CRF层、论点关系挖掘以及概率论证图推理。我们的系统在所有任务上均取得了有竞争力的性能,尤其在任务1和任务3上表现突出,证明了结合稠密检索与任务特定重排序和推理策略的多阶段流水线的有效性。本文的其余部分按任务组织,每个部分详细阐述任务定义、提出的方法、实验设置和结果。## 2. 任务1:法律案例检索 ### 2.1 任务概述 法律数据库的快速增长使得手动识别相关先例变得越来越不现实。COLIEE任务1通过如下方式定义法律案例检索:给定一个查询案例qq(所有引用均已删除),目标是从判例法文档语料库中检索所有被引用案例\{d1,d2,...,dn\}\\\{d\_\{1\},d\_\{2\},\\ldots,d\_\{n\}\\\},每个案例包含背景、事实、推理和判决。被引用案例是qq中原本引用以支持判决的案例。该任务面临多个挑战:案例文档通常为4,000至60,000字,超过许多基于Transformer的模型的上下文窗口;文档缺乏标准化结构;语料库包含混合语言内容(英语和法语)。在COLIEE 2025中,表现最好的团队JNLP(Nguyen等人,2025 (https://arxiv.org/html/2607.16603#bib.bib6))通过将UMNLP成对排名框架与BM25和SAILER特征在前馈分类器中扩展,实现了F1为0.3353,其中BM25预过滤在前100-200个候选中达到76-85%的召回率。亚军UQLegalAI(Tang等人,2025 (https://arxiv.org/html/2607.16603#bib.bib5))采用了CaseLink,一种通过对比学习建模案例级连接的图神经网络,获得了0.2962的F1分数。参与者的一致趋势是采用多阶段流水线,结合稀疏检索与神经重排序以及基于LLM的摘要进行文档压缩。 ### 2.2 方法论 为了应对法律案例检索的主要挑战——即案例文本的过长文档和复杂逻辑结构——我们提出了一个四阶段框架。该流水线首先应用基于年份的过滤以排除时间上无效的候选,然后进行稠密检索以初步排名,再进行重排序以细化相关性评分。整体架构如图1所示。 ##### 阶段1:预处理与候选过滤 由于加拿大联邦法院语料库包含双语文档,首先使用自动语言检测器¹¹¹https://huggingface.co/papluca/xlm-roberta-base-language-detection 移除法语内容。然后我们应用两个过滤启发式:(i) 排除审判日期晚于查询日期的候选,因为有效的被引案例必须在时间上早于查询;(ii) 删除也作为查询出现的案例,因为它们很少被引用为被引用案例。这些步骤防止了时间上无效的引用,并显著缩小了候选空间。 ##### 阶段2:稠密检索 稠密检索阶段从完整语料库中识别最有希望的候选,在计算效率和高召回率之间取得平衡。我们采用两个互补的预训练嵌入模型:Octen-Embedding-8B和E5-Mistral-7B-Instruct。每个文档被两个模型独立编码为稠密向量。遵循指令感知编码范式,查询通过任务特定指令增强以传达检索目标,而文档则以中立格式编码。查询:指令:给定一个法律文档,检索相关法律文档\n查询:\{查询文本\} 文档:段落:\{文档文本\} 由于案例文档经常超过嵌入模型的上下文窗口,查询和文档均被分割成块并独立编码。为了计算文档级相关性,我们采用受ColBERT启发的MaxSim评分函数(Khattab和Zaharia,2020 (https://arxiv.org/html/2607.16603#bib.bib1)): (1) s\(q,d\)=∑i=1Mmaxj∈\[N\]qi⋅djs\(q,d\)=\\sum\_\{i=1\}^\{M\}\\max\_\{j\\in\[N\]\}\\mathbf\{q\}\_\{i\}\\cdot\\mathbf\{d\}\_\{j\} 其中\{qi\}i=1M\\\{\\mathbf\{q\}\_\{i\}\\\}\_\{i=1\}^\{M\}和\{dj\}j=1N\\\{\\mathbf\{d\}\_\{j\}\\\}\_\{j=1\}^\{N\}分别表示查询块和文档块嵌入。该公式允许每个查询块匹配其最相关的文档片段,有效捕获长文档中的部分相关性。所有嵌入均经过l2\\ell\_\{2\}归一化,使得点积等价于余弦相似度。前kk个结果被传递给重排序阶段。 ##### 阶段3:重排序 在候选检索阶段之后,我们引入一个重排序模块来细化候选案例的排名。该阶段通过纳入比初始相似度分数更具表现力的相关性建模来提升检索性能。我们提出两种独立的重排序方法,每种方法捕获法律案例之间语义和结构相关性的不同方面。见图1。图1:法律案例检索的四阶段流水线,包括预处理与候选过滤、稠密检索、重排序以及自适应查询特定截断。任务1框架###### 方法1:加权集成。稠密检索独立编码查询和候选,限制了细粒度的语义匹配。重排序阶段通过联合编码每个查询-候选对来解决此问题,实现令牌级交互以获得更准确的相关性估计。我们采用Qwen3-Reranker(Zhang等人,2025b (https://arxiv.org/html/2607.16603#bib.bib3)),这是一个生成式重排序器,根据最终令牌位置的对数产生相关性分数: (2) s\(q,d\)=exp\(lyes\)exp\(lyes\)\+exp\(lno\)s\(q,d\)=\\frac\{\\exp\(l\_\{\\text\{yes\}\}\)\}\{\\exp\(l\_\{\\text\{yes\}\}\)\+\\exp\(l\_\{\\text\{no\}\}\)\} 其中lyesl\_\{\\text\{yes\}\}和lnol\_\{\\text\{no\}\}分别是“yes”和“no”令牌的对数,将相关性评估视为对生成令牌分布的二值判断。我们使用ms-swift(Zhao等人,2025 (https://arxiv.org/html/2607.16603#bib.bib2))在COLIEE 2026训练数据上微调Qwen3-Reranker-4B和8B两个变体,采用逐点二元交叉熵损失: (3) L=−\[ylogs\(q,d\)\+\(1−y\)log\(1−s\(q,d\)\)\]\\mathcal\{L\}=\-\\left\[y\\log s\(q,d\)\+\(1\-y\)\\log\(1\-s\(q,d\)\)\\right\] 其中y∈\{0,1\}y\\in\\\{0,1\\\}是真实相关性标签。正样本来自黄金被引用案例。为了构建有意义的负样本,我们应用去噪策略,过滤掉检索分数与正样本过于接近的候选,确保训练信号不会被模糊的近正例稀释。所有训练和推理遵循Qwen3-Reranker提示模板。系统:根据查询和提供的指令判断文档是否满足要求。注意答案只能是"yes"或"no"。 用户:: 给定一个法律文档,检索相关法律文档\n: \{查询文本\} \n: \{候选文档文本\} 助手:\{yes / no\} 每个候选的最终相关性分数通过加权组合整合来自所有先前阶段的信号——稠密检索分数以及两个交叉编码器重排序分数: (4) sfused\(q,d\)=α⋅sim\(q,d\)\+β⋅s4B\(q,d\)\+γ⋅s8B\(q,d\)s\_\{\\text\{fused\}\}\(q,d\)=\\alpha\\cdot\\text\{sim\}\(q,d\)\+\\beta\\cdot s\_\{\\text\{4B\}\}\(q,d\)\+\\gamma\\cdot s\_\{\\text\{8B\}\}\(q,d\) 其中sim\(q,d\)\\text\{sim\}\(q,d\)是阶段2的余弦相似度,s4Bs\_\{\\text\{4B\}\}和s8Bs\_\{\\text\{8B\}\}是Qwen3-Reranker-4B和8B的重排序分数,α,β,γ\\alpha,\\beta,\\gamma是在开发集上调优的超参数(α=0.5\\alpha=0.5,β=1.0\\beta=1.0,γ=1.5\\gamma=1.5)。这种多信号融合使系统能够利用稠密检索的广泛召回率以及交叉编码器的细粒度相关性判断。 ###### 方法2:基于MLP的重排序。为了细化初始检索结果,我们采用受UMNLP启发的成对分类框架(Curran和Conway,2024 (https://arxiv.org/html/2607.16603#bib.bib7))。对于给定的查询-候选对,模型使用多层感知器(MLP)估计相关性概率。候选构建。对于每个查询,我们从阶段2检索到的前200个候选中构建候选池,以减少噪声同时保持高召回率。真实相关案例被视为正实例,其余候选作为困难负例。这些排名靠前的非相关案例在语义上比随机负例更接近查询,鼓励模型学习法律推理中更精细的区别。特征构建。每个查询-候选对使用遵循UMNLP的命题级特征表示。我们进一步纳入: - •语义特征:稠密嵌入的最大余弦相似度。 - •词汇特征:BM25分数及其归一化变体。 - •排名特征:检索模型中的排名位置和倒数排名。 - •元数据特征:法律领域类别和案例类型。 这些特征使模型能够联合捕获语义相似性、词汇重叠以及来自检索阶段的结构信号。模型架构与训练。重排序器实现为前馈神经网络,接受拼接后的特征向量,输出相关性概率p\(q,d\)∈\[0,1\]p\(q,d\)\\in\[0,1\]。模型使用二元交叉熵损失进行训练: (5) L=−\[ylogp\(q,d\)\+\(1−y\)log\(1−p\(q,d\)\)\],\\mathcal\{L\}=\-\\left\[y\\log p\(q,d\)\+\(1\-y\)\\log\(1\-p\(q,d\)\)\\right\], 我们直接在原始数据分布上训练,没有进行激进的重新采样,使模型能更好地反映现实世界的检索条件。 ##### 阶段4:自适应查询特定截断 重排序后,系统需要确定每个查询返回多少候选。这并非琐事,因为每个查询的黄金被引用案例数量差异显著——有些只有一个相关先例,而有些则有多个。应用固定阈值会根据查询不可避免地牺牲精确率或召回率。为了解决此问题,我们训练一个XGBoost和MLP集成来预测每个查询期望的相关案例数量\|Dq\|\|\\mathcal\{D\}\_\{q\}\|。预测器输入如下: [此处应继续翻译,但原文截断]
相似文章
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines
This paper shows that LLM judges embedded in reasoning pipelines often make poor decisions, and proposes Evidence-Locked Derive–Gate–Repair (EL-DGR) to constrain judge overrides with evidence certificates, improving accuracy over majority vote and first-candidate baselines.
从判决到争议点:带有引用幻觉控制的法律推理的结构化提取
本文介绍了一条自动化流水线,该流水线使用 DeepSeek V3 模型将意大利税务法院判决分解为各个法律争议点,并按照 IRAC 框架以 XML 格式结构化表示,同时包含一个使用 Linkoln 解析器验证引用的幻觉检测过滤器,该过滤器已由专家注释者验证。
我构建了一个开源知识图谱管道,结合混合检索以改进LLM多跳推理 [P]
一个开源的全栈管道,从原始文本构建知识图谱,使用混合搜索(密集向量+稀疏+图遍历)解决LLM中的多跳推理问题,并通过倒数排名融合和交叉编码器对结果进行重排序。
面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析
本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。
平衡RAG流水线中推理深度与硬件约束的乌克兰多领域文档理解
本文提出了一种资源高效的RAG流水线,用于UNLP 2026共享任务中的乌克兰多领域文档理解,通过平衡推理深度与硬件约束,实现了第10名的排名。