LegalPincite:多层级法律信息检索数据集

Hugging Face Daily Papers 论文

摘要

介绍LegalPincite,一个基于欧盟法院(CJEU)判决构建的大规模法律信息检索数据集,包含掩码查询、完整语料库和段落级引文标注,以支持多层级检索评估。

法律信息检索(IR)中的一个常见任务是从判例法集合中查找相关的法律来源。虽然法律实践通常需要精确引用(pincite)到具体的案件段落,但大多数现有的公开法律IR数据集缺乏段落级引用标注。然而,含有此类信息的公开数据集在查询文本中存在数据泄露,并且将既不引用也不被引用的段落排除在语料库之外,这造成了一个不现实且过度简化的检索环境,可能导致性能虚高。为解决这些局限性,我们构建了一个基于欧盟法院(CJEU)判决的大规模法律IR数据集。该数据集包含:(i)掩码的案件/段落查询,移除了引用信息;(ii)包含所有段落的语料库;(iii)案件级和段落级的真实引用标注,并经过部分人类专家验证。我们的数据集支持在多个查询-文档层级(案件到案件、段落到案件、段落到段落检索)上开发和严格评估法律IR方法。数据集链接:https://huggingface.co/datasets/theresiavr/legalpincite
查看原文
查看缓存全文

缓存时间: 2026/08/05 17:46

论文页面 - LegalPincite:多层级法律信息检索数据集

来源:https://huggingface.co/papers/2608.03756

发布于 8 月 4 日

· 提交者 https://huggingface.co/theresiavr

TVR (https://huggingface.co/theresiavr) 于 8 月 5 日

摘要

法律信息检索(IR)中的一项常见任务是从判例法集合中查找相关法律来源。虽然法律实践通常需要对特定案件段落进行精确定位引用(pincites),但大多数现有的公开法律 IR 数据集缺乏段落级引用标注。然而,具有此类信息的公开数据集在查询文本中存在数据泄漏,并且从语料库中排除了既不引用其他段落也不被其他段落引用的段落,从而造成不真实且过度简化的检索环境,可能导致性能虚高。为解决这些局限性,我们构建了一个大规模法律 IR 数据集,该数据集基于欧洲联盟法院(CJEU)判决。该数据集包含:(i)掩码后的案例/段落查询,并移除了引用信息;(ii)包含所有段落的语料库;(iii)案例级和段落级真值引用,并经过部分人类专家验证。我们的数据集支持在多个查询-文档层级(案例到案例、段落到案例和段落到段落检索)上对法律 IR 方法进行开发和严格评估。数据集链接:https://huggingface.co/datasets/theresiavr/legalpincite

查看 arXiv 页面 查看 PDF 项目页面 GitHub 添加到收藏

引用本文的模型 0

没有模型关联本文

要在模型 README.md 中引用 arxiv.org/abs/2608.03756,即可从本页面链接到该模型。

引用本文的数据集 1

theresiavr/legalpincite 查看器• 更新于 35 分钟前 • 1.47M • 320 • 1 (https://huggingface.co/datasets/theresiavr/legalpincite)

引用本文的 Spaces 0

没有 Space 关联本文

要在 Space README.md 中引用 arxiv.org/abs/2608.03756,即可从本页面链接到该 Space。

收录本文的合集 1

相似文章

从判决到争议点:带有引用幻觉控制的法律推理的结构化提取

arXiv cs.CL

本文介绍了一条自动化流水线,该流水线使用 DeepSeek V3 模型将意大利税务法院判决分解为各个法律争议点,并按照 IRAC 框架以 XML 格式结构化表示,同时包含一个使用 Linkoln 解析器验证引用的幻觉检测过滤器,该过滤器已由专家注释者验证。

CanLegalRAGBench: 评估加拿大判例法上的检索增强生成

arXiv cs.CL

介绍了CanLegalRAGBench,这是一个基于真实查询和专家标注答案来评估加拿大判例法上检索增强生成的基准。评估显示对设计选择敏感、开源嵌入模型具有竞争力,以及生成答案中持续存在的幻觉问题。