LegalPincite:多层级法律信息检索数据集
摘要
介绍LegalPincite,一个基于欧盟法院(CJEU)判决构建的大规模法律信息检索数据集,包含掩码查询、完整语料库和段落级引文标注,以支持多层级检索评估。
查看缓存全文
缓存时间: 2026/08/05 17:46
论文页面 - LegalPincite:多层级法律信息检索数据集
来源:https://huggingface.co/papers/2608.03756
发布于 8 月 4 日
· 提交者 https://huggingface.co/theresiavr
TVR (https://huggingface.co/theresiavr) 于 8 月 5 日
摘要
法律信息检索(IR)中的一项常见任务是从判例法集合中查找相关法律来源。虽然法律实践通常需要对特定案件段落进行精确定位引用(pincites),但大多数现有的公开法律 IR 数据集缺乏段落级引用标注。然而,具有此类信息的公开数据集在查询文本中存在数据泄漏,并且从语料库中排除了既不引用其他段落也不被其他段落引用的段落,从而造成不真实且过度简化的检索环境,可能导致性能虚高。为解决这些局限性,我们构建了一个大规模法律 IR 数据集,该数据集基于欧洲联盟法院(CJEU)判决。该数据集包含:(i)掩码后的案例/段落查询,并移除了引用信息;(ii)包含所有段落的语料库;(iii)案例级和段落级真值引用,并经过部分人类专家验证。我们的数据集支持在多个查询-文档层级(案例到案例、段落到案例和段落到段落检索)上对法律 IR 方法进行开发和严格评估。数据集链接:https://huggingface.co/datasets/theresiavr/legalpincite
查看 arXiv 页面 查看 PDF 项目页面 GitHub 添加到收藏
引用本文的模型 0
没有模型关联本文
要在模型 README.md 中引用 arxiv.org/abs/2608.03756,即可从本页面链接到该模型。
引用本文的数据集 1
theresiavr/legalpincite 查看器• 更新于 35 分钟前 • 1.47M • 320 • 1 (https://huggingface.co/datasets/theresiavr/legalpincite)
引用本文的 Spaces 0
没有 Space 关联本文
要在 Space README.md 中引用 arxiv.org/abs/2608.03756,即可从本页面链接到该 Space。
收录本文的合集 1
相似文章
PIIBench:个人可识别信息检测的统一多源基准语料库
PIIBench 是一个用于检测多种数据源中个人可识别信息 (PII) 的统一基准语料库。该资源解决了 PII 检测任务中标准化评估的需求,这对隐私保护的自然语言处理应用至关重要。
NOWJ@COLIEE 2026: 面向法律检索与推理的自适应流水线
本文介绍了在COLIEE 2026竞赛中用于法律检索、蕴含和判决预测任务的自适应流水线,采用了多阶段检索、重排序和基于LLM的推理。
从一亿乌克兰法院判决自动构建法律引用图:大规模提取、拓扑分析与本体驱动聚类
本文从1.007亿份乌克兰法院判决中构建了首个大规模引用图,提取了超过5亿条引用链接。研究表明,引用结构能够自动恢复法律领域边界,并以接近完美的准确度预测立法重要性。此外,本文将处理流程和数据作为开放资源发布。
从判决到争议点:带有引用幻觉控制的法律推理的结构化提取
本文介绍了一条自动化流水线,该流水线使用 DeepSeek V3 模型将意大利税务法院判决分解为各个法律争议点,并按照 IRAC 框架以 XML 格式结构化表示,同时包含一个使用 Linkoln 解析器验证引用的幻觉检测过滤器,该过滤器已由专家注释者验证。
CanLegalRAGBench: 评估加拿大判例法上的检索增强生成
介绍了CanLegalRAGBench,这是一个基于真实查询和专家标注答案来评估加拿大判例法上检索增强生成的基准。评估显示对设计选择敏感、开源嵌入模型具有竞争力,以及生成答案中持续存在的幻觉问题。