BLAD:孟加拉国法律法案的历史语境化多语种数据集(1799-2025)
摘要
本文介绍了BLAD,一个精心整理的多语种数据集,包含1484部孟加拉国法律法案(时间跨度从1799年到2025年),并附有结构化元数据,支持时间跨度和跨语言的法学NLP研究。
查看缓存全文
缓存时间: 2026/07/21 06:44
# BLAD:一个具有历史背景的孟加拉国法律法案多语言数据集(1799–2025) 来源:https://arxiv.org/html/2607.17111 Adib Sakhawat 系统与软件实验室 \(SSL\) 计算机科学与工程系 伊斯兰理工大学,孟加拉国达卡 sakhadib@gmail\.com ###### 摘要 我们提出了孟加拉国法律法案数据集(BLAD),这是一个精心整理的集合,包含 1799 年至 2025 年间颁布的 1,484 部立法法案。每部法案均提供全文、结构化的章节与脚注、废止状态,以及将其与颁布时的执政政权、国家元首和现行法律框架相关联的元数据。语料库涵盖英语、孟加拉语及混合语言文档,支持对成文法进行时间维度和多语言分析。BLAD 填补了南亚低资源民法管辖区法律自然语言处理(NLP)资源长期存在的空白。我们描述了数据的获取与丰富流程,报告了跨越两个多世纪立法的描述性统计,并概述了该语料库所能推动的研究方向。该数据集在 CC BY-SA 4.0 许可下公开提供,网址为:https://www.kaggle.com/datasets/sakhadib/bangladesh-legal-acts-dataset。 ## 1 引言 近年来,法律自然语言处理(NLP)取得了快速发展,这得益于法律语料库的数字化以及基于 Transformer 架构的进步。然而,这种增长在不同管辖区之间分布不均:大型、精心整理的法律数据集绝大多数涉及英语普通法体系,而民法框架和非英语法律传统则相对服务不足(Niklaus 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib1))。这种不平衡制约了包容性法律人工智能系统的发展,并限制了跨管辖区的法律研究。 孟加拉国是这一差距的典型例证。其约 1.8 亿人口受一个混合法律体系管辖,该体系历经两百多年的殖民、分治后和独立后统治而积累形成。尽管近期有努力为南亚邻国管辖区构建法律数据集(K 和 Mishra,2025 (https://arxiv.org/html/2607.17111#bib.bib4)),但由于数字化不统一、文档语言混杂以及缺乏结构化的机器可读格式,孟加拉国的成文法语料库在计算研究人员眼中仍然基本无法获取。 现有的孟加拉国法律 NLP 资源存在三个局限。首先,它们范围狭窄:最大的纯英文语料库包含 595 部法案和 18,023 个章节(Was 等人,2024 (https://arxiv.org/html/2607.17111#bib.bib13)),不到完整成文法框架的 40%。其次,它们缺乏历史背景,未能将法案与其颁布时的政府时期系统联系起来,这排除了时间维度的法律分析。第三,它们只关注英文内容,忽略了孟加拉国法律的双语特征——孟加拉语和英语以反映殖民转型和当代语言政策的方式共存。 参照图注图 1:语料库完整时间跨度内每个十年的法案数量。这些局限带来了实际后果。孟加拉国司法机构面临数百万件待决案件的积压,这产生了对自动化法律信息系统的具体需求。缺乏全面、结构化的成文法语料库阻碍了检索增强生成系统、法律摘要工具及相关应用的开发,而这些应用本可拓宽法律信息的获取渠道。 本文介绍了**孟加拉国法律法案数据集(BLAD)**,该语料库通过三项贡献来弥补上述空白: **规模与覆盖范围。** BLAD 包含 1,484 部立法法案,跨越 226 年(1799–2025 年),涵盖 35,633 个章节和 14,523 条脚注,并附有章节级别的语言识别。这比先前最大的可用数据集增加了约 2.5 倍,并提供了对成文法框架的实质性完整覆盖。 **历史背景。** 每部法案都附有元数据,描述其颁布时的执政政权,涵盖从公司统治(1799–1858 年)到当代的十四个不同政府体系和四十二位国家元首。这一层能够支持对法律时间演变和特定政权立法行为的研究。 **多语言与结构标注。** 每部法案都被分割成章节和脚注,并标注了检测到的语言标签(英语、孟加拉语或混合语言)以及词元计数,为多语言和文档结构任务提供结构化监督。 ## 2 相关工作 过去十年,法律 NLP 取得了显著发展,这得益于法律体系的数字化和基于 Transformer 架构的进步(Niklaus 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib1))。近期调查记录了从早期基于规则的方法向为法律文本定制的大语言模型的转变(Ariai 和 Demartini,2024 (https://arxiv.org/html/2607.17111#bib.bib2))。法律文本的独特属性——长篇文档、复杂句法、领域特定术语以及对准确性和可靠性的严格要求——催生了与通用领域 NLP 不同的专门方法(Ariai 和 Demartini,2024 (https://arxiv.org/html/2607.17111#bib.bib2))。 印度通过全面的基准测试引领了区域努力。IL-TUR(印度法律文本理解与推理)(Joshi 等人,2024 (https://arxiv.org/html/2607.17111#bib.bib3))定义了涵盖英语和九种印度语言的八项任务。IndicLegalQA(K 和 Mishra,2025 (https://arxiv.org/html/2607.17111#bib.bib4))贡献了 10,000 个问答对,这些问答对来自 1,256 份印度最高法院判决,满足了法律信息检索的需求——在此背景下,超过 4300 万件的案件积压促使自动化处理成为必要(K 和 Mishra,2025 (https://arxiv.org/html/2607.17111#bib.bib4))。 相比之下,南亚地区的法律 NLP 格局在孟加拉国方面仍然在很大程度上不完整。早期针对孟加拉国的具体工作仅限于初步努力,例如法律文本可视化系统(Mandal 等人,2017 (https://arxiv.org/html/2607.17111#bib.bib15))和狭窄的领域特定应用,而非对立法框架的全面覆盖。 东亚管辖区,特别是中国和韩国,在大规模法律数据集构建和系统化基准测试方面已确立领先地位(Xiao 等人,2018 (https://arxiv.org/html/2607.17111#bib.bib5))。2018 年推出的中国人工智能与法律挑战赛(CAIL)数据集包含来自中国最高人民法院的 260 万件刑事案件。随后的中国基准测试,如 LexEval(Li 等人,2024 (https://arxiv.org/html/2607.17111#bib.bib6)),涵盖 23 项任务和 14,150 个问题,涉及多样化的法律推理能力。韩国贡献了 LBOX OPEN(Hwang 等人,2022 (https://arxiv.org/html/2607.17111#bib.bib7)),包含 147,000 个法律判例,涉及判决预测、案件分类和摘要等任务;韩国法律语言理解基准测试(KBL)(Kim 等人,2024 (https://arxiv.org/html/2607.17111#bib.bib8))则通过专为大语言模型设计的实用性评估扩展了这一方向。 标准化的评估框架一直是该领域可重复性的核心。LexGLUE(Chalkidis 等人,2022 (https://arxiv.org/html/2607.17111#bib.bib10))建立了涵盖七项法律任务的英语评估标准。在此基础上,LEXTREME(Niklaus 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib1))针对多语言评估,整合了 11 个数据集,涵盖 24 种语言和 17 个管辖区。LegalBench(Guha 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib16))通过由法律专业人员和 NLP 研究人员共同开发的 162 项任务,推进了协作式基准测试构建。 近期数据集构建强调了系统化的收集、标注和质量保证,反映出从临时性网络爬取向结构化语料库整理的成熟转变。MultiLegalSBD(Brugger 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib11))说明了法律预处理中多语种句子边界检测的困难,而专门资源则证明了专家标注对于监管应用的价值(Joshi 等人,2024 (https://arxiv.org/html/2607.17111#bib.bib3))。 尽管取得了这些进展,但仍存在若干差距。首先,大多数大规模法律数据集涉及普通法管辖区,特别是那些以英语为主要法律语言的地区(Niklaus 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib1))。其次,现有的多语言数据集往往缺乏研究法律演变所需的历史深度和系统化背景,而是集中于当代文档(Niklaus 等人,2024 (https://arxiv.org/html/2607.17111#bib.bib12))。第三,判例法和司法判决数据集的盛行使得法规、条例和立法文件相对代表性不足,尽管它们具有基础性作用(Niklaus 等人,2023 (https://arxiv.org/html/2607.17111#bib.bib1))。 这些差距推动了当前工作。将历史政府背景与成文法文本相结合,弥补了时间分析能力的不足,而构建全面的民法资源则解决了此类系统在当前多语言基准测试中代表性不足的问题。 ## 3 数据集描述 BLAD 是一个全面的孟加拉国立法法案集合,时间跨度从 1799 年到 2025 年。其构建旨在解决孟加拉国法律数据分散、处理粗浅的问题,这些问题阻碍了大规模法律 NLP 的发展。该语料库提供了已知成文法框架的结构化、机器可读表示,并附有关于每部法案颁布时的政府和法律体系的背景信息。 ### 3.1 概述 语料库包含 1,484 部立法法案、35,633 个章节和 14,523 条脚注。法案以英语、孟加拉语和混合语言形式出现,使语料库适用于多语言法律 NLP。每部法案存储在一个标准化的 JSON 记录中,包含其标题、年份、语言、词元计数以及与历史政府和法律体系背景的链接。 ### 3.2 数据来源与处理 语料库编译自孟加拉国法律、司法和议会事务部维护的官方法律门户。构建流程(图 2 (https://arxiv.org/html/2607.17111#S3.F2))分为六个阶段,每个阶段针对特定的噪音来源或特定的丰富目标。 参照图注图 2:用于构建 BLAD 的六阶段获取与丰富流程。 #### 阶段 1:获取。 一个索引爬虫枚举了法案列表,并为每部法案记录了其规范源 URL、法案编号、标题和颁布年份。请求通过固定延迟进行限速,以避免对门户造成过大负载,失败请求被记录以备重试,从而使个别错误不会中断爬取。 #### 阶段 2:结构解析。 每部法案的页面被解析为其组成部分的章节和脚注。由于不同时代法案的门户标记不一致,解析依赖于界定章节正文及其相关脚注的重复出现的结构线索,而不是单一固定模板。章节和脚注作为有序列表保留,以便下游可恢复文档结构。 #### 阶段 3:规范化与清洗。 提取的文本被去除残留标记和样板内容,不一致的字段被标准化为通用模式。年份和标识符中出现的孟加拉语数字被映射为对应的西方阿拉伯数字,使时间字段可排序,格式错误或重复的片段被修复或删除。 #### 阶段 4:语言识别。 每个章节都被分配一个语言标签。由于孟加拉语字母和拉丁字母占据不重叠的 Unicode 范围,一个脚本比例启发式方法区分了以孟加拉语为主的文本和以英语为主的文本,并且当两种脚本的出现比例均超过阈值时,将章节标记为“*mixed*”(混合)。对每部法案使用应用于清洗后文本的正则表达式分词器计算词元计数。 #### 阶段 5:历史与法律体系背景化。 每部法案通过将其年份与一个精心整理的政府时期查找表进行匹配,从而链接到其颁布时的政治时期——例如公司统治、英国殖民统治、巴基斯坦时期以及独立后的民主和军事政权——以及相应的政府和政府首脑。一个并行的映射记录了该时期更广泛的法律体系背景,包括现行法律框架、法院结构、警务安排和土地关系制度。这个背景层源自二手历史资料,而非来自法案本身,因此被视为一种解释性注释而非原始数据。 #### 阶段 6:验证与恢复。 合并后的记录经过结构一致性验证,并且一个自动恢复步骤为元数据最初缺失或损坏的法案重新推导背景。每条记录都保留了处理统计信息、源 URL 和时间戳,以支持审计和可重复性。 ### 3.3 数据集特征 每部法案包含以下字段: - •**法案标题**:立法法案的标题。 - •**法案年份**:颁布年份。 - •**语言**:法案使用的语言(英语、孟加拉语或混合语言)。 - •**词元计数**:法案中的词元数量,通过正则表达式分词计算。 - •**章节**:包含内容的有序章节列表。 - •**脚注**:包含修正历史(如有)的有序脚注列表。 - •**废止状态**:法案当前是否已被废止。 - •**政府背景**:颁布时的执政政府,包括其名称、政府首脑、统治时期和执政方式。 - •**法律体系背景**:颁布时生效的法律框架、时期和警务安排。 - •**处理信息**:分词方法、源 URL 和元数据恢复状态。 该语料库旨在作为孟加拉国法律史、多语言法律 NLP 以及全球南方法律技术应用的基础研究资源。 ## 4 数据集统计与分析 BLAD 支持对两个多世纪立法活动的描述性分析。本节报告关于法案数量、随时间变化的立法趋势、跨政府体系和领导人的活动分布,以及单个法案结构复杂性的统计数据。此处报告的趋势是描述性的;我们不提出任何因果主张,读者应牢记不同时期的档案覆盖可能不均衡。 ### 4.1 语料库概览 语料库包含以下内容: - •**法案总数**:1,484 部 - •**章节总数**:35,633 个 - •**脚注总数**:14,523 条 - •**语言**:英语、孟加拉语、混合语言 - •**时间跨度**:1799–2025 年 - •**政府体系**:14 个 - •**国家元首**:42 位 - •**词元计数**:超过 250 万个词元 这些数字涵盖了跨越几个不同政治时代的大约 226 年的法律史。 ### 4.2 每个十年的立法活动 立法产出随着时间的推移显著增加,在重大政治转型时期出现显著变化(图 3
相似文章
表面礼貌,实际错误:用于修复多语言孟加拉语生成中敬语失误的精选数据集
本文介绍BLADE,一个文化对齐的指令微调数据集,包含4,196个交互对,用于修复多语言孟加拉语生成中的敬语失误和语用差距。在此数据集上微调DeepSeek-8B和LLaMA-3.2-3B等模型,在结构保真度和敬语对齐方面取得了显著改进。
KhatianDoc:一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败
本文介绍了KhatianDoc,一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败,揭示了当前模型在符号识别和文档问答等任务上的失败。
IMLJD:用于印度婚姻诉讼分析的计算数据集
本文介绍了IMLJD,一个专门用于分析印度婚姻诉讼的计算数据集,支持自然语言处理和法律分析研究。
BIASEDTALES-ML:用于分析大语言模型生成故事中叙事属性分布的多语言数据集
# BIASEDTALES-ML:用于分析大语言模型生成故事中叙事属性分布的多语言数据集 来源:[https://arxiv.org/html/2604.17008](https://arxiv.org/html/2604.17008) Yuxuan Ouyang1,Yingfeng Luo1,Tong Xiao1,2,Jingbo Zhu1,2 1中国沈阳东北大学计算机科学与工程学院 2中国沈阳 NiuTrans Research [email protected] {xiaotong,zhujingbo}@mail.neu.edu.cn ###### 摘要 大型语言模型(LLM)正日益被广泛用
CBRS:基于双语数据集与双层过滤的多平台社交流认知血液请求系统
孟加拉国工程技术大学的研究人员提出了CBRS,一个多平台框架,采用双层架构并利用包含1.1万条孟加拉语和英语双语解析血液请求消息的新数据集,对社交媒体中的血液捐赠请求进行过滤和解析。其LoRA微调的Llama-3.2-3B模型实现了99%的过滤准确率和92%的零样本解析准确率,在减少35倍令牌使用量的同时,优于GPT-4o-mini等其他大语言模型。