尼泊尔法律专长通过生成式和抽取式预训练变压器(NepLEGiT)

arXiv cs.CL 论文

摘要

本文介绍了NepLEGiT,一种专门在尼泊尔法律文本上从头预训练的小型语言模型,旨在提升尼泊尔法律知识的可及性和服务交付。

arXiv:2609.16010v1 公告类型:新 摘要:法律语言的复杂性和法律信息有限的可及性对尼泊尔的司法交付构成重大挑战。传统法律服务由于语言障碍、信息碎片化以及法律专业知识严重短缺,尤其在农村地区,对许多公民来说仍然不可及。我们介绍了NepLEGiT(尼泊尔法律专长通过生成式和抽取式预训练变压器),这是一种专门设计的小型语言模型(SLM),旨在普及法律知识并提升尼泊尔的法律服务交付。我们在一个经过整理的约400万词元的尼泊尔法律文本语料库上从头预训练了一个基于解码器的GPT-2 SLM,涵盖宪法、民法和刑法以及行政法规。该模型包含约3000万参数,采用6层、6头、384维的变压器架构,使用预热余弦衰减调度、梯度累积和混合精度算术进行训练。在留出的验证集上,NepLEGiT的交叉熵损失为0.5684,困惑度为1.8,下一个词元预测准确率为82.9%。我们进一步评估了mBERT和MuRIL在相同语料库上的持续掩码语言模型预训练;mBERT的困惑度为2.35(评估损失0.8565),优于MuRIL(困惑度6.07,评估损失1.8026),提供了一个强大的编码器基线,与NepLEGiT的生成导向互补。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:39

# 通过生成式与抽取式预训练Transformer实现的尼泊尔法律专业知识(NepLEGiT)
来源:https://arxiv.org/html/2609.16010
兰吉特·劳特 加德满都大学人工智能系 尼泊尔杜利基尔 [email protected] &蒂什亚·达卡尔 加德满都大学人工智能系 尼泊尔杜利基尔 [email protected] &安里安·沙克亚 加德满都大学人工智能系 尼泊尔杜利基尔 [email protected] &巴布克·塔帕 加德满都大学人工智能系 尼泊尔杜利基尔 [email protected] &普拉斯迪达·科伊拉拉 加德满都大学人工智能系 尼泊尔杜利基尔 [email protected] &巴尔·克里希纳·巴尔 加德满都大学计算机科学与工程系 尼泊尔杜利基尔 [email protected]

###### 摘要

法律语言的复杂性和法律信息的有限可及性,对尼泊尔的司法公正构成了重大挑战。由于语言障碍、信息碎片化以及法律专业人才(尤其是在农村地区)的严重短缺,传统的法律服务对许多公民而言仍难以获取。我们提出了NepLEGiT(通过生成式与抽取式预训练Transformer实现的尼泊尔法律专业知识),这是一个专门的小型语言模型(SLM),旨在实现尼泊尔法律知识的民主化并提升法律服务交付水平。我们在一个经过整理的、包含约400万尼泊尔法律文本词元的语料库上,从头开始预训练了一个基于解码器的GPT-2 SLM,内容涵盖宪法、民法刑法典及行政法规。该模型包含约3000万参数,采用6层、6头、384维的Transformer架构,通过热启动余弦衰减调度、梯度累积和混合精度算术进行训练。在预留的验证集划分上,NepLEGiT的交叉熵损失为0.5684,困惑度为1.8,下一个词元预测准确率达到82.9%。我们进一步在相同的语料库上对mBERT和MuRIL进行了持续的掩码语言模型预训练评估;mBERT达到了2.35的困惑度(评估损失0.8565),优于MuRIL(困惑度6.07,评估损失1.8026),为NepLEGiT的生成导向提供了强大的编码器基线补充。

## 1 引言

法律知识的数字化催生了针对文档分析、问答和合规辅助量身定制的法律AI系统浪潮。然而,这些系统绝大多数针对英语普通法系,使得全球南方的法律体系在很大程度上未被触及。尼泊尔正是这一差距的例证:其法律框架融合了大陆法系、普通法系以及本土习惯法元素,主要以正式的、充满梵语衍生术语的尼泊尔语书写,这使其超出了通用多语言模型的有效覆盖范围。

尼泊尔司法系统在数字化程度低、农村地区合格法律专业人员严重短缺的条件下,处理着不断增长的案件量。负担不起律师的公民常常在没有帮助的情况下应对法律体系,加剧了现有的不平等。与此同时,该国的《数字尼泊尔框架》明确了电子政务和数字赋能公民的任务,而人工智能驱动的法律工具有助于实现这一任务。

尼泊尔法律可及性面临的挑战包括:(i)语言障碍:法律文件使用正式尼泊尔语及梵语衍生术语,阻碍普通公民理解;(ii)法律专业知识有限:法律信息分散在政府公报、法院判决和命令中,偏远地区合格专业人员严重匮乏;(iii)技术鸿沟:现有法律AI针对西方(普通/大陆法系)体系和英语,忽视了尼泊尔混合的法学体系;(iv)合规复杂性:快速变化的法规导致企业及公民无意违规。我们通过一个来自尼泊尔法律委员会的1000万词元数据集(其中4000万词元为干净训练集划分)、一个在整理的尼泊尔法律语料库上从头预训练的基于解码器的GPT-2语言模型,以及对mBERT和MuRIL进行持续预训练的掩码语言模型来应对这一需求。

## 2 相关工作

在法律语料库上进行领域特定预训练,在法律NLP任务上持续优于通用模型。LegalBERTZheng等人(2021 (https://arxiv.org/html/2609.16010#bib.bib15))通过对合同、法院意见书和法规文本继续BERT预训练来证明了这一点,在文档分类和命名实体识别方面取得了改进。LexGLUEChalkidis等人(2022 (https://arxiv.org/html/2609.16010#bib.bib2))针对英语法律NLP在分类、NER、QA和蕴涵任务上建立了统一评估,确立了领域内预训练是提升法律模型性能最稳健的单一干预措施。Harvey AI和Legal Robot将此扩展到GPT-4驱动的生成场景,但两者仍局限于普通法系、英语环境。

mBERT和XLM-RConneau等人(2020 (https://arxiv.org/html/2609.16010#bib.bib3))提供了广泛的多语言覆盖,但在法律等高度专业化领域表现不佳,因为这些领域的词汇和句法约定与通用训练数据存在显著差异。MuRILKhanuja等人(2021 (https://arxiv.org/html/2609.16010#bib.bib6))证明了特定语言的微调对包括尼泊尔语在内的印度语系语言大有裨益,这支持了我们选择在仅尼泊尔语语料库上进行预训练。在我们的实验中,在尼泊尔法律语料库上对mBERT进行持续的掩码语言模型预训练,其困惑度为2.35,优于MuRIL(困惑度6.07)——这一重要的实证发现表明,当目标语言是尼泊尔语时,广泛的多语言覆盖可能比针对印度语系的预训练更易于进行法律领域适应。然而,此前尚无工作在预训练阶段解决尼泊尔法律NLP问题。

JEC-QAZhong等人(2020 (https://arxiv.org/html/2609.16010#bib.bib16))为中文法律问答提供了一个里程碑式的数据集,并表明具有独特管辖区、独特引用惯例和非拉丁文字的非西方法律体系需要定制的解决方案。COLIEERabelo等人(2019 (https://arxiv.org/html/2609.16010#bib.bib10))推进了普通法系的案例检索,但未能推广到英语以外。NepLEGiT的定位类似于JEC-QA,但针对尼泊尔的法律和语言环境。

Eldan和Li(2023 (https://arxiv.org/html/2609.16010#bib.bib5))表明,在精心整理的领域特定数据上训练的小模型,在特定任务上可以匹配或超越大得多的通用模型。这促使我们选择预训练一个约3000万参数的模型,而不是微调一个多十亿参数的大语言模型(LLM):在发展中国家环境下,参数效率、快速推理和资源约束下的可部署性对于法律AI至关重要。

TransformerVaswani等人(2017 (https://arxiv.org/html/2609.16010#bib.bib14))引入了自注意力作为所有当代语言模型的基础。BERTDevlin等人(2019 (https://arxiv.org/html/2609.16010#bib.bib4))和RoBERTaLiu等人(2019 (https://arxiv.org/html/2609.16010#bib.bib8))普及了双向编码器预训练;GPT及其后续版本Radford等人(2018 (https://arxiv.org/html/2609.16010#bib.bib11), 2019 (https://arxiv.org/html/2609.16010#bib.bib12));Brown等人(2020 (https://arxiv.org/html/2609.16010#bib.bib1))确立了自回归解码器预训练作为文本生成的主导范式。BARTLewis等人(2020 (https://arxiv.org/html/2609.16010#bib.bib7))和T5Raffel等人(2020 (https://arxiv.org/html/2609.16010#bib.bib13))将两者结合到适用于序列到序列任务的编码器-解码器架构中。我们的架构评估(第3.2节 (https://arxiv.org/html/2609.16010#S3.SS2))引导我们为NepLEGiT的生成导向选择了GPT-2。

## 3 方法

### 3.1 数据集

我们从尼泊尔法律委员会获取了尼泊尔法律语料库:宪法、民法刑法典及所有主要法规。

表1:尼泊尔法律语料库统计
### 3.2 模型

双向编码擅长理解任务:分类、NER、抽取式问答,但因果解码器的缺失使其不适合开放式的法律文本生成,而这正是NepLEGiT的主要用例。我们选择mBERT和MuRIL作为NepLEGiT的基线。序列到序列架构在理解和生成方面具有通用性,非常适合摘要和生成式问答。其双层设计将计算成本翻倍,并且需要大得多的数据集才能有效收敛。自回归解码器能产生连贯、上下文一致的长序列输出。因果语言建模目标易于优化,具有可预测的扩展性,并直接服务于NepLEGiT的主要用例:法律文件起草、解释生成和对话式法律指导。我们为NepLEGiT选择了基于解码器的GPT-2。我们评估了三个Transformer系列以满足尼泊尔法律文本生成的要求。

参见标题图1:系统架构。我们采用GPT-2 BPE分词器(Tiktoken库,词汇表大小50,257),因其对NepLEGiT的GPT-2架构中Unicode字符的鲁棒性。经过NFC规范化后,它能较好地处理尼泊尔语子词分割;平均法律文档长度约为2500个词元。预处理后的语料库被序列化为二进制NumPy memmap格式,无需将完整数据集加载到RAM即可实现高效的随机访问I/O。对于mBERT和MuRIL,我们使用了它们在Hugging Face上托管的专用分词器配置和词汇表,通过标准的AutoTokenizer类加载。

参见标题图2:GPT-2模型架构。NepLEGiT实现了一个标准的因果Transformer解码器,遵循Vaswani等人(2017 (https://arxiv.org/html/2609.16010#bib.bib14))的架构并包含Radford等人(2019 (https://arxiv.org/html/2609.16010#bib.bib12))的修改。表2 (https://arxiv.org/html/2609.16010#S3.T2)总结了配置。

表2:NepLEGiT GPT-2模型配置。层归一化应用于注意力和MLP子层*之前*(而非之后),以稳定深层网络中的梯度流Brown等人(2020 (https://arxiv.org/html/2609.16010#bib.bib1))。前馈子层使用GELU激活,隐藏维度扩展4倍(4×384=1,536)。输出投影矩阵与输入词元嵌入绑定,减少了参数并强制了输入和输出空间之间的一致性表示。缩放点积自注意力被掩蔽以防止关注未来位置。在硬件支持的情况下启用Flash注意力。在输入层与词元嵌入求和。线性层使用N(0,0.02);残差投影层遵循Radford等人(2019 (https://arxiv.org/html/2609.16010#bib.bib12))使用N(0,0.02/√(2·n_layer))。

### 3.3 训练

表3:训练超参数。我们使用AdamW优化器,采用解耦权重衰减Loshchilov和Hutter(2018 (https://arxiv.org/html/2609.16010#bib.bib9))。较高的β2=0.95(相比常规的0.999)产生更平滑的二阶矩估计,有利于稀疏、领域特定的词更新。我们通过PyTorch的SequentialLR实现两阶段调度。

阶段1 - 线性热启动(步数0–1,000)
ηt = ηmax·(t / t_warm)
逐渐上升防止了来自随机初始化的大幅梯度更新破坏早期训练的稳定性。

阶段2 - 余弦退火衰减(步数1,000–100,000)
ηt = ηmin + (1/2)(ηmax - ηmin)(1 + cos(π·(t - t_warm)/(T - t_warm)))
余弦包络提供了平滑、单调的衰减,避免了速率的突变,同时以ηmin=5×10⁻⁵继续进行缓慢的优化。为了在仅支持32微批次的硬件上模拟1,024的有效批量大小,我们在每次优化器更新前累积32步的梯度。使用bfloat16(float16后备)的自动混合精度(AMP)将内存消耗减半并提高了吞吐量。GradScaler防止了float16梯度计算中的下溢。内存映射二进制文件(NumPy uint16 memmap)允许在不将整个语料库加载到RAM的情况下进行全库的随机访问采样。每步采样一个随机的上下文窗口批次,并通过移动一个位置构建下一个词元预测目标。每500次训练迭代,模型进入评估模式,并在500个随机验证批次上平均交叉熵损失。保留验证损失最低的检查点用于最终评估。训练在云实例(Tesla T4, P100)上通过Kaggle、Colab和Lightning AI进行。完整的100,000次迭代运行大约需要12小时的挂钟时间,峰值VRAM占用约12GB。mBERT和MuRIL的持续预训练实验在Tesla P100-PCIE-16 GB(Kaggle)上进行,每个模型3个epoch,约27K个训练样本,各需约2-3小时。

## 4 结果

训练呈现三个不同阶段。从约7.5快速下降到约2.0,这是由热启动初始化和0–20,000次迭代期间的陡峭梯度下降驱动的。随着余弦衰减从20,000–50,000次迭代期间精炼学习到的表示,持续稳步改进。从50,000–100,000次迭代,损失收敛并稳定,最终训练损失约为0.57,最终验证损失为0.5684。

参见标题图3:训练(绿色)和验证(红色)交叉熵损失随评估步数(一步==500次迭代)的变化。三个阶段:快速下降(0–20k迭代),稳步改进(20–50k),以及接近0.57的收敛(50–100k)。两条曲线的紧密耦合表明泛化能力强,过拟合可忽略不计。困惑度PPL=exp(L)为每个词元的不确定性提供了一个可解释的度量(图4 (https://arxiv.org/html/2609.16010#S4.F4))。从初始化时的约1,800开始,它在最初10,000次迭代内急剧下降,随后稳定在1.8,这意味着模型平均能将正确的下一个词元置于其前2个预测中。

参见标题图4:训练过程中的验证困惑度(越低越好)。从约1,800降至1.8,反映了对尼泊尔法律语言模式的深度适应。词元预测准确率遵循典型的学习曲线,收敛于82.9%,考虑到尼泊尔法律文本的专业词汇和复杂语法,这是一个强劲的结果(图5 (https://arxiv.org/html/2609.16010#S4.F5))。

参见标题图5:验证集上的Top-1下一个词元预测准确率。进程:约38%(初始)→约50%(2k迭代)→约75%(10k迭代)→82.9%(100k迭代)。参见标题图6:两阶段学习率调度(对数刻度):步骤0–1,000为线性热启动,步骤1,000–100,000为余弦退火衰减。表4 (https://arxiv.org/html/2609.16010#S4.T4)总结了三

相似文章

NepKANUN:基于RAG的尼泊尔法律助手

arXiv cs.CL

NepKANUN 是一款基于RAG的面向尼泊尔的法律助手,利用RAG和微调后的LLaMA 3.2 3B模型为法律查询提供准确答案,并经专家评审验证。

推理先行翻译:利用结构化推理增强法律机器翻译

arXiv cs.CL

本文比较了多种增强法律领域神经机器翻译的方法,包括监督微调和基于可验证奖励的强化学习。重点针对瑞士法律体系翻译,表明小型语言模型可显著增强,其中强化学习超越监督微调的性能。