UA-Legal-Bench:评估大语言模型在乌克兰法律推理能力的基准
摘要
介绍了UA-Legal-Bench,这是一个基于统一国家法院判决登记册构建的、用于评估大语言模型在乌克兰法律推理能力的五项任务基准。评估了11个LLM,揭示了任务相关的少样本效应以及在不平衡法律任务中准确率的误导性。
查看缓存全文
缓存时间: 2026/05/29 09:15
# UA-Legal-Bench:用于评估大型语言模型在乌克兰法律推理中的基准测试 来源:https://arxiv.org/html/2605.29170 ###### 摘要 法律自然语言处理基准测试 overwhelmingly 以英语为中心,导致形态丰富、非拉丁文字语言的失效模式未被发现。我们提出 **UA-Legal-Bench**,这是一个包含五项任务的基准测试,用于评估大型语言模型在乌克兰法律推理中的表现。该基准测试基于统一国家法院判决登记册(EDRSR)构建,这是世界上最大的开放司法语料库之一(含 9950 万份判决)。该基准包括:(1) 案件类型分类(4 类,n=2,000),(2) 判决形式分类(4 类,n=2,000),(3) 案件结果预测(6 类,n=800),(4) 法律规范提取(n=1,794),以及 (5) 原因类别预测(22 类,n=1,871)。我们通过 AWS Bedrock 对来自五个系列的 11 个 LLM(3B–675B)进行了零样本和 3-shot 提示评估,共调用 158K 次 API。我们的结果揭示了 sharply 任务依赖性的小样本效应:小样本提示使判决形式分类提升高达 +38.6 个百分点,但对结果预测的影响不一。我们表明,在类别不平衡的法律任务中,准确率具有误导性:COP 准确率最高(62%)的模型实际上是多数类预测器(宏平均 F1:23%),而真正最佳的模型宏平均 F1 也仅为 44%。系列内缩放分析显示,8B 模型在表层任务上可达到前沿性能,但不同模型系列之间的缩放阈值差异显著。我们发布所有数据、提示和模型预测结果。 数据:https://huggingface.co/datasets/overthelex/ua-legal-bench 关键词:法律自然语言处理、基准测试、乌克兰语、法院判决、多语言评估、小样本学习 ## 1 引言 大型语言模型在法律实践中的快速应用推动了评估其推理能力的基准测试的发展。LegalBench (Guha et al., 2023 (https://arxiv.org/html/2605.29170#bib.bib6))、LexGLUE (Chalkidis et al., 2022 (https://arxiv.org/html/2605.29170#bib.bib3)) 和 CUAD (Hendrycks et al., 2021 (https://arxiv.org/html/2605.29170#bib.bib7)) 建立了严格的评估标准——但都仅限于英语。多语言努力如 LEXTREME (Niklaus et al., 2023 (https://arxiv.org/html/2605.29170#bib.bib9)) 和 MultiLegalPile (Niklaus et al., 2024 (https://arxiv.org/html/2605.29170#bib.bib10)) 将覆盖范围扩展到欧盟语言,但排除了西里尔字母管辖区和西欧以外的大陆法系。 这一差距意义重大。乌克兰语使用西里尔字母、黏着形态和七种语法格,呈现出根本不同的分词表面。我们之前的工作 (Ovcharov, 2026b (https://arxiv.org/html/2605.29170#bib.bib12)) 表明,子词分词器将乌克兰法律文本的分词率平均比英语对应文本高出 1.6 倍,这直接增加了推理成本并降低了上下文学习能力。此外,乌克兰法律体系——一个以成文法而非普通法判例为基础的大陆法系——需要英语基准未捕获的独特推理模式。 乌克兰的统一国家法院判决登记册(EDRSR)提供了无与伦比的实证基础:自 2006 年以来发布了 9950 万份判决,是世界上最大的开放司法数据集之一。我们利用这一资源构建了 UA-Legal-Bench,这是一个涵盖五项任务的基准测试,这些任务逐步深入法律理解的不同层次: 1. 案件类型分类 (CTC) – 将判决分为四类管辖权类别; 2. 判决形式分类 (JFC) – 识别文档类型(判决、裁定、刑事判决、命令); 3. 案件结果预测 (COP) – 仅根据案件事实预测司法裁决; 4. 规范提取 (NE) – 从判决文本中提取法律规范引用; 5. 原因类别预测 (CCP) – 将法律主题分类为 22 个大类。 我们的贡献是: 1. 第一个针对西里尔字母、大陆法系管辖区的综合性法律推理基准,包含 2000 份跨越五项难度递增任务的判决。 2. 对 11 个 LLM(3B–675B,五个系列)在零样本和小样本条件下进行标准化评估,共调用 158K 次 API。 3. 发现 sharply 任务依赖性的小样本效应,包括小样本作为规模均衡器(12B 模型提升 +38.6 个百分点,接近 120B 性能)。 4. 系列内缩放分析表明,乌克兰法律推理的参数阈值在不同模型系列之间差异巨大。 5. 所有数据、提示、模型预测和评估代码均公开发布。 ## 2 相关工作 #### 英语法律基准测试。 LegalBench (Guha et al., 2023 (https://arxiv.org/html/2605.29170#bib.bib6)) 定义了涵盖六类法律推理的 162 项任务,在前沿 LLM 上进行评估。LexGLUE (Chalkidis et al., 2022 (https://arxiv.org/html/2605.29170#bib.bib3)) 提供了涵盖七个数据集的法律语言理解多任务基准。CUAD (Hendrycks et al., 2021 (https://arxiv.org/html/2605.29170#bib.bib7)) 专注于合同审查。最近,Katz 等人 (2024 (https://arxiv.org/html/2605.29170#bib.bib8)) 证明了 GPT-4 通过了统一律师资格考试,突出了基准测试必须跟踪的快速能力增长。这些基准测试推动了显著进展,但完全在英语和普通法系内进行评估。 #### 多语言法律自然语言处理。 LEXTREME (Niklaus et al., 2023 (https://arxiv.org/html/2605.29170#bib.bib9)) 聚合了欧盟法律领域内 24 种语言的 11 个数据集,而 SCALE (Rasiah et al., 2024 (https://arxiv.org/html/2605.29170#bib.bib13)) 增加了复杂度缩放的任务。MultiLegalPile (Niklaus et al., 2024 (https://arxiv.org/html/2605.29170#bib.bib10)) 提供了一个 689 GB 的多语言法律语料库,涵盖 24 种欧盟语言。Chalkidis 等人 (2020 (https://arxiv.org/html/2605.29170#bib.bib2)) 为法律文本提供了基础的预训练模型,Zheng 等人 (2021 (https://arxiv.org/html/2605.29170#bib.bib17)) 研究了法律自然语言处理中的跨语言迁移。尽管覆盖范围广泛,但这些努力排除了乌克兰语,并且没有解决西里尔字母法律文本的特殊挑战。 #### 小样本评估与指标选择。 Brown 等人 (2020 (https://arxiv.org/html/2605.29170#bib.bib1)) 将小样本提示确立为标准评估范式,但它在非英语、领域特定任务上的有效性仍研究不足。Zhao 等人 (2021 (https://arxiv.org/html/2605.29170#bib.bib16)) 表明小样本性能对示例选择和排序敏感,这促使我们使用固定、分层示例。关于类别不平衡分类中指标选择的问题已得到充分研究 (Grandini et al., 2020 (https://arxiv.org/html/2605.29170#bib.bib5));我们表明,这一问题在法律基准中尤为严重,因为多数类预测可能产生高准确率但低宏平均 F1。 #### 乌克兰自然语言处理。 目前没有针对乌克兰法律推理的基准测试。Syvokon 和 Romanyshyn (2023 (https://arxiv.org/html/2605.29170#bib.bib15)) 在 EACL 2023 上组织了首个乌克兰自然语言处理共享任务,涵盖了命名实体识别和词形还原,但不包括法律任务。与欧盟官方语言相比,通用乌克兰自然语言处理资源仍然有限:乌克兰语仅占 mC4 语料库的 0.5%,比俄语少 18 倍,比波兰语少 2.4 倍 (Ovcharov, 2026a (https://arxiv.org/html/2605.29170#bib.bib11))。这种数据稀缺与分词器效率低下 (Rust et al., 2021 (https://arxiv.org/html/2605.29170#bib.bib14)) 相结合,给乌克兰法律自然语言处理带来了“双重惩罚”。 #### 定位。 UA-Legal-Bench 填补了这一空白,成为第一个针对西里尔字母、大陆法系管辖区的法律基准测试 (表 1 (https://arxiv.org/html/2605.29170#S2.T1))。与通常评估单一任务类型的先前基准不同,UA-Legal-Bench 涵盖了五项难度递增的任务,并明确评估了小样本提示、模型规模和指标选择之间的交互。 表 1:与现有法律自然语言处理基准测试的比较。 ## 3 基准测试设计 ### 3.1 数据来源 所有任务均来源于统一国家法院判决登记册(EDRSR,Єдиний державний реєстр судових рішень),这是一个乌克兰官方政府登记册,包含 2006–2026 年期间所有司法层级和法院类型的 9950 万份法院判决。每条记录包括结构化元数据(法院、日期、案号、管辖权类型、判决形式、原因类别)和完整的判决文本。 我们从 2024 年的分区中抽取了 2000 份判决:每个管辖权(民事、刑事、商业、行政)500 份,按判决形式分层。仅包含文本长度在 2000 到 30000 字符之间的实质性判决(中位数长度:12060 字符)。对于每份判决,我们使用基于规则的解析器(已根据 EDRSR 的规范文档结构进行验证)提取:事实部分(用于 COP)、引用的法律规范(用于 NE)和裁决结果(用于 COP)。 ### 3.2 任务 #### 任务 1:案件类型分类 (CTC)。 给定一份法院判决,将其分为四类管辖权类别之一:*民事* (цивільне)、*刑事* (кримінальне)、*商业* (господарське) 或 *行政* (адміністративне)。标签来自 EDRSR 元数据。此任务评估基本的法律文档理解。 *指标:*准确率。*规模:*n=2,000。 #### 任务 2:判决形式分类 (JFC)。 分类文档类型:*rishennya*(判决)、*postanova*(裁定)、*vyrok*(刑事判决)或 *ukhvala*(命令)。与 CTC 不同,这需要理解文档的程序性质——裁定和判决可能来自同一法院,但履行不同的法律功能。 *指标:*准确率。*规模:*n=2,000。 #### 任务 3:案件结果预测 (COP)。 仅给出法院判决的事实部分(裁决被隐藏),预测六个类别中的结果:*granted*(支持)、*partial*(部分支持)、*denied*(驳回)、*closed*(结案)、*guilty*(有罪)、*left without consideration*(不予考虑)。此任务需要根据事实情况进行法律推理,并且仅限于事实部分和结果标签可可靠提取的判决。 *指标:*宏平均 F1(由于 61% 为多数类)。*规模:*n=800。 #### 任务 4:规范提取 (NE)。 给定一份法院判决,提取所有法律规范引用(例如,“ст. 625 ЦК України”、“ч. 2 ст. 16 ЦПК України”)。真值通过从判决文本中解析规范的引用模式构建,平均每份文档 7.5 个规范。 *指标:*集合级 F1。*规模:*n=1,794。 #### 任务 5:原因类别预测 (CCP)。 将案件的法律主题分类为 22 个大类(例如,*合同*、*盗窃*、*家庭*、*养老金/社会*、*财产*、*暴力*),这些类别源自 EDRSR 的 4106 类别分类法,通过基于关键词的聚合得到。 *指标:*准确率。*规模:*n=1,871。 ### 3.3 评估协议 所有任务在零样本和 3-shot 提示下进行评估。提示使用乌克兰语,并采用标准化指令模板。所有推理使用温度 0 以确保可重复性。小样本示例从固定池中抽取(不与测试数据重叠),使用确定性种子和分层抽样以覆盖标签多样性。对于不平衡的任务(COP:61% 多数类;CCP:31% 多数类),我们报告宏平均 F1 而非准确率,以防止多数类偏差。95% Wilson 置信区间为 CTC/JFC(n=2,000)±0.8 个百分点,COP(n=800)±3.4 个百分点,CCP(n=1,871)±2.3 个百分点。 ## 4 模型 我们评估了来自五个模型系列、通过 AWS Bedrock 访问的十一个 LLM,其中三个系列(Mistral、Meta、NVIDIA)有多个规模可供选择,以实现系列内缩放分析(表 2 (https://arxiv.org/html/2605.29170#S4.T2))。 表 2:评估的模型。前沿模型(顶部)及其较小的对应模型(底部)可实现系列内缩放分析。生殖力:乌克兰法律文本的每词 token 数 (Ovcharov, 2026b (https://arxiv.org/html/2605.29170#bib.bib12))。 七个前沿模型的参数总量从 32B 到 675B 不等,分词器生殖力范围从 2.43(Llama 4 Maverick)到 3.90(Qwen3 32B)——相差 1.6 倍,意味着相同的乌克兰法律文本在最低效的分词器上消耗的 token 多出 60%。四个较小模型(3B–12B)来自 Mistral、Meta 和 NVIDIA 系列,可直接衡量特定模型系列内乌克兰法律任务的性能如何缩放。 ## 5 结果 我们报告了在 11 个模型上进行的 158,419 次 API 调用的结果。表 3 (https://arxiv.org/html/2605.29170#S5.T3) 显示了所有五项任务的性能,前沿模型和较小模型分开列出。 表 3:UA-Legal-Bench 结果。CTC/JFC/CCP:准确率 (%)。COP:宏平均 F1 (%),这考虑了不平衡的标签分布(61% “granted”)。NE:集合级 F1。每项任务的最佳零样本结果以粗体显示。基线:多数类 = 始终预测最频繁类别;随机 = 均匀随机。 ### 5.1 任务难度梯度 图 1:前沿模型的任务难度梯度。条形图显示平均分数;须状图显示最小-最大范围。JFC 显示出最大的小样本增益;COP 显示出最宽的模型分布。 五项任务形成了清晰的难度梯度(图 1 (https://arxiv.org/html/2605.29170#S5.F1))。CTC 几乎已解决:所有前沿模型零样本准确率超过 96%,最佳与最差之间仅相差 1.0 个百分点。JFC 难度大得多(零样本 74–84%),需要模型区分程序上相似的文档类型。COP 是最困难的任务:前沿模型零样本宏平均 F1 仅为 23–41%,需要对隐藏结果进行真正的法律推理。CCP 的难度介于 JFC 和 COP 之间(零样本准确率 44–51%),测试法律主题的领域知识。 ### 5.2 小样本效应具有任务依赖性 图 2:所有 11 个模型和 5 项任务的小样本增量(百分点)。绿色 = 小样本有帮助,红色 = 有害。JFC 显示出一致的大增益;COP 结果不一;NE 接近零。 UA-Legal-Bench 的核心发现是,小样本提示效应 sharply 依赖于任务,无法仅从任务难度预测(图 2 (https://arxiv.org/html/2605.29170#S5.F2))。表 4 (https://arxiv.org/html/2605.29170#S5.T4) 总结了前沿模型的增量。 表 4:前沿模型相对于零样本的小样本增量(百分点)。COP 使用宏平均 F1 增量。粗体:|Δ| > 5 个百分点。 #### JFC:小样本始终有帮助。 七个模型中有六个在判决形式分类上从小样本示例中获益 8.6–17.7 个百分点。最大增益来自 Llama 3.3 70B(+17.7 个百分点,从 74.1% 到 91.8%)。
相似文章
VLegal-Bench: 越南法律推理认知基础基准测试
VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
LegalBench-BR:评估大语言模型在巴西法律判决分类上的基准
研究者发布首个公开基准 LegalBench-BR,用于评估大模型在巴西法律文本分类任务上的表现。实验表明,LoRA 微调的 BERTimbau 大幅超越 GPT-4o mini 与 Claude 3.5 Haiku。
TW-LegalBench: 衡量台湾法律理解能力
TW-LegalBench 是一个评估大型语言模型在台湾法律理解能力方面的基准,包含超过16,000道选择题、117道论述题和14,000个法律判决预测实例。结果显示,顶级模型超过了律师考试及格线,但未达到法官和检察官的水平,凸显了在法律文本生成可靠性方面的挑战。