从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
摘要
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。
查看缓存全文
缓存时间: 2026/04/20 08:29
# 越南法律文本上的大规模LLM双方面评估 在FISU人工智能联合会议(FJCAI 2026)越南分会接收。 来源:https://arxiv.org/html/2604.16270 ## 从基准测试到推理:越南法律文本上LLM的双方面大规模评估 ###### 摘要 越南法律文本的复杂性对公众获得司法的权利构成了重大障碍。虽然大型语言模型为法律文本简化提供了一个有前景的解决方案,但评估其真正的能力需要超越表面指标的多方面方法。本文介绍了一个全面的双方面评估框架来满足这一需求。首先,我们为四个最先进的大型语言模型(GPT-4o、Claude 3 Opus、Gemini 1.5 Pro和Grok-1)建立了性能基准,涵盖三个关键维度:准确性、可读性和一致性。其次,为了理解这些性能分数背后的"原因",我们对60篇复杂越南法律条款的精选数据集进行了大规模错误分析,使用了一种新颖的、专家验证的错误分类法。我们的结果揭示了一个关键的权衡:Grok-1等模型在可读性和一致性方面表现出色,但在细粒度法律准确性方面有所妥协;而Claude 3 Opus等模型获得高准确性分数掩盖了大量微妙但严重的推理错误。错误分析指出"不正确的例子"和"误解"是最普遍的失败,证实当前LLM的主要挑战不是摘要,而是受控的、准确的法律推理。通过整合定量基准和定性深度分析,我们的工作为法律应用提供了全面的、可操作的LLM评估。 ## I 引言 大型语言模型(LLM)的出现承诺了一个变革性的愿景:通过将复杂的、成文的法律翻译成公众能理解的语言来实现司法民主化。在越南这样的民法法系中,这个承诺尤其深远。该国的法律虽然全面,但常常笼罩在"法律术语"中——一种密集的法律术语,对于寻求了解基本权利和义务的公民造成了重大障碍[8]。LLM提供了一个消除这一障碍的潜在工具。 然而,这个承诺被一个重大危险所阴影笼罩:生成流畅、看似合理但不准确的法律简化的风险[3]。为了负责任地利用LLM的潜力,我们必须首先能够以细致和深入的方式衡量其能力。初步评估,包括我们自己的先前工作,专注于使用表面指标(如法律准确性、用户感知的可读性和输出一致性)设置性能基准[5]。虽然这些指标提供了一个有价值的"是什么"——量化哪些模型在表面上表现更好——但它们从根本上未能解释"为什么"。一个模型可能通过正确总结继承的一般规则获得高准确性分数,但完全忽略了对特定情况的关键例外,这是一个微妙但灾难性的推理错误,表面分数会掩盖。这个限制是对我们初期研究的关键反馈,因为样本量小且缺乏对模型失败模式的新见解而受到批评。 这突出了文献中的一个关键差距:缺少一个将大规模定量基准与法律推理的深层定性诊断相结合的全面评估框架[5]。为了填补这个空白,本文介绍了一个全面的、双方面的评估框架,旨在既广泛又深入。我们结合了两个不同但互补的研究方向: 1. 大规模性能基准:我们在之前方法的基础上进行了扩展,将准确性、可读性和一致性的指标应用于60篇复杂越南法律条款的大型多样化数据集,以确保我们发现的可推广性和统计显著性。 2. 深入的法律推理错误分析:我们引入并应用了一种新颖的、专家验证的错误分类法到相同的输出。这使我们能够超越分数,解剖每个模型的性能,以识别和分类其推理失败的具体根本原因。 通过整合定量和定性方法,我们提供的不仅仅是模型排行榜。我们的工作提供了对当前最先进LLM在越南法律领域能力和更重要的系统性弱点的详细诊断。研究结果揭示了性能方面之间的关键权衡——如可读性与事实保真度之间的权衡——并指出了必须克服的核心挑战,以构建真正可靠和值得信赖的法律AI。 ## II 相关工作 LLM在法律领域的应用已迅速发展,但特别是对于非英文语言和民法法系,仍存在重大差距。我们的工作位于几个关键研究方向之内。 ### II-A 领域适应和预训练法律模型 一条基础性研究表明,特定领域的预训练显著改善了法律任务的性能。LEGAL-BERT等模型[2]表明在大规模法律语料库上进行持续预训练使模型能够比通用模型更好地理解法律词汇和背景。这突出了特定领域数据的重要性,对于越南等拥有大量数字化法律语料库较少的语言来说是一个挑战。 ### II-B 法律文本简化 简化法律文本是一项公认的任务,旨在改善对司法的获取。该领域的研究已探索了各种技术,从结合词汇替换和句子分割的无监督方法[1]到监督方法。然而,如Garimella等人所指出的一个反复出现的挑战[4]是平行复杂-简单法律语料库的稀缺,使监督训练变得困难。这种稀缺性提升了评估现代LLM零样本简化能力的重要性,这是我们研究的重点。 ### II-C 法律LLM的评估和可靠性 随着LLM变得更强大,评估其在高风险领域的可靠性至关重要。Lai等人的调查[6]提供了LLM在法律领域应用的广泛概述,从起草协助到法律问答,同时也概述了与推理、透明度和事实准确性相关的风险。评估的关键方面是理解和缓解"幻觉"。例如,Dahl等人[3]为法律幻觉开发了一个分类法,主要关注案例法摘要和法律问答任务中的事实不准确和引文错误。 虽然这样的工作对于识别基于事实的错误是基础性的,但我们的研究解决了一个不同但同样关键的挑战:在文本简化背景下的推理失败。我们的九类别错误分类法专门设计用于捕捉这项任务独有的细微差别。与关注幻觉(即伪造不存在的事实)的分类法不同,我们的框架也分类了微妙但严重的错误,如"过度简化"、"误解"法律术语,以及在"不正确的例子"中未能正确应用原则。这种对简化特定的推理错误的关注,而不仅仅是事实正确性,代表了一个补充现有评估框架的关键贡献。它强调了表面级准确性指标的不足,并为深入错误分析提供了动力。 ### II-D 越南法律语言处理 在越南的背景下,开发专门法律AI资源的努力正在加速。在研究前沿,ViGPT-Law等项目[9]和VLQA和VNLAWQC等法律问答数据集[7]正在构建基础模型和基准,主要用于信息检索和问答。与此同时,越南政府部署了实际工具,如司法部的"虚拟法律助手",旨在改善公众获取法律信息的途径。 然而,在创建这些应用与从根本上理解其可靠性之间存在关键差距。虽然现有的努力通常强调事实正确性,但它们可能忽视了生成性任务(如简化)中微妙但严重的推理失败。我们的工作直接解决了这一差距。虽然应用工具提供了有价值的服务,但我们的研究通过新颖的错误分类法提供了对基础LLM能力的基础性诊断评估,识别系统性失败模式。这种大规模的、系统性的生成简化评估,从法律推理的角度来看,是补充现有工作的一个贡献。它不仅推进了技术基准,而且为审计和改善越南面向公众的法律AI系统的安全性和可靠性提供了一个可操作的框架。 ## III 双方面评估框架 为了提供全面的评估,我们设计了一个从两个互补的角度评估LLM性能的框架:高级性能指标和低级错误分析。整个框架被应用于一个大型数据集,以确保统计显著性和可推广性,同时也能够更深入地理解不同模型在法律推理的各个方面如何成功或失败。 ### III-A 数据和模型选择 模型:我们选择了四个最先进的LLM,代表当前商业AI的最前沿:GPT-4o(OpenAI)、Claude 3 Opus(Anthropic)、Gemini 1.5 Pro(Google)和Grok-1(xAI)。这些模型是基于三个标准选择的:(1)市场主导地位:它们代表来自领先AI实验室的旗舰模型;(2)架构多样性:它们体现了不同的训练理念和上下文窗口能力(例如,Gemini的长上下文与Grok的MoE架构);(3)可访问性:它们是当前最易访问的高性能工具,使其评估与公众法律获取高度相关。 数据集:我们通过有目的抽样策略精心策划了一个包含60篇法律条款的数据集。这种大规模方法优先考虑深度和广度。这些条款是从三份核心立法文本中选择的:《2015年刑法》(20篇条款)、《2015年民法》(20篇条款)和《2024年土地法》(20篇条款)。选择标准关注已知复杂的条款,包括那些具有:(a)多个例外和条件、(b)抽象法律术语(例如,"trái đạo đức xã hội")和(c)需要顺序逻辑推理(例如,"thừa kế thế vị")的条款。这确保了LLM的挑战性和代表性测试平台。通过结合民法、刑法和土地法,数据集反映了日常生活和专业法律背景中遇到的多种法律推理挑战。此外,这个精心平衡的语料库提供了足够的变化,以在可比较的条件下对不同模型家族的适应性进行压力测试。 任务:对于每篇条款,模型被给予一个一致的、零样本提示,要求它们充当法律助手,用简单的术语为非专业人士解释法律,并提供实际例子。使用的具体提示是:"充当法律助手。用简单的术语为非专业人士解释以下条款[条款内容],并提供一个实际例子"。每个模型对每篇条款生成两个回应(温度为0.2),创建了480个输出的语料库(4个模型×60篇条款×2次运行)用于评估。这个实验设计使我们能够评估生成的简化的准确性和可访问性,以及模型行为在重复生成中的稳定性。值得注意的是,这个双组件提示——要求既有解释(摘要任务)又有例子生成(应用任务)——允许我们观察模型在后者中一致地挣扎更多,突出了法律推理而不仅仅是文本简化中的核心挑战。 ### III-B 第一阶段:整体性能基准测试 这个阶段量化了生成文本在三个以用户为中心的维度上的整体质量,提供了模型的高级比较。 #### III-B1 指标1:法律准确性 该指标评估了输出的法律精准性。它由五名经过培训的法律学生在1-5李克特量表上进行评估。为了确保可靠性,每个输出至少由两名学生评估,任何重大差异通过讨论解决。该指标是四个子标准的加权平均: - •内容保留(40%):对核心法律规则的忠实性。 - •完整性(30%):包含所有基本要素和条件。 - •清晰性(20%):法律定义的易理解程度。 - •例子相关性(10%):所提供例子的适当性。 权重方案是基于法律建议中"安全第一"的原则建立的。内容保留被分配最高权重(40%),因为省略核心法律含义的简化对错误信息构成最大风险。完整性(30%)随后,确保不遗漏任何关键条件。清晰性(20%)和例子相关性(10%)权重较低,因为法律准确但干燥的解释优于流畅但不正确的解释。 #### III-B2 指标2:可读性 该指标评估了非专家观众的易理解性。它由通过大学邮件列表和社交媒体招募的253名非专家参与者在1-5李克特量表上对随机子集的10-15个输出进行评估,涵盖三个加权子标准: - •语言易度(40%):词汇和句子结构的简单性。 - •结构连贯性(30%):逻辑流、格式和组织。 - •例子的实用性(30%):例子在澄清概念方面的帮助程度。 对于可读性,语言易度权重最高(40%),因为它直接解决了非专业人士面临的"法律术语"障碍,之后是结构连贯性(30%)和例子的实用性(30%)相等,它们支持理解和记忆。 #### III-B3 指标3:一致性 该指标衡量了模型在两次独立运行中输出的稳定性。这个复合指标结合了自动化评分和人工判断: - •语义一致性(30%):句子嵌入之间的余弦相似度(使用paraphrase-multilingual-MiniLM-L12-v2)。 - •语言一致性(30%):句子级BLEU评分以衡量措辞重叠。 - •长度一致性(10%):输出长度稳定性(字数)。 - •人工一致性评分(30%):人工评估者对运行间意义保留的评估。 长度一致性(10%):虽然输出长度不是推理质量的直接衡量,但相同提示的长度显著差异(例如,产生简短摘要
相似文章
VLegal-Bench: 越南法律推理认知基础基准测试
VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
LegalBench-BR:评估大语言模型在巴西法律判决分类上的基准
研究者发布首个公开基准 LegalBench-BR,用于评估大模型在巴西法律文本分类任务上的表现。实验表明,LoRA 微调的 BERTimbau 大幅超越 GPT-4o mini 与 Claude 3.5 Haiku。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
LLM对越南方言的鲁棒性如何?
本文介绍了VialectBench,这是一个评估LLM在六种越南方言群体和四项任务上鲁棒性的基准,发现平均性能下降2.82%,且没有模型完全不受方言影响。