大语言模型能否进行具有法律意义的推理?基于欧洲人权法院案例的小规模研究

arXiv cs.CL 论文

摘要

本小规模研究通过欧洲人权法院案例评估了大语言模型在法律案件预测中的推理能力,发现模型能够生成结构完整但实质浅薄的分析,且基于大语言模型的评估器与人类标注者的一致性较低。

arXiv:2608.17168v1 发布类型:新文章 摘要:推理已成为当代大语言模型的标准化技术和特征;然而,在诸如法律案件预测等高要求的法律导向任务中,其应用与质量仍待深入探索。本研究以欧洲人权法院的法律案件为试验平台,探究大语言模型如何在法律案件预测情境中进行推理。我们评估了OpenAI GPT 5.4这一近期顶尖大语言模型,通过探索不同提示策略,这些策略或多或少暗示了在欧洲人权法院判例背景下何种推理可被视为具有法律意义。我们呈现了通过人类和大语言模型评估模型响应后得出的发现。研究发现,所考察模型在法律推理方面的得分远未达理想水平;模型生成的分析虽结构完整但实质浅薄;此外,作为“评审员”的大语言模型评估器内部一致,但与受训标注者的匹配度仅属微弱——即可靠但无法有效替代人类评估。总体而言,专家策划的提示能引导更全面的推理,但这并未比其他考察设置带来更准确的预测。基于这些发现,我们强烈呼吁学界不要仅依赖自动化的基于大语言模型的评估方法,并避免使用任务准确率作为推理质量的合适代理指标。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:50

# 大语言模型能否以具有法律意义的方式进行推理?一项基于欧洲人权法院案件的小规模研究  
来源:https://arxiv.org/html/2608.17168  
Amogh Raina  
所属单位:丹麦哥本哈根大学计算机科学系  
通讯邮箱:[[email protected]](mailto:[email protected])  
Daniel Hershcovich  
所属单位:丹麦哥本哈根大学计算机科学系  
Henrik Palmer Olsen  
所属单位:丹麦哥本哈根大学法学系  

###### 摘要  
推理已成为当代大语言模型的标准技术与核心能力;然而,在法律导向的高要求任务(如法律案件预测)中,其应用方式与推理质量仍鲜被深入探讨。本研究以欧洲人权法院案件为实验平台,探究大语言模型在法律案件预测情境中的推理表现。我们评估了近期顶尖大语言模型OpenAI GPT 5.4,通过设计不同提示策略,探索其在欧洲人权法院判例法框架下何种程度能体现“具有法律意义的推理”。我们采用人工评估与大语言模型评估相结合的方式分析模型输出结果。研究发现:被测模型在法律推理层面远未达到理想水平——其生成的分析虽结构完整但实质浅显;“大语言模型作为评估者”的评估方式虽具备内部一致性,但与训练有素的人工标注者吻合度较低,即该方法可靠但尚不能替代人工评估。总体而言,经专家设计的提示能引导更全面的推理过程,但其预测准确性并未优于其他设置。基于研究结论,我们呼吁学术界不应仅依赖大语言模型的自动化评估,同时避免将任务准确率作为推理质量的合理代理指标。  

###### 关键词  
机器学习,ICML  
††脚注:贡献均等  

## 1 引言  
采用推理能力的大语言模型(常被称为推理语言模型)在多种复杂指令跟随与问题解决任务中(包括数学与编程)展现出卓越性能。大语言模型的推理能力已成为关键研究课题,目前主要在逻辑、数学和代码领域得到充分测评;然而,其在复杂法律导向任务(如法律案件判决预测)中的潜在应用仍待深入探索。在此类任务中,推理不仅是提升预测准确性的路径,更是透视模型决策过程的窗口,其可解释性超越了单纯基于模式匹配的方法。  

近期行业调查显示,约60%-70%的法律从业者现已每周至少使用一次生成式AI工具进行文书起草、法律研究或文档分析。有研究指出大语言模型在法律文本分类与摘要任务中表现突出,但在需要结构化法律推理的任务中则显得力不从心。法律案件判决预测本质上依赖于高度复杂的推理能力,这种能力因法律领域(如刑法、合同/商法、人权法)和司法管辖区(如国内法院或欧洲人权法院等超国家机构)的不同而存在差异。分析案件事实、将其与模型内部法律知识或其他输入信息关联,并作出预测性判断,均需先进的推理能力。  

参见图片 图1:从案件提交到法院判决及公开发布的欧洲人权法院真实案件流程示意图;以及我们基于大语言模型的法律判决预测实验流程。  

本项目以欧洲人权法院案件为小规模实验平台,探究大语言模型在法律案件预测情境中的推理机制:沿用先前研究的方法,模型需评估案件事实与指控违规行为,并推理欧洲人权法院可能作出的有利于或不利于申请人的裁决。我们旨在回答的核心问题是:**大语言模型能否以具有法律意义的方式进行推理?**  

围绕这一问题,我们设定以下研究方向:  
1. **研究问题一**:近期顶尖大语言模型(如OpenAI GPT 5.4)在欧洲人权法院案件法律推理中的能力如何?  
2. **研究问题二**:不同提示策略(如是否包含相关上下文)如何影响模型的推理表现?  
3. **研究问题三**:人工标注者与大语言模型评估者对推理质量的评价有何差异?  

我们聚焦于一项针对欧洲人权法院近期案件的小规模定向研究,案件均涉及《欧洲人权公约》第十条(言论自由),相关条款如下:  
> *1. 人人享有表达自由的权利。此项权利应包括持有意见的自由、接受和传递信息和思想的自由,不受公权力干预且不分国界。本条款不得阻止国家对广播、电视或电影企业实行许可制度。*  
> *2. 行使上述各项自由,因其附带有义务和责任,可受法律所规定的程式、条件、限制或处罚约束,且在民主社会中为国家安全、领土完整或公共安全之利益,为防止混乱或犯罪,为保护健康或道德,为保护他人名誉或权利,为防止披露保密信息,或为维护司法权威与公正所必需。*  

##### 研究贡献  
(a) 我们发布了一个包含30起近期欧洲人权法院案件的小型数据集,旨在评估大语言模型在法律判决预测与推理方面的能力(第2章)。所有案件均于2025年4月起在HUDOC数据库正式公开。¹  
¹使用近期案件的小型数据集旨在(虽不能完全消除)降低与被测模型训练数据重叠的可能性;早期实验发现模型会记忆案件细节,尤其对广泛讨论的典型案例。由于模型知识截止日期(2025年8月31日)晚于部分语料发布时间,我们将在局限性章节讨论残余数据污染风险。  

(b) 我们探究最新的OpenAI GPT 5.4模型(知识截止:2025年8月31日)在不同提示设置下的表现:(a)*开箱即用*仅含基础任务指导;(b)采用不同设置,其中提示以*逐字照搬*或*隐含引用*方式包含理想推理策略的详细步骤描述,或直接提供相关条款的官方多页指南。  

(c) 我们采用人工评估(由法学学生执行)与大语言模型评估者(“大语言模型作为评估者”)对模型生成的回复进行评估,重点关注模型评估(推理)的质量而非其最终判决(预测)。同时,我们将人工评估与基于大语言模型的评估结果作为数据集的组成部分公开,以供未来探索或与其他“大语言模型作为评估者”方案进行对比。  

## 2 研究任务与数据  
欧洲人权法院受理欧洲理事会成员国(被诉国)涉嫌违反《欧洲人权公约》的指控。申请人提交申请;若获准受理,法院将审查案件并作出裁决,该裁决公开后具有判例效力(图1)。  

我们使用HUDOC数据库中30起涉及第十条(言论自由)的欧洲人权法院案件进行实验。数据集为每起案件提供:法院裁决中呈现的*案件事实*(事实事件及相关法律框架);被诉国*涉嫌违反*第十条,法院最终裁决是否构成*实质违反*。沿用先前研究方法,模型接收案件事实后,需进行推理并预测该条款是否被违反²。  
²与先前研究不同,模型“知悉”所讨论的《欧洲人权公约》条款,这与现实中的法院裁决情境一致。  
模型需生成*评估内容*(推理过程)和*判决结果*(第3.2节)。  

##### 数据集处理  
为开展实验,我们对官方公布的法院裁决进行预处理以提取关键信息。首先提取法院裁决中描述的*案件事实*,以及概述被诉国国内法律现状的相关法律框架(作为模型输入的基准事实),平均长度为4,993词。  

进一步提取*法院评估部分*(即法院就事实如何依法解释的推理过程,涵盖干涉、合法性、正当性与比例原则),将其作为专家推理的参考标准。仅保留第十条实体部分(排除可受理性及超范围条款),并提取其*判例法引用*(如“*参见施普林格出版公司诉德国案[大审],第39954/08号*”)与*事实引用*(如“*参见上文第12-14段*”)。平均而言,评估部分包含25处事实引用与10-15处判例法引用。  

参见图片 图2:评估涉及第十条(言论自由)的《欧洲人权公约》案件的适当推理策略。  

### 2.1 任务简化说明  
本实验的任务设计并未完全复制法院实际工作流程。我们采用简化实验框架:在给定整理后的案件事实下,模型需推理并预测涉嫌违反的《欧洲人权公约》条款。主要差异如下:  
- **输入**:输入为经整理总结的案件事实(即法院听取双方陈述后认定的事实),而法院实际可获取更广泛的未过滤案件文件(事实背景、双方论点、证据)³。  
  ³案件事实认定流程详见第8条参考文献。  
- **背景知识**:模型不接收逐字表述的《欧洲人权公约》判例法(先例),而是将法院评估部分中提取的判例法引用列表作为“神谕”提供,要求模型将其合理置于论证中。  
- **输出**:模型生成与待评估《欧洲人权公约》条款相关的法律推理及潜在违反预测,而欧洲人权法院的裁决则更细化(包括案件可受理性审查、被诉国需支付的损害赔偿及诉讼费用等)。模型输出不包含这些组件。  

尽管存在上述限制,与现有文献相比,本研究框架仍最接近法院实际司法流程:输入包含相关法律框架,且要求模型输出评估内容(推理)作为支持判决的关键要素。  

### 2.2 推理质效标准  
**法律推理的适宜性**:本研究中的适宜法律推理需满足:(a) 基于案件事实(对事实的诠释构成推理部分);(b) 与待评估条款相关(推理围绕法律意义层面将条款应用于案件事实的过程展开,遵循欧洲人权法院判例法确立的标准)。  

**法律推理的优先性**:适宜的法律推理应优先于预测准确性。判决与法院裁决不符可能源于真实歧义、叙事复杂性、上下文缺失或主观判断⁴;而适宜的推理是民主社会中司法机构合法性的“法律意义美德”。  
⁴相关研究见第14条参考文献。  

## 3 实验方法  
### 3.1 被测模型  
我们测试OpenAI的GPT-5.4模型⁵(当时GPT系列第二强模型,知识截止:2025年8月31日),使用*中等*推理强度运行生成器(各设置的具体参数见附录A)。聚焦ChatGPT是因为其仍是法律从业者使用最广泛的大语言模型,最能代表法律实务界接触大语言模型生成内容的真实场景。  
⁵GPT-5.5作为评估者(“大语言模型作为评估者”)在本项目后期发布。  

### 3.2 提示策略设置  
我们探索三种替代提示设置⁶:  
(a) *非定制化*:模型仅被指示基于案件事实进行评估并按规定格式输出(以带标题段落列表形式呈现评估内容,并预测涉嫌条款是否被违反),但未提供任何关于该条款适宜推理策略的明确指导。  

(b) *专家定制化*:提供由法律专家设计的、针对该条款的适宜推理策略详细步骤描述(图2),要求模型按此策略执行评估与判决。  

(c) *指南定制化*:提供欧洲人权法院发布的《第十条官方判例指南》⁷,通过两步流程:(i) 指示模型根据指南内容推导适宜推理策略;(ii) 将生成的推理策略作为后续提示的一部分,要求模型据此评估并判决案件。  
⁷官方指南详见此链接(https://ks.echr.coe.int/documents/d/echr-ks/guide_art_10_eng)。  

生成器与所有评估器的具体API标识符、版本号及推理强度设置详见附录A。  

### 3.3 推理评估  
我们评估模型输出中形式公开的案件评估(推理)内容(评估器模型以*高*推理强度运行)。忽略模型“隐藏”的推理过程或“思考”过程。

相似文章

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。