LLMs何时会适用错误法律?诊断LLMs在时序法律推理中的失败

arXiv cs.AI 论文

摘要

本文构建了一个基准来评估LLMs在时序法律推理上的表现,揭示了它们倾向于适用最新颁布的法律的偏见,以及通用推理能力与时序性能之间的反向关系。

arXiv:2608.14610v1 公告类型:新 摘要:法律推理任务,如法律判决预测(LJP),需要识别适用于案件的时效正确的法律版本——我们称之为时序适用法律判定。然而,大型语言模型(LLMs)能否可靠地执行此任务仍待探索。在本文中,我们构建了一个基准来评估LLMs在时序适用法律判定上的表现,并系统地研究它们为何在时序法律推理中失败。我们的实验揭示了四个关键发现。首先,LLMs表现出强烈的偏见,倾向于适用最新颁布的法律,无论法律相关事实发生在何时。其次,这种偏见并非源于无法理解法律具有时效范围,也不是因为缺乏对历史法规的知识。第三,我们提供了行为证据,表明强化学习塑造的显式推理可能是一个关键机制:虽然提高了通用推理能力,但它减少了推理路径的多样性,导致模型趋同于适用当前法律。第四,这产生了一个反直觉的反向关系:具有更强通用推理能力的模型在时序法律推理上往往表现更差。我们的发现为未来改进LLMs在基于时序的法律推理中的性能提供了具体指导。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:51

# 大语言模型何时适用错误法律?诊断大语言模型在时间性法律推理中的失败  
来源:https://arxiv.org/html/2608.14610  
黄一轩¹、郑书源²††(通讯作者)、刘倩颖³、彭少文⁴、孔云涛⁵、船越宏太郎¹、肖传²、奥村学¹、曹阳¹  
¹东京科学大学 ²大阪大学 ³NII LLMC ⁴奈良先端科学技术大学院大学 ⁵ROIS-DS法信息学中心  
[email protected], [email protected]  

###### 摘要  
法律推理任务(如法律判决预测 LJP)需要识别管辖案件的、时间上正确的法律版本——我们将此能力称为**时间适用法律认定**。然而,大型语言模型(LLM)能否可靠地执行这一任务尚待探索。本文构建了一个用于评估LLM时间适用法律认定能力的基准,并系统性地探究了它们在时间性法律推理中失败的原因。我们的实验揭示了四个关键发现。第一,LLM表现出强烈的偏向,即无论案件相关的法律事实何时发生,都倾向于适用最新颁布的法律。第二,这种偏向并非源于它们无法理解法律具有时间效力范围,也并非缺乏关于历史法规的知识。第三,我们提供了行为证据,表明基于强化学习塑造的显式推理可能是一个关键机制:虽然它提升了通用推理能力,但减少了推理路径的多样性,导致模型几乎完全收敛于适用现行法律。第四,这产生了一个反直觉的逆向关系:通用推理能力更强的模型,在时间性法律推理上的表现往往*更差*。我们的发现为未来改进LLM在基于时间的法律推理方面的表现提供了具体指导¹¹¹代码和数据将在接受后公开。  

当大语言模型何时适用错误法律?诊断大语言模型在时间性法律推理中的失败  
黄一轩¹、郑书源²††(通讯作者)、刘倩颖³、彭少文⁴、孔云涛⁵、船越宏太郎¹、肖传²、奥村学¹、曹阳¹  
¹东京科学大学 ²大阪大学 ³NII LLMC ⁴奈良先端科学技术大学院大学 ⁵ROIS-DS法信息学中心  
[email protected], [email protected]  

## 1 引言  
大型语言模型(LLM)的快速发展推动了人们对其在自动化法律推理方面的日益增长的兴趣,这对司法效率和法律可及性具有重要影响(Cui等,2023;Huang等,2023)。研究人员已经探索了基于LLM的方法在广泛法律任务中的应用,包括法律判决预测(LJP)(Luo等,2017)、法律事实预测(Liu等,2025)、法院意见生成(Li & Zhang,2021)以及合同分析(Hendrycks等,2021)。这些工作表明,LLM可以作为法律领域的强大工具,推动了其在法律实践中的更广泛部署。  
法律推理中一个关键但尚未充分探索的维度是其固有的*时间*特性。*法律不溯及既往*原则规定,法律事件通常应适用相关行为发生时生效的法律(Bowen,2005)。即使法规后来被修订,其早期版本对于发生在修订之前的事件可能仍然有效。错误适用时间版本并非笔误:它可能从根本上改变行为的法律定性,并最终影响案件结果。因此,准确的法律推理需要模型识别哪一法规版本管辖给定的事实集合——我们将此能力称为*时间性法律推理*。  
尽管其重要性不言而喻,仅有少数现有研究考虑了基于LLM的法律分析中的时间维度(Barale等,2025;Santosh & Vuong,2025;Han等,2025)。其中,在LawShift研究中,Han等(2025)发现,即使是当前最先进的(SOTA)LLM也无法在其法律判断中纳入合成的法规修正案,而是默认使用基于现行法律的预测。然而,他们未能诊断*为什么*这些失败会发生,其根本原因仍然不明。  
本文调查了LLM为何未能识别并正确适用时间上适当的法律版本。识别时间上适用的法律是法律事实预测(LFP)和法律判决预测(LJP)等下游法律推理任务的必要前提:在确定哪一法规版本管辖案件之前,任何后续的判决预测或法律分析都建立在不可靠的基础上。为此,我们为*时间适用法律认定(TALD)*构建了一个基准——要求模型根据案件事实和相关事件日期,识别管辖该案件的法规版本。  
我们的实证研究得出了四个关键发现:第一,LLM表现出强烈且系统性的偏向,倾向于适用最新颁布的法律,而不管相关法律事实何时发生——这直接解释了在LawShift中观察到的失败。第二,这种偏向并非源于对先前法规版本的无知,也并非源于未能理解法律具有时间效力范围。第三,我们发现强化学习(RL)是一个关键机制:虽然它提高了通用推理能力,但同时减少了推理路径的多样性,导致模型几乎完全收敛于适用现行法律的路径。第四,这产生了一个反直觉的结果:通用推理能力更强的模型在时间性法律推理上的表现往往*更差*。  
本文的贡献如下:  
(1)据我们所知,这是首项系统性诊断LLM在时间性法律推理中失败的根本原因的工作。  
(2)我们引入了一个时间适用法律认定基准,使我们能够受控地评估LLM是否正确识别了给定案件在时间上适当的法规版本。  
(3)我们的发现表明,面向推理的强化学习可能减少与TALD相关推理路径的多样性,导致模型收敛到适用现行法律的轨迹上。  

## 2 时间适用法律认定任务  
### 2.1 初步知识  
时间是法律推理的一个基本维度。法规和条例在特定时间点颁布、修订和废除,其法律效力受相应有效期的约束。支配这一时间结构的一个基本原则是*法律不溯及既往*(Kryvoi & Matos,2021):新颁布的法律通常仅适用于其生效后产生的事实和法律关系,而不适用于在先前法律下已完成的行为。因此,确定哪一*版本*的法律管辖特定争议,是得出任何法律上合理结论的前提。  
时间适用性认定是几乎所有法律推理的基础前提。在模型将法规应用于得出法律结论之前,它必须首先确定该法规在法律相关时间点生效的版本。适用错误的版本——无论是已被取代的版本还是尚未生效的版本——无论实质性推理的质量如何,都会导致法律错误的结果。因此,时间适用法律认定是法律推理流程中的必要第一步。  

### 2.2 任务定义  
假设我们有一组法规 N = \{1, ..., n\},其中每个法规 i ∈ N 可能因时间性的法律演变而拥有多个版本。  
给定一个查询 (F, Q),其中 F 表示案件事实,Q 表示用户提出的法律问题,**时间适用法律认定(TALD)**任务旨在识别一个法律引用序列 y = [y₁, ..., yₙ],其中 yᵢ 表示在基于 F 回答 Q 时,对法规 i 具有法律适用性的正确版本。  
注意,如果 yᵢ = -1,则表示法规 i 未在法律推理过程中被引用。令 ŷ = [ŷ₁, ..., ŷₙ] 表示模型在 TALD 任务中预测的法规版本序列。模型在 TALD 上的性能可以通过 TALD 准确率来衡量,定义为真实标签 y 和预测 ŷ 之间的匹配准确率:  
\[ ACC(\hat{\boldsymbol{y}}; \boldsymbol{y}) = \frac{\sum_{i \in N} \mathbf{1}(y_i = \hat{y}_i \neq -1)}{|\{i \mid y_i \neq -1 \text{ or } \hat{y}_i \neq -1\}|} \tag{1} \]  
因此,TALD 的目标是最大化 TALD 准确率。  

## 3 实验设置  
### 3.1 研究问题  
我们通过三个研究问题(RQs)来调查大型语言模型(LLM)在时间适用法律认定(TALD)任务上的能力。  
**RQ1:LLM能否根据案件事实中的时间信息,正确判断时间上适用的法律版本?**  
这考察了模型能否利用案件描述中的时间线索——例如法律行为或争议的时间点——来选择正确的法规版本。  
**RQ2:LLM在TALD上的失败是否源于知识记忆的缺陷?**  
具体来说,我们考察模型是否缺乏关于中国民法时间适用性规则的必要知识。  
**RQ3:LLM在TALD上的失败是否源于法律推理的缺陷?**  
即使模型拥有相关法律知识,它们也可能无法正确应用这些知识来确定时间上适用的法规。  

### 3.2 数据集构建  
为了评估LLM在TALD任务上的表现,我们从中国裁判文书网平台收集民事判决文书²²²https://wenshu.court.gov.cn/。对于每份判决,我们要求模型根据案件事实和原告的主张,识别时间上正确的适用民法版本。  
由于中国民事判决遵循标准化结构,我们使用正则表达式匹配自动提取案件事实和原告主张作为TALD查询,并提取引用的民法版本作为真实标签。自动提取后,两名法律专家通过随机抽样进行交叉验证,以验证提取的准确性。  
最终数据集包含26,000份民事判决,平衡分布在两个子集中:后民法典子集(post-Code split),包含由2021年颁布的《中华人民共和国民法典》管辖的案件;前民法典子集(pre-Code split),包含由先前单行民事法规(如《物权法》和《合同法》)管辖的案件。由于《民法典》实质上整合了这些先前的法规——其物权编和合同编直接对应于先前的《物权法》和《合同法》——我们将其视为多个法规的集合,每个法规与先前的一个单行法规相对应,从而能够对模型在TALD上的性能进行更细粒度的分析。  
为了回答RQ2,两名法律专家另外构建了16个是非题,涵盖中国法律下《民法典》时间适用性的法律规定。这些问题评估LLM是否具备时间适用性规则的必要知识,为模型失败的根源提供了诊断视角。  

### 3.3 实验配置  
##### 模型。  
我们评估了一系列先进的推理模型。对于闭源模型,包括GPT-5.4、Claude Opus 4.6、Gemini-3.1-Pro、DeepSeek-V3.2和GLM-4.7。对于开源模型,评估Qwen3(235B、80B、30B)。此外,我们还包括LegalOne-8B,一个特定领域的法律推理模型。默认情况下,所有模型均在其可用的最高推理努力设置下进行评估。  

##### 测试数据。  
为确保稳健性,我们重复每个实验四次并报告平均结果。每次运行中,我们从后民法典子集中随机抽取100个案件,从前民法典子集中随机抽取100个案件,形成一个平衡的200个案件测试集。  

## 4 针对RQ1的分析  
作为对研究问题I的探索,我们进行初步测试,以考察最先进的推理大型语言模型执行TALD任务的能力。  

### 4.1 结果  
#### 4.1.1 基础结果  
表1:LLM在两个子集上的TALD性能,使用TALD准确率指标(公式1)评估。  
表1显示两个子集之间存在显著的不对称性。在旧版本子集上,每个评估模型的得分都低于0.25,其中七个模型得分低于0.15;Claude-Opus-4.6尤其降至0.014。在新版本子集上,相同模型的得分在0.70到0.84之间。这种差距并非由任务本身的普遍难度解释:在两个子集中,检索适用法律都需要对相同案件事实进行相同类型的法律推理,而新版本子集中的正确答案仅仅是涵盖了相关领域的《民法典》分编。  
这种不对称性表明存在方向性偏差——LLM倾向于优先适用最新法律,而不管相关的法律事实何时发生。  
##### 发现1。先进的推理LLM在TALD上存在方向性失败。  
当较旧版本的适用法律应管辖案件时,它们表现不佳;而当新版本适用时,其表现则具有竞争力。这种不对称性与强烈倾向于引用最新颁布法律的默认行为一致。  

#### 4.1.2 错误类型分析  
表2:错误类型统计。旧→新、新→旧、非版本分别表示具有旧→新、新→旧和非版本类型错误的测试样本比例。  
上述结果表明模型在旧版本案件上失败,但尚未揭示这种失败是否以版本为中心:LLM是否表现出对案件涉及时间版本化法律资源的基本认识,并专注于确定这些版本?因此,我们对两个子集上的错误预测进行了分析。对于LLM测试样本中每个未命中的真实目标法律,我们将错误分为三类:旧→新(正确版本是旧法律,但模型引用了新版本);新→旧(相反情况);非版本(模型给出的答案只包含与版本无关的法律)。  
表2显示,只有一小部分失败是版本无关的,而旧→新类型占大多数。在所有模型中,该类别占据了错误的主要部分,而新→旧错误则很少见。这表明模型通常能够定位相关的法律家族或版本对应物,但选择了错误的时间方向。换言之,模型并非仅仅引用无关法律。它们表现出对案件涉及时间版本化法律资源的基本认识,但它们的默认选择偏向于新版本。  
##### 发现2。先进的推理LLM在TALD上的失败以版本为中心。  
它们经常定位到相关的法规家族,但当旧版本应适用时,却选择了新版本。  

## 5 针对RQ2的实验  
表3:法规知识记忆探测

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

大语言模型何时能在弱监督下学会推理?

Hugging Face Daily Papers

# 论文页面 - 大语言模型何时能在弱监督下学会推理? 来源:[https://huggingface.co/papers/2604.18574](https://huggingface.co/papers/2604.18574) ## 摘要 研究表明,在弱监督下的推理任务中,模型泛化能力取决于奖励饱和动态和推理忠实度,而对显式轨迹进行监督微调对于成功适应至关重要。大语言模型通过[reinfor