法律判决预测中的捷径学习:来自英国就业法庭的经验证据

arXiv cs.AI 论文

摘要

本文利用英国就业法庭的索赔案例,实证研究了法律判决预测中的捷径学习现象,发现模型会利用事后司法文本中揭示结果线索,但在掩盖这些泄露特征后,模型性能依然保持稳健。

arXiv:2607.04261v1 公告类型:新发布 摘要:当前法律判决预测(LJP)因依赖事后司法材料而受到限制,这增加了模型进行回顾性分类而非真正预测的可能性。本文在此背景下实证研究了捷径学习现象,通过研究英国就业法庭(UKET)判决中索赔层面的结果预测。我们使用包含33,158个独立索赔的语料库,从索赔文本和LLM提取的案例摘要中预测结果,评估了从可解释的TF-IDF分类器到黑盒LLM等多种模型。尽管总体预测性能看似强劲,但我们证明,基于事后司法文本训练的LJP系统之所以表现出这样的性能,可能是由于源材料的回顾性本质。根据人工判断的泄露程度对测试数据进行分层分析显示,当叙事中包含揭示结果的线索时,性能会提高。此外,一个仅使用被识别为泄露特征的4%数据进行训练的模型达到了高性能,甚至超过了人类专家。这些发现证实了LJP性能可能因语言伪影而被夸大的担忧。然而,这种脆弱性并非致命。相反,事后判决可能被视为潜在受污染的文本,需要主动审计。在掩盖泄露特征后重新训练模型,Macro-F1的下降微乎其微。因此,尽管模型会在有机会时投机性地利用捷径,但当这些伪影被移除后,它们仍然能够提取有用的预测信号。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# 法律判决预测中的捷径学习:来自英国就业法庭的实证证据
来源:https://arxiv.org/abs/2607.04261
查看PDF (https://arxiv.org/pdf/2607.04261)

> **摘要:**当前的法律判决预测(LJP)受限于其对事后司法材料的依赖,这增加了模型进行回顾性分类而非真正预测的可能性。本文通过研究英国就业法庭(UKET)判决中基于个案层面的结果预测,实证性地探讨了这一背景下的捷径学习现象。利用包含33,158个独立案件的语料库,我们从案件文本和LLM提取的案件摘要中预测结果,评估了从可解释的TF-IDF分类器到黑箱LLM等多种模型。虽然标题预测性能数字看似强劲,但我们证明,基于事后司法文本训练的LJP系统,其性能可能受到源材料回顾性本质的驱动。通过按人工判断的数据泄露程度对测试数据进行分层,我们发现当结果揭示性线索嵌入叙述中时,性能会提升。此外,仅利用被识别为泄露的4%特征训练的模型实现了高性能,甚至优于人类专家。这些发现证实了LJP性能可能因语言伪影而被夸大的担忧。然而,这种脆弱性对研究议程并非致命。相反,事后判决可被视为潜在受污染文本,需要主动审计。在屏蔽泄露特征后重新训练模型,仅导致Macro-F1的微不足道下降。因此,虽然模型在有捷径可用时会机会主义地加以利用,但当这些伪影被移除时,它们仍然能够提取有用的预测信号。

## 提交历史

来自:Joe Watson \[查看邮箱 (https://arxiv.org/show-email/33342473/2607.04261)\] **\[v1\]**2026年7月5日星期日 12:15:47 UTC (1,152 KB)

相似文章