法律判决预测中的捷径学习:来自英国就业法庭的经验证据
摘要
本文利用英国就业法庭的索赔案例,实证研究了法律判决预测中的捷径学习现象,发现模型会利用事后司法文本中揭示结果线索,但在掩盖这些泄露特征后,模型性能依然保持稳健。
arXiv:2607.04261v1 公告类型:新发布
摘要:当前法律判决预测(LJP)因依赖事后司法材料而受到限制,这增加了模型进行回顾性分类而非真正预测的可能性。本文在此背景下实证研究了捷径学习现象,通过研究英国就业法庭(UKET)判决中索赔层面的结果预测。我们使用包含33,158个独立索赔的语料库,从索赔文本和LLM提取的案例摘要中预测结果,评估了从可解释的TF-IDF分类器到黑盒LLM等多种模型。尽管总体预测性能看似强劲,但我们证明,基于事后司法文本训练的LJP系统之所以表现出这样的性能,可能是由于源材料的回顾性本质。根据人工判断的泄露程度对测试数据进行分层分析显示,当叙事中包含揭示结果的线索时,性能会提高。此外,一个仅使用被识别为泄露特征的4%数据进行训练的模型达到了高性能,甚至超过了人类专家。这些发现证实了LJP性能可能因语言伪影而被夸大的担忧。然而,这种脆弱性并非致命。相反,事后判决可能被视为潜在受污染的文本,需要主动审计。在掩盖泄露特征后重新训练模型,Macro-F1的下降微乎其微。因此,尽管模型会在有机会时投机性地利用捷径,但当这些伪影被移除后,它们仍然能够提取有用的预测信号。
查看缓存全文
缓存时间: 2026/07/07 04:36
# 法律判决预测中的捷径学习:来自英国就业法庭的实证证据 来源:https://arxiv.org/abs/2607.04261 查看PDF (https://arxiv.org/pdf/2607.04261) > **摘要:**当前的法律判决预测(LJP)受限于其对事后司法材料的依赖,这增加了模型进行回顾性分类而非真正预测的可能性。本文通过研究英国就业法庭(UKET)判决中基于个案层面的结果预测,实证性地探讨了这一背景下的捷径学习现象。利用包含33,158个独立案件的语料库,我们从案件文本和LLM提取的案件摘要中预测结果,评估了从可解释的TF-IDF分类器到黑箱LLM等多种模型。虽然标题预测性能数字看似强劲,但我们证明,基于事后司法文本训练的LJP系统,其性能可能受到源材料回顾性本质的驱动。通过按人工判断的数据泄露程度对测试数据进行分层,我们发现当结果揭示性线索嵌入叙述中时,性能会提升。此外,仅利用被识别为泄露的4%特征训练的模型实现了高性能,甚至优于人类专家。这些发现证实了LJP性能可能因语言伪影而被夸大的担忧。然而,这种脆弱性对研究议程并非致命。相反,事后判决可被视为潜在受污染文本,需要主动审计。在屏蔽泄露特征后重新训练模型,仅导致Macro-F1的微不足道下降。因此,虽然模型在有捷径可用时会机会主义地加以利用,但当这些伪影被移除时,它们仍然能够提取有用的预测信号。 ## 提交历史 来自:Joe Watson \[查看邮箱 (https://arxiv.org/show-email/33342473/2607.04261)\] **\[v1\]**2026年7月5日星期日 12:15:47 UTC (1,152 KB)
相似文章
轨迹评判:仅基于结果的LLM评判器在智能体轨迹中遗漏的问题
本文介绍了一个确定性测试平台,用于评估LLM评判器在智能体轨迹上的表现,表明仅基于结果的评判器会遗漏静默故障,而基于步骤的评判器能达到更高的召回率并具有更好的校准。
OBJECTION! 律师代理缓解法律判决预测中的有罪偏见
本文介绍了OBJECTION,一个推理时流水线,使用对抗性律师代理来缓解法律判决预测模型中的有罪偏见,展示了错误有罪率的显著降低,并发布了一个新的'Natural Innocent'数据集。
面向有限语义表格数据的大型语言模型:来自工业车辆改装预测的证据
本文评估了基于大型语言模型(LLM)的策略(嵌入、提示、混合)与经典表格模型在一个包含哈希化类别特征的工业车辆改装预测数据集上的表现。研究发现,树集成整体上优于LLM,但嵌入和混合方法仍有价值,而在缺乏语义线索时直接提示失败。
大语言模型能否进行具有法律意义的推理?基于欧洲人权法院案例的小规模研究
本小规模研究通过欧洲人权法院案例评估了大语言模型在法律案件预测中的推理能力,发现模型能够生成结构完整但实质浅薄的分析,且基于大语言模型的评估器与人类标注者的一致性较低。
法律判决预测中的时间概念漂移:基于乌克兰法院判决三个时期的神经基线
本文通过在地缘政治动荡定义的三个时期的乌克兰法院判决上微调Transformer模型,研究法律判决预测中的时间概念漂移。发现显示严重的前向退化、反向迁移的不对称性,以及按时间顺序的持续学习有效缓解遗忘,而领域预训练降低退化幅度。