逮捕前:基于不完整证据对LLMs进行犯罪剖析基准测试
摘要
本文介绍了PIJ基准测试,用于评估大型语言模型在基于不完整证据的犯罪剖析任务中的表现,重点突出了推理任务中的性能差距和偏见。
arXiv:2609.19965v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地应用于法律和刑事司法任务,但现有工作几乎完全集中在逮捕后的场景中,即嫌疑人的身份已知,使得从不完整证据推断嫌疑人特征的关键逮捕前挑战在很大程度上未被探索。为填补这一空白,我们引入了Profiling, Investigation, and Judgment(PIJ)基准,包含来自五个国家的2500起真实凶杀案。PIJ在贯穿整个刑事调查流程的三个任务上评估LLMs:犯罪剖析,需要从碎片化现场证据推断嫌疑人属性的溯因推理;犯罪过程重建,测试结构化信息提取;以及刑罚预测,要求法律演绎推理。我们评估了9个强大的LLMs,发现随着任务从显式事实提取转向对未知嫌疑人画像的隐式推理,性能系统性地下降。需要推理的类别,如动机和受害者-施害者关系,仍然是主要瓶颈。进一步分析揭示了LLMs与人类专家之间的显著差距,以及在性别、年龄和动机归因上的普遍偏见。我们的研究结果表明,基于不完整证据的逮捕前推理仍是一个开放挑战。
查看缓存全文
缓存时间: 2026/09/18 09:07
# 逮捕前:基于不完整证据对LLM进行犯罪侧写基准测试 来源:https://arxiv.org/html/2609.19965 ###### 摘要 大型语言模型(LLMs)在法律和刑事司法任务中的应用日益增多,然而现有工作几乎完全集中在逮捕后阶段,即嫌疑人身份已知的情况下,而从不完整证据推断嫌疑人特征这一关键的逮捕前挑战,在很大程度上尚未得到探索。为填补这一空白,我们引入了**侧写、调查与判断(PIJ)基准测试**[^1],包含来自五个国家的2,500个真实凶杀案。PIJ评估LLMs在整个刑事调查流程中的三个任务:犯罪侧写(需要通过溯因推理从零散的现场证据推断嫌疑人属性)、犯罪过程重建(测试结构化信息提取能力)以及量刑预测(需要法律演绎推理)。我们评估了9个强大的LLMs,发现随着任务从明确的事实提取转向对未知嫌疑人特征的隐含推理,模型性能系统性地下降。需要推理能力的类别,如动机和受害者-施害者关系,仍是主要瓶颈。进一步分析揭示了LLMs与人类专家之间的显著差距,以及在性别、年龄和动机归因方面普遍存在的偏见。我们的发现表明,从不完整证据进行逮捕前推理仍是一个开放性挑战。✤ 内容警告:本文包含暴力内容示例。 ## 1引言 随着大型语言模型(LLMs)的飞速发展,它们越来越多地应用于法律和刑事司法任务,例如法律判决预测[Wu等人(2023)](https://arxiv.org/html/2609.19965#bib.bib1);[Han等人(2025)](https://arxiv.org/html/2609.19965#bib.bib2)、再犯与偏见分析[Hall等人(2025)](https://arxiv.org/html/2609.19965#bib.bib3);[Pawar等人(2025)](https://arxiv.org/html/2609.19965#bib.bib8)、法律问答[Louis等人(2024)](https://arxiv.org/html/2609.19965#bib.bib4);[Akarajaradwong等人(2025)](https://arxiv.org/html/2609.19965#bib.bib5)以及案件摘要[Shen等人(2022)](https://arxiv.org/html/2609.19965#bib.bib6);[Heddaya等人(2025)](https://arxiv.org/html/2609.19965#bib.bib7)。这些任务以完整的案件事实和嫌疑人画像作为输入,进行前向演绎推理,将证据映射到法律类别以预测刑期和再犯率。然而,这些研究完全集中在刑事调查的逮捕后阶段,忽视了从有限证据推断嫌疑人特征这一关键的逮捕前挑战。参见标题图1:一个真实案例中的犯罪侧写示例,执法人员通过证据和证言细节提取并推断嫌疑人的身份信息和特征,并限定调查范围。颜色指代不同的关键信息,包括武器、过度杀戮、心理状态、动机和职业。在刑事调查的早期阶段,执法人员常常面临零散的证据。这些证据可能揭示犯罪现场和受害者信息,但无法提供关于嫌疑人身份或特征的直接线索[Feshbach(1964)](https://arxiv.org/html/2609.19965#bib.bib13);[Douglas和Burgess(1986)](https://arxiv.org/html/2609.19965#bib.bib9)。因此,他们必须进行犯罪侧写以确定嫌疑人范围。犯罪侧写是一种行为调查技术,从证据和行为特征推断嫌疑人的生理和心理特征[Turvey(2011)](https://arxiv.org/html/2609.19965#bib.bib10)。如图1所示(https://arxiv.org/html/2609.19965#S1.F1),这些特征被用于确定证据优先级、分配资源,甚至推断嫌疑人的活动轨迹[Block和Block(1991)](https://arxiv.org/html/2609.19965#bib.bib14);[Rossmo(2025)](https://arxiv.org/html/2609.19965#bib.bib12)。由于其固有的难度和紧迫性,犯罪侧写长期以来一直由专家完成。LLMs在此任务中的表现仍不清楚。不同于前向演绎推理范式,犯罪侧写需要溯因推理,为一组零散的观察提供最合理的解释[Petherick和Brooks(2021)](https://arxiv.org/html/2609.19965#bib.bib11),这与先前任务相比带来了独特的挑战。为解决这一差距,我们引入了**侧写、调查与判断(PIJ)基准测试**,包含来自中国、美国、英国、澳大利亚和新西兰的2,500个真实凶杀案。该基准系统地评估LLMs在三个任务中的表现: (1) **犯罪侧写**,要求LLMs逆向遍历因果链,推断年龄、性别、动机等隐藏变量; (2) **犯罪过程重建**,其中LLMs从完整案件文本中提取结构化的过程变量,并从多个方面生成简要摘要; (3) **量刑预测**,其中LLMs必须基于完整事实预测刑罚类型。 这些任务涵盖了从证据收集、嫌疑人逮捕到判刑的整个刑事调查流程,从而能够对LLMs在法律和犯罪学任务中的能力进行全面、综合的评估。我们在统一的提示和评分框架下,评估了9个先进的LLMs在三项任务上的表现。结果揭示,虽然LLMs在信息提取和摘要(犯罪过程重建)方面表现尚可,但在需要溯因推理(犯罪侧写)和细粒度法律判断的任务上仍显吃力。LLMs在事实理解与隐含/显式推理之间存在系统性的性能差距。进一步分析揭示了LLMs与人类专家之间的显著差异,以及LLMs在性别、年龄和动机方面固有的偏见。这些发现强调,逮捕前的设置对当前LLMs来说仍然困难重重。我们的贡献如下: - •我们引入逮捕前犯罪侧写作为法律和刑事司法的新LLM评估任务。 - •我们构建了一个包含来自五个国家的2,500个凶杀案的综合基准,利用三个任务评估LLMs在整个刑事调查流程中的表现。 - •我们发现,随着任务从明确的事实重建转向对不明确嫌疑人特征的隐含推理,性能系统性下降。需要推理能力的类别,如动机和关系,仍是LLMs的主要能力瓶颈。 参见标题图2:我们的PIJ基准测试概览,包含标注和评估流程。 ## 2相关工作 ### 2\.1LLMs在法律和犯罪学领域的应用 随着LLMs的出现,研究人员开始关注LLMs在协助法律和犯罪学相关任务方面的应用。[Chalkidis等人(2022)](https://arxiv.org/html/2609.19965#bib.bib16)引入了第一个大规模法律NLP基准测试LexGLUE,涵盖合同理解和司法判决预测等任务。[Ash等人(2023)](https://arxiv.org/html/2609.19965#bib.bib15)构建了包含威斯康星州150万刑事案件的WCLD数据集,包含人口统计信息和犯罪记录等司法信息。[Guha等人(2023)](https://arxiv.org/html/2609.19965#bib.bib17)提出了LegalBench,通过162项任务广泛评估LLMs,揭示了LLMs在复杂法律推理方面的局限性。[Wu等人(2023)](https://arxiv.org/html/2609.19965#bib.bib1)引入了PLJP框架,通过先例检索和上下文学习增强LLMs在判决任务上的表现。[Cai等人(2025)](https://arxiv.org/html/2609.19965#bib.bib18)进一步采用强化学习来优化LLMs的法律知识、逻辑可靠性和泛化能力。[Hall等人(2025)](https://arxiv.org/html/2609.19965#bib.bib3)探讨了高风险决策(如再犯预测)中的偏见,利用公平奖励模型指导LLMs完成高风险任务。[Han等人(2025)](https://arxiv.org/html/2609.19965#bib.bib2)评估了LLMs在动态司法环境中法律变更下的判决预测鲁棒性和偏见。尽管现有工作已深入探索了法律判决等逮捕后任务,但关于逮捕前任务的研究仍然不足。 ### 2\.2LLMs辅助司法系统 LLMs凭借其强大的理解和推理能力,被广泛部署于刑事司法任务中,以协助执法人员。[Kim等人(2024)](https://arxiv.org/html/2609.19965#bib.bib19)提出了一个自动执行合理且合法调查行动的系统,包含一个专门用于犯罪调查法律推理任务的数据集和检索知识库。[Yadav等人(2023)](https://arxiv.org/html/2609.19965#bib.bib22)和[Lodhi与Kassem(2024)](https://arxiv.org/html/2609.19965#bib.bib23)探讨了深度学习和LLMs在法医任务和证据提取中的应用。[Nikolakopoulos等人(2024)](https://arxiv.org/html/2609.19965#bib.bib20)进一步利用检索增强生成(RAG)策略和行为分析技术,使LLMs能够进行复杂推理并生成犯罪现场的法医报告,但忽视了细粒度RAG以及将RAG融入刑事过程推理的重要性[Chen等人(2025)](https://arxiv.org/html/2609.19965#bib.bib37);[Chen等人(2026)](https://arxiv.org/html/2609.19965#bib.bib39)。[Tshimula等人(2024)](https://arxiv.org/html/2609.19965#bib.bib21)利用LLMs分析文本数据以识别威胁行为者的心理特征并创建心理档案。[Chen等人(2024)](https://arxiv.org/html/2609.19965#bib.bib38)探讨了允许模型预测人类意图,而[Liu等人(2024)](https://arxiv.org/html/2609.19965#bib.bib24)发现LLMs普遍倾向于认为人类决策更理性,揭示了LLMs在人类心理侧写方面的潜在缺陷。这些工作展示了LLMs辅助司法系统的巨大潜力,突显了对LLMs在犯罪侧写和刑事调查任务中进行综合评估的迫切需求。 ## 3侧写、调查与判断基准测试 为系统评估LLMs在整个刑事调查流程中的推理能力,我们基于刑事调查任务中信息发现的时间顺序,设计了一个创新的三阶段**侧写、调查与判断(PIJ)基准测试**。在本节中,我们将介绍基准测试的数据来源和分布,以及我们基于各种犯罪学理论构建评估任务的方法。 ### 3\.1数据收集 我们的PIJ基准测试的基础是一个基于真实世界凶杀案精心设计的数据集。我们从五个国家的公开司法记录中获取了2,500个案件:中国[^2]、美国[^3]、英国[^4]、澳大利亚[^5]和新西兰[^6]。我们选择凶杀案是因为它们具有最广泛和详细的事实记录,并且最能代表刑事司法的统一流程。如图2左部分所示(https://arxiv.org/html/2609.19965#S1.F2),每个案件包含全面信息,包括犯罪现场、受害者状况、犯罪过程以及嫌疑人特征。此外,所有这些案件都经过最终判决,罪犯的身份和背景已被明确确定并得到法律验证,从中我们可以提取最终的判决和审判记录。这些严格的纳入标准为评估LLMs能力提供了绝对的基础事实。同时,这些案件来自四大洲的五个国家,涵盖了自1975年以来的各类犯罪事件。这种地理和时间的多样性赋予了数据集强大的泛化能力以及地理和法律体系的多样性。具体的数据分布见附录A.1(https://arxiv.org/html/2609.19965#A1.SS1)。为防止敏感信息泄露,我们已对每个案件中出现的所有具体名称、地点和时间信息进行了脱敏处理。我们使用模糊匹配结合人工审查,用掩码替换所有敏感信息。为区分不同名称和地点,我们根据出现顺序进行顺序掩码(例如,[PERSON_1],[PERSON_2])。对于受害者和嫌疑人,我们使用特殊掩码[VICTIM]和[DEFENDANT]以避免混淆。关于地点,我们仅掩码州/省以下的信息。对于具体时间,我们按时间顺序进行顺序掩码,这使我们能够保留相对时间信息的同时确保信息安全。 表1:PIJ基准测试三个任务的平均结果。DeepSeek-V4-Pro(Reasoning)代表启用了深度思考的DeepSeek-V4-Pro。犯罪过程摘要指犯罪过程重建中的摘要子任务,通过ROUGE-L(%)和BERTScore(%)评估。其他分数为F1(%)。Inc. Unk表示在评估中包含Unknown,而Exc. Unk表示排除。**粗体**分数表示每个任务中的较好结果。 ### 3\.2基于犯罪学理论的任务设计 基于脱敏后的凶杀案数据,我们根据犯罪学理论构建了三个代表刑事调查流程不同阶段的顺序任务。所有任务均由犯罪学专家手动标注,以确保专业性和高质量。对于未包含在特定案件中或无法推断的类别,我们将其标注为Unknown。标注的类别及相应选项见附录A.9(https://arxiv.org/html/2609.19965#A1.SS9)。 #### 3\.2\.1阶段一:犯罪侧写 基准测试的第一阶段通过模拟犯罪侧写任务来评估LLM的溯因推理能力。在先前掩码的基础上,我们进一步消除了所有关于罪犯身份的明确提及,包括年龄、性别、职业等。由于犯罪侧写是在逮捕前阶段进行的,我们移除了逮捕后的审判和量刑背景,仅保留犯罪现场信息和证人证言作为输入(在图2中由绿色虚线箭头表示 https://arxiv.org/html/2609.19965#S1.F2)。基于这个高度受限的输入,LLMs需要溯因推理出未知嫌疑人的10个具体特征。这些特征基于以下三个有影响力的犯罪学理论定义: 理论一:表达性-工具性凶杀分类法[Feshbach(1964)](https://arxiv.org/html/2609.19965#bib.bib13)将凶杀案分为情感驱动的“表达性”和目标驱动的“工具性”,通过分析动机、情绪、计划、受害者关系和行为模式来区分。这两个类别反映了嫌疑人的行为
相似文章
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
人类心理测量问卷误判LLM行为特征
本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。