被告陈述何时重要?LLM模拟陪审员中的偏见与说服研究
摘要
本研究探讨了被告陈述如何影响LLM模拟陪审员,重点关注说服、意识形态偏见和背景亲和性,并介绍了用于争议性刑事案件的JuryBench基准。
arXiv:2609.09887v1 Announce Type: new
摘要:大型语言模型已被用于模拟专业环境中的人类决策行为,但其在普通法系陪审团审判中的表现尚未得到探索。我们研究被告法庭陈述在何时以及如何影响LLM模拟的陪审员,重点关注说服、意识形态偏见和基于背景的亲和性。为支持分析,我们引入了JuryBench基准,其中包含美国刑法中的争议性刑事案件。在每个案件中,被告可以提出各种合理的辩护理由以支持无罪或减轻责任。我们固定基础案件,并设计具有不同背景的被告,他们提供具有不同情感吸引力或反驳的法庭陈述。模拟了具有不同意识形态背景的陪审员。我们研究了20个前沿LLM,共产生43.2万个决策和理由,并量化了判决严重性的变化。我们的研究发现,LLM陪审团模拟反映了许多人类陪审团的发现。首先,情感说服可能有害,因为陪审员可能将其视为有罪或不一致的证据。其次,我们表明,陪审员和被告之间的背景契合度比其他孤立因素更强大且显著,并且陪审员通常对背景相反的被告更严厉,对背景相同的被告更宽容。最后,我们发现陪审员的意识形态也强烈影响严重性判断。这些发现突显了使用LLM模拟陪审团推理的前景和风险,并呼吁进行谨慎评估。数据和代码可在https://github.com/choyingw/JuryBench获取。
查看缓存全文
缓存时间: 2026/09/10 08:16
# 被告陈述何时重要?LLM模拟陪审团中的偏见与说服力研究 来源:https://arxiv.org/html/2609.09887 ###### 摘要 大语言模型已被用于模拟专业场景中的人类决策行为,但它们在普通法系陪审团审判中的表现仍待探索。本研究探讨了被告的法庭陈述在何时以及如何影响LLM模拟的陪审员,重点关注说服力、意识形态偏见及基于背景的认同感。为支持分析,我们引入了JuryBench基准数据集,包含美国刑法中的争议性刑事案件。在每个案件中,被告均可提出多种合理的辩护理由以支持无罪或减轻责任。我们固定基础案件并设计不同背景的被告,他们会发表带有不同情感诉求或反驳的法庭陈述。我们模拟了具有不同意识形态背景的陪审员群体。通过对20个前沿LLM的评估,共产生432K个裁决及理由,并量化了裁决严重程度的变化。研究发现LLM陪审团模拟复现了许多人类陪审团的研究结论:首先,情感说服可能适得其反,因为陪审员可能将其视为有罪或前后矛盾的证据;其次,我们发现陪审员与被告之间的背景契合度比其他孤立因素更具显著影响力,陪审员通常对背景迥异的被告更为严苛,对背景相似的被告更为宽容;最后,陪审员的意识形态也强烈影响其判决严厉程度。这些发现揭示了使用LLM模拟陪审团推理的潜力和风险,并呼吁进行审慎评估。111数据和代码详见https://github.com/choyingw/JuryBench 图1:我们的框架设计了争议性案件场景并模拟被告与陪审员画像,以研究LLM陪审团如何决策,特别是如何回应情感说服。## 1引言 大语言模型在模拟专业场景交互方面展现出强大能力,例如医患互动Kyung等(2025) (https://arxiv.org/html/2609.09887#bib.bib33);Du等(2025) (https://arxiv.org/html/2609.09887#bib.bib15);Almansoori等(2025) (https://arxiv.org/html/2609.09887#bib.bib3);Fan等(2025) (https://arxiv.org/html/2609.09887#bib.bib18),课堂场景Zhang等(2025) (https://arxiv.org/html/2609.09887#bib.bib61);Sanyal等(2025) (https://arxiv.org/html/2609.09887#bib.bib48);Mannekote等(2025) (https://arxiv.org/html/2609.09887#bib.bib37),以及心理治疗Iftikhar等(2025) (https://arxiv.org/html/2609.09887#bib.bib29)。在司法领域,LLM已被用于模拟法庭辩论和判决Yue等(2025) (https://arxiv.org/html/2609.09887#bib.bib60);Almansoori等(2025) (https://arxiv.org/html/2609.09887#bib.bib3),但均基于大陆法系。然而,在普通法系中,根本区别在于大多数刑事案件中都设有陪审团(详细比较见附录E (https://arxiv.org/html/2609.09887#A5))。陪审团由十二名从公众中选拔、未经法律训练的人员组成,其职能是确定事实和裁决。这包括聆听案件详情、了解被告背景、评估证据或证人的可信度、听取证言(包括被告在质询后的陈述),并最终裁定被告是否犯罪;而起诉罪名和量刑则由检察官和法官决定。例如,被告声称只打算殴打受害者而非致其死亡,陪审团会评估证据(如是否击中要害部位)来判定被告是否犯有过失杀人罪。 更重要的是,证据和证人可信度、被告陈述的可靠性以及被告是否具备有效的辩护理由222辩护理由是使被告免责的一种抗辩形式,如正当防卫、受胁迫行为、紧急避险等。陪审团需裁定该理由是否适用。例如,因被追赶而闯入商店的人可能主张紧急避险,但陪审团可能不被说服,因为无法明确其是否面临即时危险。,均需基于陪审团的常识、生活经验、道德信念乃至意识形态进行评估Anwar等(2019) (https://arxiv.org/html/2609.09887#bib.bib4)。最终裁决由全体陪审员投票产生,需达成一致;若未能达成一致,法官将宣布审判无效(非无罪),检察官需寻找更多证据或申请更换陪审员。 在普通法系中,陪审团遴选至关重要。由于陪审员缺乏法律训练,法庭辩论不同于大陆法系中聚焦法律规则适用和解释的模式。在普通法系下,焦点转向叙事构建和对陪审团的情感说服,其中陪审团的偏见必然存在,需仔细研究。需注意,较高的情绪感染力可能有助于说服陪审团Erickson等(1978) (https://arxiv.org/html/2609.09887#bib.bib16);Bornstein和Greene(2011) (https://arxiv.org/html/2609.09887#bib.bib6),但过度修辞或表演性的情感诉求可能产生负面影响Cramer等(2009) (https://arxiv.org/html/2609.09887#bib.bib13);Choi等(2023) (https://arxiv.org/html/2609.09887#bib.bib10)。 为在法庭上争取有利结果,检察官和被告律师均可提出回避申请333陪审团遴选回避是法律赋予的权利,且在审判中常规使用。在大多数情况下,律师仍需详细说明理由(并经法官进一步审查)来排除陪审员,且理由不能基于种族或性别等人口特征,或简单依赖未经证实的LLM发现。,在背景调查后更换可能对己方持有敌对偏见的陪审员。如今律师通常在庭审前组建焦点小组,招募与陪审团背景相似的人预先模拟案件审判,以了解潜在偏见。该过程帮助被告律师制定新策略或寻求陪审员替换。实践中部分律师已开始使用LLM陪审团进行模拟审判,修正庭审策略,更重要的是调整向陪审团传递可能引发情感共鸣的陈述和信息。然而,目前尚无研究探讨LLM扮演陪审员角色的能力,包括每个前沿LLM的行为特征、LLM陪审团对情感化被告陈述的反应、影响每个LLM的关键因素、不同意识形态的LLM如何模拟陪审员,以及其决策是否反映与被告及陪审员背景相关的偏见。本研究首次系统性分析LLM陪审团以回应这些问题。 我们提出JuryBench,包含基于美国刑法的500起高度争议案件,被告主张多种合理的辩护理由或其他依据以争取无罪或减轻指控。每个案件固定基础背景和现有证据,但设计不同的被告及其背景(如一个符合常见刻板印象,另一个颠覆刻板印象)。我们设计并分析了12位不同意识形态的陪审员,涵盖其针对每个案件的决策及理由。共评估20个前沿LLM,产生432K个陪审员决策及理由。 贡献总结如下: - •我们首次针对普通法系核心动力——情感说服,对LLM陪审团进行研究,分析陪审团偏见并解读其决策背后的逻辑。 - •我们提出JuryBench基准:包含500起高度争议刑事案件、约400种潜在指控、多样化被告与陪审员背景,以及支持无罪或减责的长篇被告陈述。 - •我们全面评估20个前沿LLM,生成432K个带理由的陪审员决策,分析其行为并将发现与法律心理学相关联。 ## 2相关工作 ### 2\.1司法领域的人工智能 人工智能在司法领域的早期发展包括法律判决预测——基于判决文书预测被告将被指控的罪名及刑期Masala等(2021) (https://arxiv.org/html/2609.09887#bib.bib39);Han等(2025b) (https://arxiv.org/html/2609.09887#bib.bib24);Hwang等(2022) (https://arxiv.org/html/2609.09887#bib.bib28);Trautmann等(2022) (https://arxiv.org/html/2609.09887#bib.bib54);Liu等(2023) (https://arxiv.org/html/2609.09887#bib.bib35);Strickson和De La Iglesia(2020) (https://arxiv.org/html/2609.09887#bib.bib53);Feng等(2022) (https://arxiv.org/html/2609.09887#bib.bib20);Xiao等(2018) (https://arxiv.org/html/2609.09887#bib.bib59);Hu等(2026) (https://arxiv.org/html/2609.09887#bib.bib27);法律语言理解与推理——研究模型如何阅读、解释和推理法律文本Chalkidis等(2022) (https://arxiv.org/html/2609.09887#bib.bib7);Fei等(2023) (https://arxiv.org/html/2609.09887#bib.bib19);Guha等(2023) (https://arxiv.org/html/2609.09887#bib.bib22);Han等(2025a) (https://arxiv.org/html/2609.09887#bib.bib23);Chlapanis等(2025) (https://arxiv.org/html/2609.09887#bib.bib9);Akarajaradwong等(2025) (https://arxiv.org/html/2609.09887#bib.bib2);法律问答与检索——查找相关法律依据或证据以支持问答Louis等(2024) (https://arxiv.org/html/2609.09887#bib.bib36);Abdallah等(2023) (https://arxiv.org/html/2609.09887#bib.bib1);Ryu等(2023) (https://arxiv.org/html/2609.09887#bib.bib46);Li等(2023) (https://arxiv.org/html/2609.09887#bib.bib34);Dai等(2025) (https://arxiv.org/html/2609.09887#bib.bib14);Yue等(2025) (https://arxiv.org/html/2609.09887#bib.bib60)。 尽管这些工作对单一任务有贡献,但它们未充分利用LLM智能体进行法庭模拟的能力。有两项工作与我们相近:AgentsCourtHe等(2024) (https://arxiv.org/html/2609.09887#bib.bib25)模拟法庭辩论和最终判决,但其辩论基于判决文书——法官已作出裁决并以简洁结论性方式陈述案件事实。因此,被告进行实质性论证的空间有限,其陈述在许多案件中退化为多轮重复表达悔意,如“再次,我深表歉意……”;而我们聚焦于高度争议场景,被告可提出有效主张。另一项工作AgentCourtChen等(2025) (https://arxiv.org/html/2609.09887#bib.bib8)关注法律规则的适用和解释,但未探讨陪审团如何权衡涉及被告的冲突法律利益。更重要的是,这两项工作均基于大陆法系,其法庭辩论自然围绕需要密集法律语言的法律条文展开。我们的工作聚焦普通法系,其中非专业陪审员评估事实和裁决,法庭辩论常诉诸常识、说服力和情感。本研究开创性地走在了该领域的前沿,与现有工作有本质区别。 ### 2\.2人类陪审团偏见 陪审团偏见在法律心理学领域已被广泛研究。部分工作指出偏见形成于极早期阶段,如开场陈述或陪审员了解被告背景时Kramer等(1990) (https://arxiv.org/html/2609.09887#bib.bib32);Kalven等(1966) (https://arxiv.org/html/2609.09887#bib.bib30),后续研究指出陪审员可能试图强化其基于第一印象构建的故事。这种偏见可能涉及陪审员与被告背景的相似性。陪审员可能对与自己相似者表现出宽容,而对外人可能更严苛Kerr等(1995) (https://arxiv.org/html/2609.09887#bib.bib31);Rhodes等(2025) (https://arxiv.org/html/2609.09887#bib.bib45);Foresta(2025) (https://arxiv.org/html/2609.09887#bib.bib21)。然而,有研究指出在少数情况下存在“黑羊效应”,即陪审员对与自己背景相似但违背核心价值观的被告可能比对外人更为严厉Kerr等(1995) (https://arxiv.org/html/2609.09887#bib.bib31);Marques等(1988) (https://arxiv.org/html/2609.09887#bib.bib38)。此外,偏见也可能涉及意识形态。部分研究表明,持保守态度的陪审员比自由派陪审员更可能支持有罪裁决Pyo(2025) (https://arxiv.org/html/2609.09887#bib.bib44);Clark和Wink(2012) (https://arxiv.org/html/2609.09887#bib.bib11);Anwar等(2019) (https://arxiv.org/html/2609.09887#bib.bib4)。 ### 2\.3用于人格模拟的LLM 人格模拟已被应用于LLM以实现通用对话目的Wang等(2025b) (https://arxiv.org/html/2609.09887#bib.bib57);Hu和Collier(2024) (https://arxiv.org/html/2609.09887#bib.bib26);Ni等(2026) (https://arxiv.org/html/2609.09887#bib.bib40);Wang等(2025c) (https://arxiv.org/html/2609.09887#bib.bib58),或特定领域如医患互动Kyung等(2025) (https://arxiv.org/html/2609.09887#bib.bib33)和心理健康筛查Wang等(2025a) (https://arxiv.org/html/2609.09887#bib.bib56)。该模拟并未显式指示模型说什么或如何反应,而是隐式设置引导智能体响应的内部人格,这可能不会明确揭示个人背景。然而,人格模拟尚未应用于法律领域,特别是检验LLM陪审团是否表现出与人类相似的偏见。本研究分析了不同人格是否影响审判结果。 ## 3模拟框架 为分析LLM陪审团,我们需要包含详细被告背景、基础案件场景、法庭陈述和每位陪审员背景的数据。具体而言,我们需要具有争议性和可辩性的案件来理解模型的推理过程。判决文书通常仅包含基础案件场景,缺乏其他材料,且存在与先前工作He等(2024) (https://arxiv.org/html/2609.09887#bib.bib25)相同的顾虑:这些文书由法官在判决和量刑确定后撰写,事实经过筛选并以结论性方式呈现,无法反映审判过程中的不确定性。此外,为保护隐私和安全(如美国联邦法院公开访问限制此类信息泄露),陪审员档案、意识形态及被告的详细背景未被记录或公开披露(部分信息被故意封存且不完整,尤其刑事案为避免报复)。 因此,我们采用LLM与人类专家协作来生成所需材料。 ### 3\.1案件生成 我们首先使用GPT\-5\.4生成500起符合美国刑法、涵盖约400种潜在刑事指控的争议性可辩案件,并将其写入\.json文件。每个条目包含"defenda
相似文章
忠实还是虚构?LLM评审中合理化偏见的因果框架
本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。
LLM裁判存在暗电流:用于LLM-as-a-Judge评估的心理测量数据表
本文介绍了一种心理测量数据表协议,用于将LLM裁判作为测量工具进行评估,测量暗电流、位置虚假偏好、稳定交叉敏感性和目标敏感性。基于三个开放权重模型的案例研究揭示了裁判质量和行为的显著差异。
解读言外之意:法律模拟中行为真实性的建模与评估
本文介绍了WitnessSim,一个使用可控法律角色扮演的证词模拟器,以及一个用于评估法律模拟中行为真实性的评估框架。
Polar:评估LLM政治偏见的基准
Polar是一个包含4,026个多选题的基准,用于评估LLM在美国和韩国政治背景下的政治偏见,通过选项级似然度来测量偏见。对38个LLM的实验显示,系统性偏见模式因政治背景、议题类别和呈现语言而异。
FairFund-Bench:评估LLM资源分配中的分配偏差
介绍了FairFund-Bench,一个用于评估LLM资源分配中分配偏差的基准,表明审计格式会改变偏差的方向和幅度,且因果框架效应显著超过人口统计效应。