解读言外之意:法律模拟中行为真实性的建模与评估

arXiv cs.CL 论文

摘要

本文介绍了WitnessSim,一个使用可控法律角色扮演的证词模拟器,以及一个用于评估法律模拟中行为真实性的评估框架。

arXiv:2608.13712v1 公告类型:跨领域 摘要:证词培训要求律师管理动态的证人行为,然而法律AI评估主要集中在事实准确性、推理或响应层面的合理性上。我们介绍了WitnessSim,一个由可控法律角色驱动的证词模拟器。我们使用一个将行为真实性与教学实用性分开的评估框架。我们通过对抗性测试、盲法律师比较和纵向行为轨迹分析来评估真实性。WitnessSim通常保持了合理的行为边界,律师并没有系统性地偏好原始证词或WitnessSim生成的证词。教学测试表明,证人行为在应对问题形式和律师干预时发生了有意义的变化,而没有统一地崩溃分配的角色。总之,这些结果展示了法律模拟中行为保真度的一个模型,并为其性能评估提供了一个框架。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:03

# 解读行间深意:法律模拟中行为真实性的建模与评估
来源:[https://arxiv.org/html/2608.13712](https://arxiv.org/html/2608.13712)
Divya Vetticaden  
通讯作者:[[email protected]](mailto:[email protected])  
所属机构:美国加利福尼亚州斯坦福大学  
Arya Gupta  
通讯作者:[[email protected]](mailto:[email protected])  
所属机构:美国加利福尼亚州斯坦福大学  
Megan Ma  
所属机构:美国加利福尼亚州斯坦福大学  

###### 摘要  
庭外证词质询训练要求律师应对动态的证人行为,然而当前法律AI评估主要关注事实准确性、推理能力或单个回答的合理性。我们推出了**WitnessSim**——一个由可控法律角色驱动的庭外证词质询模拟器。我们采用了一种将行为真实性与教学实用性分离开来的评估框架。我们通过对抗性测试、盲法律师比较分析以及纵向行为轨迹分析来评估真实性。WitnessSim总体上维持了合理的行为边界,律师们并未系统性地偏好原始证词或WitnessSim生成的证词。教学测试表明,证人行为会根据提问形式和律师干预发生有意义的变化,同时并未完全崩解所分配的角色特征。这些结果共同展示了法律模拟中行为保真度的模型,并为其性能评估提供了框架。  

###### 关键词:机器学习,ICML  
††附属机构说明:\*代表共同第一作者身份。  

## 1 引言  
庭外证词质询是诉讼中具有战略关键性的阶段,需要妥善学习。然而,初级律师通常通过耗时且不一致的模拟练习,或在高风险的真实质询中参与实践。这些局限性在资源有限的法律机构中尤为突出。此外,有效的质询实践需要学习如何应对不切题的证词、迫使回答具体化、识别矛盾、管理抵触情绪,以及适应证人变得回避、防御、敌对、焦虑或疲惫等情况。这些人际交往和行为技能是质询实践的核心,但目前的法律AI基准测试主要评估事实准确性、法律推理或在孤立问题上的表现,对此尚未充分涉及。基于LLM的模拟为律师提供了反复且可配置的实践机会来练习这些技能。因此,我们推出了**WitnessSim**——一个基于动态角色的庭外证词质询训练系统,旨在模拟具有不同行为原型的证人。WitnessSim根据案件基础材料实例化一个证人,并随着质询的推进,更新一个可解释的、代表多个心理和行为维度的状态表示。这些更新由律师提问的特征驱动,包括压力、话题敏感性和提问形式,并用于调节证人后续的回应。这种结构旨在使行为演变过程变得可解释、可检查,而不是依赖于底层语言模型潜在且不精确的对话状态。然而,一个核心挑战在于评估:什么使得一个模拟证人对法律训练有效?仅仅生成看似合理的个别回答是不够的。一个证人可能表面上看起来真实,却无法对压力、矛盾或质询策略的变化做出有意义的回应。相反,一个模拟器可能生成具有战略难度的交互,但产生的行为却不像自然证词。因此,评估必须同时考虑证人行为是否可信,以及交互过程是否为律师提供了练习具有法律意义技能的机会。因此,我们从两个互补的维度评估WitnessSim:行为真实性和教学实用性。行为真实性层关注生成的证词是否可能由人类证人产生,以及证人是否在整个交互过程中保持连贯的行为身份。它结合了对抗性测试、专家对情境合理性的评估,以及对证人态度随时间变化的情感评估。教学实用性层则关注WitnessSim是否产生了律师在实践中需要识别和处理的那种困难交互。我们基于对法律培训材料和经验丰富的律师反馈的审查来构建此评估,将反复出现的培训目标转化为测试:证人是否对压力、提问形式、敏感话题、矛盾和特定原型的质询策略做出恰当反应。最后,我们使用从**国家处方阿片类药物诉讼案**(案号:1:17-MD-2804,一项针对阿片类药物制造商、分销商和药房的联邦多地区诉讼)的1169份候选笔录中随机抽取的300份庭外证词和审判笔录语料库,以及使用WitnessSim生成的合成交互,对该框架进行了评估。我们的贡献如下:首先,我们引入了WitnessSim,一个可控的、基于状态的系统,用于模拟庭外证词质询中的动态证人行为。其次,我们开发了一个将行为真实性与教学实用性区分开来的评估框架。该框架通过对抗性测试、专家对情境合理性的评估,以及一种新颖的、探索性的情绪向量分析来操作化“真实性”;同时通过基于法律的测试来评估“教学实用性”,考察证人行为是否制造了可识别的挑战,并对律师干预是否做出了有意义的回应。这些贡献共同将庭外证词质询模拟定义为一个动态的、多轮次的问题,其模拟质量不仅取决于看似合理的个别回答,还取决于行为在交互和质询过程中的发展方式。  

## 2 相关工作  
本研究涉及三个领域的交叉:基于LLM的社会与角色模拟、情感与对话行为建模,以及用于专业培训的模拟。  
**基于LLM的社会与角色模拟**。近期研究表明,LLM智能体可以生成连贯的个体和集体社会行为。“生成智能体”(Generative Agents)证明了智能体能够形成日常惯例、对事件做出反应并维持开放式的社会交互;而(6)(https://arxiv.org/html/2608.13712#bib.bib22)将这项工作扩展到再现社区层面模式(如同质性)(15)(https://arxiv.org/html/2608.13712#bib.bib6)的更大人群。在这些情境中,“保真度”被广泛定义为连贯且可识别为人类的行为,而非与特定个人回应的一致性。更紧密贴合现实的方法则试图从访谈或调查中复制个体态度和行为模式。(16)(https://arxiv.org/html/2608.13712#bib.bib23)构建代表特定个体的智能体,而(26)(https://arxiv.org/html/2608.13712#bib.bib24)则通过心理测量信度、结构效度、异质性和行为预测来评估人格模拟。这些研究共同将人格视为一个潜在构念,应在不同情境下产生一致的行为。基于角色的模拟介于开放式社会建模和复制特定个体之间。PersonaGym和Eval4Sim等基准测试评估行为是否在变化的情境下保持与指定角色一致且合理,使用的维度包括角色遵循度、身份一致性和对话自然度(1)(https://arxiv.org/html/2608.13712#bib.bib7);20(https://arxiv.org/html/2608.13712#bib.bib25))。(10)(https://arxiv.org/html/2608.13712#bib.bib26)进一步表明,底层特质的指定方式会实质性地影响生成的行为、多样性、对齐性和刻板印象。这项工作确立了角色构建和特质定义塑造模拟输出的观点,但主要评估的是单个回答层面的一致性,而非在持续对抗性交互中的行为。在法律领域,AgentCourt(3)(https://arxiv.org/html/2608.13712#bib.bib8)和SimCourt(28)(https://arxiv.org/html/2608.13712#bib.bib9)建模法庭程序,强调程序结构、法律推理和智能体表现;而LegalBench(5)(https://arxiv.org/html/2608.13712#bib.bib11)等基准测试则评估规则回忆、问题识别和法律应用等能力。WitnessSim在此基础上增加了一个互补的评估单位和维度:单个证人在持续质询下的行为。WitnessSim并非评估模型能否复制法律过程或得出法律上恰当的答案,而是询问模拟的证人能否保持连贯的角色身份、对对抗性压力做出合理回应,并为律师创造行为上有意义的挑战。因此,它将现有的法律AI模拟和基准测试从复制和衡量程序与学理能力,扩展到了塑造法律实践的人际互动动态。  
**情感与对话行为建模**。情感计算研究探讨情感、人格和人际行为如何以计算方式表示和衡量(17)(https://arxiv.org/html/2608.13712#bib.bib1))。对话层面的情感识别模型日益将情感视为依赖于交互历史:DialogueGCN(4)(https://arxiv.org/html/2608.13712#bib.bib3)建模说话者内和说话者间的依赖关系,EmoRoBERTa(9)(https://arxiv.org/html/2608.13712#bib.bib4)整合说话者身份,DialogXL(22)(https://arxiv.org/html/2608.13712#bib.bib5)维持更长程的话语上下文。这些方法促使我们评估跨越对话的证人行为,而非将每个回答视为独立。互补性工作探讨了心理特征如何塑造生成的语言。PsychAdapter(25)(https://arxiv.org/html/2608.13712#bib.bib27)根据连续的人格、人口统计和心理健康状况对语言模型进行条件化,证明心理表示可用于控制生成行为。(23)(https://arxiv.org/html/2608.13712#bib.bib2)识别了模型激活中情感概念的方向性表示,并表明它们能跟踪情感语境并影响生成过程。我们采用这种情绪向量方法作为轨迹层面情感动态的探索性度量。更广泛地说,WitnessSim将人际行为视为必须在交互过程中生成和评估的东西。  
**用于专业培训的LLM模拟**。仅有行为保真度并不能使模拟器对培训有用;交互还必须为实践预期技能创造机会。基于LLM的角色扮演通过支持反复练习,且无需持续依赖教练或标准化参与者,已在谈判、冲突解决、咨询和医学等领域支持了培训。AI Partner–AI Mentor框架(27)(https://arxiv.org/html/2608.13712#bib.bib12)结合了体验式角色扮演和个性化反馈,而Rehearsal(21)(https://arxiv.org/html/2608.13712#bib.bib13)允许用户练习困难冲突并探索替代策略。(14)(https://arxiv.org/html/2608.13712#bib.bib28)进一步表明,基于大五人格模型的条件化会产生系统性的谈判行为差异,包括协议、利用、毒性和语言使用,证明人格条件化可以创造独特的互动挑战。因此,专业培训系统的评估不仅限于对话质量,还包括学员策略、专家判断、感知有用性和学习成果。例如,Rehearsal比较了基于模拟和基于讲座的教学后冲突解决策略的使用情况。在法律教育领域,(19)(https://arxiv.org/html/2608.13712#bib.bib29)在一项体验式商法练习中使用了AI生成的合同语言,并通过参与度、批判性思维和学理学习进行评估。更直接地,AI辅助模拟法庭(29)(https://arxiv.org/html/2608.13712#bib.bib10)将真实性与教学实用性区分开来:其真实性评估询问模拟的法官提问是否类似于真实的提问,而教学评估则询问这些提问是否揭示了辩论者应练习应对的问题和弱点。证人模拟需要同样的区分,但训练目标不同。辩论模拟器应让辩论者接触法律和论证上的弱点,而证人模拟器必须创造律师能够识别和管理的行为挑战。因此,WitnessSim同时评估证人行为是否保持合理和连贯,以及其对法律相关干预是否做出有意义的回应。  
综上所述,先前工作表明LLM可以模拟看似合理的社会智能体、表达指定角色、建模情感行为并支持专业角色扮演。然而,如何评估一个质量取决于持续对抗性交互中行为的证人模拟器,仍是未解之题。看似合理的个别回应无法确立纵向的行为保真度,表面的真实性也无法确立培训相关性。WitnessSim通过将庭外证词质询模拟视为行为真实性和教学评估问题来填补这一空白。我们评估模拟的证人是否随时间保持了合理的行为身份,以及它们是否创造了可识别的质询挑战,并对律师提问做出有意义的回应。这将角色模拟和对话行为建模与法律培训的具体需求联系起来。  

## 3 方法  
### 3.1 WitnessSim  
WitnessSim是一个围绕连续动力系统构建的庭外证词质询模拟器,该系统建模证人在对抗性质询下心理状态的演变过程。每个回答的内容都基于一个六维状态向量进行调节,该向量根据律师提问的特征进行确定性更新,最终为LLM的生成提供条件。  
#### 3.1.1 状态空间与原型  
在质询轮次 t,证人由状态向量 yt=(Ct, Kt, At, Vt, Rt, Pt) ∈ [0,1]⁶ 表示,\\(\\mathbf{y}_\\{t\\}=\\left(C_\\{t\\}, K_\\{t\\}, A_\\{t\\}, V_\\{t\\}, R_\\{t\\}, P_\\{t\\}\\right)\\in[0,1]^\\{6\\}\\),(1)其中C、K、A、V、R和P分别表示*镇定度*、*知识水平*、*随和度*、*话语量*、*刻板度*和*表现力*。镇定度大致对应神经质的反向指标,随和度保留其传统解释,刻板度大致对应开放性的反向指标。知识水平、话语量和表现力捕捉了传统大五人格维度无法清晰代表的、质询特有的行为。我们最初基于专家意见确定了十四个候选原型。每个候选原型被表示为六维状态空间中的一个点,使用成对的余弦相似度和角度分离来识别行为特征无显著差异的候选原型。此过程产生了本研究使用的十个原型:*好斗型*、*合作型*、*防御型*、*教条型*、*机智型*、*健谈型*、*紧张型*、*中立型*、*过度自信型*和*过度准备型*。完整的保留原型向量及其近似的大五人格投影详见报告。

相似文章

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。

重新思考基于LLM的社会模拟评估与优化

arXiv cs.AI

本文引入了一个主观性系数来解决基于准确率评估LLM社会模拟的局限性,提出了适应主观性的软标签训练(SALT)进行优化,并构建了SubjSim基准测试以针对完整响应分布进行评估。