周三提问:优化自动化法律分诊与转介中的“积极倾听”
摘要
本文介绍了FETCH分类器,它使用大型语言模型集成来为自动化法律受理生成跟进问题,评估问题质量和成本权衡。研究发现,需要GPT-5等高成本模型才能提出有效的平实语言问题,并提出了评估此类问题的评分标准。
arXiv:2606.00272v1 公告类型:新
摘要:FETCH分类器使用低成本的大型语言模型集成生成跟进问题,以帮助优化申请人法律问题的最佳匹配。在本文中,我们描述了一位专家律师和LLM辅助评估FETCH中的跟进问题方法,并表明虽然低成本LLM在分类任务中表现良好,但在这种环境下生成高质量平实语言问题似乎需要更复杂、更高成本的模型。通过与法律受理工作人员的讨论,我们提出了一个用于评估法律受理分类问题的评分标准,并发现仅靠提示工程不足以改善受理目的的问题质量。我们还发现,LLM作为评判者与人类评分存在分歧。我们证明,通过增加单个高成本模型GPT-5,分类器可以从寻求法律帮助的申请人那里获取相关信息,并且这些问题能带来更准确的分类任务表现。我们还发现不同类别(包括家庭暴力)的事实获取不均衡,与家庭法筛查协议不一致,这表明在某些法律领域纳入专门的筛查小组是有价值的。
查看缓存全文
缓存时间: 2026/06/02 15:46
# 每周三,我们提问:优化自动化法律分诊与转介中的“主动倾听” 来源:https://arxiv.org/html/2606.00272 Quinten Steenhuis 和 Jacqueline Harvey 萨福克大学法学院 美国波士顿 \(2026\) ###### 摘要\. FETCH 分类器通过低成本的 LLM 集成,生成后续问题以帮助优化申请人法律问题的最佳匹配。本文描述了一位专家律师与 LLM 辅助评估 FETCH 后续问题方法的过程,并表明:虽然低成本 LLM 在分类任务上表现良好,但在该场景下生成高质量、通俗易懂的问题似乎需要更复杂且成本更高的模型。通过与法律接案工作人员的讨论,我们提出了一套用于评估法律接案分类问题的评分准则,并发现仅靠提示工程不足以提升接案目的下的问题质量。我们还发现 LLM 作为裁判与人工评分之间存在差异。我们证明,在添加单一高成本模型 GPT-5 后,分类器能够从申请法律帮助的申请人那里获取相关信息,并且这些问题能提升分类任务的准确性。我们还发现不同类别(包括家庭暴力)的问题在事实获取上存在不均衡,这与家庭法筛查协议不一致,表明有必要针对特定法律领域设置专门的筛查面板。 法律接案与分诊、法律转介、集成分类、大语言模型、LLM ††版权声明:acm授权 ††期刊年份:2026 ††DOI:XXXXXXX.XXXXXXX ††会议:国际人工智能与法律会议;2026年6月12日;新加坡 ††ISBN:978-1-4503-XXXX-X/2018/06 ††CCS:计算理论 提升 ††CCS:应用计算 政府计算 ††CCS:应用计算 法律 ††CCS:信息系统 问答系统 ††CCS:信息系统 推荐系统 ††CCS:信息系统 专家系统 ## 1. 引言 作为新入职的律师,我们其中一位作者第一次法律接案的对象是一名声称被巫毒娃娃伤害的女性。我们的作者在入职最初几周感到惊讶且不知所措,但还是继续完成了接案。虽然最初的描述看起来像是玩笑或法律无法保护的范围,但在我们作者问够问题后,他们了解到这位新客户实际上正面临室友的暴力威胁。她缺乏法律术语,但这确实是一个法律问题。一旦确定了正确框架来理解客户需求,我们的作者便帮助这位女性获得了限制令。 法律接案对自我代理的诉讼当事人尤其具有挑战性,这类人在美国民事法庭诉讼当事人中约占三分之二(Campbell 等,2025)¹¹¹ 目前尚无国际数据,但世界正义项目(2019)的数据显示,类似比例(约占世界人口三分之二)的人面临严重的司法可及性问题。。这些用户常常难以识别和表达与法律相关的事实,这可能导致案件处理效率低下,并使法律专业人员在最初阶段更难评估诉求(Ajmi 和 Davis,2025)。这表明,接案系统不能依赖用户对问题的单次初始描述,因为关键法律细节可能只有在后续提问中才会浮现。迭代分类——通过后续问题帮助发掘初始叙述中可能未出现的相关细节——是人类接案的重要组成部分。 接案系统往往在接案开始时强迫申请人阐述其法律问题,而申请人可能不知道哪些细节需要分享,可能包含无关信息,或者遗漏关键事实。FETCH(Steenhuis,2026)分类器是一种集成分类器,帮助将申请人对问题的自然语言描述匹配到法律分类体系,进而将申请人与律师对接。FETCH 分类器还使用集成方法生成并合并问题,以改善对申请人法律问题的分类。本文聚焦于: - 影响生成问题质量的因素。 - 生成问题是否能够提高分类准确性。 在本研究过程中,我们与俄勒冈州律师协会的法律接案人员举行了一次小型焦点小组,评估生成问题的质量以及法律转介工具的其他方面。由此,我们制定了一份评分准则,并设计了一项实验,以确定在不进行工具结构性修改的情况下,提示的优化能否提升生成问题的质量。 与我们作者第一次接案中的女性一样,向通用转介平台寻求法律帮助的申请人往往处于弱势,面临驱逐、家庭暴力或收入损失等紧急法律问题。在这种压力情境下,使用通俗语言至关重要,以确保申请人理解所问的问题(Steenhuis 等,2023;Welsh,2013)。这成为焦点小组中一个关键关注领域。 焦点小组中浮现的另一个问题是相关性。广义而言,相关性意味着生成的问题能够帮助申请人将问题缩小到适当的分类,而无需询问不必要的信息。 基于焦点小组的反馈,我们从相关性和可读性两个维度,使用 LLM 评分准则以及专业法律人工评估员来评估生成问题的质量。我们使用 FETCH(Steenhuis,2026)数据集进行问题生成测试,同时结合一小部分由法律接案人员根据过往经验编写、并改编自真实用户查询的新颖人工生成问题。 最后,我们通过提示策略的微小变化(包括在提示中添加少量示例)来探索生成问题质量的变化,并探讨使用能力更强的 LLM 是否能解决仅靠提示工程无法解决的问题。最后,我们提供初步证据,表明高质量问题能够提高分类质量。 ### 1.1. 研究问题 - RQ1:能否使用 LLM 以集成方法生成高质量的法律问题分类澄清问题? - RQ2:LLM 模型评分的评估能否帮助改进澄清问题的生成? - RQ3:澄清问题能否提高 LLM 辅助分类在法律场景中的表现? ## 2. 先前工作 ### 2.1. 人工智能促进司法可及性 人工智能(包括基于规则的专家系统和大语言模型)在通过技术解决司法可及性问题方面日益占据核心地位。参见例如应用于法律信息工具(Branting,2001;Westermann 和 Benyekhlef,2023)、表单填写和专家系统(Steenhuis 和 Colarusso,2021;Steenhuis,即将出版 2024;Westermann,2024)以及争议解决(Westermann,2023;Bickel 等,2015;Branting 等,2022),如 Steenhuis(2026)所引用的。 ### 2.2. AI 用于问题生成与线索资格认定 自动问题生成是现代 LLM 的核心功能(Mulla 和 Gharpure,2023),但该领域历史悠久,先前工作讨论了基于规则的方法和使用语义相似性的检索。其他方法(如逻辑回归和随机森林)已被应用于更广泛的销售线索资格认定任务(Nair 等,2020)。预写问题也被应用于法律接案(Remus 和 Levy,2017)。 ### 2.3. 衡量表单用于司法可及性的可用性 Steenhuis、Willey 和 Colarusso(Steenhuis 等,2023)提出了影响自我代理诉讼当事人表单可用性的五个因素:文本的可读性、提供准确响应的能力、提供完整回答的能力,以及回答所带来的负担(包括时间和心理创伤方面的负担)。Jarrett 和 Gaffney(Jarrett 等,2008)进一步探讨了具体输入选择(例如使用单选按钮和复选框而非开放式问题),这些选择可以减少用户回答时的负担并提高回答的准确性。 GDPR 要求接案问题“适当、相关且有限”(欧洲议会和欧盟理事会,2016),这与 Nielsen Norman 集团关于调查设计的建议(Brown,2023)(建议只问需要回答的问题)以及美国律师协会的法律接案指南(协会,2026)(建议避免“过多细节”)一致。 ### 2.4. AI 用于衡量和提高法律文本的可读性 早期关于衡量可读性的研究,包括 Flesch(1948)以及 Chall 和 Dale(1995),主要侧重于文本中易于测量的机械属性,如句子长度和每个单词的音节数,或者如 Chall 和 Dale(1995)那样将这些属性与词汇相结合。这些指标被批评为过于简单,不足以捕捉实际可读性(Redish,2000;Benjamin,2012)。机器学习方法(如 Sepehri 等,2023;François 等,2020)以及 LLM(Novotná 等,2026)(探索 LLM 衡量词汇意外性的能力)扩展了衡量可读性的灵活性,超越了这些有限的机械特征。 我们的工作聚焦于为法律接案分类生成后续问题,这涉及实际可读性问题(强调可读性、易于提供回答及问题的相关性)。具体到 FETCH 分类器,只有那些有助于将申请人匹配到正确法律帮助来源的问题才相关;而在其他类型的法律接案中,目标可能是获取申请人法律状况的完整图景,以帮助构建案件或辩护。 ## 3. 背景 接案是法律代理中的关键阶段²²²例如,2023 年 Clio 法律趋势报告包括一项面向北美律师的调查,显示律师花费高达 33% 的时间用于业务拓展(Clio,2023),其中包括线索资格认定。,并且可以被视为更广泛的“资格认定”任务的一个子集(Nair 等,2020)。在案件的接案阶段,申请人会向法律办公室分享关于其案件的信息。律师或律师助理必须扮演积极倾听的角色。他们提出的问题必须引导申请人提供关于其问题经历的相关信息。他们将问题与具体法律诉求和救济措施的细节相匹配,同时确保避免让申请人重复叙述或提供对其案件不重要的细节。 申请人往往不知道故事的哪一部分具有法律相关性。在众多法律体系中占用户绝对多数的自我代理诉讼当事人,常常难以识别和阐述关键法律事实,导致程序效率低下和案件处理延迟(Ajmi 和 Davis,2025)。作为回应,结构化接案系统日益依赖引导式、问题驱动的分诊流程,以支持早期问题识别并将案件引导至适当的法律途径。这些系统通过迭代提问来评估案件复杂性、紧迫性和风险等因素,认识到用户初始叙述往往不完整或与法律类别不一致(Ajmi 和 Davis,2025)。然而,对这些系统的实证评估揭示了实施中的重大挑战。对法庭分诊工具的可用性研究表明,用户经常难以理解法律术语、解读问题意图以及导航问题流程,常常导致接案过程中的困惑、犹豫或脱离(Pratt,2024)。用户还报告了对回答将如何被使用的不确定性,以及在理解个别问题目的方面的困难,尤其是当这些问题涉及敏感话题时(Pratt,2024)。这些发现还表明,问题质量的评估不仅应从正确性角度进行,还应根据用户如何理解并回应的情境来进行。在实际操作中,即使技术上准确的问题,如果不符合用户期望或缺乏清晰的对话推进,也可能失败。这凸显了设计反映积极倾听方法的后续问题的重要性,而非仅仅提取额外信息。 在此背景下,接案工作人员的问题可能成为决定用户是否拥有可行法律诉求甚至是否存在法律问题的关键。在其他情况下,用户可能有解决方案,但与其交谈的律师可能无法帮助他们解决该问题。 自动问题生成有潜力扮演基于规则的系统所无法实现的积极倾听角色。通过生成澄清问题,此类系统可以减少跨不同法律领域设计接案流程所需的时间和精力。另一方面,不相关、重复或令人困惑的问题可能会使用户感到沮丧、厌烦,或导致用户在获得法律转介之前放弃。 ## 4. 数据 我们使用 FETCH 数据集(Steenhuis,2026)中的去重子集,并额外添加了 60 个通过俄勒冈州律师协会工作人员进行的实验性临时测试捕获的问题。这些问题使用了根据其转介经验改编的示例,并探索了边缘情况。例如:“一个外星人偷了我的猫和妻子”和“我的邻居整晚不停地吹单簧管”。我们还从此数据集中移除了以下查询:我们
相似文章
更健康的LLMs:面向公共卫生问答的检索增强生成
本文将PubHealthBench扩展至检索增强场景,系统评估了公共卫生问答中的检索与生成选择,结果表明混合检索能提升准确率,且使用检索的较小模型可媲美较大模型。
你的LLM提示词有200行。你真的知道智能体遵从了多少吗?
本文讨论了在生产环境中评估和监控基于LLM的智能体所面临的挑战,涵盖离线评估、提示工程陷阱、可观测性工具、审查队列、标注、聚类、主题分类,以及将人工审查、LLM作为评判和小型分类器进行成本分层的方法。
当病例罕见时:面向非指南临床问答的检索基准
介绍 OGCaReBench,这是一个自由形式的检索基准,用于评估 LLM 在需要超越标准指南推理的临床问题上的表现。实验表明,即使是最好的模型也仅能达到 56% 的准确率,但检索增强将性能提升至 82%。
面向在线患者咨询的可操作分诊分类的小样本大语言模型
本文探讨了使用小样本提示的大语言模型对在线患者咨询进行可操作分诊分类,分为自我护理、预约就诊、紧急临床审查或急诊转诊。最佳模型(Claude Haiku 4.5,12次小样本提示)的macro-F1达到0.475,超过了有监督基线,但作者得出结论:LLMs可以支持分诊优先级排序和选择性人工审核,但不能自主部署。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。