DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL 论文

摘要

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。

arXiv:2606.13931v1 公告类型:新提交 摘要:律师与客户的咨询是法律服务的关键起点。有效的法律援助依赖于从客户那里获取足够且真实的信息,以便制定最能保护其利益的策略。这一任务要求大语言模型(LLMs)不仅要具备强大的法律推理能力,还要通过多轮互动战略性地挖掘重要事实,并有效引导具有不同个性的客户。然而,现有的法律基准忽略了这种交互能力。为填补这一空白,我们提出了DLawBench,一个面向真实世界法律咨询的诊断基准。基于真实的客户行为,我们将律师-客户互动分为四种类型:合作型、依赖型、退缩型和对抗型。使用基于真实案例的对话,DLawBench评估大语言模型是否能在真实条件下有效进行法律咨询。DLawBench包含来自中国和美国法律的461个案例、5532个配对事实条目、3411个查询准则和3348个问题解决准则,并评估了26个代表性大语言模型。系统实验表明,仍有很大的提升空间:表现最佳的模型GPT-5.5仅在基于咨询的法律推理上达到0.562。更重要的是,DLawBench揭示了法律咨询中的阿谀奉承现象以及一个悖论:当客户最需要指导时,模型的表现反而更差。
查看原文
查看缓存全文

缓存时间: 2026/06/15 08:56

# DLawBench:通过多轮法律咨询评估大语言模型
来源:https://arxiv.org/abs/2606.13931
作者:Li Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L), Yuzhen Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+Y), Yiran Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+Y), Jingwen Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+J), Wenbo Lv (https://arxiv.org/search/cs?searchtype=author&query=Lv,+W), Yubo Ma (https://arxiv.org/search/cs?searchtype=author&query=Ma,+Y), Wei Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+W), Rongyao Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+R), Yuanyang Qiu (https://arxiv.org/search/cs?searchtype=author&query=Qiu,+Y), Xinran Xu (https://arxiv.org/search/cs?searchtype=author&query=Xu,+X), Yuemeng Qi (https://arxiv.org/search/cs?searchtype=author&query=Qi,+Y), Linlin Miao (https://arxiv.org/search/cs?searchtype=author&query=Miao,+L), Jaromir Savelka (https://arxiv.org/search/cs?searchtype=author&query=Savelka,+J), Yun Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Y), Kevin Ashley (https://arxiv.org/search/cs?searchtype=author&query=Ashley,+K), Bing Zhao (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+B), Hu Wei (https://arxiv.org/search/cs?searchtype=author&query=Wei,+H), Lin Qu (https://arxiv.org/search/cs?searchtype=author&query=Qu,+L)

查看PDF (https://arxiv.org/pdf/2606.13931)

> 摘要:律师与客户之间的咨询是法律服务的关键起点。有效的法律帮助依赖于从客户那里获取充分且真实的信息,以便制定最能保护其利益的策略。这一任务要求大语言模型不仅具备稳健的法律推理能力,还能通过多轮互动策略性地获取关键事实,并有效引导具有不同个性的客户。然而,现有的法律基准忽略了这种互动能力。为填补这一空白,我们引入了DLawBench,一个用于评估真实世界法律咨询的诊断基准。基于真实的客户行为,我们将律师-客户互动分为四种类型:合作型、依赖型、退缩型和对抗型。利用基于真实案例的对话,DLawBench评估大语言模型在实际条件下能否有效进行法律咨询。DLawBench包含来自中国和美国法律的461个案例,5,532对事实条目,3,411个询问评估标准,以及3,348个问题解决评估标准,并评估了26个代表性的大语言模型。系统实验表明存在巨大的提升空间:表现最好的模型GPT-5.5在基于咨询的法律推理上仅达到0.562。更重要的是,DLawBench揭示了法律咨询中的谄媚行为以及一个悖论:在客户最需要指导时,模型的表现反而更差。

## 提交历史

来自:Li Zhang \[发送邮件 (https://arxiv.org/show-email/6d8a5ff3/2606.13931)\] **\[v1\]**2026年6月11日 星期四 21:50:44 UTC (2,842 KB)

相似文章

TW-LegalBench: 衡量台湾法律理解能力

arXiv cs.CL

TW-LegalBench 是一个评估大型语言模型在台湾法律理解能力方面的基准,包含超过16,000道选择题、117道论述题和14,000个法律判决预测实例。结果显示,顶级模型超过了律师考试及格线,但未达到法官和检察官的水平,凸显了在法律文本生成可靠性方面的挑战。