DLawBench:通过多轮法律咨询评估大语言模型
摘要
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
查看缓存全文
缓存时间: 2026/06/15 08:56
# DLawBench:通过多轮法律咨询评估大语言模型 来源:https://arxiv.org/abs/2606.13931 作者:Li Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L), Yuzhen Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+Y), Yiran Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+Y), Jingwen Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+J), Wenbo Lv (https://arxiv.org/search/cs?searchtype=author&query=Lv,+W), Yubo Ma (https://arxiv.org/search/cs?searchtype=author&query=Ma,+Y), Wei Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+W), Rongyao Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+R), Yuanyang Qiu (https://arxiv.org/search/cs?searchtype=author&query=Qiu,+Y), Xinran Xu (https://arxiv.org/search/cs?searchtype=author&query=Xu,+X), Yuemeng Qi (https://arxiv.org/search/cs?searchtype=author&query=Qi,+Y), Linlin Miao (https://arxiv.org/search/cs?searchtype=author&query=Miao,+L), Jaromir Savelka (https://arxiv.org/search/cs?searchtype=author&query=Savelka,+J), Yun Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Y), Kevin Ashley (https://arxiv.org/search/cs?searchtype=author&query=Ashley,+K), Bing Zhao (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+B), Hu Wei (https://arxiv.org/search/cs?searchtype=author&query=Wei,+H), Lin Qu (https://arxiv.org/search/cs?searchtype=author&query=Qu,+L) 查看PDF (https://arxiv.org/pdf/2606.13931) > 摘要:律师与客户之间的咨询是法律服务的关键起点。有效的法律帮助依赖于从客户那里获取充分且真实的信息,以便制定最能保护其利益的策略。这一任务要求大语言模型不仅具备稳健的法律推理能力,还能通过多轮互动策略性地获取关键事实,并有效引导具有不同个性的客户。然而,现有的法律基准忽略了这种互动能力。为填补这一空白,我们引入了DLawBench,一个用于评估真实世界法律咨询的诊断基准。基于真实的客户行为,我们将律师-客户互动分为四种类型:合作型、依赖型、退缩型和对抗型。利用基于真实案例的对话,DLawBench评估大语言模型在实际条件下能否有效进行法律咨询。DLawBench包含来自中国和美国法律的461个案例,5,532对事实条目,3,411个询问评估标准,以及3,348个问题解决评估标准,并评估了26个代表性的大语言模型。系统实验表明存在巨大的提升空间:表现最好的模型GPT-5.5在基于咨询的法律推理上仅达到0.562。更重要的是,DLawBench揭示了法律咨询中的谄媚行为以及一个悖论:在客户最需要指导时,模型的表现反而更差。 ## 提交历史 来自:Li Zhang \[发送邮件 (https://arxiv.org/show-email/6d8a5ff3/2606.13931)\] **\[v1\]**2026年6月11日 星期四 21:50:44 UTC (2,842 KB)
相似文章
UA-Legal-Bench:评估大语言模型在乌克兰法律推理能力的基准
介绍了UA-Legal-Bench,这是一个基于统一国家法院判决登记册构建的、用于评估大语言模型在乌克兰法律推理能力的五项任务基准。评估了11个LLM,揭示了任务相关的少样本效应以及在不平衡法律任务中准确率的误导性。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。
TW-LegalBench: 衡量台湾法律理解能力
TW-LegalBench 是一个评估大型语言模型在台湾法律理解能力方面的基准,包含超过16,000道选择题、117道论述题和14,000个法律判决预测实例。结果显示,顶级模型超过了律师考试及格线,但未达到法官和检察官的水平,凸显了在法律文本生成可靠性方面的挑战。
@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。