我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。

Reddit r/ArtificialInteligence 新闻

摘要

对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。

有一个问题反复出现:模型常常给出非常自信的法律答案,但引用的来源要么缺失、要么过时,要么无法追溯到官方整合来源。即使引用了某些内容,也不总是清楚它是否反映法律的当前版本。我很好奇其他人实际中是如何处理的:每次都依赖人工验证?还是已经有团队找到了解决AI输出“可验证法律依据”问题的可靠方法?
查看原文

相似文章

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。