我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
摘要
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
有一个问题反复出现:模型常常给出非常自信的法律答案,但引用的来源要么缺失、要么过时,要么无法追溯到官方整合来源。即使引用了某些内容,也不总是清楚它是否反映法律的当前版本。我很好奇其他人实际中是如何处理的:每次都依赖人工验证?还是已经有团队找到了解决AI输出“可验证法律依据”问题的可靠方法?
相似文章
形式化方法遇上大语言模型:面向先进AI系统合规性的审计、监控与干预
本文提出了一种将形式化方法(线性时序逻辑)与大语言模型相结合的技术,用于审计、监控和干预AI系统以确保其符合行为约束。研究表明,即便是小模型标注器在检测违规行为方面也能媲美前沿大语言模型裁判。
公司用于LLM的训练数据枯竭问题后来怎么样了?
本文重新审视了之前关于人类生成的LLM训练数据将会用尽的担忧,并提出疑问:在AI模型持续改进的情况下,这个问题是否已经解决,或者仍然是一个待解决的问题。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
对齐临床需求与AI能力:关于LLMs在医学推理中的综述
本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。
如果您在工作中使用LLM处理重要事务,您如何决定何时信任其输出?
关于在高风险专业环境(如法律、临床和金融工作)中决定何时信任LLM输出的概念性指南,强调需要批判性评估技能。