Eskwai for Students:加纳法律教育中的生成式AI助手

arXiv cs.CL 论文

摘要

本文介绍了面向学生的 Eskwai,这是一款用于加纳法律教育的生成式 AI 助手,采用检索增强生成技术,基于包含超过 12,000 条判例法和 1,400 部立法的数据库。该系统在为期 30 个月的研究中部署,有 3,100 名法律学生参与,为全球南方地区法律教育中 AI 的使用提供了洞见。

arXiv:2605.15380v1 公告类型:新 摘要:生成式 AI 的最新进展已显示出其在法律教育中的应用潜力。然而,针对全球南方地区法律教育中此类系统的开发与部署工作仍然有限。在本研究中,我们开发了面向学生的 Eskwai,这是一款生成式 AI 助手,旨在帮助法律学生进行学习。Eskwai for Students 是一个检索增强生成(RAG)系统,能够基于加纳超过 12,000 条判例法和 1,400 部立法的人工整理数据库,为法律学生提供各种法律问题的答案。我们在加纳进行了一项为期 30 个月(2.5 年)的纵向研究,部署了 Eskwai for Students,共有 3,100 名法律学生使用,产生了 32,000 次查询。我们评估了该 AI 的实用性,并深入了解法律学生向这一生成式 AI 工具提交的查询类型,这引发了一些伦理问题。本研究有助于理解全球南方的法律学生如何在学业中使用生成式 AI,以及如何负责任地利用它来推进法律教育。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:31

# Eskwai for Students:加纳法律教育的生成式AI助手
来源:https://arxiv.org/html/2605.15380
11institutetext:苏黎世联邦理工学院,瑞士
22institutetext:柏林夏里特医学院,德国
33institutetext:Kwame AI Inc., 美国Philemon BaduPatrick Agyeman-BuduSamuel AnsahEvans AtompoyaEvan IgwiloLord BaahFrederick Abu-BonsrahVictor Kumbol

###### 摘要

生成式AI的最新进展已显示出其应用于法律教育的潜力。然而,在全球南方开发和部署此类系统用于法律教育的研究仍然有限。在这项工作中,我们开发了Eskwai for Students,这是一个生成式AI助手,旨在帮助法律学生进行法律教育。Eskwai for Students是一个检索增强生成(RAG)系统,能够为法律学生提供各种法律问题的答案,其答案基于精心整理的加纳超过12,000个判例法和1,400项立法的数据库。我们通过一项为期30个月(2.5年)的纵向研究部署了Eskwai for Students,有3,100名加纳法律学生使用,共提交了32,000次查询。我们评估了AI的有用性,并深入分析了法律学生向该生成式AI工具提交的查询类型,这引发了一些伦理关切。这项工作有助于理解全球南方法律学生如何在学业中使用生成式AI,以及如何负责任地利用它来推进法律教育。

## 1 引言

生成式AI的最新进展正在重塑法律工作和教育,提供了诸如大语言模型(LLMs)和检索增强生成(RAG)系统等新工具,这些工具可以自动化认知任务、总结法律原则、协助法律研究和文书撰写[12 (https://arxiv.org/html/2605.15380#bib.bib40),13 (https://arxiv.org/html/2605.15380#bib.bib39)]。这些技术有潜力使法律知识获取更加民主化,提升学生参与度,为毕业生进入数字化的法律职业做好准备[12 (https://arxiv.org/html/2605.15380#bib.bib40),5 (https://arxiv.org/html/2605.15380#bib.bib7)]。然而,将生成式AI融入法律教育在全球南方面临独特挑战,那里技术基础设施和获取整理后法律数据的渠道存在差距[12 (https://arxiv.org/html/2605.15380#bib.bib40),8 (https://arxiv.org/html/2605.15380#bib.bib23)]。

北美、欧洲和部分亚洲司法管辖区的实证研究已开始描绘生成式AI在法律教育中的教学机遇和陷阱[12 (https://arxiv.org/html/2605.15380#bib.bib40),11 (https://arxiv.org/html/2605.15380#bib.bib37),2 (https://arxiv.org/html/2605.15380#bib.bib3),1 (https://arxiv.org/html/2605.15380#bib.bib2),4 (https://arxiv.org/html/2605.15380#bib.bib8)]。这些研究表明,生成式AI通过提供即时解释、生成假设情境、作为批判性分析和修改法律文本的平台,可以有效支撑学生理解。值得注意的是,生成式AI已被证明能提升学生参与度、个性化学习体验,并支持研究和写作技能的发展[12 (https://arxiv.org/html/2605.15380#bib.bib40)]。针对法律学生的实验表明,结构化的AI使用训练能显著提高法律分析和文书撰写的质量,而无指导或无引导的接触可能导致过度依赖、表面化参与或对AI生成输出不加批判地接受[12 (https://arxiv.org/html/2605.15380#bib.bib40),6 (https://arxiv.org/html/2605.15380#bib.bib16)]。

尽管有这些见解,但文献中仍存在重大空白:发展中国家的法律教育有其特定需求和限制,数字化法律数据库的获取有限,课程设置受当地成文法、判例法以及主流生成式AI模型训练数据中可能未反映的社会政治现实影响[12 (https://arxiv.org/html/2605.15380#bib.bib40),8 (https://arxiv.org/html/2605.15380#bib.bib23)]。这引发了关于在这些背景下部署生成式AI工具的适用性、可靠性和公平性的关键问题。

关于学术诚信、公平性和认知卸载的担忧在资源受限的环境中更加突出[12 (https://arxiv.org/html/2605.15380#bib.bib40)]。诸如抄袭、技术获取不平等以及削弱严谨法律推理的风险等问题尤其尖锐[12 (https://arxiv.org/html/2605.15380#bib.bib40),3 (https://arxiv.org/html/2605.15380#bib.bib6),7 (https://arxiv.org/html/2605.15380#bib.bib18)]。尽管如此,生成式AI有望弥合司法可及性和法律知识方面的差距,特别是对于边缘化学生而言[12 (https://arxiv.org/html/2605.15380#bib.bib40)]。

本研究通过评估“Eskwai for Students”来填补这些空白,这是一个基于加纳法律权威资料(12,000个案例和1,400项立法)的RAG系统,在2.5年内面向3,100名法律学生部署。通过评估其有效性并分析学生查询,本研究有助于理解全球南方法律教育中生成式AI的机遇和挑战。我们的主要贡献是:(1) 在加纳设计并部署了一个用于法律教育的AI系统;(2) 在一项大规模纵向研究中,评估了其在真实学习环境中的使用情况和效用。

## 2 相关工作

在本节中,我们描述了在法学教育中使用生成式AI进行学习支持的相关工作。

在一项为期两年的随机对照实验中,本科法律学生被分为三组:禁止使用、无指导使用和接受结构化培训后使用ChatGPT,并通过多项选择题和需要进行开放式法律分析与批判性思维的课后写作作业进行评估。接受结构化培训的学生得分最高,其次是无指导使用的学生,最后是被禁止使用的学生[12 (https://arxiv.org/html/2605.15380#bib.bib40)]。一年后的跟踪研究发现,有趣的是,接受指导与未接受指导而使用AI的学生之间的表现差距缩小了[12 (https://arxiv.org/html/2605.15380#bib.bib40)]。在一项类似设计的研究中,164名本科法律学生被分为三组:无AI辅助、可选AI访问、以及10分钟培训加可选AI访问,并在问题识别任务中进行了评估[6 (https://arxiv.org/html/2605.15380#bib.bib16)]。培训显著提高了AI采用率(15%)和考试成绩(27%)。相反,无培训的访问并未提高成绩。通过主分层分析总体效应后发现,培训主要增加了使用AI的学生数量,而非提高个别学生的分数[6 (https://arxiv.org/html/2605.15380#bib.bib16)]。这两项研究表明,提供指导或结构化培训可改善生成式AI的使用和学习成果。然而,即使没有初始指导,学生也可以通过长期使用而掌握技能。

相比之下,一些研究也报告了混合效果。例如,在一项评估206名法律学生审查法律投诉任务的研究中,发现AI辅助减少了任务完成时间,但对结果的准确性没有显著影响[10 (https://arxiv.org/html/2605.15380#bib.bib30)]。另一项研究中,本科法律学生接受了使用GPT-4的培训,并在GPT-4辅助下参加了第二次期末考试。作者发现,GPT-4辅助使学生在多项选择题上的成绩提高了29%,但对考试中的论文部分(包括问题识别等困难任务)没有影响[9 (https://arxiv.org/html/2605.15380#bib.bib24)]。有趣的是,根据基线结果的不同,结果存在显著差异。基线测试中表现最差的学生分数提高了约45%,而表现最好的学生分数下降了约20%[9 (https://arxiv.org/html/2605.15380#bib.bib24)]。这些数据表明,生成式AI学习支持的价值可能取决于具体任务和学生的基线表现。

最后,Hemrajani等人招募了50名高级法律学生,让他们对多个AI模型和一位人类专家在消费法问题上的法律任务输出进行盲评,这些任务包括问题识别与总结、起草、法律咨询、研究和推理[8 (https://arxiv.org/html/2605.15380#bib.bib23)]。AI模型在起草和问题识别任务中表现出色,与人类专家持平或超越。然而,在法律研究任务中表现不佳,频繁产生幻觉[8 (https://arxiv.org/html/2605.15380#bib.bib23)]。幻觉是生成式AI模型众所周知的局限性,法律研究任务导致AI模型表现最差并不意外。RAG是一种有效策略,通过提供相关文档中的上下文来限制这种风险,从而为答案提供事实依据。

在这项工作中,我们构建了一个基于判例法和立法语料库的RAG系统,这比之前依赖LLM训练数据的工作有所改进,这种设计不易产生幻觉。此外,与之前的工作不同,我们在长达2.5年的时间内对3,100名学生的庞大群体进行了系统评估,使用没有任何限制的系统,提供了更真实的评估数据。通过分析学生提出的查询,我们提供了关于学生期望从AI系统获得何种反馈和帮助的见解,这可以为未来系统的设计提供参考。

## 3 系统概述

Eskwai for Students¹¹请参阅Eskwai网站:https://eskwai.kwame.ai/ 由一个Web应用组件和一个AI组件组成。

### 3.1 Web应用

Web应用(图1 (https://arxiv.org/html/2605.15380#S3.F1))提供了一个移动端友好的界面(图2 (https://arxiv.org/html/2605.15380#S3.F2)),可在桌面和移动设备上使用Eskwai。目前包含三个主要功能:Ask Kwame、Library和Briefcase。Ask Kwame功能使用户能够提交查询并获得带有可验证内联引用的响应,并具有三种模式:研究(Research)、审查(Review)和起草(Draft)。使用研究模式,用户可以提出问题,并从判例法、立法或网络中立即获得可信的答案。使用审查模式,他们可以通过总结、标记问题和提问来分析合同和其他法律文件。使用起草模式,他们可以快速生成和修改法律文件的草稿,如法庭程序、合同和函件。Library使用户能够查看我们的案例、立法、法规和模板数据库,设计为通过智能搜索、排序和过滤器轻松导航。Briefcase允许用户在工作区中上传、存储和组织文件,该工作区也设计为通过智能搜索、排序和过滤器轻松导航。这些文件随后可在Ask Kwame中使用。

图1:Eskwai截图 图2:Eskwai移动版截图
### 3.2 AI架构

AI组件使用一个RAG系统(图3 (https://arxiv.org/html/2605.15380#S3.F3)),包括一个使用开源模型的检索组件和一个使用商业模型的生成组件(所使用的模型多年来有所变化)。它根据查询生成响应,基于案例和立法数据库以及用户文档,并提供用于生成响应的确切段落的引用。我们从案例(12,000个)和立法(1,400项)语料库中创建了5句长的文本块,这些语料库主要由有权访问法律内容的律师整理。然后,我们使用开源嵌入模型计算这些文本块的嵌入,并将其保存在Google Cloud Platform虚拟机上的ElasticSearch中。当提交查询时,我们的系统首先使用相同的嵌入模型计算查询的嵌入,然后与预先计算的嵌入计算余弦相似度,以检索前N个文本块。然后,我们使用开源重排序模型对这些文本块进行重排序,得到前30个文本块。接着,我们将这些段落作为上下文,连同提示一起传递给使用OpenAI的GPT API的生成模型。答案流式传输到Web应用上的用户,同时也显示内联引用,点击引用会打开并高亮显示案例、立法或用户文档中的支持段落。

图3:Eskwai RAG系统概述

## 4 部署与评估

我们于2023年9月推出了Eskwai,目标用户为律师和法律学生,主要通过社交媒体推广。在这项工作中,我们评估了2023年9月1日至2026年2月28日(30个月,2.5年)期间法律学生在平台上的使用情况。

### 4.1 可用性

在评估期间,Eskwai记录了法律学生社区的显著参与。超过15所加纳大学的共计3,127名学生使用了该平台,在Ask Kwame上总共提交了32,919次查询。大多数用户通过移动设备访问Eskwai。用户可以对答案进行点赞或点踩,以回应“这个回答有帮助吗?”的问题,用于计算有用性分数。用户互动相对有限,平台共收到1,131次对回答的投票。值得注意的是,只有3%的总查询收到了投票,表明通过投票机制的直接反馈率较低。平台的有用性得分为68.4%,表明用户整体满意度良好,但仍存在改进空间。点踩的用户可以从可能原因选项中选择或自行输入原因。一些原因包括:答案未针对具体问题,缺少关键细节如具体案例和立法,包含错误或误导性信息,回答过于简单,回答过于复杂,以及包含过时信息。多年来对点踩答案的分析表明,大多数原因来自:(1) 我们的数据库缺少查询中引用的具体案例和立法;(2) 缺少最新的案例和立法;(3) 用户提出的查询模糊不精确。此外,Eskwai表现出运营效率,平均响应延迟为7.1秒/查询,突显其提供及时法律信息的能力。

### 4.2 查询特征

我们借助ChatGPT(2026年3月版)对查询进行了定性分析,以获取广泛的类别和主题。具体来说,我们将查询上传到ChatGPT,并要求其通过生成查询类别及每个类别的示例来进行定性分析。然后,在阅读随机样本查询后,我们细化了类别,并更新了代表性示例查询列表。对用户查询的分析揭示了几种不同的类别,反映了法律学生的学术和实践需求(表1 (https://arxiv.org/html/2605.15380#S4.T1))。

法律意见:这些查询涉及对假设性或学理性场景的法律分析请求。有些需要结构化的回答,如IRAC(问题、规则、应用、结论)或APA格式,并且与课程作业或任务一致。示例包括论文长度的回答以及对法律原则的批判性评估。

具体案例与分解

相似文章

AILQA:面向印度法律体系的AI驱动法律问答系统评估

arXiv cs.CL

本文介绍了AILQA,一个面向印度法律语境的AI驱动法律问答系统,该系统使用嵌入和生成模型并结合检索增强生成(RAG)。论文评估了其在印度法律文本和全印度律师资格考试上的性能,发现AI生成的回答有时能优于参考答案。

为法律专业人士定制模型

OpenAI Blog

法律专业人士生成式AI平台Harvey与OpenAI合作,创建了一个定制训练的案例法模型,该模型减少了幻觉现象,改善了文件起草和合同分析等复杂法律任务的推理能力。该定制模型在10亿个美国案例法令牌上进行了训练,在律师偏好度测试中超过标准基础模型97%。

AI在斯坦福法学院研究中胜过法学教授

Hacker News Top

斯坦福法学院的一项研究发现,在盲评中,法学教授更喜欢AI生成的答案,而不是由同事教师撰写的答案,AI在直接对决中赢得了75%的胜率,这表明AI有潜力改变法律教育。