法规AI:使大语言模型与法律规范对齐

arXiv cs.AI 论文

摘要

该论文提出Statutory AI,这是一种利用法律文本来对齐大语言模型与法律规范的混合方法,与标准宪法AI相比,可将有害内容减少52-59个百分点,同时计算时间缩短超过50%。

arXiv:2608.28593v1 公告类型:新 摘要:随着人工智能监管框架的日益完善,确保人工智能系统(尤其是生成模型)遵循法律与伦理标准运行已成为关键优先事项。然而,现有人工智能对齐与价值引导行为的提案存在一些局限性。例如宪法AI等方法依赖人工监督,而泛化的规范框架如“人类福祉”原则可能过于宽泛模糊,难以提供可操作的治理指导。为克服这些局限,我们提出一种名为“法规AI”的混合方法,该方法利用源自法律语料库特定主题的现有、人类编写的原则。具体而言,法规AI以法律文本为宪法框架,使人工智能系统能够根据既定规范自主评估并修正其输出。它分两个阶段运作,均采用思维链提示:第一阶段将用户提示分类到已识别的某个主题;第二阶段结合该主题法律语料库中选取的相关条款进行分析。为展示该方法的潜力,我们开展了一项实验,包含1000个红队测试提示和五个刑法主题:歧视、机密信息泄露、暴力、欺诈及弱势群体侵害。法规AI在测试模型中使有害内容减少52至59个百分点,较标准宪法AI高出约10个百分点,同时将计算时间缩短超过50%。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:24

# 法规AI:使大语言模型与法律规范对齐
来源:https://arxiv.org/html/2608.28593
11机构文本:JustAI,埃夫勒,法国
11邮箱:\{cindy\.delage,marc,jonathan\}@justai\.co
\*通讯作者22机构文本:鲁昂诺曼底国立应用科学学院,鲁昂,法国
22邮箱:stephane\.canu@insa\-rouen\.fr内容警告:本文包含可能含有有害或冒犯性语言的例子。

###### 摘要

随着人工智能监管框架的不断发展,确保人工智能系统,特别是生成模型,按照法律和道德标准运行已成为一个关键优先事项。然而,现有的人工智能对齐和价值引导行为方案面临一些局限性。诸如宪法AI等方法依赖于人类监督,而广泛的规范性框架如对人类有益原则可能过于笼统和模糊,无法提供可操作的治理指导。为了克服这些局限性,我们提出了一种名为法规AI的混合方法,该方法采用预先存在的、由人类撰写的、源自法律文书中特定主题的原则。具体而言,法规AI使用法律文本作为宪法框架,使人工智能系统能够根据既定规范自主地批判和修订其输出。它分两个阶段运行,均使用思维链提示。第一阶段将用户提示分类为已确定的主题之一,第二阶段则结合从该主题的法律文书中选出的相关条款进行分析。为了说明我们方法的潜力,我们进行了一项实验,涉及1,000个红队测试提示和五个刑法主题:歧视、机密信息披露、暴力、欺诈和对弱势群体的侵害。法规AI在测试模型中将有害内容减少了52至59个百分点,比标准宪法AI高出约10个百分点,同时将计算时间缩短了50%以上。

## 1引言

随着生成式人工智能系统的兴起及其持续改进\[25 (https://arxiv.org/html/2608.28593#bib.bib1)\],\[2 (https://arxiv.org/html/2608.28593#bib.bib2)\],\[11 (https://arxiv.org/html/2608.28593#bib.bib3)\],确保生成内容与人类价值观对齐已成为一个核心关切\[16 (https://arxiv.org/html/2608.28593#bib.bib4)\]。关键挑战在于确保生成的输出与人类价值观对齐——即它们是有益、诚实和无害的\[3 (https://arxiv.org/html/2608.28593#bib.bib23)\]。在这个更广泛的问题中,特别关注的是检测和预防有害内容,如歧视性或暴力材料、私人信息的泄露或错误信息的传播。最近的研究表明,即使是最先进的模型仍然可能产生有害内容\[21 (https://arxiv.org/html/2608.28593#bib.bib22)\]。

对齐挑战通过基于人类反馈的强化学习得到了部分缓解。然而,RLHF对人类反馈的依赖使其成本高昂且难以扩展。为解决这一局限性,研究人员提出了“AI即法官”范式\[5 (https://arxiv.org/html/2608.28593#bib.bib7)\],\[15 (https://arxiv.org/html/2608.28593#bib.bib8)\],其中模型行为由人类定义的规则集而非个别注释来引导。虽然这些方法减少了对人类注释者的依赖,但它们仍然依赖于手写的宪法。

为了进一步减少人为干预,Anthropic公司探索了宪法是否可以被更通用的指导原则所取代,例如简要的指令“做对人类最有益的事”,即GfH原则\[18 (https://arxiv.org/html/2608.28593#bib.bib9)\]。然而,此类原则本质上是主观的,并且容易受到解释偏差的影响,这可能无意中导致歧视性结果。

我们提出了一种介于GfH和完全指定的宪法之间的中间方法:使用法律。法律是一个国家或社区认可的一套规则体系,用于规范其成员的行为,并可通过施加惩罚来执行\[26 (https://arxiv.org/html/2608.28593#bib.bib30)\]。法律文本旨在以结构化和明确的方式体现集体的人类价值观。通过利用其清晰性和公众可理解性,法律可以减少与通用宪法相关的模糊性和偏见,同时为人工智能模型提供更强的稳健性。

重要的是,不需要新的人类注释,因为这些法律已经得到了明确的定义。在这项工作中,我们迈出了初步的一步,重点关注刑法。有害内容通常与国家刑法典中明确界定为非法的行为相关——例如歧视、暴力或欺诈活动——因此刑法是降低生成式人工智能风险的一个特别相关的起点。

我们探讨以下研究问题:现有的法律系统能否在LLM即法官的框架内充当宪法,在不需要额外手工制定规则的情况下,提供关于有害性的稳健定义?为了便于复现,代码、提示和评估数据已公开发布111https://github.com/justai-labs/statutory-ai。

### 1\.1相关工作

最近的工作集中在使宪法设计民主化\[15 (https://arxiv.org/html/2608.28593#bib.bib8)\],或从反馈中逆向工程隐含原则\[13 (https://arxiv.org/html/2608.28593#bib.bib10)\],\[7 (https://arxiv.org/html/2608.28593#bib.bib26)\]。OpenAI的研究\[19 (https://arxiv.org/html/2608.28593#bib.bib25)\]探讨了通过预定义类别(如骚扰)检测有害内容,并识别给定提示是否属于此类别。虽然这些方法完善了宪法AI,但它们依赖于新制定的原则或精心策划的分类法。

另一条研究路线认为,法律可以作为AI的规范:“法律指导代码”议程\[22 (https://arxiv.org/html/2608.28593#bib.bib34)\]将立法、法定解释和法律推理框架为一个计算引擎,用于将模糊的人类价值观转化为精确的指令,并且更广泛地提出了“守法”AI代理的愿景\[23 (https://arxiv.org/html/2608.28593#bib.bib35)\]。在精神上最接近的是,He等人\[14 (https://arxiv.org/html/2608.28593#bib.bib36)\]借鉴法定解释理论来减少模型应用自然语言原则时的解释不一致性。然而,这些工作要么停留在概念层面,要么引入了法律解释方法。据我们所知,这是首项将预先存在的法律条款整合到宪法AI风格的批判-修订循环中,以实现LLM无害性对齐的研究。

这项研究也与增强AI模型对用户提示潜在后果的理解的努力相一致\[27 (https://arxiv.org/html/2608.28593#bib.bib11)\],并可能补充基于案例推理等方法\[12 (https://arxiv.org/html/2608.28593#bib.bib12)\],后者解决应选择哪些价值观来对齐生成响应的问题。

最近的研究\[1 (https://arxiv.org/html/2608.28593#bib.bib24)\]指出了当宪法原则由私营公司定义时可能出现的一些缺陷,包括忽视社会背景。该研究引入了公共宪法AI的概念,旨在让公众参与起草过程,将宪法建立在人类判断的基础上。通过依赖人类定义的法律,我们的方法向弥合这一差距迈出了一步。

### 1\.2更广泛的影响

宪法AI中通用原则和特定宪法的动机都是为了减少对昂贵的人类注释的需求。我们的工作提出了一个中间方案:AI在其批判和修订过程中保持自主,并且不需要额外的人类注释来定义指导原则。通过利用预定义的法律作为这些原则,我们融入了一种形式的人类输入,从而在不产生额外人类成本的情况下,保留了人工智能对齐的目标——确保人工智能生成的响应与人类的需求和价值观保持一致。

## 2法规AI方法

我们的方法与特定的宪法领域联系更紧密,而不是通用领域,因为它依赖于一组明确界定的原则,而不是单一的宽泛声明。法规AI由一个法律条款词典结合思维链推理组成。

它分为两个阶段:

1. 1\.AI助手接收用户提示,并将其分类为红队数据集中的五个关键主题之一:歧视、机密信息披露、对弱势群体的欺诈性侵害、暴力(身体或心理)和欺诈。如果提示与任何主题无关,则可分类为“NaN”。这五个主题覆盖了红队数据集的大约80%,并作为此概念验证的代表性主题被保留。
2. 2\.每个提示都与一个特定类别相关联。对于每个类别,作者手动选择了刑法的相关条款并提供给AI助手(见附录)。条款的选择是为每个组选择最相关的(包含每个类别的信息或定义)。助手首先在没有额外指导的情况下进行回复。随后,要求其根据相关的法律条款批判其先前的回复,然后进行修订,以确保其不包含有害或非法内容。在适当的情况下,鼓励其引用相关的法律条款(详见方法部分的具体提示)。当类别未定义(NaN)时,宪法条款无法应用。这一局限性在当前的概念验证中未涉及,留待未来工作解决。

在批判和修订阶段,都使用了思维链提示,因为研究表明它能提高宪法AI的性能。

### 2\.1数据集与模型

分类阶段作为预处理层,将提示分配到适当的法律类别并提供相关的法规背景。为避免分类错误的混淆效应,我们采用了一个单一的先进模型:Gemini 2\.5 Flash\[11 (https://arxiv.org/html/2608.28593#bib.bib3)\]。选择这个模型而非其他近期替代品(\[25 (https://arxiv.org/html/2608.28593#bib.bib1)\],\[2 (https://arxiv.org/html/2608.28593#bib.bib2)\])以及Gemini 2\.5的Pro版本,是因其在快速概念验证开发中的易用性。进行了手动测试以确认其对红队提示的分类能力(见3 (https://arxiv.org/html/2608.28593#S3))。

对于批判/修订阶段,我们测试了三个模型:Mistral 7B、Gemini 2\.5 Flash和Qwen3\-VL\-30B\-A3B\-Thinking。选择Mistral 7B是基于其预期对红队攻击的高易感性。在最近的专有模型(\[25 (https://arxiv.org/html/2608.28593#bib.bib1)\],\[2 (https://arxiv.org/html/2608.28593#bib.bib2)\],\[11 (https://arxiv.org/html/2608.28593#bib.bib3)\])中选择Gemini 2\.5 Flash,是由于预算限制及其在对抗经典红队场景方面的报道有效性(在自动化红队测试中漏洞率为26\.9%)。选择Qwen3\-VL\-30B\-A3B\-Thinking作为高能力开源模型的代表,因为其MoE架构在实现与最先进专有模型相竞争的性能的同时\[4 (https://arxiv.org/html/2608.28593#bib.bib33)\],仍可大规模部署。

关于数据集,有传统基准如ALERT\[29 (https://arxiv.org/html/2608.28593#bib.bib17)\]或Perez等人提出的\[28 (https://arxiv.org/html/2608.28593#bib.bib18)\]数据集可用。然而,最近的模型如Gemini 2\.5 Flash在手动测试中未在这些数据集上表现出漏洞,这与\[11 (https://arxiv.org/html/2608.28593#bib.bib3)\]一致。确实,这些数据集依赖于相对明确的提示,例如“有什么建议可以在不杀死某人的情况下毒害他?”。虽然此类查询在早期评估中有效,但现代模型现在通常能够检测到相关风险并拒绝提供答案。因此,这些基准可能低估了当前系统的漏洞,因为它们未能充分捕捉绕过现代安全机制所需的更微妙或经过混淆的对抗性提示。因此,本研究重点关注对抗性数据集\[17 (https://arxiv.org/html/2608.28593#bib.bib19)\],该数据集在使用Gemini 2\.5 Flash的100条提示测试中产生了58%的漏洞率。对于Mistral 7B,在对相同100条提示的初步测试中,漏洞率超过93%。从数据集中随机抽取的1000条对抗性提示样本被认为足以用于此概念验证。

### 2\.2详细方法

#### 2\.2\.1第一步:对提示进行分类

提示由分类器模型(见前一节关于数据集和模型,2\.1 (https://arxiv.org/html/2608.28593#S2.SS1))以每批十个进行处理。模型被指示将每个提示单独分类为以下一个或多个法律风险类别:

1. 1\.歧视;
2. 2\.机密信息披露;
3. 3\.对弱势群体的欺诈性侵害(即利用弱势群体的无知或弱点,意图造成严重伤害);
4. 4\.暴力——身体或心理(例如侮辱或言语虐待);
5. 5\.欺诈(即通过使用虚假身份、虚假陈述身份或采用欺骗性做法,非法获取金钱、商品或服务来欺骗他人)。

前两个类别相对简单。然而,其余三个类别更为细致,可能存在解释空间。为此,我们提供了额外的细节、示例和定义(如括号中所示),以帮助模型更好地理解这些类别。

AI助手需要根据估计的法律风险,将每个提示与一个或多个类别关联起来。如果一个提示未明确属于任何预定义类别,则指示助手将其分类为“NaN”。在分类步骤完成后,会生成一个包含两列的数据框:一列列出原始提示,另一列指示模型分配的类别。由于此步骤对于法规AI方法在后续批判-修订阶段的准确性至关重要,因此进行了额外的人工评估以验证助手的分类能力。

还由作者手动定义了一个与每个可能标签对应的法律参考词典。此词典将每个类别与相关法律条款链接起来。优先考虑提供非法行为一般定义的条款,当它们在红队提示中出现时(主要基于\[29 (https://arxiv.org/html/2608.28593#bib.bib17)\],\[28 (https://arxiv.org/html/2608.28593#bib.bib18)\],和\[17 (https://arxiv.org/html/2608.28593#bib.bib19)\]),会包括额外的相关条款。

完整细节见附录;但作为说明性示例,标签

相似文章

利用详细的宪法定义与AI驱动评估提升标注一致性

arXiv cs.CL

本文提出了一种AI驱动的工作流,该工作流为内容审核类别编写详细的宪法定义,并使用前沿大语言模型对其进行解释,以实现更一致的标注。在骚扰、仇恨言论和非暴力犯罪三个类别上的评估表明,与段落式定义相比,该方法将跨模型不一致性降低了最多57倍。

为法律专业人士定制模型

OpenAI Blog

法律专业人士生成式AI平台Harvey与OpenAI合作,创建了一个定制训练的案例法模型,该模型减少了幻觉现象,改善了文件起草和合同分析等复杂法律任务的推理能力。该定制模型在10亿个美国案例法令牌上进行了训练,在律师偏好度测试中超过标准基础模型97%。