LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI

arXiv cs.AI 论文

摘要

本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。

arXiv:2606.18021v1 公告类型:新 摘要:在法律工作流程中部署的AI系统产生的幻觉,其汇总指标报告率约为52%,但这个平均值掩盖了错误集中在哪里以及它们倾向于哪个方向,使得合规官员无法获得可信赖部署的可操作信号。我们提出了LegalHalluLens,一个包含三个组成部分的审计框架:基于CUAD(Hendrycks等人,2021)的四个法律动机主张类别(数字、时间、义务/权利、事实)的类型化幻觉档案;风险方向指数(RDI),将遗漏与虚构偏差简化为一个可用于部署比较的单一标量;以及按幅度和方向校准的类型化辩论管线。在510份合同和249,252个条款级别的实例中,我们测量了义务/数字与时间主张之间的大约38-40个百分点的模型内部差距,而汇总报告隐藏了这一点,并表明两个具有匹配52%率的系统可能带有相反的RDI。辩论管线将虚构检测减少了45%,每类增益跟踪诊断,与使用明显更小的主干(40亿活跃参数)的商业API相匹配。类型化档案和RDI揭示了汇总指标隐藏的故障模式;我们进一步展示这些诊断可作为多智能体辩论管线的校准输入,其中Skeptic挑战和针对测量故障模式的目标非对称门控优于通用调优的辩论。该框架支持面向方向的采购、问责制以及在现实环境中部署的法律AI的代理设计。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:40

# 类型化幻觉审计与校准多智能体辩论用于可信赖法律AI
Source: https://arxiv.org/html/2606.18021
###### 摘要

部署在法律工作流程中的AI系统表现出幻觉率,聚合指标报告约为∼52%,但这个平均值掩盖了错误集中在哪里以及运行方向,使合规官员缺乏用于可信赖部署的可操作信号。我们提出LegalHalluLens,一个包含三个组件的审计框架:跨四个法律动机的声明类别(数字、时间、义务/权利、事实)上的类型化幻觉概况,基于CUAD(Hendrycks等人,2021);一个风险方向指数(RDI),将遗漏与虚构偏差缩减为单个可部署比较的标量;以及一个校准了幅度和方向的类型化辩论流水线。在510份合同和249,252个条款级实例中,我们测量到义务/数字与时间声明之间约38–40个百分点的模型内差距,这是聚合报告所隐藏的,并显示两个匹配52%率的系统可能具有相反的RDI。辩论流水线将虚构检测减少了45%,各类别增益与诊断一致,以显著更小的骨干网络(4B活跃参数)匹配商业API。类型化概况和RDI揭示了聚合指标隐藏的失败模式;我们进一步展示这些诊断可作为多智能体辩论流水线的校准输入,其中针对测量失败模式的怀疑者挑战和非对称门优于通用调整的辩论。该框架支持面向方向感知的采购、问责和agent设计,适用于部署在野外的法律AI。

法律AI,幻觉评估,LLM基准测试,合规风险,AI审计,可信赖AI

\icmlshowauthorstrue

## 1 引言

法律AI正被部署在工作流程中,从业者基于模型输出做出重大决策——合同审查、合规监控、监管报告、尽职调查——而模型选择本身就是一个具有真实法律风险的决策。

#### 为什么这在大规模上重要。

法律AI错误在谁承担成本上是不对称的。模型虚构的且在审查中被遗漏的责任上限会创建一个可能被依赖数月的虚假风险天花板。一个被静默删除的非竞争范围限定词可能产生不可执行的条款,而法律顾问从未标记。可信赖部署需要知道的不仅仅是系统在52%的幻觉率,而是哪些条款、哪个方向,以及校准的干预是否能够以合理成本改变该概况。我们开发的框架是一个审计工具:类型化概况和风险方向指数可以从任何oracle界限的法律语料库中导出,支持采购评估、部署后监控和法律AI的方向感知治理。聚合幻觉率,今天的标准报告实践,无法承担这个角色:在声明类型上平均恰恰掩盖了决定法律风险的失败模式。

#### 先前工作的截止点。

先前的类型学工作(Dahl等人,2024;Hou等人,2024;Magesh等人,2025)确立了法律幻觉并非均匀,但未处理合同提取设置,也未将方向特征压缩为可部署比较的标量。第2节详细地将本工作与每个聚类进行对比。

#### 研究问题。

本文解决三个问题。

RQ1: 类型化失败排序。LLM是否在不同法律声明类型上系统地表现出不同的幻觉率,并且这种模式是否在架构间足够一致,足以作为可靠的评估信号?如果数字和义务声明在所有测试系统上的失败率显著高于时间声明,那么任何跨类型平均的评估都掩盖了最具法律后果的条款上的失败率。

RQ2: 错误方向。内容错误的方向特征——模型是抑制源文本中存在的义务,还是断言不存在的义务——能否被捕捉到单个可部署操作的度量中,并且这个信号能否区分聚合率无法区分的系统?

RQ3: 类型化缓解。一个校准了RQ1失败幅度和RQ2错误方向的辩论流水线,是否产生了集中于最高失败类别的增益,并且这种校准方法是否能使小型开放模型以显著更低的推理成本匹配或超过商业API的性能?

#### 实验范围。

我们将研究建立在结构化法律条款提取之上,使用CUAD v1.0(Hendrycks等人,2021)作为oracle界限评估语料库:510份商业合同,41个专家标注的条款类型,提供完整的真实oracle,其中每个模型输出都可以对照合同文本验证,无需外部知识。我们在全文档上下文中评估,测量检索增强变体的性能上限,其中检索错误在我们报告的内容失败之上复合。实验1评估了四个模型,两个商业API,一个32B开放模型,一个70B开放模型,覆盖所有510份合同和三次运行,产生249,252个条款级实例。实验2将类型化辩论流水线应用于gemma-4-26B-A4B(混合专家,4B活跃参数)在120份合同匹配子集上,测试实验1中的类型化失败概况是否支持校准且成本高效的缓解。

#### 贡献。

1. 类型化幻觉概况(第6节):在四个架构多样模型上一致的失败排序 {数字, 义务} ≫ 事实 ≥ 时间,每个模型跨度约38–41个百分点,在聚合报告下不可观察。
2. 风险方向指数(第6.3节):一个有符号标量度量,将内容错误分解为跨类型化声明类别的遗漏与虚构,将净方向偏差编码为单个可部署操作的信号。
3. 校准的多智能体辩论作为缓解(第7节):一个六角色辩论流水线(怀疑者、支持者、重新提取者、仲裁者、验证者、法官),在基线提取上运行,其怀疑者挑战和增加/删除门不对称性来自上述诊断,而非通用选择。在匹配子集上将虚构检测减少45%,并使4B活跃开放模型在综合分数上匹配商业API(在5种权重方案中的4种下排名第一),同时推理成本大大降低。

## 2 相关工作

#### 法律幻觉与基准测试。

Dahl等人(2024)在联邦司法任务上开发了法律幻觉的类型学(幻觉率取决于模型,在58%至88%之间),认为“并非所有幻觉模式对法律专业人士具有同等重要性”。Hou等人(2024)构建了机器生成法律分析的细粒度差距类别分类法。Magesh等人(2025)表明,商业法律AI工具中的RAG并未消除幻觉。我们将这些作为出发点;但二者均未涉及合同提取设置,也均未将方向特征压缩为可部署比较的标量,这正是我们的四类别分类法(第3节)和风险方向指数(第4.2节)所填补的空白。法律基准测试(Guha等人,2023;Blair-Stanek等人,2024;Liu等人,2025)测量任务准确度,未按声明类型进行幻觉分层;CUAD(Hendrycks等人,2021)提供了用于分类的专家标注,我们将其重新用作幻觉oracle。其他诊断工作是正交的(Enguehard等人,2025;Demir and Canbaz,2025;Purushothama等人,2025)。

#### 通用幻觉基准测试与基于辩论的缓解。

FActScore(Min等人,2023)、HaluBench(Ravi等人,2024)、HalluLens(Bang等人,2025)和PHANTOM(Ji等人,2025)在不进行声明类型分层的情况下测量事实精度。多智能体辩论已被研究为事实性机制(Du等人,2024;Fang等人,2025;Li等人,2025;Hu等人,2025),其理论动机来自推理时缩放(Snell等人,2024;Wu等人,2024)。我们的贡献在于根据实验1中的按类别和按方向的失败模式校准怀疑者挑战和非对称门;Huang等人(2024)为我们观察到的内容纠正极限提供了背景。

#### 高风险部署中的Agent设计。

最近的多智能体辩论工作跨所有错误类型通用地调整怀疑者提示、门阈值和聚合规则(Du等人,2024;Hu等人,2025)。我们认为这种通用调整对于高风险野外部署来说是错误的默认设置:适当的怀疑者挑战取决于底层模型实际展示的失败模式,适当的门不对称性取决于方向性风险概况。类型化概况(第4.1节)和RDI(第4.2节)被设计为agent设计的校准输入,而非独立的基准测试数字。我们的辩论流水线(第4.3节)实例化了这个配方:怀疑者挑战来自按类型失败概况,增加/删除门不对称性由测量的FAR-vs-FRR概况设定。据我们所知,这是第一个其组件根据测量的按失败模式诊断进行校准而非通用选择的多智能体提取流水线。

## 3 背景

我们简要介绍跟随我们的贡献所需的领域知识:激发我们四类别声明分类法的法律文本验证结构,以及我们通篇使用的度量和符号。

### 3.1 合同文本的验证结构

商业合同包含具有根本不同验证特征的声明。形式为“责任上限为$5,000,000”的声明具有单一数值,其正确性可通过与源文本的直接比较确定。形式为“协议于2024年12月31日终止”的声明同样简化为逐字字符串比较。相比之下,诸如“供应商应在第4.2节规定的情况下,赔偿买方因在生效日期前制造的产品引起的第三方索赔”的声明包含多个必须全部保留的语义元素:情态动词(*shall*)、例外条款(*except as provided*)、范围(*products manufactured before*)和时间锚点。身份声明,如适用法律或对手方名称,简短且结构简单,但依赖于模型抵抗其对普通法管辖区的参数化先验知识。

这四个验证机制对应于我们在全文中使用的类别:数字、时间、义务/权利和事实。这些类别由主要验证挑战定义,而非由文档类型定义,因此相同的分类法可应用于任何模型声明可对照源文本检查的法律提取任务。

### 3.2 度量和符号

令\(D\)表示法律文档,\(c_i\)表示固定清单\(\mathcal{C}\)中的声明类型,\(M\)表示提取模型。对于每个\((D, c_i)\)对,模型输出条款提取或“不存在”决策。每个实例的结果相对于CUAD oracle形成混淆矩阵\(\{\mathrm{TP},\mathrm{FP},\mathrm{FN},\mathrm{TN}\}\)(TP=正确检测为存在;FP=虚构,断言存在但实际不存在;FN=遗漏,存在但被判定为不存在;TN=正确不存在)。然后,每个TP被标注为*支持*或*矛盾*,并在识别错误时附上分类的mismatch_type。我们报告:

- • \(\mathbf{FAR}=\mathrm{FP}/(\mathrm{FP}+\mathrm{TN})\) 假接受率:虚构不存在的条款
- • \(\mathbf{FRR}=\mathrm{FN}/(\mathrm{FN}+\mathrm{TP})\) 假拒绝率:遗漏存在的条款
- • \(\mathbf{Acc}=(\mathrm{TP}+\mathrm{TN})/N\) 检测准确度
- • \(\mathbf{Hal_{TP}}=\mathrm{contradicted}/\mathrm{TP}\) 检测中的内容质量(实验1)
- • \(\mathbf{Hal_{Gen}}=(\mathrm{contradicted}+\mathrm{FP})/(\mathrm{TP}+\mathrm{FP})\) 所有生成输出的质量(实验2)
- • \(\mathbf{JEq}=\mathrm{supported}/(\mathrm{TP}+\mathrm{FN})\) 端到端正确性
- • \(\mathbf{RDI}\):见第4.2节

这两个幻觉度量在范围上不同。\(\mathrm{Hal_{TP}}\)测量*条件于检测*的内容正确性:在模型声称找到的条款中,有多少比例内容错误?它隔离了定位到正确条款但提取文本不正确的失败模式,是实验1中类型化概况的主要信号。\(\mathrm{Hal_{Gen}}\)更严格:在*模型作为条款输出的所有内容*中,错误的比例是多少,包括内容矛盾*和*虚构?由于\(\mathrm{Hal_{Gen}}\)惩罚FP,它是评估减少虚构的缓解流水线的合适度量,我们在匹配子集排行榜(实验2)中将其用作内容质量列。FAR和FRR是检测级度量;两个幻觉度量测量内容质量。所有四个度量是互补的,并在各自基准测试中一起报告。

## 4 方法

我们描述三个组件:(i)类型化幻觉概况,(ii)风险方向指数,以及(iii)类型化辩论流水线。前两个是评估程序;第三个是由其输出指导的缓解机制。

### 4.1 类型化幻觉概况

对于在语料库\(\mathcal{D}\)上评估的模型\(M\),我们按声明类别\(c_i \in \{\mathrm{numeric}, \mathrm{temporal}, \mathrm{obligation}, \mathrm{factual}\}\)划分所有条款级输出,并按类别分层报告\(\mathrm{Hal_{TP}}(M, c_i)\)。模型内类型化差距定义为

\[
\mathrm{Gap}(M) = \max_{c_i} \mathrm{Hal_{TP}}(M, c_i) - \min_{c_i} \mathrm{Hal_{TP}}(M, c_i)
\]

相似文章

AI代理中的操作幻觉与安全漂移

arXiv cs.AI

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

幻觉即利用:携带证据的多模态智能体

arXiv cs.AI

本文形式化了多模态智能体中的幻觉到动作转换,并提出了携带证据的智能体(ECA),它使用受限验证器仅授权安全的工具调用,在200个任务的流水线上实现了0%的不安全动作率。