机器何时能信任法规?针对机器提取法律逻辑的生存证书

arXiv cs.AI 论文

摘要

本文提出了一种生存证书,用于认证机器提取法规数据中的逻辑含义,使用统计方法处理提取器分歧,并在真实法律语料库上进行验证。

arXiv:2609.01741v1 Announce Type: new 摘要:法规在人类阅读前越来越多地被机器解析,且解析器存在分歧:以密苏里州法规为例,两个独立编写的提取器在数字阈值存在性上分歧,假阴性率为0.43。我们探究在这样的噪声下,何种形式逻辑能够存续。我们构建了一个被动生存证书,用于机器提取法规上下文的Duquenne-Guigues蕴涵基:测量每个属性的提取器间分歧,在1,000次蒙特卡洛试验中针对该基进行重放,仅当生存率的单侧Wilson 95%下限达到0.95时,才认证一个蕴涵;每个认证的蕴涵都带有前提跨度和一个最小反例。在29,365个密苏里州章节和502个印度中央法案章节上,预注册的保留门通过(7个标题中的10个法规家族完全匹配;11个中的16个有5%容忍度),然而,在一个全局部署的错误模型下,93.2%的保留章节低于信息性阈值,且一个2x2因子设计将此归因于校准率转移,而非选择。该证书可用但脆弱:需按章节校准或容错部署。代码、数据产品和审计跟踪,包括一个撤回的声明,已发布。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:56

# 法规何时能被机器信任?机器提取法律逻辑的生存证书
来源:https://arxiv.org/html/2609.01741
###### 摘要

法规在被人阅读之前,正越来越多地被机器解析,但解析器之间存在分歧:以密苏里州法规为例,两个独立编写的提取器在数值阈值存在性判断上的假阴性率高达0.43。我们探讨在这样噪声下,何种形式逻辑能够幸存。我们为机器提取的法规上下文构建了一个被动的生存证书,用于验证杜克内-吉格蕴含基:测量每个属性上不同提取器之间的分歧,在1000次蒙特卡洛试验中对蕴含基进行回放,仅当生存率的单侧威尔逊95%下限达到0.95时,才认证一个蕴含;每个认证蕴含都附带前提跨度和最小反例。在29,365条密苏里州法条和502条印度中央法案条款上,预注册的保留测试通过(在7个标题中精确匹配10个法规族;在11个标题中16个法规族容差5%),然而在全局部署的错误模型下,93.2%的保留章节低于信息量门槛,而2×2因子设计将此归因于校准率转移,而非选择偏差。该证书可用但脆弱:需按章节校准或容错部署。代码、数据产品及审计跟踪记录(包括一项撤回声明)已发布。

## 引言

机器提取是我们所知每项法规流程的第一步:解析器读取文本并写下结构化属性,下游符号逻辑则将这些属性视为精确值。但它们并不精确。在本研究使用的密苏里州合并上下文中,两个独立编写的规则解析器在数值阈值存在性判断上的假阴性率达0.43。分歧并非边缘噪声;它存在于法律逻辑所依赖的属性上。

由此产生的问题是具体的,我们自己结果中的一对蕴含比任何框架都更好地阐述了这一点。在2,555条密苏里州合并条款中,标准蕴含基包含 `{deadline} → {numthresh}`(支持度792):近八百条条款将期限表述为数值持续时间,该蕴含看似语料库中最安全的规则。在测量到的分歧模型下,其生存概率为0.000,因为第二个提取器几乎一半时间会遗漏拼写出的数值阈值,每次遗漏都会产生反例。同一基中包含 `{oblig, proviso, unless, numthresh, penalty, deadline} → {prohib}`(支持度12),这是关于条件繁多的监管条款的平凡规律,其生存概率为0.965,足以通过认证,因为它所依赖的属性几乎从未被两个提取器删除。支持度——所有符号流程可见的量——并不能预测在部署中重要的量:稳健性。预测稳健性的是蕴含的属性足迹与提取器测量误差结构之间的交互作用。

本文构建了使该交互明确化的工具:一个用于机器提取法规上下文杜克内-吉格(DG)蕴含基的*生存证书*。两个提取器——参考解析器和独立编写的词元邻接解析器——被应用于相同法规。其每个属性的分歧校准了一个条件误差模型。该模型在N=1000次蒙特卡洛试验中对参考基进行回放,每个标准蕴含在测量噪声下获得一个生存概率。当生存率的单侧威尔逊95%下限达到τ=0.95时[16 (https://arxiv.org/html/2609.01741#bib.bib16)],且对认证集合采用本雅明尼-霍赫贝格校正[4 (https://arxiv.org/html/2609.01741#bib.bib4)],蕴含即通过认证。每个认证蕴含都带有出处:前提和结论跨度、一个最小反例,以及最可能的校准关联失效方式。

三项实证发现组织了本文。第一,支持度不是机器提取法律蕴含稳健性的可靠代理指标;该证书分离了在任何基于支持度或置信度的观点下看起来相同的蕴含(§5.1 (https://arxiv.org/html/2609.01741#S5.SS1))。第二,全局校准是脆弱的,因为提取分歧在法规章节间是异质的:在部署到每个章节的统一误差模型下,93.2%的保留密苏里州章节低于信息量门槛,而预注册的2×2因子设计将失败归因于异质章节间的校准率转移,而非保留集选择(§5.3 (https://arxiv.org/html/2609.01741#S5.SS3))。第三,按章节校准实质性提升了信息量,将保留集平均认证比例从0.038提升至0.128,同时该工具仍是条件性且脆弱的:它是基于经验测量的提取器间分歧模型下的生存统计下限,并非法律正确性的保证(§5.4 (https://arxiv.org/html/2609.01741#S5.SS4), §6 (https://arxiv.org/html/2609.01741#S6))。

控制性评估是预注册且保留的。评估门槛要求证书在至少两个来自不同标题的保留密苏里州法规族上具有信息量,误差模型在不相交的校准半集上测量。它通过了:在精确语义下,10个合格章节跨7个标题;在5%误差容忍语义下,16个章节跨11个标题。跨司法管辖区的复制失败:在IndiaCode上,6个合格法案中没有一个落入信息量区间。我们如实报告两者,未作平滑处理。

贡献。(i) 用于机器提取法规上下文DG基的被动生存证书:在测量到的条件误差模型下的每个蕴含生存率,基于通用蒙特卡洛预算的威尔逊下限认证,精确和ε容忍语义,以及前提折叠/违反分解(§3 (https://arxiv.org/html/2609.01741#S3))。(ii) 一个携带反例的出处层,使每个认证蕴含均可手工审计(§3.6 (https://arxiv.org/html/2609.01741#S3.SS6))。(iii) 在密苏里州和IndiaCode上的预注册保留评估,包含将选择偏差与校准率转移混淆分离的因子设计、负对照组,以及458章节规模的运行(§4 (https://arxiv.org/html/2609.01741#S4), §5 (https://arxiv.org/html/2609.01741#S5))。

范围。该证书界定蕴含在解析器分歧下存活的概率。它不涉及解析器是否法律正确,参考提取是否为真实依据,或认证蕴含是否为真实法律规则。`Pr[蕴含在测量分歧下存活]`与`Pr[提取在法律上正确]`的区别在整个过程中得到维持,§6.2 (https://arxiv.org/html/2609.01741#S6.SS2)精确陈述了该工具的局限。

## 相关工作

#### FCA与蕴含基。

形式概念分析将二元对象-属性表转换为概念格;杜克内-吉格基是其标准、最小、完整的蕴含集[9 (https://arxiv.org/html/2609.01741#bib.bib9)]。该基的组合学已确定[12 (https://arxiv.org/html/2609.01741#bib.bib12)],且在实践中枚举速度快[10 (https://arxiv.org/html/2609.01741#bib.bib10)]。此文献假设上下文正确。我们研究当上下文是机器提取且可测量地有噪声时,该基会发生什么。

#### 有噪声和近似蕴含基。

精确关联规则的近似基[11 (https://arxiv.org/html/2609.01741#bib.bib11)]、精确规则的近似计算[3 (https://arxiv.org/html/2609.01741#bib.bib3)]以及基于置信度的冗余移除[2 (https://arxiv.org/html/2609.01741#bib.bib2)]放宽对象以获取稳健性;完全蕴含推断的稳健性也已被直接分析[8 (https://arxiv.org/html/2609.01741#bib.bib8)]。我们的ε容忍语义遵循博克曼的EL⊥本体容错构建[5 (https://arxiv.org/html/2609.01741#bib.bib5)]。这些工作交付了一个新的、近似的对象。我们保留精确的标准基作为产物,并询问其哪些成员能在测量到的扰动下存活,ε被视为声明的敏感性参数。

#### 稳定性与PAC式稳健性。

概念稳定性按抵抗对象删除的能力对概念排序[1 (https://arxiv.org/html/2609.01741#bib.bib1), 7 (https://arxiv.org/html/2609.01741#bib.bib7)];它不使用噪声模型,并回答重采样问题,而非提取问题。PAC蕴含基带有分布学习保证[6 (https://arxiv.org/html/2609.01741#bib.bib6)]。我们的保证是每个蕴含且频率主义的:在校准误差过程下生存率的威尔逊下限,集水平多重性由本雅明尼-霍赫贝格处理[16 (https://arxiv.org/html/2609.01741#bib.bib16), 4 (https://arxiv.org/html/2609.01741#bib.bib4)]。

#### 交互式误差纠正。

最接近的路线通过专家交互纠正错误上下文上的蕴含[13 (https://arxiv.org/html/2609.01741#bib.bib13)],并使用标准蕴含标记损坏行中的错误[15 (https://arxiv.org/html/2609.01741#bib.bib15)]。两者均假设人类仲裁者。我们用测量误差模型替代仲裁并被动认证;我们的反例载体与[15 (https://arxiv.org/html/2609.01741#bib.bib15)]方向相反,解释认证蕴含会如何失效,而非定罪损坏行。

#### 法律与法规NLP。

法律FCA应用稀少;我们可验证的最接近应用是将概念格用于巴西LGPD而未建模提取噪声[14 (https://arxiv.org/html/2609.01741#bib.bib14)]。生产法律工具在形式层之上运作,不计算任何蕴含基,因此该生态系统中没有可认证的东西。

本文占据的缺口:从机器提取法律属性诱导的精确符号蕴含的稳健性,在测量到的提取分歧下,带有可审计的反例和出处层。

## 方法

图1 (https://arxiv.org/html/2609.01741#S3.F1)展示了端到端的流程。本节定义每个阶段;不影响科学论证的实现细节推迟到附录。

法规语料库:RSMo 29,365条;IndiaCode 502条。
提取:参考解析器 R;独立解析器 E。
形式上下文:12个二元属性(仅操作性文本)。
DG标准基:NextClosure + 2次交叉检查。
校准:每个属性上的 p_fp, p_fn(来自 E 对比 R)。
扰动:方法A(主要)N=1000次试验。
证书:威尔逊下限 ≥ τ=0.95 + BH-FDR伴随。
出处:跨度 + 最小反例。

图1:流程。参考上下文在构建上即为文献真实;校准测量第二个独立编写的解析器与其分歧程度;认证询问哪些标准蕴含能在该测量分歧下存活。### 二元法规上下文

形式上下文 K=(G,M,I) 有条款 G 作为对象,二元属性 M,以及关联 I⊆G×M [9 (https://arxiv.org/html/2609.01741#bib.bib9)]。对于 X⊆M,推导 X′={g∈G: gIm ∀m∈X} 及其对偶给出闭包运算符 X′′;蕴含 X→Y 在 K 中成立当且仅当 Y⊆X′′,即每个携带所有 X 的条款也携带所有 Y。X 的支持度是 supp(X)=|X′|。

模式在12个机器可验证的操作性文本属性上固定:oblig, prohib, permis, proviso, unless, except, xref, xref_res, def, numthresh, penalty, deadline(定义见附录A (https://arxiv.org/html/2609.01741#A1))。由参考解析器产生的参考上下文在实验内被视为文献真实。我们测量的一切是下游逻辑对提取分歧的稳健性,而非提取本身是否正确。

### 杜克内-吉格基

我们使用NextClosure计算DG标准基[9 (https://arxiv.org/html/2609.01741#bib.bib9)],并与独立的基于定义的伪意图预言机和concepts库交叉检查;三者在每个真实上下文上一致。枚举在亚秒内完成且有界(在9个主要上下文中最大基为59,在304/458章节扫描中为62,相比预注册上限10,000)。评估目标是前提支持度至少为 S_min=1 的蕴含集;零支持度蕴含被丢弃,模式同义反复 xref_res→xref 被标记并单独报告。

### 校准:测量的提取器间分歧

误差模型是测量的,非假设的。第二个解析器与参考解析器独立编写(词元邻接扫描、独立编写的词表、否定窗口极性、数字和拼写数字识别、无共享模式表),被应用于相同条款。对于每个属性 m,我们记录条件分歧率 p_fp(m)=Pr[m∈E(g) ∣ m∉R(g)] 和 p_fn(m)=Pr[m∉E(g) ∣ m∈R(g)]。表9 (https://arxiv.org/html/2609.01741#A4.T9)(附录D (https://arxiv.org/html/2609.01741#A4))给出了合并矩阵:numthresh主导假阴性(p_fn=0.429),而 prohib, xref, except, deadline 测量到的 p_fn=0。

该量是*两个手工构建解析器之间的提取器间分歧*。它不是外部验证的提取错误,且两个解析器共享上游操作性文本分割和模式,因此分歧可能低估真实错误(§6.2 (https://arxiv.org/html/2609.01741#S6.SS2))。因此证书是条件性的:它界定在测量分歧模型下的存活,仅此而已。

### 扰动模型

方法A(主要)。
独立每个属性条件翻转:在每次蒙特卡洛试验中,单元格 (g,m) 在不存在时以概率 p_fp(m) 添加,在存在时以概率 p_fn(m) 移除。方法A生成真正的新错误,并假设每个属性独立;该假设被披露并经过压力测试,而非隐藏。

方法D⋆(联合误差诊断)。
极性条件联合残差自助法:整个观察到的每条款误差向量从校准池中抽取,仅在供体和目标参考极性匹配时逐单元格应用,在测量条件率下保留联合共误差结构。D⋆的存在是为了检验方法A的独立性假设是否低估了损害;它不是第二个独立提取器。机制及其替代的无效估计器记录在附录K (https://arxiv.org/html/2609.01741#A11)。

### 存活与认证

给定扰动上下文 K~,蕴含 X→Y *非平凡地存活* 当且仅当某些行仍支持 X 且该蕴含在所有支持行上成立(精确,ε=0)或在最多 ε 比例的支持行上成立(ε容忍)。

相似文章

法规AI:使大语言模型与法律规范对齐

arXiv cs.AI

该论文提出Statutory AI,这是一种利用法律文本来对齐大语言模型与法律规范的混合方法,与标准宪法AI相比,可将有害内容减少52-59个百分点,同时计算时间缩短超过50%。