文档抽取中基于字段的选择性风险控制:三种失效模式、一个有效性阶梯及其有效条件

arXiv cs.LG 论文

摘要

本文剖析了文档抽取系统中基于字段的选择性风险控制的三种失效模式,并提出一个由低到高的有效性阶梯式修复方案,通过使用前沿AI模型在真实数据上的实验证明了其改进效果。

arXiv:2608.14639v1 公告类型:新研究 摘要:在字段级别以选择性风险不超过α为标准的“接受/审核”机制——即仅当已接受字段的错误率被控制在α以内时才接受该字段——是文档抽取系统所需的信任契约,而现有常规流程在真实文档上却悄然违反了该契约。在来自800份CORD收据的13,859个真实的claude-sonnet-5字段(正确率49.0%)上,我们诊断出三种失效模式:文档聚集效应(设计效应1.84-2.45)、分数重拟合泄漏(覆盖率0.416对应风险0.127,在95%的数据划分中违反了α=0.10的要求),以及平局分数病理(退化的分数导致阈值网格崩溃,从0.030降至0.001)。我们将修复方案组织为一个有效性阶梯,并为每一层声明其保证形式。一个拟合/验证集划分协议为一种学习到的融合模型恢复了期望选择性风险控制:在名义α=0.10下,其覆盖率为0.318,对应风险为0.096,无容差带(生产变体为0.326)——这是一个平均意义上的点估计,其在47.5%的重复划分中实现的风险超过了α,而非一种保证。蒙德里安“先学习后检验”方法配合精确二项式尾部检验提供了每组的PAC保证:字段独立同分布下覆盖率为0.171,风险0.068;经聚集校正后为0.140;文档独立同分布下为0.060——这是唯一匹配文档特性的层级,但目前其保证非常弱。预先指定的“来源分类法-支撑箱”方法在sonnet模型处理CORD数据集的所有严格层级上均获胜(p<1e-4,经Bonferroni校正)——但此优势在相同文档上使用haiku或qwen模型时无法复现;而在更高精度的语料库上,合并阈值方法获胜:条件作用恰恰在合并方法无法提供保证的地方起效,而在其他地方则被学习分数所涵盖。在未经选择调整的claude-haiku-4-5模型上,冻结配置的确认测试在两个风险水平上均成立。一项盲评的三标注员人工黄金标准审计验证了实际层级接受集合的风险为1.3%,低于其10%的预算(Fleiss' kappa=0.83;标签错误呈单向悲观)。本研究以Apache-2.0协议发布,包含种子固定、回归门控的流程。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:18

# 文档提取的逐字段有效选择性风险控制:三种失败模式、一个有效性阶梯,以及条件化何时有效

来源:https://arxiv.org/html/2608.14639

###### 摘要

在选择性风险不超过α\\alpha的前提下进行逐字段接受/审查——仅当接受字段中的错误率得到控制时才接受该字段——是文档提取系统需要的信任契约,而通过校准集上的加一平滑阈值来设定置信度分数这一自然流程,在实际文档中悄然违反了这一契约。在800份CORD收据(字段正确率49.0%)的13,859个真实claude-sonnet-5字段上,我们诊断并量化了三种失败模式:文档聚类(设计效应为1.84–2.45,大致将有效校准规模减半)、分数重拟合泄露(在同一字段上拟合学习到的分数及其阈值:覆盖率0.416,风险0.127,在95%的划分中违反了名义α=0.10\\alpha\{=\}0.10),以及平局质量病理(退化的分数分布使阈值网格崩溃;一个反事实的单个信号归零重现了0.030→0.0010.030\\\!\\\to\\\!0.001的认证覆盖率崩溃)。我们将修复方案组织为一个**有效性阶梯**,并在每一级陈述其保证形式。一个*训练/验证划分协议*恢复了学习融合分数的期望选择性风险控制:在名义α=0.10\\alpha\{=\}0.10且无容差带(生产变体为0.326,风险0.097)的情况下,覆盖率为0.318,达成风险为0.096——这是一个平均运行点,其实际风险在47.5%的重划分中超过α\\alpha,并非认证。蒙德里安学习后检验(Mondrian Learn-then-Test)结合精确二项分布尾部检验,产生每组PAC*认证*:字段-iid在风险0.068时的覆盖率为0.171(违规率0.03),聚类校正后在风险0.051时的覆盖率为0.140,文档-iid在风险0.020时的覆盖率为0.060——这是唯一假设与文档匹配的层级,但目前几乎空洞无物。**支持区间**,即预先指定的基于来源的*出处*分类法,在sonnet CORD捕获上赢得了所有严谨性层级(p<10−4p<10^\{\-4},40个文档级重划分中符号翻转;经Bonferroni校正后跨分类法)——这一胜利*并未*在相同文档上使用haiku或qwen模型时重现(§7 (https://arxiv.org/html/2608.14639#S7)),而在更高精度的语料库上,合并阈值获胜:条件化恰好在合并阈值无法认证的地方挽救了认证,而在其他地方,学习分数则包含了它。在选择步骤未触及的claude-haiku-4-5捕获上,冻结配置的确认保持了两个风险水平(在0.093时为0.167;在0.037时为0.068),并且一次盲目的三标注者人类黄金标准审计验证了实际层级接受集的风险相对于其10%10\\%预算为*1.3%1.3\\%*(Fleiss'κ=0.83\\kappa\{=\}0.83;自动校准标签错误呈单边悲观)。以Apache-2.0协议发布,包含种子固定、回归门控流程。

## 1引言

文档解析器现在能够流畅地阅读页面,但仍然会悄然输出错误的结构化值(Ferguson 等人, 2026 (https://arxiv.org/html/2608.14639#bib.bib1))。领域趋同的解决方案是逐字段*信任契约*:每个提取的字段都带有一个置信度和一个接受/审查决策,系统承诺*选择性风险*——接受字段中的错误率——保持在目标α\\alpha以下。自然的实现方式是经验法则:拟合置信度分数,留出一个校准集,选择其加一平滑经验选择性风险≤α\\leqα的最小阈值(Geifman 和 El-Yaniv, 2019 (https://arxiv.org/html/2608.14639#bib.bib15);Angelopoulos 等人, 2024 (https://arxiv.org/html/2608.14639#bib.bib17))。本文表明,在真实的前沿LLM输出的大规模测试中,这一经验法则流程在实际文档上悄然违反了契约——并展示了在三个明确的严谨性层级上应运行什么。

我们的测试平台是刻意困难且刻意真实的:从claude-sonnet-5在800份CORD收据上捕获的13,859个逐字段预测,其中只有49.0%是正确的,加上跨越难度范围的FUNSD和XFUND-de捕获(表1 (https://arxiv.org/html/2608.14639#S3.T1));构造、标签和测量结果在配套基准论文中(Gurram, 2026 (https://arxiv.org/html/2608.14639#bib.bib31))。111配套论文:本文拥有流程、保证、诊断和表征;VerifyDocBench(Gurram, 2026 (https://arxiv.org/html/2608.14639#bib.bib31))拥有数据集、标注流程和可靠性审计,以及模型/语言测量研究。这里的数字可从已发布的工具箱中重现(种子固定的划分、回归门控流程)。

#### 贡献\.

\(C1\) 诊断\. 文档上朴素的逐字段选择性保证的三种量化失败模式——文档聚类(设计效应1.84–2.45)、分数重拟合泄露(风险0.127,名义0.10,95%划分违反)以及平局质量病理(退化分数使阈值网格崩溃)——每一项都通过反事实实验得以确定(§4 (https://arxiv.org/html/2608.14639#S4))。这些均未在文档提取中被量化过。\(C2\) 协议\. 一个作为报告标准的*有效性阶梯*(§5 (https://arxiv.org/html/2608.14639#S5)):实际层级(训练/验证划分协议 + 加一法;控制*期望*选择性风险)、严谨的字段-iid PAC层级(蒙德里安学习后检验,使用精确二项分布尾部,每组P\(risk\>α\)≤δP\(\\text\{risk\}\>\\alpha\)\\leqδ),以及严谨的文档-iid PAC层级(每文档约束;与文档匹配的可交换性单元),每行都标注了其估计量、假设和违规比例。\(C3\) 结果\. 首次在真实前沿LLM的大规模提取上,保持了名义运行点和PAC认证(§6 (https://arxiv.org/html/2608.14639#S6)),其中*出处*(基于来源的支持区间)作为预先指定的条件化分类法,在困难区域的sonnet捕获上赢得了所有严谨性层级(p<10−4p<10^\{\-4})——这是一个模型范围的结果,并非语料库通用:§7 (https://arxiv.org/html/2608.14639#S7)显示,当使用信号较弱的模型处理相同文档时,这一胜利会崩溃。\(C4\) 表征\. 一个具有所述机制的经验双重区域定律(§7 (https://arxiv.org/html/2608.14639#S7)):当使用学习到的接受分数时,协变量属于*分数内*(蒙德里安条件化被包含,且可能有害);当使用冻结或弱分数时,协变量属于*分类法内*——并且分类法侧的条件化恰好在合并阈值无法在目标α\\alpha下进行认证的地方获得回报。\(C5\) 工件\. 一个开放、解耦的工具箱:40个固定的文档级划分(种子7),跨实验链式位精确合理性门控,463/624单元格位精确回归检查,以及完整披露捕获阶段的数据缺陷及其取证分析(附录B (https://arxiv.org/html/2608.14639#A2))。

我们不声称新的保形理论:机制是经典的(Vovk 等人, 2003 (https://arxiv.org/html/2608.14639#bib.bib24);Angelopoulos 等人, 2021 (https://arxiv.org/html/2608.14639#bib.bib18);2024 (https://arxiv.org/html/2608.14639#bib.bib17))。贡献在于诊断、协议、认证应用以及表征。

## 2相关工作

提取的置信度\.*超越对数概率*(Preprint authors, 2026a (https://arxiv.org/html/2608.14639#bib.bib8))融合了对数概率和一致性,用于文档字段置信度,并报告ECE/AUROC/选择性风险;Cleanlab TLM(Cleanlab, 2025 (https://arxiv.org/html/2608.14639#bib.bib10))销售模型无关的逐字段信任分数;实时可信度评分(Preprint authors, 2026b (https://arxiv.org/html/2608.14639#bib.bib9))类似。这些都没有附加来源信息,也没有提供风险控制的接受/审查保证——这正是本文及配套基准(Gurram, 2026 (https://arxiv.org/html/2608.14639#bib.bib31))所增加的维度。KIE的来源本身已经确立(DocILE的KILE任务(Šimša 等人, 2023 (https://arxiv.org/html/2608.14639#bib.bib4))、SROIE(Huang 等人, 2019 (https://arxiv.org/html/2608.14639#bib.bib5))、OCRBench v2(Fu 等人, 2025 (https://arxiv.org/html/2608.14639#bib.bib6))、BoundingDocs(Preprint authors, 2025a (https://arxiv.org/html/2608.14639#bib.bib29)));我们使用出处作为*风险控制的条件化协变量*,而非输出格式。诸如语义熵(Farquhar 等人, 2024 (https://arxiv.org/html/2608.14639#bib.bib11))和一致性/语言融合(Chen 和 Mueller, 2023 (https://arxiv.org/html/2608.14639#bib.bib12))之类的不确定性信号共享一个盲点(自洽错误),这促使了我们分类法所使用的外部验证信号——来源支持。

选择性预测与风险控制\.加一选择性风险阈值是Geifman 和 El-Yaniv(2019 (https://arxiv.org/html/2608.14639#bib.bib15))的选择性分类约束;保形风险控制(Angelopoulos 等人, 2024 (https://arxiv.org/html/2608.14639#bib.bib17))、保形事实性(Mohri 和 Hashimoto, 2024 (https://arxiv.org/html/2608.14639#bib.bib22))和选择性CRC(Preprint authors, 2025b (https://arxiv.org/html/2608.14639#bib.bib26))控制*边际*风险。学习后检验(Angelopoulos 等人, 2021 (https://arxiv.org/html/2608.14639#bib.bib18))将风险控制转化为多重检验——我们的严谨层级通过精确二项分布尾部(Clopper 和 Pearson, 1934 (https://arxiv.org/html/2608.14639#bib.bib21))和Holm逐步下降法(Holm, 1979 (https://arxiv.org/html/2608.14639#bib.bib20))实现了这一点。条件覆盖理论(Gibbs 等人, 2025 (https://arxiv.org/html/2608.14639#bib.bib23))表明精确的每实例条件化是不可能的,但精确的*组*条件控制是可以实现的(蒙德里安CP(Vovk 等人, 2003 (https://arxiv.org/html/2608.14639#bib.bib24)));风险控制预测集(Bates 等人, 2021 (https://arxiv.org/html/2608.14639#bib.bib19))给出了我们陈述的PAC形式。CRC-certify(Preprint authors, 2026d (https://arxiv.org/html/2608.14639#bib.bib25))定义了字段级JSON损失和弃权边界,但未以出处为条件,也未诊断本文主题的文档特定失败模式。风险控制的生成式OCR(Preprint authors, 2026c (https://arxiv.org/html/2608.14639#bib.bib27))和VISA(Preprint authors, 2024 (https://arxiv.org/html/2608.14639#bib.bib28))确立了视觉归因;Traub 和 Kirchhof(2024 (https://arxiv.org/html/2608.14639#bib.bib16))则从评估角度研究了选择性预测。

## 3设置

### 3\.1任务与信任契约

给定一个文档DD和一个JSON模式SS,提取器输出带有值的叶字段;信任层为每个字段附加一个置信度c∈\[0,1\]c\\in\[0,1\]、一个来源(页面/bbox/字符区间,带有支持分数),以及一个决策\{接受,审查\}\\\{\\text\{接受\},\\text\{审查\}\\\}。契约:在选择性风险(接受字段中的错误率)≤α\\leqα的前提下,最大化*覆盖率*(接受的比例)。正确性标签是模式类型化的(每个叶字段为精确/数字/语义);遗漏和幻觉被单独评分(Gurram, 2026 (https://arxiv.org/html/2608.14639#bib.bib31))。

### 3\.2数据:真实的前沿LLM捕获

所有主要实验运行在*真实的*claude-sonnet-5(k=3k\{=\}3自洽性)的逐字段输出上,这些输出仅捕获一次并被冻结(表1 (https://arxiv.org/html/2608.14639#S3.T1))。这些捕获是通过文本层提示的:模型读取文档的OCR文本层,而非页面图像——尽管“VLM”是闭源前沿API模型的自然简称,但在本文的主要结果中未使用任何视觉能力(配套基准论文中跨供应商的gpt-4o行是两篇论文中唯一真正基于视觉的捕获;参见(Gurram, 2026 (https://arxiv.org/html/2608.14639#bib.bib31)))。CORD是困难区域:只有49.0%的主张字段是正确的,但来源具有很强的区分性(有来源 vs 无来源的正确性差距+0.352+0.352,95%文档聚类置信区间\[0.33,0.37\]\[0.33,0.37\];语言化AUROC0.8450.845\[0.83,0.86\]\[0.83,0.86\])(Gurram, 2026 (https://arxiv.org/html/2608.14639#bib.bib31))。claude-haiku-4-5捕获保留用于冻结配置确认(§6.4 (https://arxiv.org/html/2608.14639#S6.SS4)),未经过任何选择步骤。

表 1:本文使用的真实逐字段捕获。“正确” = 主张字段中被评为正确的比例;“有来源” = 有定位来源的字段比例。haiku捕获未经选择(仅用于确认)。
### 3\.3信号与接受分数

对于每个字段,我们计算五个信号:语言化的自我报告、kk次抽样自洽性、一个有来源标志、一个基于自然语言推理(NLI)的价值与源区域的蕴含分数,以及*歧义惩罚来源支持*。支持是信任相关的出处信号:当预测值匹配m个同样好的页面位置(例如一个裸露的“2”匹配许多标记)时,我们保留支持=分数/m\\text\{支持\}=\\text\{分数\}/m。在均匀先验下,m个同样好的匹配中恰好有一个真实来源,那么1/m1/m是给定匹配是来源的概率——这是一个表现良好的启发式方法(并非声称最优),它将偶然的短值匹配隔离出有良好来源的组之外。表2 (https://arxiv.org/html/2608.14639#S3.T2)消融了惩罚形式;更软的形式(1/m1/\\sqrt\{m}, 1/\(1\+ln⁡m\)1/\(1\{\+\}\\ln m\))惩罚不足,将偶然匹配(及其错误)留在了有来源的组内。

表 2:歧义惩罚形式的消融:在m个同样好位置找到的单位分数匹配所保留的支持。均匀先验1/m1/m最积极地降低模糊匹配的等级;更软的形式惩罚不足。始终使用两个接受分数。*共享的低容量融合*是一个基于5个信号的逻辑回归(黑盒默认;我们不称其为“固定”,因为它在每个划分上重新拟合——参见§6.1 (https://arxiv.org/html/2608.14639#S6.SS1)中的警告)。*学习融合*(hgb\_split)是一个深度为3的直方图梯度提升树,基于五个信号加上工程特征(值长度、数字比例、是否为数字、信号交互和字段类型独热编码),并带有文档级早停机制;在CORD上的测试AUROC为0.925,而LR为0.871。\_noent变体去除了NLI信号。

### 3\.4条件化分类法

蒙德里安条件化在分类法的每个组内应用相同的阈值规则(Vovk 等人, 2003 (https://arxiv.org/html/2608.14639#bib.bib24))。候选方法:合并(单个组);*支持区间*(歧义惩罚支持的三分位数,校准分位数为0\.34/0\.670\.34/0\.67)——这是*预先指定的出处分类法*,在任何大规模实验开始前的预研草案中就被宣布为本项目的论点;字段类型-频率(叶键词汇表,键有≥\\geq25个校准字段);字段类型-规则(固定的关键词映射,与数据无关)。所有数据相关的分类法部分(区间边界、词汇表)仅从阈值拟合行计算得出。

### 3\.5评估协议:“保持”的含义

每个数字是40个固定的文档级50/50校准/测试划分(numpy生成器种子7;一个文档的字段从不跨越划分边界)的平均值,在名义α\\alpha下且*无*容差带。一个配置被*保持*当且仅当其平均达成的测试选择性风险≤α\\leqα;我们总是共同报告跨划分的覆盖率标准差以及违规比例,即实际风险超过α\\alpha的划分比例。配对差异使用双侧符号翻转置换检验(20,000次翻转):其下限为1/20,0011/20\{,\}001,因此我们写作p<10−4p<10^\{\-4},从不更小;因为40个重划分共享文档,这些p值衡量的是*划分重采样*

相似文章

超越Logprobs:一种基于多信号的LLM文档字段提取置信度引擎

arXiv cs.CL

ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。