超越Logprobs:一种基于多信号的LLM文档字段提取置信度引擎
摘要
ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。
arXiv:2606.24420v1 公告类型:新提交
摘要:在金融对账、合规验证和采购自动化等高风险文档处理流程中,LLM提取结果的隐性错误比显性缺失更为危险。核心挑战不仅在于提取准确性本身,更在于可靠的置信度估计:能够逐字段判断提取结果是否足以自动化处理,还是需要人工复核。词元级别的对数概率、口头化置信度以及多样本自一致性等方法,在实际阈值下均趋于全阳性行为,无法可靠区分可信与不可信的提取结果。
我们提出ExtractConf——一种跨领域、字段无关的置信度引擎,其置信度估计基于对同一文档的两种结构不同的解读方式。字段引导的Hunter调用在模式槽填充压力下提取每个字段;文档引导的Mapper调用则进行整体扫描,输出根植于文档内容的值。这种不对称性导致不同的失败模式:Hunter会对缺失字段产生幻觉值,而Mapper会遗漏视觉上不显著的信息。两者之间的不一致性本身具有独立的信息价值。ExtractConf融合了跨调用不一致性、LLM内部不确定性、OCR、图像质量和空间布局,形成一个无需领域特定规则或重新训练的分类器。在DocILE数据集(55字段发票,26%失败率)上,该方法达到了0.928的ROC AUC,并将选择性预测风险相比于对数概率均值降低了70%。在80%覆盖率下,准确率达到99.1%,实现了实用的人机协同工作流。对CORD收据的零样本迁移取得了0.858 AUC;轻量级Lasso重新校准使ECE降低了89%,Brier分数降低了43%,证实了该信号在文档领域间的泛化能力。
查看缓存全文
缓存时间: 2026/06/24 07:47
# 1. 引言 来源: https://arxiv.org/html/2606.24420 超越对数概率:用于基于LLM的文档字段提取的多信号置信度引擎¹¹扩展版已被 RobustifAI 研讨会(IJCAI-ECAI 2026,德国不莱梅)接收(口头报告)。 Nitesh Kumar¹ ¹Perfios Software Solutions Pvt. Ltd. [email protected] 摘要 在高风险的文档处理流水线中,包括财务对账、合规验证和采购自动化,一个默默出错的大语言模型(LLM)提取结果比明显缺失的结果更危险。核心挑战并非仅提取准确率,而是*可靠的置信度估计*:逐字段地判断,给定的提取结果能否被信任用于自动化,还是必须交由人工审核。现有方法存在不足:词元级别的对数概率、口语化置信度以及多样本自一致性,在实际阈值下都会趋向于全阳性行为,无法在可信和不可信提取之间提供可靠的区分。 我们提出了**ExtractConf**,一个跨领域、与字段无关的置信度引擎,其基于对同一份文档的两种结构上不同的解读来构建可靠的置信度估计。一次由字段引导的**Hunter**调用,在模式-槽位补全提示下独立提取每个字段;一次由文档引导的**Mapper**调用,整体扫描文档并展示出基于文档实际内容的候选值,而不受任何单一字段的锚定。这种输出结构的不对称性使它们具有不同的失败模式:**Hunter**倾向于为模棱两可或缺失的字段凭空捏造值,而**Mapper**倾向于遗漏视觉上不显著的字段。它们之间的分歧本身提供了独立的信息。**ExtractConf**融合了源自这种跨调用分歧、LLM内部不确定性、OCR、图像质量和空间布局的信号,通过一个二元分类器运行,无需任何领域特定的规则或为新文档类型或字段集重新训练。在DocILE上(55字段发票,26%自然失败率),**ExtractConf**达到了0.928的ROC AUC,并将选择性预测风险相比对数概率均值降低了70%。在最高置信度区间,准确率达到99.1%,比基准率提高了25.8个百分点,实现了一个实用的人机协作工作流程:自动化高置信度预测,其余转交人工。零样本迁移到CORD收据实现了0.858 AUC,无需任何重新训练;轻量级Lasso重校准将ECE降低了89%,Brier降低了43%,证实了这些可靠性信号在不同文档领域间具有泛化能力。 从商业文档中自动提取结构化字段是一项高价值的生成任务,其中错误的提取会带来直接的经济后果。近年来,大型多模态LLM显著推进了文档信息提取[[1](https://arxiv.org/html/2606.24420#bib.bib1), [2](https://arxiv.org/html/2606.24420#bib.bib2)],在涵盖发票、收据和表单的结构化基准上取得了很高的准确率。然而,生产部署需要的不仅仅是准确率:还需要*知道何时信任一个提取结果*。一个校准过的置信度分数使得工作流程能够将低置信度预测转交人工审核,在最大化自动化吞吐量的同时减少代价高昂的下游错误。这种选择性预测问题在分类场景中已有充分研究[[4](https://arxiv.org/html/2606.24420#bib.bib4), [5](https://arxiv.org/html/2606.24420#bib.bib5)],但在基于LLM的文档提取中仍未得到有效解决。 标准的方法是使用词元级别的对数概率作为正确性的代理。我们证明这从根本上失败:在DocILE上,一个55字段的发票基准测试中,前沿LLM在26%的字段上失败,对数概率均值仅达到0.705的ROC AUC,并在任何实际阈值下退化为全阳性分类器。口语化自我评估的置信度表现类似(0.692 AUC)。即使是通过五次采样调用的自一致性,也只达到0.744 AUC,略有改善,但AURC为0.138,略低于对数概率均值的0.145,并且API成本是单次调用的5倍。 这种失败是结构性的。这些方法衡量的是*生成词元序列*的置信度,但文档处理中的提取错误经常由模型无法观察到的失败原因引起:不可读的源材料、模糊的布局、OCR噪声。前沿LLM自信地转录OCR噪声会产生高对数概率的错误答案。 **ExtractConf**采取了不同的方法:从多个异质来源构建可靠性信号,即模型生成了什么,文档的图像质量揭示了什么,提取结果的空间位置在哪里,文档OCR说了什么,以及两次结构上不同的提取调用是否一致。驱动该架构的设计问题是:*如果我们用两种具有不同失败模式的方式两次阅读同一份文档,会怎样?* #### 贡献 1. 1.我们引入了一种双调用 **Hunter–Mapper** 设计,其中两次结构上不对称的LLM调用从相反的输出结构方向处理同一份文档。(§3)。 2. 2.我们将这种跨调用信号与LLM内部不确定性、文档质量和空间布局融合到一个梯度提升置信度分类器中,实现了0.928的ROC AUC,并将选择性预测风险相比对数概率均值降低了70%(§5)。 3. 3.我们展示了所有三种基线作为路由信号的失败之处;自一致性每字段成本增加5倍,但AURC改善微乎其微;并且单独使用文档质量就优于单独使用LLM内部不确定性。(§5)。 4. 4.事后重校准(M7/M8)将ECE降低了最多83%,为判别、校准和路由质量建立了三种部署配置(§5)。 5. 5.在CORD上的零样本Lasso重校准实现了ECE降低-89%,Brier降低-43%,证实了可靠性信号在不同文档领域间具有泛化能力(§5.1)。 ## 2. 相关工作 #### 多信号KIE置信度 **HYCEDIS**[[13](https://arxiv.org/html/2606.24420#bib.bib13)]是**ExtractConf**最接近的前身:它通过一个学习的二元分类器融合CRNN OCR对数概率、LSTM语言特征、Graph-KV结构对数概率和VAE图像异常分数,以预测每个KIE提取是否正确,并在SROIE和CORD上报告AUC和ECE。**ExtractConf**继承了多信号融合范式,但在三个方向上将其扩展到LLM时代:LLM对数概率和熵取代了CRNN对数概率;不对称的**Hunter–Mapper**设计增加了一个在HYCEDIS中结构上缺失的跨调用信号;评估使用了DocILE,一个55字段的基准测试,具有26%的自然失败率,而SROIE为4%,提供了更丰富的负样本监督。 #### 选择性预测与弃权 **ExtractConf**本质上是一个选择性预测系统:它决定是对提取结果采取行动还是转交人工审核,并使用选择性预测指标AURC进行评估。Geifman和El-Yaniv[[4](https://arxiv.org/html/2606.24420#bib.bib4)]形式化了神经网络的选择性预测,表明通过对低置信度预测弃权可以实现覆盖率-准确率的权衡。Corbière等人[[5](https://arxiv.org/html/2606.24420#bib.bib5)]提出学习一个独立的弃权置信度分数,而不是依赖softmax概率,这启发了我们的CatBoost元分类器设计。本文使用的风险覆盖率曲线和AURC遵循Geifman和El-Yaniv[[6](https://arxiv.org/html/2606.24420#bib.bib6)]的选择性预测评估框架。共形预测[[14](https://arxiv.org/html/2606.24420#bib.bib14)]事后提供覆盖率保证,但产生集合值输出而非校准的标量分数;**ExtractConf**是补充性的,提供了能够实现连续路由决策的分级概率估计。 #### 集成分歧与认知不确定性 **Hunter–Mapper**设计属于更广泛的分歧基不确定性估计器家族。查询委员会[[7](https://arxiv.org/html/2606.24420#bib.bib7)]使用集成成员间的分歧作为主动学习信号;协同训练[[8](https://arxiv.org/html/2606.24420#bib.bib8)]利用同一实例的两个视图之间的分歧来传播标签。Lakshminarayanan等人[[9](https://arxiv.org/html/2606.24420#bib.bib9)]表明,深度集成通过预测分歧产生比单一模型校准得更好的不确定性。**ExtractConf**的**Hunter–Mapper**对与这些方法有一个关键区别:两次调用不是经过不同训练或独立初始化;它们是接收*结构上不对称的提示*的同一个模型,具有不同的失败模式。因此,分歧源于认知不确定性,衡量文档是否为两种解读提供足够的依据使其收敛,而不是反映集成成员间的参数方差。 #### LLM不确定性量化 自一致性[[28](https://arxiv.org/html/2606.24420#bib.bib28)]采样多次生成并使用多数一致作为置信度;我们将其作为基线B3。其路由效用受限于分数粒度:使用5次调用。BSDetector[[17](https://arxiv.org/html/2606.24420#bib.bib17)]和CONSTRUCT[[18](https://arxiv.org/html/2606.24420#bib.bib18)]将基于一致性的UQ扩展到结构化提取输出,但不知晓文档;它们不使用OCR、空间或图像质量信号。语义熵[[19](https://arxiv.org/html/2606.24420#bib.bib19)]聚类语义等价的生成并测量聚类熵;P(True)[[20](https://arxiv.org/html/2606.24420#bib.bib20)]使用LLM自我评估;口语化置信度[[21](https://arxiv.org/html/2606.24420#bib.bib21)]引出数值分数。这些方法作为仅模型的基线(B1, B2)包含在内。语义熵不直接适用于结构化字段提取,其中正确性由与真实值的精确或近似精确字符串匹配决定,而不是自由形式生成之间的语义等价。 #### 多模态基础不确定性 **ExtractConf**的核心洞见,即提取的不确定性应源自文档侧基础的不稳定性而非仅仅词元概率,与新兴的多模态幻觉文献相关。Li等人[[10](https://arxiv.org/html/2606.24420#bib.bib10)]表明,视觉语言模型以高置信度幻觉出图像中不存在的对象,这正是**Hunter**在缺失字段上表现出的失败模式。这个问题在文档AI中的特定变体,即OCR置信度作为基础质量代理,由ConfBERT[[15](https://arxiv.org/html/2606.24420#bib.bib15)]验证,它将OCR置信度注入BERT用于事后OCR错误检测。 #### 结构化预测的校准 Jagannatha和Yu[[22](https://arxiv.org/html/2606.24420#bib.bib22)]对温度缩放、MC-Dropout和等渗回归在NER和关系抽取校准上进行了基准测试,确立了等渗回归是结构化NLP任务中强大的事后校准器,这启发了我们的M7设计。Nixon等人[[23](https://arxiv.org/html/2606.24420#bib.bib23)]提供了多桶ECE框架;Kull等人[[24](https://arxiv.org/html/2606.24420#bib.bib24)]提供了Brier分数分解为校准和细化组件,用于解释我们的映射器贡献。 ## 3. ExtractConf 架构 参考图注 图1:ExtractConf架构。一份文档并行输入两个不对称的LLM调用:字段引导的**Hunter**(蓝色)和文档引导的**Mapper**(橙色)。两者都报告提取的值、词元对数概率以及它们关注的相邻文本。值一致性、相邻文本重叠和空间中心差异(来自OCR边界框)构成跨调用可靠性信号。OCR置信度和图像质量通过虚线箭头输入特征表。所有40个特征由CatBoost分类器融合;可选的事后重校准(M7/M8)产生校准的概率。分数c∈[0,1]根据阈值τ路由至自动化或人工审核。 ### 3.1 双调用 Hunter–Mapper 设计 **Hunter**接收一个*字段引导*的提示:给定文档,提取字段f的值。它返回提取的值、每个词元的对数概率以及它在文档中关注的相邻文本。 **Mapper**接收一个*文档引导*的提示:给定文档,全面扫描并识别每个目标字段最显著的候选值,锚定于文档实际包含的内容,而非孤立地针对任何单个字段。它返回一个基于文档内容的字段-值对扁平列表、对数概率以及每个提取关注的相邻文本。 设计原理是*输出结构的不对称性*。**Hunter**在完成压力下为每个字段填充固定的模式槽位;无论字段是否在文档中清晰存在,它都会生成答案,因此容易为缺失或模糊的字段编造看似合理的值。**Mapper**生成一个在其文档中发现最显著内容的自由证据列表;它仅报告视觉上有根据的内容,因此在确实产生值时是可靠的。因此,它们的分歧本身提供了独立的信息:值冲突标志着真正的提取模糊性,而**Hunter**报告但**Mapper**沉默则标志着一个需要完成压力才能显现的字段,无论对数概率质量如何,都应给予较低的置信度。这两种失败模式都无法通过重新采样任一调用来观察,并且无论模式大小如何,两次调用的成本对于每份文档都是固定的。 ### 3.2 特征组 #### 组1:LLM内部不确定性 对于**Hunter**和**Mapper**调用分别独立地,我们从API返回的对数概率序列中提取词元级别的统计量。对于对数概率:均值、最小值、第10百分位数(P10)和标准差。对于香农词元熵:均值、最大值和第90百分位数(P90)。这些统计量总结了模型在整个解码轨迹中的置信度,而香农熵则专门捕获每一步概率质量的分散程度,提供了超越原始对数概率的不确定性互补视角。这产生了14个特征(每次调用7个),保持两组分开,因为**Hunter**和**Mapper**具有结构上不同的输出格式,它们的不确定性分布不可直接比较。 #### 组2:OCR基础与值置信度 LLM返回提取的值和字段标签,如同它们从文档中读取的那样。我们将它们与文档OCR词元列表进行比对,以计算区域级别的置信度分数。 **值在OCR中的匹配**是一个二元指示符,指示提取的值是否精确出现在文档的原始OCR文本中的任何位置。这为两次调用计算,用于检测那些无论字段分配如何,在任何OCR词元中都无根据的幻觉值。 **候选竞争特征**在不要求单个精确匹配的情况下捕获基础证据。它们试图捕捉有多少替代OCR证据看起来也兼容。对于**Hunter**标签区域,我们计算OCR候选值中其与提取标签的相似度超过三个阈值(50%、75%、90%)的比例,给出三个特征,总共六个候选竞争特征。这些特征编码了有多少竞争的OCR证据支持该提取,且仅对**Hunter**计算,作为主要的提取调用。 **标签和值**(以下部分被截断,但根据上下文,应继续描述其他特征组和后续部分。由于输入结束,我们翻译到此为止)。
相似文章
自信的撒谎者:利用对数概率和LLM-as-Judge诊断多智能体辩论
本文研究了多智能体辩论系统中令牌级对数概率分布、LLM-as-judge评分标准分数和最终任务准确性之间的关系。它发现了一致的四阶段置信度轨迹以及Constructor与Auditor智能体之间的角色不对称性。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
通过探针目标微调,让LLM真正表达其自信程度。[研究]
这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。
自我评价之言:大语言模型在机器翻译中的口头化置信度研究
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
面向可靠LLM判断的边际自适应置信度排序
本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。