施工文档中基于证据的约束检查

arXiv cs.AI 论文

摘要

提出了一种用于施工文档约束检查的基于证据的流水线,评估了在专家参考任务中PDF证据分配的分辨率-广度权衡。

公告类型:新 摘要:专业文档审查是一个约束检查问题,其中决策依赖于文本、几何、页面和文档修订之间的关系。我们提出了一种基于证据的流水线,该流水线规范化提取的事实,确定性地执行四状态规则,保留源跨度,并将未解决案例升级处理。我们使用重复的四系统测试和不相交的两系统广度扩展,在来自29个施工项目的160个基于参考依据的任务上评估其PDF证据分配器。在重复测试中,将四图像预算从检索到的页面概览重新分配为一个概览和三个重叠图块,使项目族标准化决策准确率提高了10.6个百分点(95%项目簇自助置信区间:4.3至18.0;精确p = 0.031)。这种效应在更广泛的区块中并不持续:Region-RAG将准确率改变了-4.1个百分点(95%置信区间:-10.2至1.9;精确p = 0.209),而等图像敏感性分析则偏向页面广度。精确发现集恢复率仍然较低,误通过仍然常见,重复运行的一致性校准不佳。结果表明,存在分辨率-广度权衡,而非区域聚焦证据具有普遍优势,这促使了规则感知的证据路由和专家审查。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:30

# 施工文档中基于证据的约束检查
来源:https://arxiv.org/html/2607.29058

###### 摘要

专业文档审查是一个约束检查问题,其答案取决于文本、几何、页面和文档修订之间的关系。我们提出了一个基于证据的流水线:规范化提取的事实,确定性地执行四状态规则,保留源片段,并将未解决的情况升级处理。我们在来自 29 个施工项目的 160 个专家引用任务上评估其 PDF 证据分配器,并进行了重复四系统测试和不相交两系统广度扩展。在重复测试中,将四张图片的容量从检索到的页面概览重新分配为一张概览加三张重叠切片,使项目簇标准化决策准确率提高了 10.6 个百分点(95% 项目簇 bootstrap CI 4.3–18.0;exactp=\.031p=\.031)。这种对比在更大的广度块中没有持续:Region-RAG 将准确率改变了 -4.1 个百分点(95% CI -10.2–1.9;exactp=\.209p=\.209),而均衡图片敏感性更有利于页面广度。精确发现定位仍然较低,误通过仍然常见,重复运行的一致性校准不佳。因此,核心结果不是切片具有普遍优势,而是需在专家审查之前进行规则与证据感知路由的分辨率–广度权衡。

多模态文档理解、约束检查、施工文档、证据锚定、选择性预测

## 1 引言

审查一套施工文档需要保留无序文本流无法保持的关系。细节标注只有在引线终止的对象处才有意义;图纸引用只有在其目标存在时才有效;产品送审件只有跨文档数值一致时才能满足规格书。这些是针对文本、几何、文档结构和修订状态的类型化约束。检索可以暴露正确的术语,却仍可能丢失做出正确专业判断所需的关系。

本文研究一个一般的机器学习问题:**多模态专业文档中的基于证据的约束检查**。施工文档是一个要求很高的试验场,因为页面很大、证据稀疏,而且未经检查的误通过可能比标记出来的案例后果更严重。我们使用 AEC-Bench(Mankodiyaet al.,2026 (https://arxiv.org/html/2607.29058#bib.bib1)),并根据其发布的一组专家生成引用的类型化清单对预测进行评分。主要终点是一个四路判定——满足、不满足、信息缺失或不确定——次要终点包括发现精确率和召回率、任务完全正确率、误通过率和误拒绝率、校准性以及选择性风险。

我们实现了一个基于证据的约束检查器,包含四个组件:源适配器、类型化事实、确定性规则和证明踪迹。PDF 适配器结合了保留布局的文本检索与受限视觉区域。CAD 和 IFC 使用相同的源片段接口,但不属于当前经验数据的一部分。确定性化简器将提取的事实状态转换为判定,而失败关闭策略会将缺失、不确定、低置信度或缺少踪迹的事实识别出来,交由专家审查。

我们的核心测试刻意收窄且可证伪:在相同的文本检索和四张图片上限下,将视觉容量分配给局部细节是否比将该容量分散到检索到的页面概览上更能改善专家引用决策?重复测试包含来自 6 个项目的 40 个任务、四个 Google/Azure 系统、三种证据策略以及每个单元五次调用(2,400 次试验)。广度扩展增加了来自 23 个不相交项目的 120 个任务,涵盖两个 Google 系统。独立推断在源项目级别进行。

贡献如下:

- •一个类型化约束检查架构,具有确定性化简、源级证据契约和显式专家升级;
- •一个机器可读的专家引用套件,包含 7 个约束族和 29 个源项目的 160 个任务;以及
- •一个受控证据分配实验,其中重复测试的 10.6 个百分点增益在 23 个不相交项目上变为 -4.1 个百分点,揭示了分辨率–广度权衡。

## 2 相关工作

#### 多模态文档。

DocVQA 确立了文档图像上的视觉问答任务(Mathewet al.,2021 (https://arxiv.org/html/2607.29058#bib.bib3));MMLongBench-Doc 研究包含文本和图形的长文档(Maet al.,2024 (https://arxiv.org/html/2607.29058#bib.bib4));M3DocRAG 和 ColPali 研究用于多页推理的多模态检索(Choet al.,2024 (https://arxiv.org/html/2607.29058#bib.bib5); Faysseet al.,2025 (https://arxiv.org/html/2607.29058#bib.bib6))。布局感知编码器和免 OCR 文档模型从像素和文本中学习页面结构(Huanget al.,2022 (https://arxiv.org/html/2607.29058#bib.bib7); Kimet al.,2022 (https://arxiv.org/html/2607.29058#bib.bib8))。这些设置使检索或表示成为被评估系统的一部分。我们的关注点比一般文档 QA 更窄:输出是一个类型化约束判定,具有不对称的安全错误、显式来源出处和源项目分组评估。

多模态检索工作通常优化哪些页面进入长上下文回答模型。我们的干预针对一个后续分配问题:在较小的图片预算和固定的排序文本集下,数据包应该保持页面广度,还是将容量用于局部分辨率?对于大幅面图纸来说,这种区别很重要,因为页面概览可以保留全局布局,但会使尺寸、引线和标注文本不可读。我们固定检索,以隔离这种分辨率–广度选择。

#### 施工文档理解。

AEC-Bench 评估在图纸、规格书和送审件上的可执行工作流(Mankodiyaet al.,2026 (https://arxiv.org/html/2607.29058#bib.bib1))。DrawingVQA 评估对已签发施工图纸的专家撰写问题,包括分辨率和纯文本消融(Junget al.,2026 (https://arxiv.org/html/2607.29058#bib.bib2))。我们保留前者多样的专业任务,但将分析限制在表达约束判断的七个族中,并根据其专家生成的引用清单对生成的发现进行评分。早期的自动检查系统针对结构化 BIM 表示编译建筑规则(Eastmanet al.,2009 (https://arxiv.org/html/2607.29058#bib.bib9); Solihin and Eastman,2015 (https://arxiv.org/html/2607.29058#bib.bib10))。我们的架构保留确定性执行和可审计规则状态,同时允许从 PDF 以及 CAD 和 IFC 源中提取事实。

结构化 BIM 检查假设相关实体和属性已经存在于一个可查询模型中。PDF 套装反转了这一前提:检查器必须在应用规则之前从稀疏文本和图形中恢复实体和关系。这促使我们将学习型事实提取边界与确定性规则边界分开。这也允许相同的规则和踪迹对象在未来接受 CAD/IFC 事实,而不把未经测试的模态视为当前结果的一部分。

#### 工具使用、弃权和测量。

使用工具的语言模型系统结合了检索、动作和生成(Yaoet al.,2023 (https://arxiv.org/html/2607.29058#bib.bib13));因此其观察到的性能取决于完整推理流水线。选择性预测要求系统以覆盖率换取更低风险(Geifman and El-Yaniv,2017 (https://arxiv.org/html/2607.29058#bib.bib11)),而校准则询问置信度是否与正确性相对应(Guoet al.,2017 (https://arxiv.org/html/2607.29058#bib.bib12))。在专业审查中,两者都需要在独立项目层面进行验证,而不是将重复调用视为新案例。我们的分析报告了这些量,但没有推断专家一致性,因为源发布没有提供这一点。

重复采样有时被用作生成系统中置信度的代理。对于约束检查,相同的答案可能反映一个稳定的错误,因此重复提供了一个经验类别频率,而不是一个有保证的正确概率。我们直接测量其校准性和保留风险,其中任务重复嵌套在源项目内。

## 3 基于证据的约束检查

### 3.1 问题表述

设一个任务提供文档 \(D\)、约束规则 \(r\) 以及提取的事实 \(F=\{f_j\}\)。每个事实都有一个类型化谓词、主体、期望值和观测值、状态 \(s_j\in\{\text{verified},\text{violated},\text{missing},\text{uncertain}\}\)、置信度以及一个或多个源引用。源引用标识一个 PDF 页面和规范化区域、一个 CAD 实体,或一个 IFC 实体及属性路径。

设 \(V\)、\(M\) 和 \(U\) 分别表示存在违反、缺失或不确定的事实。对于合取式审查规则,确定性化简器为

\[
g(F)=
\begin{cases}
不满足, & V,\\
缺失, & \neg V\land M,\\
不确定, & \neg V\land\neg M\land U,\\
满足, & \text{其他},
\end{cases}
\tag{1}
\]

其中不满足、缺失、不确定和满足分别对应 Does Not Meet、Missing Information、Uncertain 和 Meets。这个优先级是有意失败关闭的:受支持的违反不会被缺失证据覆盖,不完整证据也不能变成通过。

### 3.2 源契约与事实契约

源层将文档访问与规则执行分开。每个源引用都包含一个不可变的文档标识符和一个简短摘录。PDF 引用额外要求一个从 1 开始的页码,并可能携带规范化边界框。CAD 和 IFC 引用要求一个实体标识符,并可能携带字段或属性路径。无效页码、退化区域和未解析的实体引用会在规则运行之前使架构验证失败。

提取器将源证据映射为类型化事实 \(f_j=(q_j,o_j,e_j,s_j,c_j,Z_j)\):谓词 \(q_j\)、观测值 \(o_j\)、期望值 \(e_j\)、状态 \(s_j\)、置信度 \(c_j\in[0,1]\) 以及源集合 \(Z_j\)。规则声明其所需的事实标识符。已核实或违反的事实必须至少引用一个源;提取器输出中缺失的必需事实会被插入为 missing。重复的事实标识符会被拒绝。这些不变量使提取错误对规则层可见,而不是静默地将其转换为成功检查。

算法 1:失败关闭约束化简

0: 必需事实 ID \(R\)、已提取事实 \(F\)、阈值 \(\tau\)
1: for 按规则顺序的 \(r\in R\) do
2: if \(r\notin F\) then
3: 插入 \((r,\texttt{missing},1.0,\varnothing)\)
4: endif
5: 验证类型、置信度和源契约
6: endfor
7: if 任何必需状态为 violated then
8: \(d\leftarrow\textsc{Does Not Meet}\)
9: else if 任何必需状态为 missing then
10: \(d\leftarrow\textsc{Missing Information}\)
11: else if 任何必需状态为 uncertain then
12: \(d\leftarrow\textsc{Uncertain}\)
13: else
14: \(d\leftarrow\textsc{Meets}\)
15: endif
16: 输出有序事实步骤、来源和完整性
17: 如果 \(d\) 未解决、\(\min_j c_j<\tau\) 或缺少某个源,则升级
18: return 判定 \(d\)、证明踪迹、升级原因

化简器刻意保持很小:相同的事实总是产生相同的判定,并且每个分支都可以在没有另一次生成式传递的情况下检查。当前实现评估所需事实的合取。更复杂的专业规则可以在上游将析取或例外暴露为类型化谓词;评估这种编译不在当前实验范围内。

### 3.3 机器可读规则族

每个族定义包含一个稳定的规则标识符、一个用于编写和审查的自然语言陈述、一个事实类型,以及绑定任务实例所需的主题字段。引用消解规则绑定源区域、目标图纸和目标视图;标题和标注规则将文本绑定到所描绘内容或引线端点;索引规则将索引项绑定到标题栏。规格书和送审件规则将必需值与观测值绑定到条款和图纸来源。规则文件还对四个判定标签和公式 (1) 中的状态优先级进行版本管理。

这种表示分离了通常被合并到一个提示中的三个操作。*编写*定义必须为真的内容以及需要哪些事实。*提取*从文档证据中填充这些事实。*执行*应用固定的状态代数。这种区分对于信息缺失很重要:未能提取必需事实被表示为 missing,而源支持的矛盾则是 violated。两者都不能通过流畅的解释性文本转换为 Meets。

规则独立于任务引用和模型输出存储。任务适配器实例化主题和期望值,而源哈希标识规则被评估所依据的文档。这允许在不更改源适配器的情况下审查或修订规则,也允许同一执行器使用来自 PDF、CAD 或 IFC 提取的事实。这里使用的七个族定义见附录 A (https://arxiv.org/html/2607.29058#A1);其中只评估其 PDF 实例化。

PDF 页面已评估 / CAD·IFC 适配器接口
类型化提取:文本片段 + 视觉区域
事实图:谓词、值、状态、来源
确定性规则:四状态化简
判定:Meets / Does Not Meet / Missing / Uncertain
证明踪迹:规则步骤 + 源片段
升级:置信度 + 完整性
专家审查:在升级时

图 1:约束检查架构。实线路径在实验中为 PDF 实例化;虚线 CAD/IFC 路径是适配器契约。规则引擎同时输出判定和可审计踪迹。基准缺乏区域级引用标注,因此实验评估判定和发现内容,而不是踪迹定位准确率。

### 3.4 PDF 证据分配

保留布局的文本通过确定性方式提取并使用 BM25 索引(Robertson and Zaragoza,2009 (https://arxiv.org/html/2607.29058#bib.bib17))。查询是任务指令,并移除程序性示例。最多保留 12 个页面摘录,对于最多包含四个文件的任务进行文档均衡检索。图像渲染的最大边长为 1,800 像素。

检索器按页面而不是任意词元窗口索引,这样每个命中都有稳定的页面引用。任务指令中的显式页码会被插入到排序候选项之前。对于最多包含四个文件的任务集,每个文件在全局前 12 截断之前贡献候选项;这防止长规格书或图纸集抑制所有其他文档。每个摘录记录其文档 ID、页面、分数、提取方法和内容哈希。这些记录在两个配对的视觉条件下完全相同。

*Page-RAG* 策略使用最多四个排名最高的不同页面概览。*Region-RAG* 策略使用相同的有序文本摘录、一个最高排名页面概览,以及该页面墨迹边界框的三个重叠半跨度裁剪。裁剪沿着较长内容轴从 0、0.25 和 0.5 的偏移开始,并以 3,000 像素源渲染。两种策略都有四张图片上限;短文档

相似文章

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

基于证据链评估的校准式选择性事实核查

arXiv cs.AI

本文介绍了一种名为证据链评估(ECE)的选择性事实核查框架,该框架允许基于LLM的验证代理在证据薄弱、稀疏或不一致时放弃给出判断。在ECE-Bench上,ECE实现了93.7%覆盖率下的97.8%选择性准确率,展示了处理认知薄弱证据时面向安全性的权衡。

证据账本裁决:实现主张-证据可追溯性

arXiv cs.AI

本文介绍了证据账本裁决(evidence-ledger adjudication),一种用于AI辅助写作中主张-证据可追溯性的工作流,并在基于AVeriTeC、CLIMATE-FEVER和SciFact构建的盲测基准上进行了评估,结果表明基于智能体的方法优于基线方法。

通过结构化内联引用生成实现显式证据溯源

arXiv cs.CL

本文介绍了 FullCite,一个用于生成结构化内联引用的框架,该框架能将每个声明同时链接到其源文档和具体的证据跨度。在三个问答基准(ASQA、BioASQ、ExpertQA)上评估后发现,虽然 LLM 在文档级归因方面表现良好,但在精确的证据跨度识别上仍有困难。