基于图谱的忠实P&ID推理:通过恢复证据图约束视觉语言模型

arXiv cs.LG 论文

摘要

本文介绍了一种基于图谱的视觉语言模型工具,通过从图像中恢复证据图,来提高回答管道和仪表图拓扑问题的准确性。

arXiv:2609.05880v1 公告类型:新 摘要:管道和仪表图(P&IDs)是过程工厂的权威地图:隔离、维护和HAZOP决策取决于什么连接什么。视觉语言模型可以流畅地描述这些图纸,但它们常常编造或遗漏过程连接——而一个编造或遗漏的连接可能反转隔离或可达性判断,因此工厂决策不能信任一个从未与线条核对过的流畅回答。我们改为恢复图纸的显式图——其符号、它们之间的过程连接,以及命名它们的标签——然后要求模型仅通过七个只读操作符查询该图来回答问题,因此拓扑声明仅在引用支持它的查询结果时才返回。在TopoPID-VQA上,这是一个包含3000个关于这些图纸的拓扑问题的新套件,图谱基础工具(我们的)将精确匹配准确率从仅图像提示下的36.7-41.3%提高到Qwen3-VL-4B、Qwen3-VL-8B和Gemma-4-E4B的74.3-76.0%。它在不完美的基底上实现:在Digitize-PID数据集上,恢复的图在精确过程连接上得分为F1 0.742,一旦将符号和标签合并,得分0.801。残差错误跟踪了该差距——当恢复的图正确时,基于图谱的方法有效,当它不正确时,感知错误仍然破坏拓扑问题。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:27

# 基于恢复证据图约束视觉语言模型的可靠P&ID拓扑推理  
来源:https://arxiv.org/html/2609.05880  
作者:Prathamesh Gadekar\*、Sakhinana Sagar Srinivas、Venkataramana Runkana  
单位:塔塔研究发展与设计中心,印度浦那 411057  

###### 摘要  
管道与仪表流程图(P&ID)是流程工厂的权威蓝图:隔离操作、维护决策和危害与可操作性分析(HAZOP)均取决于*设备间的连接关系*。视觉语言模型虽能流畅描述这些图纸,却常虚构或遗漏工艺连接——而一个虚构或遗漏的连接可能逆转隔离或可达性判断,因此未经图纸线条验证的流畅回答无法用于工厂决策。我们提出一种方法:首先恢复图纸的显式图结构——包括符号、符号间的工艺连接以及命名标签——然后要求模型仅通过七种只读算子查询该图来回答问题,使拓扑断言仅在其引用查询结果支持时才被返回。在针对此类图纸设计的3000道拓扑问题新基准集TopoPID-VQA上,图基约束框架(我们的方法)将Qwen3-VL-4B、Qwen3-VL-8B和Gemma-4-E4B的精确匹配准确率从仅图像提示的36.7–41.3%提升至74.3–76.0%。此结果基于一个非完美的底层基础:在Digitize-PID数据集上,恢复的图在精确工艺连接上的F1值为0.742,若将符号和标签综合计算则为0.801。残余误差与此差距相关——接地效果在恢复图正确时显著,而感知错误仍会导致拓扑问题在恢复图不正确时失败。  

## 1 引言  
管道与仪表流程图(P&ID)是流程工厂的工程图纸:它们记录哪些设备、阀门和仪表共享工艺管线与控制回路(Paliwal等人,2021;Rahul等人,2019)。石油天然气、化工、发电、制药、水处理以及航空航天推进或地面测试设施均将P&ID作为隔离、维护、HAZOP和竣工检查的权威蓝图。这些图纸是工厂获得许可、进行改造和安全关停的依据;一个虚构或遗漏的连接是操作错误,而非标注缺陷。工程师查询它们用于隔离规划、标签追踪、路由检查及其他依赖于*连接关系*而非自由描述的任务。  

大多数工厂档案仍以光栅格式保存P&ID。从中读取拓扑结构对人类而言耗时且对视觉语言模型(VLM)不可靠:模型可能流畅命名符号,却虚构出标记A与标记B之间的路径而未与线条核对。在P&ID中,这种虚构的边可能逆转隔离或可达性判断。因此,一个有用的P&ID辅助工具需要两样东西:首先是从图纸恢复的显式工艺图,使连通性成为存储事实而非猜测关系;其次是一种强制每个拓扑断言引用图事实来回答英文问题的方法。我们探讨这种接地机制在拓扑问题上能带来多少准确率提升,以及恢复图本身的精度还存在多少限制。  

实际图纸使挑战具体化:数百个近似符号、长管道走向、立交跨越以及相似标签。纯像素读取效果不佳;而决策依赖的正是工艺拓扑。我们的系统分为两个阶段。阶段一恢复接地基底:微调感知模型检测符号、线条和文本;确定性规则(交叉节点化、图纸自适应接合点捕捉、首符号链式遍历、标签关联)构建分类型工艺图\(G_{\mathrm{auto}}\)。可选的*信号边层*可在虚线折线上附加仪表连接;我们单独报告其恢复情况,而TopoPID-VQA问题仅使用工艺边。阶段二是图基约束框架(我们的方法):VLM通过七种返回事实的图算子进行规划,在图纸上定位标记和标签,并返回引用支持图实体的结构化答案。无引用证据的答案将被拒绝。图1对比了两种模式。  

**01 纯图像**  
标记光栅图 → 问题 \(Q\) → 图像仅VLM → 从像素的视觉推理 → 无图或证据检查 → “A连接至B” → 无依据的拓扑断言  

**02 证据接地**  
标记光栅图 → 问题 \(Q\) → 恢复图 \(G_{\mathrm{auto}}\) → 节点、边和标识符 → 图基约束框架 → 限制性证据查询 → “未连接” → 引用可审查的证据ID  

**非接地**:看似合理但未经验证的拓扑表述。  
**接地**:答案、来源及审计轨迹。  

图1:接地将看似合理的预测转化为可审计的答案。图像仅VLM可能未经核对底层线条而虚构工艺连接(左);图基约束框架将答案基于恢复拓扑,并返回可审查的证据标识符(右)。  

#### 贡献  
- **接地机制**。图基约束框架(我们的方法)将恢复的证据图与七种通用算子及答案契约(必须调用工具查询;必须查询命名实体;返回引用支持实体的分类型答案)结合。  
- **拓扑基准**。TopoPID-VQA是一个包含3000道拓扑问题(简单/中等/困难)的基准集,在恢复工艺图 \(G_{\mathrm{auto}}\) 上评估图接地的答案准确率。  
- **面向部署的度量**。在Qwen3-VL-4B、Qwen3-VL-8B和Gemma-4-E4B上,图接地比纯图像推理提升整体准确率33.8–37.6个百分点,而 \(G_{\mathrm{auto}}\) 上的精确边F1值0.742反映了残余基底误差。  

对于P&ID工作流,实际主张明确:图接地提升拓扑问题答案的可靠性,而 \(G_{\mathrm{auto}}\) 上的精确边F1值表明图纸误差仍有部分传导至答案。第2节定位研究背景;第4节详述两个阶段;第5节首先呈现TopoPID-VQA结果,随后分析基底保真度。我们在TopoPID-VQA上评估开源VLM作为推理前端,同时也在相同图纸上评估云端OCR、物体定位API及零样本线段分割器作为感知对照组。这些基线表明,现成视觉服务难以替代针对P&ID微调的基底(附录A.8),因此阶段一采用微调感知加确定性图构建,而非仅依赖现成检测器堆栈。  

## 2 相关工作  
#### 接地与忠实多模态推理  
文档与图表VQA强调阅读与布局(Mathew等人,2021;Masry等人,2022);组合式基准集在清晰结构下隔离关系推理(Johnson等人,2017;Hudson与Manning,2019)。VLM仍会虚构像素从未支持的关系,尤其在密集图形中。工具使用与多模态链式方法通过调用外部动作或检索器减少自由猜测(Yao等人,2023;Schick等人,2023;Lu等人,2022)。我们采取结构化路径:从光栅恢复分类型图,然后要求每个拓扑断言来自工具结果而非不可验证的推理。  

#### 图与工具增强智能体  
交错推理与外部调用的智能体循环(Yao等人,2023;Schick等人,2023)以及将问题转化为可执行查询的图查询前端(Gupta等人,2025;Alimin与Schweidtmann,2026)均假设存在干净的给定图或数据库。我们的场景不同:智能体在从预测感知构建的 \(G_{\mathrm{auto}}\) 上运行,同时评估答案准确率及 \(G_{\mathrm{auto}}\) 相对于 \(G_{\mathrm{oracle}}\) 的偏移。这将感知误差与推理误差耦合,而非假设存在干净、人工校正的知识库。  

#### 工程图纸理解  
Digitize-PID及早期提取流程在将符号、文本和管道链接成图前先恢复它们(Paliwal等人,2021;Rahul等人,2019)。PIDQA将P&ID实体转化为标记属性图,并评估LLM生成的Cypher查询,因此QA准确率是在被视为知识库而非图纸测量近似的图上报告的(Gupta等人,2025)。ChatP&ID(Alimin与Schweidtmann,2026)将GraphRAG应用于DEXPI风格的智能P&ID模型,其中节点和边的接地主要由源格式提供。针对工艺示意图的多智能体检索系统同样面向基于文档上下文的开放域问答,而非恢复拓扑的保真度(Sakhinana等人,2024)。我们针对的差距是端到端的:光栅→恢复证据图→接地智能体,其中图的不完美是被测量而非被忽略。我们还将虚线仪表连接保留为单独的信号边层,这在Digitize的真实连通性中未在我们的分区上建模。  

## 3 问题形式化  
每个实例是标记图纸 \(I\) 和英文问题 \(Q\)。金标准答案 \(a^\star\) 从神谕工艺图 \(G_{\mathrm{oracle}}\)(真实几何加Digitize真实连通性)计算得出,且在推理时绝不提供。部署系统仅接收 \((I, Q)\) 加恢复的工艺图 \(G_{\mathrm{auto}}\)。图像仅基线仅见 \((I, Q)\);图基约束框架(我们的方法)接收 \((I, Q, G_{\mathrm{auto}})\) 并可调用固定工具库。我们在TopoPID-VQA上报告精确匹配准确率及相对于 \(G_{\mathrm{oracle}}\) 的图F1值,以便区分感知与推理失败。  

## 4 基于证据的VLM框架  
图3展示了从光栅到结构化答案的证据路径。阶段一恢复接地基底:多模态感知发现符号、线条墨迹和文本,然后确定性构建将这些检测转化为分类型工艺图 \(G_{\mathrm{auto}}\)。阶段二在答案契约下运行图基约束框架(我们的方法),使拓扑断言必须来自工具结果而非像素上的自由猜测。将恢复与QA分阶段进行,便于定位失败源于图还是使用它的规划器。  

#### 答案契约  
(1) 无最终答案时至少调用一次图工具。  
(2) \(Q\) 中每个命名实体在回答前必须通过工具查询。  
(3) 对于闭合计数问题,引用的支持实体数量必须与报告计数匹配。  

#### 阶段一:接地基底恢复(P&ID图恢复栈(我们的方法)→ \(G_{\mathrm{auto}}\))  
感知栈按固定顺序在每张图纸上运行:分块YOLO11s(Jocher等人,2023)符号检测(测试集检测F1值0.983)、EfficientNet-B0 U-Net(Ronneberger等人,2015)用于实线和虚线墨迹的掩模(Dice微平均0.982),以及带微调TrOCR的YOLO-text(Li等人,2023)进行图表OCR(检测F1值0.833)。这些模块仅定位墨迹。拓扑结构随后在预测实线层上通过确定性几何构建。骨架化将实线掩模转化为折线。*交叉节点化*在T型接头和拐角处分割或修剪交叉线段,使分支共享精确端点而非越过接合点。每张图纸的接合点捕捉半径基于中段长度和末端间隙的中位数设定,而非全局像素阈值(固定10像素捕捉会使预测实线上的精确边F1值降至0.193)。每个检测到的符号在其框中心120像素内连接至最近实线段。*首符号*遍历随后沿段图穿越空支架接合点,在首个被占接合点停止,向该处符号发射无向工艺连接边;共享接合点的符号构成一个团。仅通过此遍历——页面接近或立交跨越若无共享接合点则不产生边——两个符号才能相邻。几何规则随后通过包含、重叠和近似关系将OCR词绑定到符号和线条,并沿段图进行线条种子传播。产物即 \(G_{\mathrm{auto}}\):分类型符号节点(类别和可选标签)、无向工艺边及可供后续工具使用的线条-标签关联。作为可选扩展,*信号边层*在虚线仪表折线上运行相同遍历,使用虚线专用自适应捕捉(Digitize在我们的分区上未将符号关联至虚线)。我们仅作为恢复证据评估该层;TopoPID-VQA问题使用工艺连接。神经网络寻找墨迹;确定性规则构建拓扑——图构建器不通过学习模型虚构边。图2展示了一张Digitize-PID图纸通过此阶段的过程:原始光栅、感知叠加层和恢复的工艺图。  

**原始P&ID光栅**  
**检测到的线条、符号和文本**  
**恢复的工艺图**  

图2:在一张Digitize-PID图纸上从光栅到证据图(注释和标题栏已移除)。左:输入图纸。中:线条、符号和文本的感知叠加层。右:从这些检测恢复的工艺连接图(节点在符号中心;边来自首符号遍历)。  

#### 阶段二:基于 \(G_{\mathrm{auto}}\) 的工具介导推理  
每个TopoPID-VQA项目包含标记图纸 \(I\)、英文问题 \(Q\) 和该图纸的冻结图 \(G_{\mathrm{auto}}\)。图像仅基线仅见 \((I, Q)\)。图基约束框架(我们的方法)接收 \((I, Q, G_{\mathrm{auto}})\) 并通过最多六轮的规划器循环回答。首次工具调用前,检测 \(I\) 上的彩色标记字母(A/B/C)并捕捉至附近 \(G_{\mathrm{auto}}\) 节点,\(Q\) 中命名的任何标签字符串通过OCR标签关联(当多个节点共享字符串时可选局部裁剪)。该种子步骤是七种图工具之外的辅助步骤。规划器随后可调用节点查找、邻居列表、节点搜索、广度优先遍历、最短路径、边检查和集合操作。每次调用返回结构化事实——ID、类型、标签、跳数列表、距离或成员关系——绝不返回关于 \(Q\) 的是/否判断。计数、比较、阈值化和路由保留在模型对这些返回值的推理中。典型的可达性项目将标记解析为节点ID,请求广度优先前沿或最短路径距离,然后才陈述真/假或区间标签;标签选择项目通过类型或前缀搜索并引用

相似文章

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。