DrawingVQA:一个用于建筑图纸多深度视觉-文本推理的真实世界基准

arXiv cs.AI 论文

摘要

介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。

arXiv:2607.15418v1 公告类型:新论文 摘要:我们提出了DrawingVQA,这是首个旨在评估多模态大语言模型(MLLMs)在真实世界建筑图纸上表现的基准——建筑图纸是建筑、土木及许多其他工程实践中的核心媒介。与自然图像或示意图平面图不同,建筑图纸融合了抽象几何、符号标注、表格数据、注释以及领域特定文本,形成一个独特复杂的视觉-文本领域,是工程工作流的核心。DrawingVQA通过33张“施工发布版”图纸和92个由专家精心策划的问答对填补了这一空白,涵盖三种推理深度:感知理解、上下文解释和领域专家推理。为评估模型能力,我们提出了一个双分类框架,共同分析七个建筑工程维度和四个MLLM能力维度上的表现——这是首次将工程工作流明确映射到AI推理能力上。对当前先进MLLM的评估揭示了模型与专家性能之间的显著差距,尤其是在更高推理深度上。该基准为领域专门化的多模态推理奠定了基础,有助于推动AI驱动的理解与真实工程工作流的集成。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:21

# DrawingVQA: 一个用于施工图纸多深度视觉-文本推理的真实世界基准 来源:https://arxiv.org/html/2607.15418 Yoonhwa Jung 路易斯安那州立大学 yoonhwa\.jung@lsu\.edu同等贡献†在伊利诺伊大学厄巴纳-香槟分校攻读研究生期间完成的工作。Mani Golparvar-Fard 伊利诺伊大学厄巴纳-香槟分校 [email protected]

###### 摘要

我们引入DrawingVQA,这是首个旨在评估多模态大语言模型(MLLMs)在真实世界施工图纸——建筑、土木及诸多工程实践中核心媒介——上表现的基准。与自然图像或示意图式平面图不同,施工图纸融合了抽象几何、符号标记、表格数据、注释和领域特定文本,构成了工程工作流中独有的复杂视觉-文本领域。DrawingVQA通过33份“施工用图”(IFC)和92个专家精心设计的问答对填补了这一空白,覆盖三个推理深度:感知理解、情境解读和领域专家推理。为评估模型能力,我们提出一个双分类框架,共同分析七个建筑工程维度和四个MLLM能力维度的表现——这是首个将工程工作流显式映射到AI推理能力的基准。对前沿MLLM的评估揭示了模型与专家表现之间的显著差距,尤其在更高推理深度上。本基准为领域专用多模态推理奠定了基础,推动AI驱动理解与真实世界工程工作流的融合。DrawingVQA可在此获取:https://joonv2.github.io/DrawingVQA/

## 1 引言

参见图注 图1:IFC图纸的多模态挑战与DrawingVQA的工程级VQA。(A) 解构IFC图纸复杂性:真实世界的“施工用图”(IFC)图纸是信息密集的产物,提出了独特的多模态挑战(见第3.2节)。(B) 提供VQA示例DrawingVQA:我们呈现来自DrawingVQA的具有挑战性的问答对,这些问答对需要行业专业工程推理,并按我们的三个推理深度(星号表示:⋆感知,⋆⋆情境,⋆⋆⋆专家级知识与推理)进行分类。每个示例对应特定的MLLM能力(例如,OCR、视觉感知、知识、推理)和建筑工程(CE)任务(例如,工程量清单、设计理解、要素识别、合规性)。这些任务远远超出学术基准的范围(见第3.4节)。

多模态大语言模型(MLLMs)的快速发展揭示了通向通用人工智能(AGI)的重要里程碑,展现出在感知、推理和跨模态理解方面常常匹配甚至超越人类表现的显著能力[2]。最近的多模态基准显示,前沿模型在许多通用领域[19, 32, 27, 14]、学术领域[9, 21, 35, 10]或专业领域如金融[9, 22]、医学[1, 11, 17]和生物学[8, 20]中可以达到或接近人类表现。然而,深层工程学科,尤其是土木与建筑工程,仍然很大程度上未被探索。土木与建筑工程是最成熟但数字化程度最低的工程领域之一,其中专业推理严重依赖于施工图纸——一种密集、多层的视觉产物,结合了几何实体、注释、表格、说明、工程符号和跨图纸引用,以传达设计意图和工程问题。该领域的现有研究大多涉及低层感知任务,例如对简单平面图的目标检测或分割[8, 34, 24]。少有的工程领域问答数据集倾向于关注学术知识,例如“FE考试”式问题[1, 30]。这引发了一个关键问题:在学术考试中表现出色的MLLM是否具备行业专业人士的实践推理能力?更广泛地说,通用基准上的高分在多大程度上转化为像施工这样复杂且高风险领域的胜任力?

为填补这一空白,我们引入DrawingVQA,这是首个旨在评估MLLMs在真实世界施工图纸上表现的基准。与先前数据集不同,DrawingVQA使用“施工用图”(IFC)级别的图纸,反映了实践中的土木、结构和施工工程师所遇到的标准、复杂性和语义。该数据集包含多图像和交错文本-图像VQA问题,由33份图纸与92个专家精心设计的问答对组成,反映了工程师在真实工作流中执行的推理任务类型。每个问题被分为三个推理层级——简单(感知识别)、中等(情境解读)和困难(专家推理)——捕捉人类如何从感知逐步推理到专业判断。除了传统准确率指标,DrawingVQA引入一个双分类框架,共同分析模型在七个建筑工程维度(例如,工程量清单、设计意图、规范合规性)和四个核心MLLM能力维度(视觉感知、知识、推理、OCR/文本理解)上的表现。这种多轴评估是首个将工程工作流显式映射到AI推理能力的方法,揭示当前模型成功之处、失败之处及其原因。这是首个在IFC图纸上以工程专业水平评估开源和专有MLLM的基准。我们将贡献总结如下:

- • 我们引入DrawingVQA,这是首个基于复杂、真实世界“施工用图”(IFC)结构图纸的VQA基准,配有精心策划的反映专业推理深度的问答对。
- • 我们提出一个双分类框架,将专业工程工作流显式链接到核心AI推理能力,实现对模型优势和失败的多维分析。
- • 我们提供对MLLM的全面分析,突出高层工程推理中的关键差距,并为未来研究设定一个新的有挑战性的基线。

## 2 相关工作

**MLLM推理基准** MLLM的评估已从自然图像上的通用感知VQA(如VQA[4]、GQA[12]、A-OKVQA[27])演变为测试深层领域专业知识的基准。这种专业转变要求深度的学科理解,通过测试大学水平的学术知识(如MMMU[9]、SceMQA[16])并针对专业领域如医学[1, 11, 36]和生物学[8, 20]中的研究级推理。尽管这种向深度推理的趋势至关重要,但尚未应对工程所需的独特实践推理,其中视觉和文本信息通过符号图表、几何和空间关系以及领域特定约定深度交织。

**工程中的MLLM** 与工程相关的现有MLLM基准主要评估学术或陈述性知识,而非实践技能。例如,MMMU[9]的工程类别包含使用自然图像、表格或示意图的大学级考试式问题。同样,R-Bench[10]涵盖工程学科的研究生级考试式问题。ScienceQA[21]关注自然和通用图像(即照片)上的科学实验问题,没有领域级别的视觉基础。我们主张,这些数据集虽然有价值,但并未测试综合的多模态推理——例如交叉和多视图空间理解、细节引用或解读技术注释——这些是专业工程任务必不可少的技能。更接近我们领域的是,其他基准已部分涉及设计阶段文件。MM-Vet[32]在简化平面图上进行VQA,分析MLLM的OCR、空间意识和数学能力。DesignQA[2]在机械CAD图纸及附加PDF文档上进行VQA,而DrafterBench[15]引入基于向量化CAD数据的LLM编辑。这些数据集虽然有价值,但专注于示意性、低密度的设计表示,未能评估“施工用图”(IFC)图纸所需的多模态推理——这些图纸集成了几何复杂性、符号标记、表格数据、注释和领域特定文本。

**施工领域基准** 在AEC领域内,研究过往绕过了IFC图纸上的高层推理,转而关注其他数据类型。大量工作针对示意性平面图上的低层感知任务,如目标检测、分割、3D重建[8, 34, 24, 23]或图像描述[13, 6]。其他基准基于执照考试或专业准则处理纯文本问答[1, 30]。这些方法完全绕过了工程沟通的多模态特性。因此,仍然没有基准能够捕捉工程师在施工专业工作流中如何跨视觉、文本和空间模态进行推理。DrawingVQA是首个通过基于真实世界IFC图纸的专家级VQA数据集填补这一空白的基准。第3.5节展示了DrawingVQA如何在工程学科中与其他标准MLLM基准不同。

## 3 DrawingVQA

### 3.1 DrawingVQA概述

DrawingVQA的主要目标是解决现有MLLM基准与工程专业人员执行的实践、真实世界视觉推理任务之间的显著差距。当前基准通常关注学术知识或简化示意图,未能捕捉行业标准文档的复杂性。DrawingVQA旨在识别和衡量前沿模型中的这些表现差距,提供推动行业采用的关键工具。为实现此目标,我们的基准基于两个核心原则:
- • 真实数据源:我们使用真实世界的“施工用图”(IFC)结构图纸,这些是现场使用的密集、多模态且具有法律约束力的文档。
- • 实际问题提问:问答对由三位领域专家设计,模拟专业人员日常进行的查询和推理工作流,而非表面学术问题。

数据集涵盖三个不同的推理深度:(1)简单感知理解,(2)情境解读,(3)深层领域专家推理。为高粒度分析模型表现,我们引入一个新颖的双分类框架,将每个问答对共同映射到七个建筑工程维度和四个基础MLLM能力维度。据我们所知,这是首个将工程工作流显式映射到核心AI推理能力的框架,提供关于模型在真实施工工程环境中为什么以及在哪里失败的诊断性见解。

表1:DrawingVQA统计

参见图注 图2:图纸复杂性比较。(a) 来自[8]的低密度示意性建筑平面图。(b) 来自[2]的机械设计。(c) 来自我们DrawingVQA语料库的高密度“施工用图”(IFC)级别图纸。

### 3.2 施工图纸(施工用图)

DrawingVQA的视觉基础包括来自六个真实世界教育建筑项目的33份结构图纸集。我们的语料库由高熵“施工用图”(IFC)文档组成。将IFC图纸的视觉和语义复杂度与其他数据集使用的示意性建筑平面图或机械设计区分开来至关重要(见图2)。与其他2D图纸相比,IFC图纸作为“真理之源”贯穿整个项目生命周期,集成了精确几何、工程注释、材料规格、修订历史和合规性说明——所有这些构成了专业人员日常解读的密集视觉-文本界面。具体而言,IFC图纸代表了独特的多模态挑战,因为它们是多层信息密集的产物:
- • 复杂几何:结构元素的精确2D表示(平面、剖面、立面)(图1)。
- • 符号语言:符号和领域特定词汇(例如,焊接符号、材料填充、领域特定语言和缩写)
- • 密集注释:带箭头的文本和符号标注、尺寸和注释,需要高保真OCR。
- • 数据丰富的表格和说明:用于柱、梁、基础、修订的复杂表格日程和通用说明。
- • 交叉引用:需要模型对齐信息并理解跨不同详图和多张图纸的标注的指针。

### 3.3 数据策展过程

**数据收集** 我们从6个校园建筑项目的33份结构图纸集中策展数据集,确保每份文档符合专业“施工用图”(IFC)标准。视觉产物包括平面、剖面、详图、注释、符号和通用说明,覆盖多样化的结构组件(例如

相似文章