PlanBench-V: 面向视觉语言模型的空间规划地图基准
摘要
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
arXiv:2606.05744v1 Announce Type: new
摘要: 空间规划地图是领土治理的核心,将规划目标、法规和空间策略转化为视觉形式,用于决策、公共沟通和机构协调。然而,解读这些地图需要细粒度的视觉感知、空间推理以及基于政策的专业判断,这对人类学习者和人工智能系统都构成了重大挑战。随着视觉语言模型(VLM)的快速发展,它们在城市规划分析中的应用日益受到关注,但现有的多模态基准主要针对通用视觉理解,忽略了规划实践中特定领域的认知过程。为填补这一空白,我们引入了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准。我们首先构建了空间规划地图数据库(SPMD),这是一个由专业规划师整理的、包含223张规划地图和1629个问答对的专家标注数据集,覆盖了不同的地理区域和制图风格。然后,我们提出了一个基于理论的评估框架,评估四个渐进能力:感知、推理、关联和实施,与规划地图解读的认知过程相对应。通过对两代VLM的广泛实验,我们看到了明显的进步,但也存在持续的限制。2026年最优的智能推理模型Qwen3.6-Plus比2025年最优模型GPT-4o高出27%。然而,所有模型在需要评估性判断、政策敏感性和约束感知决策的面向实施的任务中仍然表现不佳。这些发现揭示了当前VLM在专业规划背景下的根本局限性,并强调了开发领域自适应的多模态推理框架的必要性。代码和数据可在https://plangpt.github.io获取。
查看缓存全文
缓存时间: 2026/06/05 08:07
# 面向视觉语言模型的空间规划地图基准 来源:https://arxiv.org/html/2606.05744 何铸\*,1,2 苏俊友1,2 王文1,2 邓一杰1,2 张文嘉†,1,3 1 行为与空间人工智能实验室 * 同等贡献。† 通讯作者。邮箱:[email protected] 同济大学 2 行为与空间人工智能实验室 北京大学 3 建筑与城市规划学院 同济大学 ###### 摘要 空间规划地图在国土治理中扮演核心角色,它们将规划目标、法规框架和空间策略转化为可视化表征。这些地图不仅是决策的技术工具,也是公共沟通和机构协调的关键媒介。然而,解读空间规划地图需要结合精细的视觉感知、空间推理以及基于政策的专业判断,这对人类学习者和人工智能系统都构成了巨大挑战。随着视觉语言模型(VLM)的快速发展,其在城市规划分析中的潜在应用日益受到关注。然而,现有的多模态基准主要关注通用视觉理解,未能捕捉规划实践中嵌入的领域特定认知过程。在这项工作中,我们引入了 PlanBench-V,这是首个旨在评估 VLM 在空间规划地图解读中性能的综合性基准。首先,我们构建了空间规划地图数据库(SPMD),这是一个由专业规划师手工标注的数据集,包含 223 张规划地图和 1629 个问答对,覆盖了多样化的地理区域和制图风格。其次,我们提出了一个基于理论的评估框架,该框架在四个渐进维度上评估模型能力:感知、推理、关联和实施,反映了规划地图解读的完整认知流程。跨越两代 VLM 的广泛实验揭示了清晰的进步轨迹,但也存在持续的挑战。虽然 2026 年最佳的智能体推理模型 Qwen3.6-Plus 比 2025 年最佳的 GPT-4o 模型性能高出 27%,但所有模型在处理需要评估判断、政策敏感性和约束感知决策的实施导向任务时仍然困难重重。我们的发现揭示了现有 VLM 在专业规划背景下的根本性局限,并强调了发展领域自适应多模态推理框架的必要性。代码和数据可在 https://plangpt.github.io/ 获取。 ###### 关键词: 空间规划地图;视觉语言模型;多模态基准 ## 1 引言 空间规划地图是城市发展的基本工具,它们作为社会经济和主题可视化文档,记录现状、描绘未来情景并引导政策实施。通过专门的制图表达,规划者利用符号和标注传达愿景、优先级和约束条件,这些符号和标注体现了土地利用分配、基础设施布局和功能分区。这些地图将地理空间作为结构化画布,以特定的比例和方向描绘规划元素,确保空间布局的清晰性。与通用地图不同,规划地图具有独特的表达元素,从大规模总体规划到详细城市设计各不相同,每种都有独特的风格特征 (Lynch1984, Steinitz1995, Healey1997)。本研究专门关注**法定**空间规划地图,因为诸如概念图或城市设计插图等更广泛的类别并不总是与明确、受监管的规划意图相关联。让 VLM 能够有效解读这些专业规划地图,将显著提升城市规划领域的专业实践和教育场景。 尽管 VLM 在通用视觉语言任务中展现了令人印象深刻的能力,但它们在高度专业化领域的有效性仍未得到充分探索。规划地图体现了高度的复杂性和专业特殊性,融合了精细的视觉元素(如符号、图例和颜色代码)、复杂的空间结构和布局关系,以及与法规和政策框架紧密相关的规划语义。然而,当前的 VLM 往往难以完全识别地图图例、地理实体和规划边界等关键制图元素。它们在解析复杂空间关系或推断嵌入的规划逻辑和空间策略方面能力有限。此外,VLM 普遍缺乏对领域特定术语和正式规划表达的深入理解,这阻碍了准确的解读和规范性推理。 另外,空间规划日益强调以人为中心的治理和公众参与。从技术官僚式规划向参与式规划的转变,凸显了确保规划信息能够被包括居民、开发商、政策制定者和研究人员在内的多元受众所获取的重要性日益增长。然而,当前的 VLM 为非专业用户提供的支持不足,从而限制了公众参与和透明度。它们未能有效跨越利益相关者群体传达规划意图,这削弱了跨学科合作,并阻碍了智能、数据驱动的规划支持系统的发展。如果 VLM 要充当技术规划文档与更广泛受众之间的中介,它们必须具备准确解读规划地图的能力,同时尊重制度和监管背景。缺乏系统性的评估框架阻碍了实现这一目标的进程。 为弥补这一空白,我们引入了 PlanBench-V,一个专门设计用于评估 VLM 规划地图理解能力的基准。PlanBench-V 由两个主要部分组成:一个高质量数据集和一个领域知情的评估框架。 该数据集包含 223 张空间规划地图,来源于(1)中国的官方总体规划;(2)中国注册城乡规划师资格考试(CURPQE);以及(3)国际空间规划地图,以确保视觉风格的准确性和多样性。此外,我们构建了 1629 个由专业城市规划师手动标注的问答对,为评估基于真实规划实践的推理提供了严格基础。 我们开发了一个综合性基准,以系统评估 VLM 在理解空间规划地图方面的能力。如图 1 所示,该框架结构化为四个关键维度: - **感知**:评估模型识别视觉组件的能力,包括布局配置、文本注释、基本地理特征和绘图元素。 - **推理**:关注模型从规划地图中嵌入的复杂视觉和语义信息中提取结构化见解并执行领域特定推理的能力。 - **关联**:评估收集和关联与规划地图相关的背景政策、法规和规划指标的能力。 - **实施**:涉及比较、评判和优化规划方案的能力。  *参见图注* 图 1:提出的 PlanBench-V 概览 总之,我们的贡献如下: 1. 我们引入了 PlanBench-V,这是第一个明确设计用于评估视觉语言模型在空间规划地图解读中性能的基准,基于真实规划文档和专家知识。 2. 我们提出了一个四维度评估框架——感知、推理、关联和实施——反映了规划实践的渐进认知结构,连接了基础地图素养与应用专业判断。 3. 通过跨越两代 VLM 的广泛评估,我们揭示了智能体推理带来的显著性能提升,但也揭示了在处理需要政策敏感性和评估判断的实施导向任务时存在的持续差距,为未来领域自适应多模态模型开发提供了指导。 ## 2 相关工作 ### 2.1 空间规划地图 空间规划地图是制图可视化的一种特殊形式,它随城市规划实践而发展。它们不仅仅是空间的技术性图纸;更是在特定政治和制度背景下传达规划意图、价值观和意识形态的符号性表征 (Harley1989, 2002; Albrechts 等 2003; Dühr2007)。这些地图是空间规划过程不可或缺的部分,充当沟通、协商和说服的工具。 空间规划地图可根据其规模、目的和法律地位大致分类。在国家和区域层面,战略空间地图提供了空间发展的高层次愿景,通常强调经济走廊、生态网络和城市层级 (Faludi2000; Albrechts 等 2003)。在市镇层面,分区地图划定了关于土地利用、密度和建筑形态的具体规定 (Burgess and Carmona2009)。介于两者之间,存在一系列非法定或说明性地图,包括概念图、总体规划和城市设计框架,旨在促进公众参与和设计沟通 (Dühr2009; Li 等 2025)。 这些地图的制图设计在将抽象政策编码为视觉形式方面面临独特挑战。这个过程涉及对符号系统、视觉层次和空间构图进行谨慎决策。符号学维度,包括视觉语法、符号化和布局,是使复杂的规划意图能为不同受众所解读的基础 (Bertin1983; Dühr2007)。与此互补,分析性分类法将地图分为描述性、评估性和规定性三种形式,每种服务于特定功能:记录现状、评估潜力或指导未来空间组织 (Moroni and Lorini2017)。 空间规划地图的解读依赖于基于天生视觉处理和后天知识结构组合的感知和认知机制。在感知层面,用户提取即时视觉线索,如形状、大小、接近度和对比度,这些对于识别分区模式、基础设施对齐和土地利用层级至关重要 (Palmer1999; Rautenbacher 等 2017)。像接近度、连续性和图形-背景分化等格式塔原则在观众如何从复杂视觉数据形成整体空间理解中起核心作用 (Wertheimer1938; Koffka1935)。在感知之外,诸如图式激活和模式识别等认知过程使用户能够基于先验知识和语境期望来解读地图符号,如颜色、线条和纹理 (Mayer2005; Arnheim1969)。通过利用视觉和认知原则,规划者可以确保空间表征不仅在技术精确,而且在跨不同利益相关者群体时直观可及 (Kress and van Leeuwen2006; Alexander1977)。 尽管对空间规划地图有广泛理解,但在地图解读所涉及的认知过程中仍存在空白,特别是关于不同利益相关者如何解码和利用这些地图。 ### 2.2 专业领域中的 VLM 和基准 VLM 在通用多模态任务中展现了显著进步,包括图像理解 (Hurst 等 2024; DeepMind2023)、视觉推理 (Zhu 等 2025c; Guo 等 2025) 和多模态对话 (Liu 等 2023; Wang 等 2024a)。最近的研究已成功将这些模型扩展到医学影像 (Li 等 2023; Lai 等 2025; Pan 等 2025)、地理信息系统 (Zhang 等 2024b, a) 和数学推理 (Chen 等 2025; Shen 等 2025) 等专业领域。综合性基准的发展对于推动多模态 AI 能力至关重要。已建立的 VQA (Agrawal 等 2016)、COCO-Captions (Lin 等 2015) 和 Visual Genome (Krishna 等 2017) 等数据集推动了通用视觉语言理解的进步。更近期,针对特定领域的专业基准不断涌现,包括科学图表 (Li and Tajbakhsh2023; Roberts 等 2024)、文档理解 (Mathew 等 2021; Wang 等 2024b)、美学 (Huang 等 2024; Zhou 等 2024; Lin 等 2024)、自动驾驶 (Qian 等 2024; Sima 等 2024) 等领域。 在地理和制图领域,MapQA (Chang 等 2022) 和 Charting New Territories 数据集 (Roberts 等 2023) 为基于地图的问答(如定位和识别)提供了初步评估。然而,这些资源主要解决基本地理解读问题,而非规划地图分析中复杂且领域特定的需求。 我们认为城市规划是能够显著受益于专业 VLM 的关键领域,用于解读复杂的规划地图——即使是领先的商业模型在识别专业元素和规划逻辑方面也表现出显著局限性。
相似文章
Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力
介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
VABench: 通过视觉演示、主动感知和度量控制来测量具身空间智能
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。