VCG-Bench:面向统一视觉中心的生成与编辑结构化基准

arXiv cs.CL 论文

摘要

VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。

arXiv:2605.15677v1 公告类型:新 摘要:尽管视觉-语言模型(VLM)取得了快速进展,但在处理专业工作流程中必需的、结构化的可控制图表任务方面仍存在关键空白。现有方法主要依赖于基于像素的合成,这种操作在概率像素空间中进行,在可编辑性和保真度方面存在固有局限。为此,我们提出了一种新的“以图表为代码”范式,采用符号逻辑,利用 mxGraph 可扩展标记语言(XML)实现精确的图表生成与编辑。我们提出了 VCG-Bench,这是一个面向视觉中心 mxGraph 任务的统一基准。VCG-Bench 包括:(1)一个分类数据集,包含 1,449 张覆盖 6 个领域和 15 个子领域的多样化图表;(2)一个整合了生成(视觉到代码)和可编辑性(代码到代码)的范式定义;(3)一个定制化评估协议,采用多维指标,如 mxGraph 执行成功率、风格一致性分数(SCS)等。实验结果表明,当前最先进的视觉-语言模型在结构化保真度和指令遵循方面面临挑战,反映了其视觉与推理能力的局限性。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:33

# VCG-Bench:面向结构化生成与编辑的统一视觉中心基准

来源:https://arxiv.org/html/2605.15677 董培杰,唐振恒,唐松,翟语瑶,林凯涛,陈亮,盖宇航,罗宇宇,王强,赵晓文

###### 摘要

尽管视觉语言模型(VLM)取得了快速进展,但在处理专业工作流程中至关重要的结构化、可控图表任务方面仍存在关键差距。现有方法主要依赖于基于像素的合成,这种操作在概率像素空间中进行,本质上在可编辑性和保真度上存在局限。相反,我们提出了一种新的“图表即代码”范式,该范式采用符号逻辑,利用 mxGraph 可扩展标记语言(XML)实现精确的图表生成和编辑。我们提出了 VCG-Bench,这是一个面向视觉中心 mxGraph 任务的统一基准。VCG-Bench 包含:(1) 一个分类数据集,包含涵盖 6 个领域和 15 个子领域的 1,449 个多样化图表;(2) 一个范式定义,集成了生成(视觉到代码)和可编辑性(代码到代码);(3) 一个定制的评估协议,采用多维指标,如 mxGraph 执行成功率、风格一致性得分(SCS)等。实验结果凸显了当前最先进 VLM 在结构保真度和指令遵循方面面临的挑战,反映了它们的视觉和推理能力。

机器学习,ICML

## 1 引言

视觉语言模型(VLM)——如 OpenAI(2023)、Google DeepMind(2025)、Wu 等人(2025a)、Chen 等人(2025b)、Liu 等人(2023)、Wang 等人(2024a)、Bai 等人(2025)——在通用多模态任务中展示了令人印象深刻的能力,范围从视觉问答(Antol 等人,2015)到开放式的图像生成(Rombach 等人,2022;Podell 等人,2024)。通过高容量架构和大规模多模态预训练,现代 VLM 在场景描述、光学字符识别(OCR)和跨模态推理方面达到了接近人类的性能。然而,从自然图像向抽象、符号化和结构化视觉信息的跨越仍是一个关键前沿。这一差距在流程图表、系统架构图、科学图表和 UI 模型等图表中尤为明显——这些在专业环境中普遍存在(Pan 等人,2024)。与自然图像不同,图表旨在通过组合、布局和离散符号来编码精确的语义,要求模型捕获结构而非外观。

参见图注 图 1:图表任务的比较。VCG 利用符号化的 mxGraph XML 进行精确生成和编辑,克服了基于像素模型中的结构漂移。

表 1:视觉表示格式的比较分析。mxGraph 在语义丰富性和结构化可编辑性之间取得平衡。

参见图注 图 2:VCG-Bench 框架概览。与碎片化的方法(上图)不同,VCG-Bench(下图)统一了视觉到代码的生成(任务 1)和指令到补丁的编辑(任务 2)。利用符号化的 mxGraph XML 能够为专业工作流程实现精确、低成本的修改。

我们提出 VCG-Bench,这是一个统一的基准,旨在评估 VLM 在生成和编辑 mxGraph XML 图表方面的端到端能力。VCG-Bench 遵循“数据-任务-评估”框架。(1) 我们构建了一个多样化的数据集,分为 6 个主要领域(学术、软件、商业等),涵盖复杂、逻辑密集的布局。(2) 我们将图表任务统一为两个互补的流程:生成(从标准图像创建有效的 mxGraph XML)和可编辑性(根据指令修改现有结构),并采用增量修改策略以提高效率。(3) 我们建立了一套严格的评估协议,超越了简单的文本匹配,融合了执行成功率、视觉风格一致性(SCS)以及通过 QA 进行的语义保真度检查。我们的贡献总结如下:

- • 我们引入了 VCG-Bench,这是第一个弥合视觉与可编辑结构化生成之间差距的基准。
- • 我们整理了一个高质量、分类的 1,449 个图表数据集,具有来源和结构多样性。
- • 我们提出了一套全面的评估协议,包含新颖的可执行性、风格一致性和指令遵循指标,并对最先进的 VLM 在图表任务上进行了基准测试。

为了激励这一基准设计,我们首先对比两种图表范式。对于图表任务,主要范式之一是“图表即像素”。它依赖于光栅化的像素生成和编辑管道(例如,提示 + 像素编辑模型,如 GPT-Image 和扩散模型)。虽然它可以产生视觉上合理的结果,但本质上具有**随机性、非结构化和易幻觉**的特点,因为它操作的是像素而非符号结构。图 1 说明这通常会导致**线条模糊、文本扭曲、比例/对齐错误**,甚至出现**幻觉元素**(例如,插入一个非预期的“CDN”)。这些问题与实际的图表编辑工作流程相冲突,后者需要:(1) **矢量精确输出**(例如,SVG 或 mxGraph),(2) **低成本的增量修改**,以及 (3) **频繁的迭代编辑**而不会退化。

为了解决这些局限性,我们采用了“图表即代码”范式,该范式**可控性更强、结构化程度更高、更具确定性**。我们不是编辑像素,而是使用 VLM(例如,Gemini(Google DeepMind, 2025)、Claude(Anthropic, 2025)和 GPT(OpenAI, 2025))将光栅图像转换为结构化表示。在用户指令的引导下,系统通过**视觉可控生成(VCG)**使用符号操作进行编辑,实现了 LLM 与人类用户之间的有效协作,同时保留了精确、可编辑的图表结构——生成**清晰、高保真**的输出图形(图 1)。值得注意的是,“图表即代码”范式可以与像素级生成器集成,以产生更美观、风格化的渲染效果。

对于“图表即代码”,表 1 对比了主流表示格式(mxGraph、SVG、HTML/CSS、PPT)。SVG 主要面向几何,语义有限;HTML/CSS 仅提供中等的结构控制;PPT 以 GUI 为中心,程序化可编辑性受限。相比之下,mxGraph 将图表建模为语义实体(节点/边),通过可解释的开放 XML 表示提供**高语义深度**、**结构化可编辑性**和**高 AI 可控性**,使其非常适合 AI 驱动的推理和精确修改。(详见附录 D.2 的进一步讨论。)

参见图注 图 3:VCG-Bench 数据生成框架概览。子图 (a) 展示了任务 1 的端到端管道,从原始网络抓取到结构化的基于 XML 的渲染。子图 (b) 详述了任务 2 的管道,该管道专注于从任务 1 派生的基于编辑的推理任务的生成。

图 3 详细说明了 VCG-Bench 的数据生成管道,并展示了从数据收集到结构化评估的系统化过程。附录 B 提供了数据合成管道的详细描述,包括阶段 1(图像到 mxGraph XML)和阶段 2(指令合成)。

## 2 相关工作

我们的工作聚焦于 mxGraph 格式,推动了多模态代码生成领域的发展。我们将其置于四个方面相关文献中:图表与科学绘图生成、用户界面与符号图形、指令驱动图像编辑以及评估方法论。

**图表与科学绘图生成。** 图表推理已通过 VQA 基准(例如,AI2D (Kembhavi et al., 2016)、ChartQA (Masry et al., 2022)、FigureQA (Kahou et al., 2018)、MMBench (Liu et al., 2024b))和图表理解评估(CharXiv (Wang et al., 2024b)、MMSCI (Li et al., 2024c)、AIBench (Liao et al., 2026))得到推进。最近关于可执行代码的工作包括 ChartMimic (Yang et al., 2025; Niu et al., 2025)、Plot2Code (Wu et al., 2025b)、PlotCraft (Zhang et al., 2025)、MMCode (Li et al., 2024b)、Flow2Code (He et al., 2025) 和 RealChart2Code (Zhang et al., 2026);这一系列工作大多仍集中在光栅化的数据驱动可视化上。交互式可视化系统如 HAIChart (Xie et al., 2024) 研究人-AI 协作的图表创建。与科学图表相关,Draw with Thought (Cui et al., 2025) 将静态科学图表重建为可编辑的 mxGraph XML。VCG-Bench 提供了一个多领域的 Draw.io/mxGraph 基准,共同覆盖了图像到 XML 的生成和基于指令的 XML 编辑,并带有明确的空间和拓扑评估。表 2 将 VCG-Bench 与这些基准进行了定位。

表 2:VCG-Bench 与相关基准的比较。Edit.: 支持基于指令的编辑。Fine-grained: 超越单一通过/失败或相似性的多维度评估。✓: 存在;×: 不存在。VCG-Bench 是唯一一个同时支持 Edit. 和 Fine-grained 评估的多领域基准(表 2)。先前的视觉-代码基准侧重于单领域生成(执行通过或相似性);PlotCraft (Zhang et al., 2025) 支持基于指令的编辑和细粒度评估,但仍局限于数据可视化。我们通过任务 1(图像到 mxGraph XML)和任务 2(基于指令的编辑)统一了多领域图表覆盖,并通过 XQA、XDRFR、ESR 和 SCS 进行评估;这种设计既支持严格评估,也支持为模型训练可扩展地生成经过验证的视觉-代码对。

**用户界面与符号图形生成。** UI 到代码已从早期的 CNN/RNN 系统(Pix2Code (Beltramelli, 2018)、Sketch2Code (Jain et al., 2019))演进到基于扩散的生成(Rombach et al., 2022; Zhang et al., 2023b)和基准如 Design2Code (Si et al., 2025);代码 LLM(Chen et al., 2021; Li et al., 2023; Lozhkov et al., 2024; Roziere et al., 2023; Guo et al., 2024)已推进了程序合成。在矢量图形方面,VCode (Lin et al., 2025) 和 SVGenius (Chen et al., 2025a) 针对 SVG;学习方法(DeepSVG (Carlier et al., 2020)、Im2Vec (Reddy et al., 2021))和基于 LLM 的方法(Jain et al., 2023; Vinker et al., 2022; Wu et al., 2023)处理 SVG。最近的基准进一步评估了 SVG 编辑(Nishina and Matsui, 2024, 2025)和文本到图表生成/编辑(Wei et al., 2025)。这些相邻设置侧重于 SVG/矢量图形或通用结构化视觉内容;我们针对具有空间和语法约束的可编辑 mxGraph XML,它保留了更高级别的图表拓扑和编辑语义,以实现精确的组件操作。

**指令驱动图像编辑。** 基于扩散的编辑(Prompt-to-Prompt (Hertz et al., 2023)、InstructPix2Pix (Brooks et al., 2023)、MagicBrush (Zhang et al., 2023a))已取得显著进展,但受到语义纠缠(难以保留未编辑区域)和精度不足(字符扭曲、拓扑幻觉)的困扰。我们将编辑重新定义为对 mxGraph XML 的代码重构,在编辑区域外保持精确保真度,并支持在像素空间中不可行的编辑。因此,这种代码中介范式避免了像素级编辑的语义纠缠和精度限制,同时支持确定性、局部化的修改。

**指令遵循的评估方法论。** 鲁棒评估仍是一个关键挑战;传统指标通常难以捕捉复杂指令的细微差别。InFoBench (Qin et al., 2024; Zhou et al., 2023) 引入了分解需求遵循率(DRFR);多模态基准(Yu et al., 2023; Yue et al., 2024, 2025; Li et al., 2024a; Xu et al., 2024; Chen et al., 2024)以及领域特定工作(Yang et al., 2025; Wu et al., 2025b; Si et al., 2025; Zhuo et al., 2025; Xie et al., 2026)使用了细粒度标准,包括结构化视觉事实检查和可视化质量评估。受此启发,我们对 Draw.io 输出的结构和视觉保真度采用了一种分解策略(XDRFR 及相关指标),允许直接在生成的 XML 上进行细粒度的指令遵循验证。在 XML 结构上进行评估而非渲染图像,避免了视觉歧义,并支持可重复的、属性级别的检查。对 XDRFR 的手动审计(附录 A)证实了自动评分与人类判断之间的高度一致性。

## 3 VCG-Bench 构建

### 3.1 数据准备

相似文章

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。