VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?

arXiv cs.CL 论文

摘要

介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。

arXiv:2608.10408v1 公告类型:新 摘要:视觉语言模型(VLM)在根据文本或视觉规范生成可视化代码方面展现了强大的能力。然而,现实世界中的可视化创作本质上是迭代的:用户经常修改现有可视化以修复有缺陷的图表或使其适应所需样式。现有基准主要评估从零开始的生成,而来自多模态反馈的可视化代码编辑在很大程度上仍未得到探索。我们引入了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,基于现实的可视化工作流程和失败案例。VisEditBench涵盖两种实际场景:反馈引导的修复(模型使用有缺陷或标记的图表以及文本反馈来修改可视化代码)和参考引导的重新样式化(模型修改代码以匹配目标图表图像)。对20个最先进的VLM的评估表明,可视化代码编辑仍然具有挑战性:Claude-4.6-Sonnet达到了最佳总体通过率74.46%,而大多数开源模型仍低于50%。在视觉依据的风格适配方面,性能尤其薄弱,Claude-4.6-Sonnet仅达到55.71%。为了建立强大的基线,我们进一步提出了VisEditAgent,一个基于渲染的编辑框架,迭代地生成、执行、验证和优化候选编辑。基于GPT-4o,VisEditAgent将总体通过率从55.75%提升到67.99%,展示了基于渲染的反馈对于忠实可视化编辑的重要性。我们将在https://github.com/vis-nlp/VisEditBench发布VisEditBench。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:34

# VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?

来源:https://arxiv.org/html/2608.10408

Mizanur Rahman‡、Arshia Azimlu‡、Shadikur Rahman‡22footnotemark:2、Md Tahmid Rahman Laskar‡22footnotemark:2、Amran Bhuiyan‡22footnotemark:2、Shafiq Joty$,¶、Enamul Hoque Prince‡11footnotemark:1 ‡约克大学 $南洋理工大学 ¶Salesforce AI Research

###### 摘要

视觉语言模型(VLM)在从文本或视觉规范生成可视化代码方面已经展现出强大的能力。然而,现实世界中的可视化创作本质上是迭代式的:用户经常修改现有的可视化,以修复有缺陷的图表或使其适应所需的风格。现有基准主要评估“从零开始生成”,而基于多模态反馈的可视化代码编辑在很大程度上尚未被探索。我们引入了 VisEditBench,这是一个包含 1,395 个基于真实可视化工作流和失败案例的人工标注可视化代码编辑任务的基准。VisEditBench 涵盖两种实际设置:**反馈引导修复**(模型使用有缺陷或带标记的图表以及文本反馈来修订可视化代码)和**参考图引导重样式化**(模型修改代码以匹配目标图表图像)。对 20 个最先进的视觉语言模型的评估表明,可视化代码编辑仍然具有挑战性:Claude-4.6-Sonnet 取得了最佳的整体通过率 74.46%,而大多数开源模型仍低于 50%。在视觉锚定的风格适配方面,性能尤其薄弱,Claude-4.6-Sonnet 仅达到 55.71%。为了建立强基线,我们进一步提出了 VisEditAgent,一个基于渲染反馈的编辑框架,它迭代地生成、执行、验证和细化候选编辑。基于 GPT-4o,VisEditAgent 将整体通过率从 55.75% 提高到 67.99%,证明了基于渲染反馈对于忠实可视化编辑的重要性。我们将在 https://github.com/vis-nlp/VisEditBench 发布 VisEditBench。

\undefine@key

newfloatplacement\undefine@keynewfloatname\undefine@keynewfloatfileext\undefine@keynewfloatwithin

# VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?

Mizanur Rahman‡††thanks:通讯作者:\{mizanurr,enamulh\}@yorku\.ca,Arshia Azimlu‡††thanks:这些作者贡献相同\.,Shadikur Rahman‡22footnotemark:2、Md Tahmid Rahman Laskar‡22footnotemark:2、Amran Bhuiyan‡22footnotemark:2、Shafiq Joty$,¶、Enamul Hoque Prince‡11footnotemark:1 ‡约克大学 $南洋理工大学 ¶Salesforce AI Research

## 1 引言

参见图注 [图1](https://arxiv.org/html/2608.10408#S1.F1):VisEditBench 任务概览。给定可视化代码、视觉反馈或参考图表以及语言指令,模型必须生成经过修订的可执行代码,以修复或重样式化可视化,同时保留底层数据语义。

数据可视化在现代数据分析和沟通中发挥着核心作用,它使数据科学家、业务分析师、记者、政策制定者和研究人员能够在各个领域探索模式、传播见解并支持决策 hoque2024natural;rahman2025llm。为了支持日益复杂的可视化工作流,视觉语言模型(VLM)的最新进展推动了自动化可视化的快速发展,包括从自然语言指令生成图表 rahman2025text2vis;maddigan2023chat2vis 以及从图表图像重构可视化代码 yang2025chartmimic;wu2025plot2code。

然而,现实世界中的可视化创作很少止步于首次生成的图表。即使模型生成了可执行的可视化,其输出也常常无法完全匹配用户的意图、视觉偏好、可访问性要求或出版约束 rahman2025text2vis;chen2024viseval。因此,用户经常检查渲染出的图表、修改底层代码并重新渲染输出,通过迭代细化来完善结果。在许多工作流中,图表还必须适配到特定的视觉风格或参考设计,因为默认可视化往往在风格上高度同质,且与沟通目标不匹配。[图1](https://arxiv.org/html/2608.10408#S1.F1) 展示了一个典型的修复工作流:尽管用户已经拥有可视化代码和渲染图表,但输出仍存在视觉缺陷;标签重叠、注释遮挡重要区域、视觉强调放错了位置。即使是看似微小的修改,也可能触发级联的布局和样式变化,需要反复进行调试和视觉检查。这种“修复-重样式化”循环是实际可视化工作流中最常见且最耗时的瓶颈之一 harper2017converting。与一次性生成不同,这些工作流需要局部编辑,在仅修改所需视觉属性的同时,保留数据语义、布局结构、编码方式和分析意义。因此,可视化创作本质上是一个**迭代式多模态编辑问题**。解决这个问题需要基于上下文的(grounded)多模态推理。模型必须确定**哪里**在视觉上出错、**哪些**代码区域需要更改、渲染图表应**如何**演变,以及原始可视化的**哪些方面**必须保留。这比标准的代码生成或图表重构需要更丰富的推理能力。

尽管 VLM 进展迅速,现有基准在很大程度上忽略了这个场景。文本到可视化基准主要评估从自然语言查询或数据表生成图表 luo2021nvbench;liu2021advisor;rahman2025text2vis;chen2024viseval,而图表到代码基准则评估从图表图像重构代码 yang2025chartmimic;wu2025plot2code。两者都未捕捉到一种常见工作流:用户已经拥有可视化代码,并希望模型使用多模态反馈或参考图表**迭代编辑**渲染出的可视化。更广泛的多模态软件工程基准 yang2024swestudy 研究了视觉错误修复,但没有解决可视化特有的挑战,例如修复误导性编码、解决布局混乱、或在不破坏数据语义的情况下匹配参考图表风格。

为了填补这一空白,我们引入了 VisEditBench,一个用于评估基于多模态反馈的可视化代码编辑的基准。每个任务都提供现有的可视化代码、渲染图表和一条自然语言编辑指令,并要求模型生成经过修订的可执行代码,以产生所需的可视化结果。VisEditBench 支持两种实际编辑设置。在**反馈引导修复**中,模型接收有缺陷或人工标记的图表以及文本反馈,必须在保持预期含义的同时修复可视化([图1](https://arxiv.org/html/2608.10408#S1.F1))。在**参考图引导重样式化**中,模型接收目标图表图像,并必须调整原始可视化以匹配参考风格,且不改变底层数据语义。在所有这些设置中,VisEditBench 包含 1,395 个人工标注任务,这些任务基于从 Stack Overflow、Matplotlib 和 Vega-Lite issue 报告以及多种真实世界可视化数据集中收集的实际可视化问题。

除了可执行性之外,成功的可视化编辑还要求编辑在视觉上忠实、语义上精确且有效。为了支持细粒度分析,VisEditBench 引入了包含八种可视化编辑意图的分类体系,涵盖正确性修复、可读性提升、风格适配、一致性协调、鲁棒性提升、结构转换、约束满足和风格感知修复([图3](https://arxiv.org/html/2608.10408#S3.F3))。这些设置共同捕捉了需要视觉推理、代码理解和多模态锚定的真实可视化工作流。

我们在零样本设置下评估了 20 个最先进的 VLM 在 VisEditBench 上的表现,使用可执行性、任务准确性、可读性和清晰度、视觉质量、视觉相似度以及最终通过率。结果表明,可视化编辑仍然具有挑战性:Claude-4.6-Sonnet 的最佳整体通过率为 74.46%,而大多数开源模型仍低于 50%。性能在视觉锚定的风格适配方面尤其薄弱,即使是 Claude-4.6-Sonnet 也仅达到 55.71%。为了进一步研究渲染反馈如何改善编辑,我们引入了 VisEditAgent,一个基于渲染反馈的基线,它生成多个候选修改,执行并渲染它们,视觉验证输出,并迭代细化选定的解决方案。使用 GPT-4o 作为基础模型,VisEditAgent 将整体通过率从 55.75% 提高到 67.99%,证明了基于渲染反馈对于视觉忠实可视化编辑至关重要。

总之,我们的贡献包括:(i)VisEditBench,一个包含 1,395 个手动标注的可视化代码编辑任务的基准,涵盖反馈引导修复和参考图引导重样式化,并涉及多种可视化编辑意图;(ii)一个**结构化评估框架**,衡量可执行性、任务准确性、图表可读性和清晰度、视觉质量、视觉相似度以及最终通过率;(iii)对 20 个最先进 VLM 的**零样本评估**,揭示了在可执行且视觉忠实的图表编辑方面的主要局限;(iv)VisEditAgent,一个基于渲染反馈的基线,通过执行反馈、视觉验证和迭代细化来改进可视化编辑。

## 2 相关工作

**文本到可视化**。现有的可视化基准和系统主要研究了模型如何从自然语言查询、表格数据、图表图像和分析意图中生成 rahman2025text2vis、理解 hoque2022chartquestionansweringstate 或重构图表 wu2025plot2code([表6](https://arxiv.org/html/2608.10408#A1.T6))。WikiSQL zhong2017seq2sql 支持表格上的自然语言到 SQL 解析,而 nvBench luo2021nvbench 通过从 NL-to-SQL 基准合成配对的自然语言查询和可视化规范,将该设置扩展到大规模跨领域 NL2VIS。后来的系统探索了可视化推荐、规范生成和基于自由形式分析查询的代码生成 liu2021advisor;dibia2019data2vis;narechania2020nl4dv;song2022rgvisnet;maddigan2023chat2vis。最近的基于 LLM 的基准,包括 Text2Vis rahman2025text2vis 和 VisEval chen2024viseval,评估大语言模型能否在多样化的真实世界数据集上生成可视化。ChartBench xu2023chartbench 专注于图表理解和视觉推理,而 ChartLlama han2023chartllama、ChartMimic yang2025chartmimic 和 Plot2Code wu2025plot2code 则测试图表推理或从图表图像重构可视化代码。

然而,现有基准并不评估基于多模态反馈的迭代式可视化编辑——在这种编辑中,用户使用渲染反馈或参考图表修订现有可视化代码,同时保持数据语义([表6](https://arxiv.org/html/2608.10408#A1.T6))。VisEditBench 通过反馈引导修复和参考图引导重样式化任务来评估基于多模态反馈的可视化代码编辑,从而填补了这一空白。

##### 多模态代码生成。

最近的工作已将代码生成扩展到多模态设置,其中模型从视觉输入生成或编辑代码 li2024mmcode;si2025design2code;wu2025plot2code。早期的 UI-to-code 系统将截图或草图转换为可执行界面 beltramelli2018pix2code;robinson2019sketch2code,而后续工作通过视觉-代码架构和视觉反馈改善了截图到代码的生成 soselia2023learning。最近的基准研究了视觉锚定的编程任务,包括基于图表的编程(MMCode li2024mmcode)、截图到网页生成(Design2Code si2025design2code)、SVG 编辑(SVGEditBench nishina2024svgeditbench)和视觉软件错误修复(SWE-bench Multimodal yang2024swe)。相比之下,VisEditBench 专注于从多模态反馈编辑和重样式化现有可视化代码,同时保留数据语义。

参见图注 [图2](https://arxiv.org/html/2608.10408#S2.F2):VisEditBench 构建流程概览。我们收集真实可视化问题和真实世界的图表/数据示例,构建多模态编辑任务,对候选项进行交叉评审以确保质量,并保留具有编辑意图、问题类型、图表类型和可视化库等元数据的最终基准。

## 3 VisEditBench

我们引入了 VisEditBench,一个包含 1,395 个基于多模态反馈的人工标注可视化代码编辑任务的基准。

参见图注 [图3](https://arxiv.org/html/2608.10408#S3.F3):VisEditBench 中跨越八种编辑意图的示例。每个任务将输入可视化代码与有缺陷的、人工标记的或参考图表图像以及一条自然语言指令配对;模型必须输出修订后的可执行代码,以渲染出所需的可视化。

### 3.1 数据收集

我们将 VisEditBench 设计为捕捉真实的可视化编辑工作流,而非合成的图表生成提示。为确保真实性和多样性,我们结合了两个互补来源:真实用户报告的可视化问题,以及模型在真实世界数据集上生成的图表失败案例。[图2](https://arxiv.org/html/2608.10408#S2.F2) 展示了收集过程。

首先,我们从 Stack Overflow 和 Matplotlib/Vega-Lite GitHub issue 讨论中手动收集了 120 个真实的可视化编辑案例。我们只保留了包含用户报告的问题、可视化代码以及带有清晰视觉问题的对应渲染有缺陷图表的示例,这些问题需要修复、改进或重样式化。这些自然发生的案例包括布局混乱、标签不可读、坐标轴畸形、误导性编码、注释失败、图例损坏和渲染不一致等。

其次,我们使用了 Text2Vis 基准 rahman2025text2vis,其表格和查询来自 Statista statista、Pew Research pewresearch、Our World in Data owid 和 OECD oecd 等真实数据源。我们在 Text2Vis 查询上重新运行了前沿和开源模型,执行生成的代码,并手动检查渲染图表以识别视觉、语义和呈现失败。只有当渲染输出表现出明显的可视化错误或不完美的视觉设计(如布局问题、错误编码、不可读标签或较差的呈现质量)时,我们才保留图表-代码对。因此,这些保留案例反映了当前模型在零样本可视化生成中失败的真实示例。这一过程大大增加了超出自然报告 bug 的多样性,不仅涵盖正确性修复,还涵盖风格适配、一致性协调、鲁棒性提升、结构转换和风格感知修复。

### 3.2 标注与质量控制

根据这些来源,四位标注者创建了 1,648 个候选编辑任务的初始池。对于每个任务,标注者编写了一条自然语言编辑指令,并分配元数据,包括编辑意图、问题类型、可视化库和图表类型。然后,另一个标注者独立对每个候选进行交叉评审,以验证该任务在视觉上有根据、符合现实、指定清晰,并且可以通过代码编辑解决。只有当评审者判断代码、图表图像、指令和元数据共同构成一个有效的编辑任务,且具有可观察的视觉目标和可行的代码级解决方案时,该候选才会被保留。

为了衡量标注可靠性,我们计算了所有候选项在二元接受/拒绝决定上的标注者间一致性。

相似文章

VCG-Bench:面向统一视觉中心的生成与编辑结构化基准

arXiv cs.CL

VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hugging Face Daily Papers

SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。