DashArena:对LLM在交互式分析仪表板生成上的基准测试

arXiv cs.AI 论文

摘要

介绍了DashArena,这是首个针对LLM开放式、任务驱动的交互式分析仪表板生成的基准测试。它使用浏览器执行器重放交互轨迹,并使用VLM评判器评估结果,人工研究证实了其有效性。

arXiv:2608.10567v1 公告类型:新 摘要:分析仪表板结合了协调视图和交互,用于数据探索和决策。最近的模型可以从数据和自然语言目标生成它们,但评估其实用性仍然困难。仪表板生成是开放式的,仅靠静态外观或成功执行都无法单独捕捉分析支持和交互质量。我们引入了DashArena,据我们所知,这是首个用于开放式、任务驱动的交互式分析仪表板生成的基准测试。其关键创新在于要求每个系统同时生成仪表板和可重放的交互轨迹。浏览器执行器重放轨迹,将系统预期的分析工作流转化为可复现的视觉和执行证据。VLM评判器使用这些证据比较候选方案,并通过Bradley--Terry聚合生成排行榜。我们进一步将评判器蒸馏为开放权重的DashJudge-8B。人工评估表明,DashJudge-8B能有效复现人类判断,消融实验显示交互证据提高了评判器的一致性。对前沿模型的实验揭示了持续存在的渲染、分析和交互失败。总之,这些结果表明,现实世界的仪表板生成仍然具有挑战性,而交互感知评估能捕捉到静态或仅执行检查所遗漏的失败。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:26

# DashArena:在交互式分析仪表盘生成上对LLM进行基准测试
来源:https://arxiv.org/html/2608.10567

###### 摘要

分析仪表盘结合了协调视图与交互,用于数据探索和决策制定。最近的模型能够根据数据和自然语言目标生成这些仪表盘,但评估其有用性仍然困难。仪表盘生成是开放式的,仅靠静态外观或成功执行都无法充分体现分析支持质量和交互质量。我们引入了DashArena,据我们所知,这是第一个针对开放式、任务驱动的交互式分析仪表盘生成的基准测试。其关键创新在于要求每个系统同时生成仪表盘和可重放的交互轨迹。浏览器执行器重放该轨迹,并将系统预期的分析工作流转化为可复现的视觉与执行证据。VLM评审器利用这些证据比较候选方案,并通过Bradley–Terry聚合生成排行榜。我们进一步将评审器蒸馏为开放权重的DashJudge-8B。人工评估表明,DashJudge-8B能有效复现人类判断,消融实验表明交互证据能提高评审器与人类判断的一致性。对前沿模型的实验揭示了持续的渲染、分析和交互失败。综合来看,这些结果表明,现实的仪表盘生成仍具挑战性,而交互感知的评估能够捕获静态或仅执行检查所遗漏的失败。

## 引言

分析仪表盘是交互式界面,通过协调多视图总结数据并支持探索性分析(Bachet al. 2023 (https://arxiv.org/html/2608.10567#bib.bib1); Sarikayaet al. 2019 (https://arxiv.org/html/2608.10567#bib.bib2); Few2006 (https://arxiv.org/html/2608.10567#bib.bib9))。创建这些仪表盘需要对数据转换、视觉编码、多视图组织和交互设计做出决策(Setluret al. 2024 (https://arxiv.org/html/2608.10567#bib.bib3); Srinivasanet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib11))。最近的LLM能够生成可执行应用并分析表格数据,使得仪表盘生成越来越可行(Zhouet al. 2024 (https://arxiv.org/html/2608.10567#bib.bib67); Huet al. 2024 (https://arxiv.org/html/2608.10567#bib.bib68))。

评估这种能力是困难的,因为仪表盘生成是开放式的。多种布局、图表选择和交互设计都可能同样有效地支持同一个分析目标,因此匹配单一人工参照或固定组件清单可能会错误地惩罚合理的替代方案。静态截图能展示视觉质量,但无法说明交互是否有效。相反,程序化执行检查能检测出失效操作,但无法判断一个功能正常的仪表盘是否很好地回答了任务。随着GUI代理的兴起(Nguyenet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib71)),一些基准测试提出使用它们来探索Web应用并评估其功能(Tranet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib70))。然而,评估结果将依赖代理发现陌生界面的能力,且遗漏的功能与不存在的功能难以区分。这种探索也代价高昂且难以复现。因此,一个有用的基准测试必须保留设计自由,获取关于每个工件预期使用方式的可复现证据,并将语义质量评估交给独立的评审器。

我们提出DashArena,一个在受控单文件Web环境中进行开放式分析仪表盘生成的基准测试。我们使用高质量人工编写的仪表盘作为任务种子,并请VLM观察其页面、数据模式和从代码中提取的交互特征,然后将底层用户情境、分析目标和期望交互表达为自然语言任务。该任务描述预期的分析,而非要求复现原始仪表盘。对于每个任务,候选LLM首先生成Web仪表盘,然后在其自身实现可访问的情况下,生成描述有意义分析走查的结构化交互轨迹。遵循GameCraft-Bench的可重放演示原则(Luoet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib69)),我们将该轨迹视为随生成工件提供的可执行文档。它简要演示了其声称支持的分析路径。我们的浏览器执行器独立重放每个声明的操作,并记录其是否成功以及哪些图表、控件和文本组件发生变化。因此,VLM评审器可以基于任务、截图和执行证据评估仪表盘质量,而无需自行探索界面。

参见图1:DashArena概览。人工编写的仪表盘提供现实任务种子。每个被评估模型生成仪表盘和轨迹;浏览器执行将该轨迹转化为确定性证据。VLM评审器比较匿名候选,任务聚类的Bradley–Terry聚合生成最终排行榜。

DashArena对候选方案进行成对评估。VLM评审器比较两个匿名仪表盘及其轨迹,利用截图和执行报告预测其相对质量。我们首先使用Claude Opus 4.6作为专有教师模型实例化该协议,并收集其在任务分层候选对上的偏好。然后,我们基于Qwen3-VL-8B-Instruct微调DashJudge-8B,一种VLM评审器,使用255个独立的教师标注对,并采用交换候选顺序和反转标签的数据增强策略。这使得在本地硬件上进行可复现、高吞吐量的评估成为可能。我们进行了评估,并使用Bradley–Terry模型(Bradley and Terry1952 (https://arxiv.org/html/2608.10567#bib.bib72))聚合比较结果,生成最终排行榜。

表1 (https://arxiv.org/html/2608.10567#Sx1.T1)展示了DashArena与现有可视化基准测试的定位比较。nvBench和nvBench 2.0评估自然语言到可视化(NL2VIS)任务,后者显式建模受控歧义(Luoet al. 2021 (https://arxiv.org/html/2608.10567#bib.bib44), 2025 (https://arxiv.org/html/2608.10567#bib.bib45))。VisEval还通过VLM评审器评估图表可读性(Chenet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib48))。这三个基准测试都聚焦于单图表生成。VisJudge-Bench评估包括仪表盘在内的静态可视化图像质量,但不考虑交互性和任务完成度(Xieet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib49))。据我们所知,DashArena是第一个针对开放式、任务驱动的交互式分析仪表盘生成的基准测试。它也是第一个使用生成器编写、可重放交互轨迹作为运行时和交互评估证据的仪表盘生成基准测试。

| 基准测试 | 主要工件 | 任务驱动评估 | 开放式或模糊请求 | 多视图仪表盘 | 视觉质量评估 | 执行交互 |
|---|---|---|---|---|---|---|
| nvBench (Luoet al. 2021 (https://arxiv.org/html/2608.10567#bib.bib44)) | 仅代码 | ✓ | ✗ | ✗ | ✗ | ✗ |
| nvBench 2.0 (Luoet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib45)) | 仅代码 | ✓ | 受控 | ✗ | ✗ | ✗ |
| VisEval (Chenet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib48)) | 代码 + 图像 | ✓ | ✗ | ✗ | ✓ | ✗ |
| VIS-Shepherd (Panet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib73)) | 代码 + 图像 | ✓ | ✗ | ✗ | ✓ | ✗ |
| VisJudge-Bench (Xieet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib49)) | 仅图像 | ✗ | ✗ | ✓ | ✓ | ✗ |
| DashArena(ours) | 代码 + 图像 + 交互证据 | ✓ | ✓ | ✓ | ✓ | ✓ |

表1:与代表性可视化生成和评估基准测试的范围比较。“受控”表示围绕已知图表规格注入的歧义;它不同于具有多种有效仪表盘设计的开放式分析请求。

我们的最终基准测试包含234个任务,涵盖14个主题聚类和广泛的结构复杂度。我们评估了七个主流LLM,并将原始人工编写的仪表盘作为匿名人类基线。为验证评审器,我们邀请六位独立标注者为100个分层候选对进行标注,每对获得三条标注。在99个可评估对上,DashJudge-8B获得79.8%的人类一致率和κ=0.600\kappa=0.600。消融轨迹及其执行报告会将一致率降至71.7%,而仅确定性执行规则只能达到42.4%,这表明交互证据是有用的,但如果没有多模态语义判断则不够充分。最终排行榜在Bradley–Terry、Thurstone–Mosteller和平均胜率聚合下保持稳定。

我们的贡献如下:

- 我们引入DashArena,据我们所知,这是第一个面向开放式、任务驱动的交互式分析仪表盘生成的基准测试,并附带数据集、任务文档和匿名人类基线。
- 我们开发了一种基于交互证据的评估方法,将生成器编写、可重放的交互轨迹转化为多模态成对判断的执行证据。我们发布了蒸馏后的开放权重评审器DashJudge-8B,作为该方法的一种可复现且高效的实现。
- 我们对七个前沿模型和人类基线进行了全面的实证研究,并辅以人工校准研究、确定性可靠性指标、聚合诊断、稳健性检查和100个案例的失败审计。

## 相关工作

#### 可视化生成与评估。

NL2VIS系统将语言映射为可视化代码,而后续工作将生成扩展到仪表盘和基于LLM的工作流(Luoet al. 2018 (https://arxiv.org/html/2608.10567#bib.bib47); Narechaniaet al. 2021 (https://arxiv.org/html/2608.10567#bib.bib39); Zhouet al. 2021 (https://arxiv.org/html/2608.10567#bib.bib46); Denget al. 2023 (https://arxiv.org/html/2608.10567#bib.bib31); Wuet al. 2022 (https://arxiv.org/html/2608.10567#bib.bib30); Maddigan and Susnjak2023 (https://arxiv.org/html/2608.10567#bib.bib50); Tianet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib14); Ouyanget al. 2025 (https://arxiv.org/html/2608.10567#bib.bib42))。然而,基准测试大多仍停留在图表级别:nvBench和nvBench 2.0测试文本到可视化及歧义处理(Luoet al. 2021 (https://arxiv.org/html/2608.10567#bib.bib44), 2025 (https://arxiv.org/html/2608.10567#bib.bib45)),VisEval和VIS-Shepherd使用VLM评审器评估单图表(Chenet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib48); Panet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib73))。VisJudge-Bench涵盖多视图仪表盘,但不涉及交互或任务完成度(Xieet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib49))。交互式多视图生成也已被研究(Zhaoet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib23); Qiuet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib26); Shenet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib25); Shiet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib27)),但这些系统主要通过专家研究而非可扩展基准来评估。Dashboard2Code评估静态仪表盘重建(Niuet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib78)),但不考虑开放式任务或交互。DashArena是第一个在开放式任务上评估交互式仪表盘的基准测试,其评估同时考虑了运行时有效性、交互证据和视觉质量。

#### 交互工件与多模态评判。

Design2Code针对静态页面重建,而WebArena和VisualWebArena评估代理在现有站点中的行为(Siet al. 2025 (https://arxiv.org/html/2608.10567#bib.bib74); Zhouet al. 2024 (https://arxiv.org/html/2608.10567#bib.bib67); Kohet al. 2024 (https://arxiv.org/html/2608.10567#bib.bib75))。MLLM-as-a-Judge推动了成对多模态评估,同时也记录了评审器偏差(Chenet al. 2024 (https://arxiv.org/html/2608.10567#bib.bib76))。ArtifactsBench评估广泛的可执行工件,但缺乏仪表盘特定的数据分析和关联视图评估(Zhanget al. 2025 (https://arxiv.org/html/2608.10567#bib.bib79));MiniAppBench和Vibe Code Bench依赖GUI代理探索创建的工件(Zhanget al. 2026 (https://arxiv.org/html/2608.10567#bib.bib77); Tranet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib70))。遵循GameCraft-Bench的“先重放后评判”原则(Luoet al. 2026 (https://arxiv.org/html/2608.10567#bib.bib69)),DashArena使用提交的轨迹为分析仪表盘获取可复现的交互证据。

## DashArena

### 任务构建

#### 收集与质量过滤。

我们从Tableau Public¹¹https://public.tableau.com/app/search/vizzes/dashboard.爬取仪表盘,这是一个共享交互式数据可视化的平台,同时获取其元数据、页面截图、工作簿文件²²工作簿是存储仪表盘结构和交互操作的XML文件。以及表格数据。我们按热门程度搜索并排序仪表盘,因此爬取到的仪表盘很可能具有较高的社区认可度。我们首先移除无法提供全部四种工件类型的条目,然后使用VLM保留具有至少两个可用视图的分析型仪表盘,并排除教程、模板和非分析展示。我们按底层数据相似性对数据源去重,同时保留针对同一数据的有限替代人工设计;完整细节见补充材料。我们仅收集可公开访问的工件,并保留每个来源URL和创作者署名。发布的基准测试将项目派生的任务和元数据与原始Tableau资产区分开来,后者仍受创作者权利、平台条款和来源特定许可证的约束;补充材料详细说明了来源、再分发和移除程序。

#### 任务派生。

Claude Opus 4.6接收所有参考页面、采样数据模式以及从工作簿文件中提取的交互操作。它生成一个结构化种子,包含标题、用户情境、一个简洁的任务简述、非穷尽的分析目标和期望的交互能力。提示禁止复制截图中的特定KPI数值,并要求关注分析意图,而非图表、布局或像素级复现。种子随后被转换为固定模板的自然语言任务文档,并附加数据库模式和常见实现约束。我们检查生成的任务,确认所有分析目标都能通过提供的数据实现。最终生成的234个任务构成发布的基准测试。这些任务涵盖14个数据驱动主题聚类和广泛的结构复杂度;完整分布和构建细节见补充材料。

### 候选生成

每个模型接收任务文档和数据模式,必须返回一个完整的HTML文档。为了进行可比较的浏览器评估,我们要求使用ECharts³³https://echarts.apache.org/.并在交互元素上具备稳定的data-test-id属性。允许使用标签页和多个内部页面,约束不规定具体设计选择。

生成采用连续两轮对话。在生成HTML之后,模型接收交互轨迹模式并生成一系列操作。第二轮保留完整上下文,因此模型可以引用其刚刚生成的仪表盘代码。

#### 为什么使用模型编写的轨迹?

受GameCraft-Bench启发(Luoet al.

相似文章

JudgeArena:可复现的LLM裁判评估统一框架

arXiv cs.CL

JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。