Crystalis:渐进式成核与语义退火实现协调多视图可视化生成

arXiv cs.AI 论文

摘要

Crystalis是一个框架,采用以查询为中心的建模和两种机制(渐进式成核与语义退火),使大语言模型能够生成结构正确的协调多视图可视化,在基准测试中实现了高达75%的端到端成功率。

arXiv:2607.24766v1 公告类型:新 摘要:大语言模型(LLMs)可以生成单个图表,但协调多视图可视化(CMV)——其中视图共享数据流和跨视图交互——仍然遥不可及。数据转换、视觉编码和交互协调之间的紧密字段级耦合导致一个组件的错误会无声地使其他组件失效。我们不追求端到端的分析质量(这取决于模型能力、领域知识和用户专业知识),而是针对一个基础性问题:LLMs能否可靠地生成结构正确的CMV?哪些抽象化使得这成为可能?我们提出了Crystalis,一个基于以查询为中心的CMV建模的框架,它将CMV分解为对依赖图的结构化查询,该依赖图跨越三种组件类型(数据、可视化、交互)和三个抽象层次(需求、规范、可执行对象)。两种互补机制在此结构上运行:渐进式成核沿依赖顺序垂直地将每个查询从需求结晶为对象,而语义退火通过分层逻辑检查在每个级别上强制执行跨查询的水平一致性。在涵盖五个前沿LLM的12任务基准测试中,Crystalis实现了高达75%的端到端成功率,显著优于一个智能体编码基线(使用相同基础模型时端到端成功率仅为8.3%),并且一项包含12名实践者的用户研究确认了分解和迭代优化工作流的可用性。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:51

# Crystalis: 渐进成核与语义退火——协同多视图可视化生成
来源:https://arxiv.org/html/2607.24766
\onlineid

1174\vgtccategory区域4:表示与交互\authorfooter作者单位:浙江大学

###### 摘要

大型语言模型(LLMs)可以生成独立的图表,但协同多视图可视化(CMVs)——其中视图共享数据流和跨视图交互——仍然难以实现:数据转换、视觉编码和交互协调之间的紧密字段级耦合,导致一个组件中的错误会静默地使其他组件失效。我们并不追求端到端的分析质量(这取决于模型能力、领域知识和用户专业知识),而是针对一个基础性问题:LLMs能否可靠地生成结构正确的CMV?哪些抽象使得这成为可能?我们提出\system框架,该框架基于**以查询为中心的CMV建模**,将CMV分解为对依赖图的结构化查询,该依赖图跨越三种组件类型(数据、可视化、交互)和三个抽象层级(需求、规范、可执行对象)。两个互补机制在此结构上运行:**渐进成核**沿着依赖顺序,将每个查询从需求垂直结晶为对象;而**语义退火**通过分层逻辑检查,在每个层级强制跨查询的水平一致性。在跨越五个前沿LLM的12个任务基准测试中,\system实现了高达75%的端到端成功率——显著优于基于智能体的编码基线(使用相同基础模型时端到端成功率为8.3%)——一项有12名从业者参与的用户研究证实了分解和迭代优化工作流的可用性。

###### 关键词:

可视分析,可视化原型设计,大型语言模型,逻辑验证。

\teaser![[无标注图片]](https://arxiv.org/html/2607.24766v1/figs/teaser.png)

\system将CMV生成建模为跨三种查询类型(数据、可视化、交互)和三种抽象层级(需求、规范、对象)的结构化查询矩阵。**渐进成核**(左)将每个查询从紧凑需求垂直结晶为可执行对象,而**语义退火**(右)通过分层逻辑检查,在每个层级强制跨查询的水平一致性。

## 引言

协同多视图可视化(CMV)是可视分析的基石[4269947,9222323]。通过共享数据流和交互协调——在一个视图中选择会在其他视图中过滤或高亮相关记录——CMV使分析人员能够在统一的分析背景下,从互补的角度审视复杂数据集。然而,构建有效的CMV仍然是一项艰巨的任务。数十年的研究已经产生了丰富的理论基础——嵌套模型[5290695]、设计研究方法论[6327248]和任务分类学[6634168]——正是因为构建这些系统需要涵盖领域理解、数据准备、图表设计和交互编排的深厚专业知识[Keim2008,6875967]。随着大型语言模型(LLMs)在生成独立可视化方面展现出越来越强的能力[dibia2019data2vis,tian2024chartgpt,10753451],一个自然的问题出现了:LLMs能否也生成CMV?

答案并不简单。虽然LLMs能够熟练地生成独立图表,但CMV远不止是独立视图的集合。其视图构成了一个**耦合系统**:每个视图都基于处理后的数据,其模式决定了哪些字段可用于编码和交互;跨视图协调(如联动刷选或过滤)施加了隐式契约,要求锚定字段在所有参与视图中存在且语义一致;而上游变化——如添加聚合、重命名列——可能静默地使系统中下游的视图和交互失效。这种**跨组件的字段级耦合**正是CMV生成与单一图表生成的区别所在:每个部分的正确性取决于其他部分的决策,且错误会跨边界静默传播。现有的基于LLM的可视化方法[deng2023dashbot,wu2021multivision,shi2020calliope,cheng2024snil]主要生成松散连接的图表集合或叙事序列,其中视图不共享如此紧密的结构依赖,因此耦合的CMV生成问题在很大程度上未被解决。

将LLM应用于此问题的两种自然策略各有不足。**直接代码生成**——让LLM(或智能体编码助手,如Claude Code或Cursor)生成完整的前端/后端实现——将跨视图依赖埋藏在数百行代码中,使得故障难以定位,字段级不匹配难以检测。**平台中介生成**——让LLM通过工具API(如Tableau[981851])组合预构建的仪表盘小部件——将输出限制为固定的图表类型和交互模板,限制了自定义CMV所需的分析灵活性。这两种方法都无法提供一种中间抽象,既足够紧凑以支持可靠的LLM生成,又具有足够的表现力以捕捉定义CMV的耦合。因此,我们提出以下问题:**LLMs能否可靠地生成结构正确、具有正常跨视图交互的CMV?哪些抽象使得这成为可能?**耦合带来了三个具体挑战。

**如何为LLM建模CMV生成。** CMV规范很容易超过数百行,即使几个错误参数也会导致渲染失败。所需要的是将CMV分解为可处理的生成单元——足够紧凑以便LLM可靠生成——同时保留定义其语义的组件间依赖关系。

**如何在保留依赖关系的同时解耦生成。** 数据转换、视觉编码和交互协调在数据字段层面紧密耦合。同时生成所有组件会导致错误叠加,然而独立生成它们又可能破坏将它们绑定的契约。挑战在于解耦生成,使得每个组件可以独立生成,同时尊重支配数据流的依赖顺序。

**如何通过逻辑验证重新链接解耦的组件。** 独立生成的组件可能各自正确但全局不一致——图表可能引用了上游数据处理丢弃的字段;交互可能通过具有不同语义含义的字段链接视图。挑战在于逐步验证解耦组件是否满足耦合它们的契约。

我们提出\system,它通过一个建模抽象和一个生成框架来应对这些挑战。为了解决建模挑战,我们引入**以查询为中心的CMV建模**,该模型将CMV生成抽象为对依赖图的结构化查询组合,其中每个查询生成一个组件,并带有显式的模式契约,下游查询可以消费并根据其进行验证。在此模型基础上,\system框架通过两个互补机制解决剩余的两个挑战。为了在保留依赖关系的同时解耦生成,**渐进成核**——类似于结晶学中分子在种子位点聚集形成有序结构——沿着依赖顺序,通过三个抽象层级(需求、规范、可执行对象)垂直优化每个查询。为了重新链接解耦的组件,**语义退火**——类似于热退火缓解材料内部应力——主要在每个抽象层级强制跨查询的水平一致性,在违规级联之前检测并纠正,并有一个最终的跨层级恢复机制来处理持续失败。

我们将\system实现为一个交互式系统,从业者可以在此与LLM共同创建CMV原型,将分析需求转化为数据转换代码和具有跨视图协调的Vega-Lite规范[YE202443,ying2024vaid]。本工作聚焦于CMV的**建模**和**鲁棒生成**——确保框架能够可靠地产生结构正确且语义一致的输出。生成的CMV的最终分析质量取决于生成框架本身之外的因素——基础模型的推理能力、系统可用的领域知识,以及用户在制定目标和引导优化方面的专业知识。我们将此工作视为一项初步探索,建立了结构生成问题及其可行的解决方案;我们的用户研究证实D-V-I分解是直观的,且从业者可以通过需求编辑有效引导生成。我们的贡献包括:

- ⋄\diamond**以查询为中心的CMV建模**,将CMV生成抽象为对依赖图的结构化查询组合,将单一规范分解为紧凑、可独立生成的单元,并带有显式模式契约。
- ⋄\diamond**\system框架**,具有**渐进成核**和**语义退火**,沿着依赖顺序解耦CMV生成,同时通过交织的逻辑检查逐步消除跨组件不一致性。
- ⋄\diamond**\system系统**,一个交互式CMV生成系统,将该框架操作化为以人为中心的可视分析。
- ⋄\diamond**全面评估**,包括CMV生成基准测试、跨前沿LLM的比较研究,以及评估可用性和有效性的专家用户研究。

## 1 相关工作

### 1.1 可视分析的理论模型

可视分析(VA)的知识生成模型[Keim2008,6875967]将VA系统框架为通过迭代探索集成模型和可视化以实现知识发现的工件。Munzner的嵌套模型[5290695]将可视化设计分解为分层抽象——领域特征、数据/操作抽象、编码/交互设计和算法设计——建立了从高层需求到底层实现的原则性递进。随后的任务分类学[6634168,6634156,1532136,8019880,8023762]和实证研究[10874217]进一步架起了分析目标与可视化技术之间的桥梁。虽然这些模型指导**人类设计师**,但推进VA原型的**生成式**方法需要更深层的结构建模。VA系统是集成的代码库,其技术复杂性使得直接基于LLM的生成不切实际,这凸显了对保留系统语义同时支持自动生成的中间抽象的需求。Ying等人[ying2024vaid]探索了这一方向,通过构建受Vega-Lite启发的索引结构来编目VA视图设计,扩展其属性词汇以涵盖复杂的数据转换和复合编码,展示了结构化注释如何表征从数据处理到协调视图的基本系统组件。

### 1.2 协同多视图可视化

协同多视图可视化(CMV)[4269947]通过共享数据流和交互逻辑集成多个视图,大多数实际VA实现采用CMV架构[9222323]。先前的研究已建立了设计指南[8017651,10.1145/345513.345271]、定量布局分析[8933655,shao2021modeling]和系统组合模式[9222323]。

一个关键挑战是**视图协调**。North[north1997generalized]将协调形式化为视图间链接,由此产生了Snap-together模型[north2000snap],该模型通过主键-外键关系协调视图[north2002schemas]。最近的工作[10745882]将其扩展到基于图的表示,建模交互模式和空间邻接性。

现代工具通过数据驱动连接[north2000snap]、基于模板的系统如Polaris[981851]、以交互为中心的技术[8017621,1382904]以及声明式语法如Vega-Lite[7539624]来实现协调。Mosaic[heer2024mosaic]提供了一种跨视图协调架构,通过共享数据库层连接交互式视图,实现跨异构可视化的可扩展联动选择。Observable Framework[observable2024framework]采取了互补的方法,为数据应用提供了一个静态站点生成器,其中数据加载器、转换和交互式视图通过响应式数据流组合成仪表盘。虽然Mosaic和Observable专注于**创作基础设施**——为开发者手动组合协调视图提供了强大的原语——我们的工作专注于**自动生成**:给定分析目标,通过LLM引导的分解生成结构正确的CMV。我们目前以Vega-Lite为目标,因其代表性和LLM在单视图编码方面的熟悉程度;集成更丰富的协调和数据流框架(如Mosaic或Observable)是扩展输出表达力的有前途方向。

### 1.3 可视化推荐与生成

可视化推荐系统通过基于规则[mackinlay1987automatic]、基于浏览[wongsuphasawat2015voyager,wongsuphasawat2017voyager]和基于学习[luo2018deepeye,hu2019vizml,dibia2019data2vis,9552844]的方式为数据集建议图表参数。自然语言驱动的生成方法——从NL4DV[9222342]和NcNet[9617561]到基于LLM的ChartGPT[tian2024chartgpt]——越来越多地支持从文本描述生成可视化规范[10.1145/3411764.3445400,10.1145/3472749.3474792,srinivasan2023bolt]。然而,这些方法主要针对没有跨视图协调的单视图可视化。

对于多视图生成,MultiVision[wu2021multivision]和DashBot[deng2023dashbot]在学习框架中融入了手工制作的设计度量,而LightVA[10753451]集成了LLM进行任务分解。MEDLEY[9911200]根据分析意图推荐仪表盘集合。然而,这些系统中的跨视图协调仍然基本——主要限于Vega-Lite内置的选择同步——且没有建模跨视图的数据转换流或它们之间的交互协调流。Nebula[9417674]从自然语言构建协调交互,但假设预定义视图;VisFlow[7536189]和FlowSense[8807265]支持增量数据流构建,但缺乏整体协调。我们的工作端到端生成CMV:给定多个数据集和分析目标,生成具有显式数据转换流和交互协调流的CMV。

## 2 初步研究

为了指导\system的设计,我们进行了一项初步研究,以了解从业者当前如何开发CMV系统,以及基于LLM的编码辅助在哪些方面不足。

##### 参与者和协议。

我们通过电子邮件邀请了六位数据分析和可视化从业者(P1–P6),特别针对有实际操作CMV开发经验的个体,以获取深入见解。参与者包括两位副教授(P1、P2)、一位博士后研究员(P5)和三位博士生(P3、P4、P6),总共拥有2–8年的VA经验。所有人都构建过多个CMV系统并日常使用基于LLM的编码助手。我们进行了半结构化访谈(每人30–50分钟),然后进行了主题分析[braun2006using],以识别重复出现的主题。该研究已获得大学机构审查委员会的批准。

### 2.1 问题和F

(注意:原文在此处截断为"Questions and F",根据上下文可能是"Questions and Findings"或类似内容。但用户提供的消息到此结束?实际上,用户消息的末尾是"Questions and F"并换行。我们需要翻译已有的内容。如果用户消息被截断,我们只能翻译到此处。但根据规则,我们应该忠实地翻译给定的内容。所以我们将翻译"### 2.1 Questions and F"这部分,但可能不完整。我们保留原样。)

#### 2.1 问题和F

(由于原文中断,后续内容缺失,无法继续翻译。如有完整内容,请补充。)

相似文章

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。

GeoVerse:几何潜空间中的全局一致新视角合成

Hugging Face Daily Papers

GeoVerse 是一个框架,通过在三维基础模型的几何潜空间中进行生成,并注入视频生成模型的外观先验,来合成全局一致的新视角,展示了相比现有方法在视觉质量和几何一致性上的提升。