VESTA:基于统计工具代理的视觉探索

arXiv cs.AI 论文

摘要

本文介绍了VESTA,一个为视觉-语言模型配备动态增长工具包的框架,用于数据探索和统计模型优化,在复杂的科学建模任务上优于先前的基于代理的方法。作者还提出了Dawn基准,用于分布拟合和时间序列建模,涵盖真实的天文学挑战。

arXiv:2606.00384v1 公告类型:new 摘要:将定量模型拟合到数据是科学工作流中的核心步骤,但它的自动化程度仍然最低。最近的基于代理的系统利用语言和视觉-语言模型(VLM)迭代地提出和优化统计模型,但这些系统在更具挑战性的建模任务上表现不佳。为解决这些限制,我们提出了VESTA:基于统计工具代理的视觉探索(Visual Exploration with Statistical Tool Agents),一个为VLM配备动态增长探索工具包的框架,通过数据变换、假设驱动的可视化以及稳健的统计测试来指导模型优化。与先前仅依赖迭代批评的系统不同,VESTA在优化之前和过程中通过选择或创建诊断工具主动探索数据,这些工具会累积在模型上下文中并可后续重用。我们在三种工具配置下评估VESTA与已有基线的性能:无工具、静态专家编写工具和动态模型编写工具。为支持评估,我们提出了DAWN(自动工作流与数值建模数据集),一个针对分布拟合和时间序列建模的基准,包含不同难度层次,最后涉及真实的天文学任务,包括建模初始质量函数和引力波啁啾信号。我们发现VESTA的动态工具创建优于先前的代理流水线,在复杂和特定领域的任务上改进最大。我们进一步表明,动态生成的工具比现有视觉工具创建系统生成的工具复杂得多,每个函数覆盖更多诊断类别,并且强烈偏好VLM批评者可直接推理的视觉输出。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:46

# Vesta:基于统计工具代理的可视化探索  
来源:https://arxiv.org/html/2606.00384  

William Rudman¹, Abhishek Divekar¹, Kanishk Jain¹, Sebastian Joseph¹, Stella S. R. Offner¹, Matthew Lease¹, Kyle Mahowald¹, Greg Durrett², Junyi Jessy Li¹  
¹德克萨斯大学奥斯汀分校  
²纽约大学  
通讯作者:[email protected] | https://github.com/wrudman/VESTA  

###### 摘要  
将定量模型拟合到数据中是科学工作流中的核心步骤,但至今仍是自动化程度最低的环节之一。最近基于智能体的系统利用语言模型和视觉-语言模型(VLM)迭代地提出并优化统计模型,但在更具挑战性的建模任务上表现欠佳。为解决这些局限,我们提出 **Vesta**(**V**isual **E**xploration with **S**tatistical **T**ool **A**gents,基于统计工具代理的可视化探索),一个为VLM配备动态增长探索工具包,通过数据变换、假设驱动的可视化和稳健统计检验来指导模型优化的框架。与以往仅依赖迭代批评的系统不同,Vesta在优化前后主动探索数据,选择或创建诊断工具,这些工具会累积在模型上下文中并可后续复用。我们在三种工具配置下评估Vesta与现有基线的表现:无工具、静态专家编写工具和动态模型编写工具。为支持此评估,我们引入 **Dawn**(**D**ataset for **A**utomated **W**orkflows and **N**umerical **M**odeling,自动化工作流与数值建模数据集),一个针对分布拟合和时间序列建模的基准测试,包含不同难度级别,最终涵盖真实天文学任务,包括建模初始质量函数和引力波啁啾信号。我们发现Vesta的动态工具创建优于先前的智能体流水线,在复杂和领域特定任务上提升最为显著。我们进一步表明,动态生成的工具比现有可视化工具创建系统产生的工具复杂得多,每个函数覆盖更多诊断类别,并且强烈偏向于VLM批评者可以直接推理的可视化输出。  

## 1 引言  
大型语言模型(LLM)和视觉-语言模型(VLM)智能体在科学发现中展现出巨大潜力,已具备形成假设、设计实验和综合结果的能力。然而,不同步骤的失败阻碍了这些模型真正加速科学进程。本文聚焦于**将定量模型拟合到数据**这一任务。该步骤复杂,需要关于目标领域的先验知识和细致的统计分析,且相较于机器学习工程和数据科学等其他定量分析任务研究较少[13,10]。弥补这一差距在诸如天文学等科学学科中尤为重要,因为在那些领域模型难以有效利用领域惯例[23]。  

我们提出 **Vesta**¹(基于统计工具代理的可视化探索),一个通过分析数据**可视化表示**来提出、优化和评估统计模型的框架。Vesta基于PyMC[1]中定义的模型运行。PyMC是一个贝叶斯概率编程框架,允许使用高效的马尔可夫链蒙特卡洛(MCMC)方法定义模型并拟合数据。使用PyMC代码构建模型是组合式的,可以通过组合更简单的组件来构造复杂分布。Vesta实例化一个循环:提出模型、选择最优模型、然后迭代,大致类似于现有的自动研究流程[40,8]。然而,与先前工作不同,Vesta通过用新型**可视化工具**增强这个基本循环来利用多模态反馈。可视化工具允许Vesta使用VLM检查模型拟合,使其在与以往工具使用工作不同的模态中获得优势。图1展示了一个模型如何使用工具计算残差、生成可视化,然后检查该可视化以识别预测模型与数据拟合不佳的区域,并提出一个更好地拟合数据的新统计模型。对于本文探索的多样统计模型拟合任务,事先枚举所有必要工具是不可行的;需要**动态**工具实例化来覆盖全部情况。  

(参见图注)  

图1:Vesta概览。通过有效使用和创建工具,Vesta生成一个拟合输入数据的概率性PyMC程序。  

为促进当前方法难以处理的挑战性模型拟合问题上的进展,我们引入一个新的基准测试,称为**Dawn**(自动化工作流与数值建模数据集)²。Dawn问题涵盖与通用数据科学和科学研究密切相关的两个领域:将概率分布拟合到离散数据以及构建时间序列分析模型。与现有常包含少量分布和有限数据点的基准[15,29]不同,Dawn包含跨越两个难度级别(Easy和Hard)的合成问题,以及两个天文学的基础问题(Astro):拟合恒星初始质量函数(IMF)和检测并表征嵌入引力波数据中的啁啾信号。  

利用Dawn,我们将Vesta与针对贝叶斯模型和动态VLM工具生成系统的先前框架进行基准测试。现有方法在我们的Easy划分中表现有竞争力,但随着数据复杂性增加和任务转向领域特定的科学现象,性能大幅下降。这种下降揭示了当前智能体在迭代、证据驱动的模型优化方面的系统性差距。我们表明,Vesta的可视化工具有效解决了这一问题;凭借这些工具,智能体能够探索多个假设,将其可视化,并基于工具的可视化分析生成新假设。此外,我们发现Vesta不仅比现有基线以更高成功率恢复专家工具,而且创建的复杂工具通常组合多个专家工具,以便同时测试多个假设。虽然使用动态生成的可视化工具并未优于专家编写的工具(可能由于智能体处理复杂图表的局限性),但Vesta在创建和利用统计工具方面展现出巨大潜力。  

## 2 相关工作  
##### 自动化模型拟合  
以往工作评估了LLM和VLM在自动化统计分析[42,22]、时间序列建模[52,47,16,56,34]和贝叶斯模型提案[37,28]方面的能力。Ji等人[22]和Sun等人[42]调查了基于LLM的智能体如何从数据清洗和模型选择自动化统计工作流。然而,Zhu等人[59]发现,即使最先进的LLM在选择适当统计方法的基准测试上也仅达到中等准确率,揭示了LLM在复杂统计任务上推理能力的显著局限。虽然文献中的许多工作聚焦于使用LLM/VLM预测时间序列的延续或检测异常,我们的工作旨在表示生成观测数据的**底层模型**,使用的是概率性贝叶斯模型(PyMC)。以往用PyMC代码生成模型以拟合数据的工作在科学环境中已取得成功,但这些工作通常依赖人类编写的高斯过程核,限制了方法的使用场景[5,6,12]。最近的工作通过使用LLM自动执行“Box循环”(即迭代地提出新模型并批评现有模型,直到获得足够拟合,模型以PyMC代码编写)来解决这一关键局限[27]。尽管使用LLM提出概率模型取得了一些有希望的结果,但Gandhi等人[15]发现LLM在从真实世界领域采样的更具挑战性数据集上表现挣扎,并且表明PyMC模型的迭代优化并不总是比一次性LLM提供更好的预测。此外,现有基准虽然跨不同领域采样数据,但仅覆盖狭窄的分布范围,限制了其难度和广度。我们的Vesta使用VLM自动化Box的提出-批评-优化循环,实现了数据分析的工具使用和创建,同时处理了显著更复杂的分布。  

##### 多模态工具使用与创建  
多项工作已经表明VLM是熟练的工具使用者,并且成功使用工具可以改进视觉问答任务上的细粒度推理[20,57,49,51]。在智能体系统中整合VLM工具使用带来了更大的性能提升[53,18,50,19]。特别是,Zhang等人[54]提出了一个多智能体VLM框架,其中编排智能体协调专门的子智能体和视觉专家工具,以改进细粒度视觉感知。最近的工作测试了VLM的能力;例如,在PyVision[55]中,VLM被用于一个智能体流程,动态创建和执行工具直到得出答案。以往工作将VLM工具使用(即在视觉输入上执行或生成代码)限于图像增强、注释、裁剪和基本统计计算[17,44,58]。虽然有些工作将多模态工具创建应用于模型拟合[24],但这些工具仅限于简单统计和基本绘图,缺乏专用的工具创建步骤,且每次使用后就被丢弃而非跨迭代重用。相比之下,Vesta使用LLM工具智能体动态创建可视化以检验统计假设,然后将这些可视化作为证据传递给VLM批评者以优化假设。  

##### 自主工具扩展  
虽然LLM和VLM都已证明能有效使用工具,但为问题整理确切的工具集通常需要手动策划工具包。初期工作表明LLM能够编写有效且可靠的工具[36,7],尽管这些工具通常与模型推理分开创建[2,48]。诸如Voyager[46]等系统通过允许工具库适应任务需求并跨示例演化,扩展了这一静态范式。许多自主工具扩展系统倾向于关注软件工程任务[11,43,26]或范围狭窄的API调用基准[21,41],而较少关注需要判断驱动的统计分析的问题。虽然EvoSkill[2]和TTE[30]创建了一些与统计计算相关的工具,但它们往往包含更简单的函数,如计算平均值、面积或从表格中检索信息。  

## 3 Vesta:基于统计工具的可视化探索  
我们假设输入数据集 \(D\) 由模型 \(M(\theta)\) 生成。\(M\) 是一个数据生成过程(例如,一个有向图模型),参数为 \(\theta\)。在本文中,我们考虑可以用PyMC代码指定的模型。给定一个提议的模型 \(\tilde{M}(\tilde{\theta})\),我们可以用指标 \(R(D, \tilde{M}(\tilde{\theta}))\) 评估它对 \(D\) 的拟合程度。我们的核心方法是**可视化工具** \(\varepsilon(D, M, \theta)\),实现为可执行的Python函数,接收数据 \(D\) 和当前模型 \((M, \theta)\),并返回用于后续建模决策的可视化或统计诊断。  

### 3.1 Vesta算法  
算法1展示了Vesta的工作流。我们从根据数据的初始图估计概率模型开始进行初始预测,然后在 \(N\) 步内优化这个预测。在每一步,我们提出 \(p\) 个替代候选模型,然后选择指标 \(R\) 最优的模型。每次迭代分四步:提出、生成工具、批评模型拟合、总结运行步骤。  

**提出。** 在第一次迭代中,Vesta获取数据的初始可视化,生成简要的可视化描述,并被指示创建 \(p\) 个多样化的模型提案。为确保忠实于提议的模型参数,PyMC代码在一个专用步骤中生成,该步骤将参数规格转换为可执行的PyMC程序。如果没有这一步,我们发现模型经常偏离其指定的参数化。  

**算法1** 可视化探索智能体  
1: 数据 \(D\),迭代次数 \(N\),提案数 \(p\),指标 \(R\),注册表 \(\mathcal{E}\)(初始状态:仅 generate_new_tool)  
2: \(M_{\text{best}}, \theta_{\text{best}}\)  
3: \(M_{\text{best}}, \theta_{\text{best}} \leftarrow \textsc{Propose}(\text{Plot}(D))\)        ⊳ 绘制数据;拟合 \(j\) 个模型并按指标 \(R\) 选择最佳模型  
4: \(s_0 \leftarrow \textsc{Summarize}(M_{\text{best}}, \theta_{\text{best}})\)  
5: **for** \(i = 1, \ldots, N\) **do**  
6: \(\varepsilon^* \leftarrow \textsc{ToolManager}(s_{i-1}, D, \mathcal{E})\)  ⊳ 选择/创建工具;更新 \(\mathcal{E}\)  
7: \(T_i \leftarrow \varepsilon^*(D, M_{i-1}, \theta_{i-1})\)  ⊳ 执行工具  
8: \(M_i, \theta_i \leftarrow \textsc{Critique}(T_i, s_{0:i-1}, D)\) ⊳

相似文章

AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆

Hugging Face Daily Papers

AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。

智能体可视化项目

Reddit r/AI_Agents

涵盖与AI智能体可视化相关的项目,可能是用于表示智能体行为的工具或库。