DSWorld:面向高效自主代理的数据科学世界模型

arXiv cs.AI 论文

摘要

DSWorld 提出了一种数据科学世界模型,通过预测环境状态转换来减少自主代理中代价高昂的试错过程,在强化学习训练中实现了14倍加速,推理时加速3-6倍,同时保持了有竞争力的性能。

arXiv:2607.15901v1 Announce Type: new 摘要:尽管在数据理解和决策方面能力强大,自主数据科学代理仍然严重依赖涉及昂贵计算的试错工作流程。这一瓶颈促使人们需要能够在实际执行前预见数据科学操作效果的模型。在本文中,我们引入了数据科学世界模型的概念,该模型通过根据当前工作流状态和候选操作预测环境状态转换来模拟数据科学执行环境。我们进一步提出了DSWorld,一个实用框架,结合了结构化状态构建、成本感知路由、轻量级实际执行以及用于昂贵操作的基于LLM的模拟器。为支持训练,我们构建了一个8K规模的转换轨迹数据集,并引入了反思性世界模型优化,一种用于改进转换预测的基于错误感知的强化学习策略。实验表明,DSWorld在保持竞争性能的同时,将基于RL的代理训练加速约14倍,基于搜索的推理加速约3-6倍,在转换预测任务上比最强LLM基线高出35.6%。代码可在https://anonymous.4open.science/r/DSWorld获取。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:23

# DSWorld:一个用于高效自主智能体的数据科学世界模型
来源:https://arxiv.org/html/2607.15901
Zherui Yang¹, Fan Liu¹, Hao Liu¹
¹香港科技大学(广州)
[email protected]; [email protected]; [email protected]

###### 摘要

尽管在数据理解和决策方面具有强大能力,自主数据科学智能体仍然高度依赖试错工作流,涉及大量昂贵的计算。这一瓶颈促使研究者探索能够在实际执行前预测数据科学操作效果的模型。本文引入了**数据科学世界模型**的概念,该模型通过基于当前工作流状态和候选操作来预测环境状态转移,从而模拟数据科学执行环境。我们进一步提出了**DSWorld**,一个实用的框架,结合了结构化状态构建、成本感知路由、轻量级真实执行以及用于昂贵操作的基于LLM的模拟器。为了支持训练,我们构建了一个8K规模的转移轨迹数据集,并引入了**反思式世界模型优化**,这是一种基于误差感知的强化学习策略,用于改进转移预测。实验表明,DSWorld能够将基于RL的智能体训练加速约14倍,将基于搜索的推理加速约3-6倍,同时保持具有竞争力的性能,并在转移预测任务上比最强的LLM基线平均提升35.6%。代码见https://anonymous.4open.science/r/DSWorld。

## 1 引言

自主数据科学智能体近期被提出用于自动化广泛的数据科学任务,从探索性数据分析到预测建模(Tang et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib8); Zhu et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib9))。例如,ML-Master 2 (Zhu et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib39)) 在MLE-Bench (Chan et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib29)) 的Kaggle竞赛任务上达到了56.4%的奖牌水平表现。现有方法通常利用测试时缩放策略,通过迭代试错工作流探索大量候选解决方案(Jiang et al., 2025b (https://arxiv.org/html/2607.15901#bib.bib23); Du et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib24))。然而,这些策略严重依赖昂贵的分析计算,包括数据处理、模型训练、评估和工作流更新。因此,大部分执行时间都花在计算上而非智能体推理上。例如,ML-Master (Liu et al., 2025a (https://arxiv.org/html/2607.15901#bib.bib1)) 在MLE-Bench中超过86%的执行时间用于模型训练。这种巨大的计算开销严重限制了自主数据科学系统的效率和可扩展性。

(a) 视觉世界模型想象物理世界的未来状态,而**数据科学世界模型**则预测数据科学操作的效果,无需昂贵执行。
(b) DSWorld将智能体RL训练加速约14倍。
(c) DSWorld将智能体推理加速约3-6倍。

图1:DSWorld模拟数据科学环境并加速智能体训练和推理。

这引发了一个关键问题:**我们能否为数据科学工作流开发一个转移预测模型,使智能体能够在执行昂贵计算之前预测数据科学操作的效果?**

为此,我们引入了**数据科学世界模型**的概念。如图1(a) (https://arxiv.org/html/2607.15901#S1.F1.sf1)所示,类似于视觉世界模型想象物理世界的未来状态(Chu et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib3); Ding et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib5)),数据科学世界模型将数据科学执行环境视为待建模的世界。给定一个工作流状态和一个候选数据科学操作,模型预测下一个环境状态,包括数据集和模型的变化、执行反馈、错误和性能信号。这种能力使智能体能够在不执行昂贵真实执行的情况下预测数据科学操作的效果,从而显著加速自主智能体的训练和推理。

为实现这一愿景,我们提出了**DSWorld**,一个用于自主数据科学工作流的实用数据科学世界模型框架。具体来说,**状态构造器**将原始数据科学环境转换为结构化的状态表示,包含任务、数据集、执行历史、输出和环境状态。为了平衡预测准确性和效率,我们进一步引入了一个成本感知路由机制。给定一个智能体动作,**路由器**确定该动作是否需要大量计算。轻量级动作通过**编译器**直接执行以确保准确性,而计算密集型动作则由基于LLM的**模拟器**处理,它无需实际执行即可预测下一个环境状态,从而提高效率。

在此框架基础上,我们首先进行监督微调(SFT)以初始化模型,并进一步提出**反思式世界模型优化**,这是一种通过误差感知反思和迭代细化来改进下一状态预测的反思式强化学习策略。

由于缺乏自主数据科学工作流的大规模转移数据,我们构建了DSWorld-8K,一个包含8千条高质量数据科学智能体轨迹的训练数据集。具体来说,我们首先从真实世界的自主数据科学任务中收集真实的转移轨迹,然后合成相应的思维链(CoT)轨迹(Wei et al., 2022 (https://arxiv.org/html/2607.15901#bib.bib10))来解释转移逻辑。然而,真实世界轨迹昂贵且规模有限。因此,我们进一步开发了一个可扩展的数据合成流水线,利用先进LLM和来自MMTU(Xing et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib11))的大规模数据源来合成多样化的工作流状态和数据科学操作。生成的动作在真实环境中执行以获得下一个状态,仅保留经过验证的样本用于训练。额外合成CoT轨迹以进一步解释转移动态。

我们在两种实用的下游场景中评估DSWorld:(1)作为训练自主数据科学智能体的转移模型,以及(2)作为智能体推理的转移模型。实验结果表明,DSWorld在保持强大智能体性能的同时,显著加速了智能体训练和推理,实现了约14倍的RL训练加速和3-6倍的推理加速。此外,我们在多个转移预测任务上评估DSWorld。实验结果表明,DSWorld取得了强大的预测性能,在转移预测任务上平均比最强的LLM基线高出35.6%。

总结而言,我们的贡献如下:

- • 我们引入了**数据科学世界模型**的概念,旨在预测自主数据科学工作流中数据科学操作的效果,而无需执行昂贵的真实世界计算。
- • 我们提出了**DSWorld**,一个用于建模状态转移的实用数据科学世界模型框架,并进一步引入了一种反思式强化学习策略,通过误差感知反思和迭代细化来改进转移预测。
- • 我们开发了一个可扩展的数据合成流水线,用于构建大规模转移数据以训练数据科学世界模型。
- • 大量实验证明了DSWorld的有效性,在保持强大下游智能体性能的同时,实现了约14倍的RL训练加速和3-6倍的推理加速。

图2:DSWorld概述。(a) DSWorld在执行昂贵计算之前预测数据科学操作的效果。(b) 反思式世界模型优化通过误差感知反思细化下一状态预测。(c) LLM合成并验证数据科学状态转移,并生成CoT轨迹。

## 2 相关工作

### 2.1 世界模型

世界模型旨在对环境动态进行建模,用于预测、控制和模拟,通常通过基于当前状态和动作预测未来状态实现(Chu et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib3); Ding et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib5); Ha and Schmidhuber, 2018 (https://arxiv.org/html/2607.15901#bib.bib4))。现有世界模型研究涵盖多个领域。在物理世界中,世界模型用于视频生成(Bruce et al., 2024 (https://arxiv.org/html/2607.15901#bib.bib15); Chen et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib14))、3D世界生成(Kong et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib16); World Labs, 2025 (https://arxiv.org/html/2607.15901#bib.bib17))和潜在空间动态建模(Ha and Schmidhuber, 2018 (https://arxiv.org/html/2607.15901#bib.bib4); Assran et al., 2023 (https://arxiv.org/html/2607.15901#bib.bib18))。在数字世界中,近期工作模拟网页或软件状态转移,用于网页和GUI智能体(Xiao et al., 2026 (https://arxiv.org/html/2607.15901#bib.bib19); Chae et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib20))。尽管取得了这些进展,针对自主数据科学环境的世界建模仍然基本未被探索。与先前工作不同,我们研究数据科学世界模型,对数据科学工作流中的环境转移进行建模。

### 2.2 自主数据科学智能体

近期,自主数据科学智能体被提出用于自动化广泛的数据科学任务(Tang et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib8); Zhu et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib9))。现有方法主要通过两种方式提升智能体性能。一条工作线通过训练增强基础模型。例如,ML-Agent (Liu et al., 2025b (https://arxiv.org/html/2607.15901#bib.bib21)) 使用强化学习训练智能体以完成机器学习任务。另一条工作线通过测试时缩放策略提升性能。例如,AIDE (Jiang et al., 2025b (https://arxiv.org/html/2607.15901#bib.bib23))、ML-Master (Liu et al., 2025a (https://arxiv.org/html/2607.15901#bib.bib1))、AutoML-Gen (Du et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib24)) 和 AutoMind (Ou et al., 2025 (https://arxiv.org/html/2607.15901#bib.bib25)) 使用搜索算法探索候选解决方案并选择最优结果。尽管有效,这些方法在训练和推理过程中都严重依赖耗时的计算。因此,开发能够对环境转移进行建模、使智能体在昂贵计算之前预测数据科学操作效果的数据科学世界模型至关重要。

## 3 预备知识

###### 定义1(数据科学工作流状态)
在时间步t,数据科学工作流状态表示为St = {Tt, Dt, Pt, Lt},其中Tt表示任务,Dt表示数据状态(例如,数据集统计信息和预览),Pt表示执行环境(例如,库和运行时配置),Lt表示执行日志、中间输出和任务进度。

###### 定义2(动作)
在时间步t,数据科学智能体基于当前状态St生成一个动作At,其中At表示数据科学操作,如特征工程、模型训练和评估。

###### 定义3(数据科学世界模型)
数据科学世界模型被定义为一个转移模型,用于在昂贵计算之前预测数据科学操作的效果:
St+1 = W(St, At), (1)
其中W表示数据科学世界模型。

## 4 方法论

图2 (https://arxiv.org/html/2607.15901#S1.F2) 展示了DSWorld的整体框架。给定一个数据科学工作流状态,一个状态构造器将其转换为结构化表示。基于当前状态,数据科学智能体生成一个动作。该动作被编码为稠密嵌入,然后被路由到编译器进行实际执行,或路由到基于LLM的模拟器进行下一个状态预测。

### 4.1 DSWorld

我们提出的数据科学世界模型包含四个组件:W = {SC, R, C, S},其中SC表示状态构造器,R表示路由器,C表示编译器,S表示基于LLM的模拟器。

**状态构造器。** 我们首先引入状态构造器,它将原始执行环境转换为结构化的状态表示,形式化为 St = SC(Et),其中Et表示时间步t的数据科学环境。具体来说,状态构造器是一个基于规则的程序,它从环境中提取并组织关键信息,包括任务描述、数据集统计信息、数据预览、执行环境、执行历史、中间输出和错误消息。生成的结构化状态表示使DSWorld能够以统一的方式对环境转移进行建模。

**路由器。** 给定当前状态,数据科学智能体生成一个动作:At = π(St),其中π表示智能体策略。为了实现高效路由,我们首先使用一个动作编码器将生成的动作编码为稠密嵌入表示。然后将得到的动作嵌入以及当前状态输入路由器进行决策。路由器确定生成的动作是否可以高效执行:mt = R(St, At),其中mt ∈ {execute, simulate}。直观上,轻量级操作(如简单的数据操作或环境检查)被路由到直接执行,而计算密集型操作(如大规模模型训练)被路由到模拟。

**编译器。** 如果动作代价较低,编译器直接执行它:
Ŝt+1 = C(St, At)。 (2)
编译器与实际执行环境交互,并返回生成的下一个状态,包括更新后的数据状态、执行输出和运行时反馈。

**模拟器。** 否则,模拟器在不进行真实执行的情况下预测下一个状态:
Ŝt+1 = S(St, At)。 (3)
模拟器是一个基于LLM的转移模型,它直接根据当前状态和动作预测执行结果和潜在错误,从而避免昂贵的计算。为了提高对路由错误的鲁棒性,我们进一步对编译器执行设置了时间限制。如果执行超过预定义的超时阈值,动作将被重定向到模拟器进行转移预测。

相似文章

通过世界模型扩展自动研究代理

Hugging Face Daily Papers

本文介绍了World Model RL,通过用学习到的世界模型替代环境执行来扩展自动研究代理,从而将后训练加速3-4倍,并使较小的代理在基准测试中优于较大的代理。

Scaling Automatic Research Agents via World Models

arXiv cs.LG

This paper identifies a scalability bottleneck in RL-trained automatic research agents—environment execution dominates training cost—and proposes World Model RL (WMRL) with online debiasing and inverse-variance denoising to replace real execution, achieving 3–4x training speedups and better generalization.

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua

面向回合级智能体强化学习的科学发现环境扩展

arXiv cs.AI

本文介绍了SciDisco,一个可扩展的框架,用于通过过程可验证环境、基于DAG的轨迹合成和回合级强化学习来训练科学发现智能体。所提出的SciDisco-14B模型在假设驱动的科学数据分析基准上达到了最先进水平。