DS-Lighting: 显式化代理工具链以赋能数据科学自动化
摘要
DS-Lighting是一个统一的工具链套件,它使工具链设计在数据科学自动化中变得显式,从而提高端到端工作流的可重复性、可比性和可靠性。
arXiv:2608.28590v1 公告类型:新
摘要:大型语言模型(LLM)代理在自动化数据科学工作流方面展现出潜力,但其端到端性能关键取决于代理工具链,该工具链负责表示任务、管理执行状态、约束输出工件并提供评估反馈。现有的数据科学代理通常将工具链隐式化,使得结果难以在异构任务中重现、比较和归因。我们引入DS-Lighting,这是一个统一的工具链套件,旨在使工具链设计在数据科学自动化中显式化。DS-Lighting将工具链分解为四个可重用层:数据、工作流、执行和评估,并将各种代理表示为可执行的操作符程序,支持预定义管道和自适应搜索。我们进一步将多个开源数据科学基准集成到MLE-Bench风格的任务格式中,允许在共享任务接口、沙盒运行时和度量协议下进行受控比较。跨代理、工具链、模型和消融实验表明,显式工具链设计提高了可重复性、可比性和可靠性,同时减少了端到端数据科学工作流中可避免的系统级故障。我们的代码可在https://github.com/usail-hkust/dslighting获取。
查看缓存全文
缓存时间: 2026/09/01 12:23
# DS-Lighting:使数据科学自动化的代理框架显式化 来源:https://arxiv.org/html/2608.28590 范刘1,郝刘1 1香港科技大学(广州) [email protected] [email protected] ###### 摘要 大型语言模型(LLM)代理在数据科学工作流的自动化中展现出潜力,但其端到端性能很大程度上取决于代理框架——即负责任务表示、执行状态管理、输出产物约束及评估反馈的系统层。现有数据科学代理通常隐含处理该框架,导致结果在异构任务间难以复现、比较和归因。我们提出DS-Lighting,一个统一的框架工具包,旨在使数据科学自动化的框架设计显式化。DS-Lighting将框架分解为四个可复用层:数据、工作流、执行和评估,并将多样化的代理表示为可执行的算子程序,支持预定义流程与自适应搜索。我们进一步将多个开源数据科学基准整合为MLE-Bench风格的任务格式,实现在共享任务接口、沙箱运行时和指标协议下的可控对比。实验覆盖代理、框架、模型与消融研究,表明显式框架设计提升了可复现性、可比性和可靠性,同时减少了端到端数据科学工作流中可避免的系统级故障。代码开源于https://github.com/usail-hkust/dslighting DS-Lighting:使数据科学自动化的代理框架显式化 范刘1,郝刘1 1香港科技大学(广州) [email protected] [email protected] ## 1 引言 大型语言模型(LLM)代理近期开创了自动化数据科学工作流的新范式[You等,2025]。给定自然语言目标及关联数据集,它们能够生成代码、与执行环境交互,并迭代优化分析方案。然而其成功不仅由模型能力决定[Lou等,2026]:端到端性能同样依赖于**代理框架**——管理数据上下文、工作流执行、反馈机制与输出评估的系统层。该框架对数据科学任务尤为重要,因为异构输入、长周期执行和结构化输出要求可能在模型生成看似合理的推理或可执行代码时仍引发失败。 参见说明图1:现有数据科学代理与DS-Lighting的对比。这一对比凸显了以框架为中心的设计动机:现有代理将任务数据、执行与评估混杂,而DS-Lighting将其解耦以锚定数据、管控执行并使输出与指标对齐。 尽管已有进展,现有数据科学代理仍将框架主要视为实现细节而非核心研究对象。早期系统引入了多样化的自动化机制:DS-Agent[Guo等,2024]将任务分解为手工设计的流程,涵盖知识检索、问题分析、代码生成与执行;而AIDE[Jiang等,2025]将自动化视为对候选解的迭代代码优化。其他工作探索了规划[Hong等,2024]、自优化[Yang等,2025]和多步工具使用[Zhu等,2026]。但这些系统嵌入了对任务表示、执行状态、中间验证和输出评估的不同隐含假设,使得性能差异难以归因于更强的模型、更优的工作流或系统特定的框架选择。 构建数据科学框架是一个非平凡的系统问题。与仅回答问题或单步工具使用任务[Ning等,2026;Pan等,2026]不同,数据科学代理必须在真实数据集上执行长周期工作流,并生成可被任务特定指标检查的产物。这带来了两个耦合挑战:首先,框架需统一多样工作流——从固定流程到自适应搜索与多代理协作——使异构代理能通过公共接口实例化、编排与比较;其次,它必须支持可靠的端到端执行,通过锚定异构输入、维护一致的代码与文件状态、并强制任务特定的输出约束。缺乏这些机制时,代理可能遵循看似合理的推理路径却执行不兼容的工作流、解决错误问题、破坏运行时状态或生成无法评估的产物。 为应对这些挑战,我们提出DS-Lighting——一个统一的框架工具包,旨在使基于LLM的数据科学自动化框架设计显式化。DS-Lighting将框架分解为四个可复用层:数据层将原始任务与资产转换为结构化任务契约;工作流层将代理表示为可执行的算子程序;执行层提供沙箱化的有状态运行时控制;评估层验证产物并返回标准化反馈。在统一接口下,该设计支持预定义流程与基于自适应搜索的工作流。为实现可控评估,DS-Lighting进一步将多个开源数据科学基准整合为MLE-Bench风格的任务格式,使代理与框架能在相同任务接口、执行环境与指标协议下进行比较。 我们的贡献有三方面:首先,我们将代理框架确立为基于LLM的数据科学自动化中的一等对象,证明任务表示、执行状态、产物约束和评估反馈对可靠且可比的端到端性能至关重要;其次,我们提出DS-Lighting——一个将数据科学自动化分解为四个可复用层(数据、工作流、执行、评估)的统一框架工具包。借助算子程序抽象,DS-Lighting将多样代理表示为可执行工作流,并在共享执行接口下支持预定义流程与自适应搜索;第三,我们通过将多个开源数据科学基准转换为MLE-Bench风格的任务格式构建统一评估套件,使代理与框架能在相同任务接口、沙箱运行时与指标协议下进行比较。跨代理、框架、消融研究、模型与故障模式的实验表明,显式框架设计提升了可复现性、可比性与端到端可靠性。 ## 2 相关工作 数据科学基准。近期基准评估LLM代理在数据科学任务上的表现,涵盖从探索性分析到端到端建模。数据分析基准测试表格理解、清洗、转换、可视化和迭代分析[Hu等,2024];例如DA-Code[Huang等,2024]强调细粒度代码生成操作,而DSEval[Zhang等,2024b]针对交互式优化。数据建模基准则要求完整的机器学习流程,包括数据集检查、特征工程、训练与评估[Chan等,2025;Huang等,2023]。 LLM数据科学代理。基于LLM的代理在自动化端到端数据科学工作流方面受到日益关注[You等,2025]。现有系统通常遵循两种范式:固定工作流与自适应搜索。固定工作流代理将任务分解为预定义阶段,如问题分析、代码生成、执行与验证[Wang等,2025a];示例包括采用程序化流程的DS-Agent[Guo等,2024],以及通过分层工作流组织分析并包含增量验证的Data Interpreter[Hong等,2024]。自适应代理包括AIDE[Jiang等,2025]和AutoKaggle[Li等,2024],它们迭代提议、执行、评估与优化候选解[Ou等,2025;Zhang等,2024a]。 代理框架。除数据科学外,近期研究强调了LLM代理的评估框架、可执行环境与运行时基础设施。WebArena[Zhou等,2023]、AppWorld[Trivedi等,2024]和OSWorld[Xie等,2024]等基准超越了静态问答,要求工具使用、有状态交互和程序化验证。HAL[Kapoor等,2025]等框架标准化了编排、日志记录、成本跟踪、轨迹检查与可复现比较,而AutoHarness[Lou等,2026]和SafeHarness[Lin等,2026]研究了提升可靠性与安全性的框架约束。然而这些工作并非为数据科学工作流设计,后者需协同管理数据上下文、代码执行、输出产物与基于指标的评估。DS-Lighting通过数据科学特定的框架填补了这一空白,分离数据、工作流、执行与评估的关注点,同时支持现有代理与灵活的算子程序工作流。 ## 3 基础概念 数据科学任务。数据科学任务表示为 其中q为自然语言目标(例如“从历史销售记录预测房价”),D指定任务数据资产(如表格、图像、时间序列、图或多模态输入),A提供辅助要求(如文档、外部知识、提交约束或评估指标)。任务输出y为所需产物,如分析报告、预测文件或模型。 代理框架。数据科学代理受**代理框架**H管理,即控制模型如何使用任务上下文、执行工作流并融入反馈的系统层。在DS-Lighting中,框架围绕四项职责组织:构建数据上下文、实例化工作流、执行动作与评估产物。给定任务x,代理依据以下公式产生输出: y∼πθ(⋅∣x,H), y∼π_{θ}(⋅∣x,H), (2) 其中πθ为底层LLM。 代理工作流。在框架内,代理被表示为工作流W,指定数据科学能力如何跨多步骤组织与执行。工作流为 W=(O,CW,λ), W=(O,C_{W},λ), (3) 其中O为可复用原子能力的算子库(如数据检查、代码生成、模型训练、验证与结果提交),CW为工作流控制器,在执行中组合与调用算子(如固定顺序、条件分支、迭代优化或基于搜索的选择),λ为工作流配置(如提示词、模型设置、温度、最大迭代次数、时间预算与验证阈值)。 在步骤t,选定算子Ot∈O调用原子能力,可能调用LLM、与执行环境交互并返回观察值。简单工作流可遵循固定序列(如InspectData、GenerateCode、TrainModel、Validate和Submit),而自适应工作流根据中间观察选择算子,例如在执行错误后重试代码生成或在验证分数较低时切换模型。 执行循环。工作流与框架通过迭代循环交互。在步骤t,状态st概括当前执行上下文(如任务需求、可用数据、代码上下文、生成文件与先前反馈)。控制器选择算子Ot=CW(st),被选算子促使模型生成动作: at∼πθ(⋅∣st, Ot). a_{t}∼π_{θ}(⋅∣st, Ot). (4) 执行层运行动作并返回观察值ot=Exec(at, st)(如输出、错误、产物、验证信号或指标反馈)。随后框架更新状态: st+1=UpdateH(st,at,ot). s_{t+1}=Update_{H}(s_{t},a_{t},o_{t}). (5) 执行W产生轨迹τW={(st,Ot,at,ot)}t=1T τ_{W}={(s_{t},Ot,a_{t},o_{t})}_{t=1}^{T},最终输出y从该轨迹生成并评估。 ## 4 DS-Lighting:分层代理框架 DS-Lighting将代理框架H实现为四个协调层,将原始任务输入转换为可执行工作流与评估输出。**数据层**[4.1]从任务描述与数据文件构建结构化任务契约;**工作流层**[4.2]将每个契约转换为算子程序;**执行层**[4.3]在受控环境中运行动作并返回观察值;**评估层**[4.4]验证产物、步骤级反馈与任务级指标。图[2]展示框架概览,附录A提供加载任务、运行预定义或自定义代理及启动基准套件的紧凑代码示例。 参见说明图2:DS-Lighting作为分层代理框架概览。数据层构建任务契约,工作流层将代理能力组织为算子程序,执行层管控沙箱化交互与产物生成,评估层验证输出并返回反馈。 ### 4.1 数据层 数据层构建下游工作流使用的任务上下文。原始数据科学输入常混合定义不明确的指令与异构资产,使代理难以推断目标、定位相关文件、理解模式并满足输出要求。为减少此歧义,数据层通过两个组件将原始任务描述qraw与数据资产Draw映射为结构化任务契约x=(q,D,A):**数据分析器**与**任务处理器**。数据分析器将资产总结为紧凑的数据报告,任务处理器将其与任务描述合并生成结构化任务契约。
相似文章
DataFlow-Harness:一个基于代码代理的落地平台,用于构建可编辑的LLM数据管道
DataFlow-Harness 引入了一个平台,该平台引导LLM代理通过增量变更构建可编辑的基于DAG的数据管道,与脚本生成基线相比,实现了高通过率和降低成本。
Agent Lightning v1.0:迈向受控的代理强化学习
Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。
Show-Harness:仅凭VLM代理即可控制机器人
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
驾驭之道
作者探讨了使用控制工具管理AI编码代理的重要性,并分享了借助Cursor、Claude和Deepseek等工具提升生产力和模型使用成本效益的技巧。
Harness Handbook 将智能体行为映射到代码(28分钟阅读)
Harness Handbook 为AI智能体框架提供了行为级手册,将系统行为与可验证的代码证据关联,使框架可理解、可审计、可编辑。