DataFlow-Harness:一个基于代码代理的落地平台,用于构建可编辑的LLM数据管道

Hugging Face Daily Papers 论文

摘要

DataFlow-Harness 引入了一个平台,该平台引导LLM代理通过增量变更构建可编辑的基于DAG的数据管道,与脚本生成基线相比,实现了高通过率和降低成本。

大型语言模型(LLMs)越来越多地被用于自动化数据处理工作流,但编码代理通常生成的脚本不会自动转化为持久、可编辑的平台工件。我们将这种脱节称为NL2Pipeline差距。为了弥合这一差距,我们引入了DataFlow-Harness,这是一个平台,它引导LLM代理通过类型化的增量变更(而非自由形式的脚本)来构建平台原生的有向无环图(DAG)。该平台结合了用于过程指导的DataFlow-Skills、一个暴露实时算子注册表和当前流水线状态的模型上下文协议(MCP)层,以及DataFlow-WebUI,它将会话式编写与可视化DAG编辑器同步。在12项数据工程基准测试中,DataFlow-Harness实现了93.3%的端到端通过率。与Vanilla Claude Code相比,它降低了72.5%的测量货币成本和49.9%的生成延迟;其观察通过率与Context-Aware Claude Code基线相差0.9个百分点以内,同时成本低42.8%。每项任务的分析表明,当构建依赖于隐式程序知识时,Skills最为有用。这些结果表明,实时的平台基础可以产生持久、可编辑的工作流工件,其观察可靠性接近脚本生成基线,且具有更低的测量构建成本和延迟。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - DataFlow-Harness:用于构建可编辑LLM数据管道的接地代码智能体平台

来源:https://huggingface.co/papers/2607.16617

摘要

大型语言模型(LLM)越来越多地被用于自动化数据处理工作流,然而编码智能体通常生成的脚本并不会自动物化为持久、可编辑的平台工件。我们将这一脱节称为“自然语言到管道”(NL2Pipeline)鸿沟。为弥合这一鸿沟,我们引入了DataFlow-Harness,这是一个引导LLM代理通过类型化的增量突变(而非自由格式脚本)来构建平台原生有向无环图(DAG)的平台。该平台结合了用于过程指导的DataFlow-Skills、一个暴露实时操作符注册表和当前管道状态的模型上下文协议(MCP)层,以及一个将对话式创作与可视化DAG编辑器同步的DataFlow-WebUI。在一个包含12个任务的数据工程基准测试中,DataFlow-Harness实现了93.3%的观测端到端通过率。与Vanilla Claude Code相比,它的测量货币成本降低了72.5%,生成延迟降低了49.9%;其观测通过率比Context-Aware Claude Code基线仅低0.9个百分点,而成本则低42.8%。按任务分析表明,当构建依赖于隐式过程知识时,Skills最为有用。这些结果表明,实时平台接地可以生成持久、可编辑的工作流工件,其观测可靠性接近脚本生成基线,并且测量构建成本和延迟更低。

查看arXiv页面 (https://arxiv.org/abs/2607.16617) 查看PDF (https://arxiv.org/pdf/2607.16617) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16617)

在您的智能体中获取这篇论文:

hf papers read 2607.16617

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接这篇论文

在模型README.md中引用arxiv.org/abs/2607.16617以从本页链接。

引用该论文的数据集0

没有数据集链接这篇论文

在数据集README.md中引用arxiv.org/abs/2607.16617以从本页链接。

引用该论文的Spaces0

没有Space链接这篇论文

在Space README.md中引用arxiv.org/abs/2607.16617以从本页链接。

包含该论文的收藏集0

没有收藏集包含这篇论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从本页链接。

相似文章

审计智能体执行框架安全性

arXiv cs.CL

本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。