DataFlow-Harness:一个基于代码代理的落地平台,用于构建可编辑的LLM数据管道
摘要
DataFlow-Harness 引入了一个平台,该平台引导LLM代理通过增量变更构建可编辑的基于DAG的数据管道,与脚本生成基线相比,实现了高通过率和降低成本。
查看缓存全文
缓存时间: 2026/07/22 06:41
论文页面 - DataFlow-Harness:用于构建可编辑LLM数据管道的接地代码智能体平台
来源:https://huggingface.co/papers/2607.16617
摘要
大型语言模型(LLM)越来越多地被用于自动化数据处理工作流,然而编码智能体通常生成的脚本并不会自动物化为持久、可编辑的平台工件。我们将这一脱节称为“自然语言到管道”(NL2Pipeline)鸿沟。为弥合这一鸿沟,我们引入了DataFlow-Harness,这是一个引导LLM代理通过类型化的增量突变(而非自由格式脚本)来构建平台原生有向无环图(DAG)的平台。该平台结合了用于过程指导的DataFlow-Skills、一个暴露实时操作符注册表和当前管道状态的模型上下文协议(MCP)层,以及一个将对话式创作与可视化DAG编辑器同步的DataFlow-WebUI。在一个包含12个任务的数据工程基准测试中,DataFlow-Harness实现了93.3%的观测端到端通过率。与Vanilla Claude Code相比,它的测量货币成本降低了72.5%,生成延迟降低了49.9%;其观测通过率比Context-Aware Claude Code基线仅低0.9个百分点,而成本则低42.8%。按任务分析表明,当构建依赖于隐式过程知识时,Skills最为有用。这些结果表明,实时平台接地可以生成持久、可编辑的工作流工件,其观测可靠性接近脚本生成基线,并且测量构建成本和延迟更低。
查看arXiv页面 (https://arxiv.org/abs/2607.16617) 查看PDF (https://arxiv.org/pdf/2607.16617) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16617)
在您的智能体中获取这篇论文:
hf papers read 2607.16617
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接这篇论文
在模型README.md中引用arxiv.org/abs/2607.16617以从本页链接。
引用该论文的数据集0
没有数据集链接这篇论文
在数据集README.md中引用arxiv.org/abs/2607.16617以从本页链接。
引用该论文的Spaces0
没有Space链接这篇论文
在Space README.md中引用arxiv.org/abs/2607.16617以从本页链接。
包含该论文的收藏集0
没有收藏集包含这篇论文
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从本页链接。
相似文章
DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化的LLM驱动框架
DataFlow是一个LLM驱动的框架,用于自动化数据准备和工作流工程,具备近200个可复用算子和六个领域通用流程,可在数学、代码和Text-to-SQL等任务上提升LLM性能。
从提示到契约:面向可审计企业级LLM代理的约束工程
介绍了一种约束工程方法,用于构建可审计的企业级LLM代理,通过将确定性行为转移到代码、模式和验证工件中,并在韩国企业数据上通过故障注入和模型替换测试进行了演示。
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
审计智能体执行框架安全性
本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。