DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化的LLM驱动框架
摘要
DataFlow是一个LLM驱动的框架,用于自动化数据准备和工作流工程,具备近200个可复用算子和六个领域通用流程,可在数学、代码和Text-to-SQL等任务上提升LLM性能。
查看缓存全文
缓存时间: 2026/05/17 00:26
论文页面 - DataFlow:面向数据驱动AI时代的大模型驱动统一数据准备与工作流自动化框架
来源:https://huggingface.co/papers/2512.16676
发布于 2025年12月18日
#1 今日最佳论文 (https://huggingface.co/papers/date/2025-12-23)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
DataFlow 是一个由大语言模型驱动(LLM-driven)的数据准备框架,能够通过自动生成的流水线提升多种任务的数据质量与可复现性,进而改进 LLM 的性能。
随着大语言模型(LLMs)对高质量数据的需求快速增长,对可扩展、可靠且语义丰富的数据准备流水线的需求日益迫切。然而,当前实践中仍以临时脚本和松散定义的工作流为主,缺乏原则性抽象,阻碍了可复现性,且对模型参与(model-in-the-loop)的数据生成支持有限。为解决这些问题,我们提出了 DataFlow,一个统一且可扩展的 LLM 驱动数据准备框架。DataFlow 采用系统级抽象设计,支持模块化、可复用且可组合的数据转换,并提供了类似 PyTorch 的流水线构建 API,用于构建可调试、可优化的数据流。该框架包含近 200 个可复用算子以及六条通用领域流水线,覆盖文本、数学推理、代码、Text-to-SQL、智能体 RAG(agentic RAG)和大规模知识抽取等领域。为进一步提升易用性,我们推出了 DataFlow-Agent,可自动将自然语言规范转化为可执行流水线,该过程涉及算子合成、流水线规划与迭代验证。在六个代表性用例中,DataFlow 持续提升下游 LLM 的性能。我们的数学、代码和文本流水线优于人工策划数据集和专门的合成基线,在 Text-to-SQL 上相比 SynSQL 执行准确率提升高达 +3%,代码基准平均提升 +7%,在 MATH、GSM8K 和 AIME 上获得 1–3 个百分点的提升。此外,由 DataFlow 生成的统一 10K 样本数据集使基础模型超越了使用 100 万 Infinity-Instruct 数据训练的模型。这些结果表明,DataFlow 为可靠、可复现且可扩展的 LLM 数据准备提供了实用且高性能的基础,并为未来以数据为中心的 AI 发展奠定了系统级基石。
查看 arXiv 页面 (https://arxiv.org/abs/2512.16676)
查看 PDF (https://arxiv.org/pdf/2512.16676)
项目页面 (https://github.com/OpenDCAI/DataFlow)
GitHub 3.65k (https://github.com/OpenDCAI/DataFlow)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.16676)
在您的 Agent 中获取此论文:
hf papers read 2512.16676
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
无模型链接到此论文
请在模型的 README.md 中引用 arxiv.org/abs/2512.16676 以从此页面链接。
引用该论文的数据集 9
OpenDCAI/dataflow-demo-Text2SQL 预览 • 更新于 2月4日 • 1.11k • 1 (https://huggingface.co/datasets/OpenDCAI/dataflow-demo-Text2SQL)
OpenDCAI/dataflow-mm-context_vqa 查看器 • 更新于 1月30日 • 206k • 372 (https://huggingface.co/datasets/OpenDCAI/dataflow-mm-context_vqa)
OpenDCAI/dataflow-instruct-10k 查看器 • 更新于 2025年12月29日 • 10k • 259 • 6 (https://huggingface.co/datasets/OpenDCAI/dataflow-instruct-10k)
OpenDCAI/Infinity-Instruct-Curated-1M 查看器 • 更新于 3月16日 • 1M • 113 (https://huggingface.co/datasets/OpenDCAI/Infinity-Instruct-Curated-1M)
浏览引用该论文的 9 个数据集 (https://huggingface.co/datasets?other=arxiv:2512.16676)
引用该论文的 Space 0
无 Space 链接到此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2512.16676 以从此页面链接。
包含该论文的合集 18
浏览包含该论文的 18 个合集 (https://huggingface.co/collections?paper=2512.16676)
相似文章
@tom_doerr: 从原始数据生成LLM就绪的数据集 https://github.com/OpenDCAI/DataFlow…
DataFlow是一个开源工具,提供可视化、低代码的管道,用于从原始数据生成、清洗和准备高质量的LLM训练数据集。它包含一篇arXiv上的技术报告。
DataFlow-Harness:一个基于代码代理的落地平台,用于构建可编辑的LLM数据管道
DataFlow-Harness 引入了一个平台,该平台引导LLM代理通过增量变更构建可编辑的基于DAG的数据管道,与脚本生成基线相比,实现了高通过率和降低成本。
@llama_index: 大多数AI管道的质量取决于我们提供的数据,而这些数据通常意味着PDF或其他非结构化文档…
Parse-Flow 是 LlamaIndex 构建的一个开源可视化工作流设计器,它将四个文档处理原语——Parse(解析)、Classify(分类)、Split(分割)和 Extract(提取)——串联到一个由 LlamaAgents 工作流驱动的拖拽画布中,能够从非结构化企业文档(如PDF、合同和发票)中可靠地提取结构化数据。
DataFlex:面向大语言模型数据驱动动态训练的统一框架
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。
LeanFlow:工作流驱动的Lean自动形式化案例研究
LeanFlow是一个LLM智能体系统,用于将数学论文转化为形式化的Lean项目,通过案例研究和与Kimi-K2.6及GPT-5.5的基准测试进行评估,在预算限制内实现了高完成率。