DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化的LLM驱动框架

Papers with Code Trending 论文

摘要

DataFlow是一个LLM驱动的框架,用于自动化数据准备和工作流工程,具备近200个可复用算子和六个领域通用流程,可在数学、代码和Text-to-SQL等任务上提升LLM性能。

大型语言模型(LLM)对高质量数据的需求快速增长,加剧了对可扩展、可靠且语义丰富的数据准备流程的需求。然而,当前实践仍以临时脚本和松散指定的工作流为主,缺乏原则性抽象,阻碍了可复现性,并且对模型在环数据生成的支持有限。为应对这些挑战,我们提出了DataFlow,一个统一且可扩展的LLM驱动数据准备框架。DataFlow通过系统级抽象设计,支持模块化、可复用和可组合的数据变换,并提供了类似PyTorch的流程构建API,用于构建可调试和可优化的数据流。该框架包含近200个可复用算子和六个领域通用流程,涵盖文本、数学推理、代码、Text-to-SQL、智能体RAG和大规模知识抽取。为进一步提升易用性,我们引入了DataFlow-Agent,它通过算子合成、流程规划和迭代验证,自动将自然语言规范转化为可执行流程。在六个代表性用例中,DataFlow持续提升了下游LLM性能。我们的数学、代码和文本流程在性能上超越了人工精选数据集和专门合成基线,在Text-to-SQL上相比SynSQL实现了高达+3%的执行准确率提升,代码基准测试平均提升+7%,并在MATH、GSM8K和AIME上获得了1-3个百分点的增益。此外,DataFlow生成的统一10K样本数据集使基础模型能够超越在100万Infinity-Instruct数据上训练的对应模型。这些结果表明,DataFlow为可靠、可复现且可扩展的LLM数据准备提供了实用且高性能的基座,并为未来的数据中心AI发展奠定了系统级基础。
查看原文
查看缓存全文

缓存时间: 2026/05/17 00:26

论文页面 - DataFlow:面向数据驱动AI时代的大模型驱动统一数据准备与工作流自动化框架

来源:https://huggingface.co/papers/2512.16676
发布于 2025年12月18日

#1 今日最佳论文 (https://huggingface.co/papers/date/2025-12-23)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

DataFlow 是一个由大语言模型驱动(LLM-driven)的数据准备框架,能够通过自动生成的流水线提升多种任务的数据质量与可复现性,进而改进 LLM 的性能。

随着大语言模型(LLMs)对高质量数据的需求快速增长,对可扩展、可靠且语义丰富的数据准备流水线的需求日益迫切。然而,当前实践中仍以临时脚本和松散定义的工作流为主,缺乏原则性抽象,阻碍了可复现性,且对模型参与(model-in-the-loop)的数据生成支持有限。为解决这些问题,我们提出了 DataFlow,一个统一且可扩展的 LLM 驱动数据准备框架。DataFlow 采用系统级抽象设计,支持模块化、可复用且可组合的数据转换,并提供了类似 PyTorch 的流水线构建 API,用于构建可调试、可优化的数据流。该框架包含近 200 个可复用算子以及六条通用领域流水线,覆盖文本、数学推理、代码、Text-to-SQL、智能体 RAG(agentic RAG)和大规模知识抽取等领域。为进一步提升易用性,我们推出了 DataFlow-Agent,可自动将自然语言规范转化为可执行流水线,该过程涉及算子合成、流水线规划与迭代验证。在六个代表性用例中,DataFlow 持续提升下游 LLM 的性能。我们的数学、代码和文本流水线优于人工策划数据集和专门的合成基线,在 Text-to-SQL 上相比 SynSQL 执行准确率提升高达 +3%,代码基准平均提升 +7%,在 MATH、GSM8K 和 AIME 上获得 1–3 个百分点的提升。此外,由 DataFlow 生成的统一 10K 样本数据集使基础模型超越了使用 100 万 Infinity-Instruct 数据训练的模型。这些结果表明,DataFlow 为可靠、可复现且可扩展的 LLM 数据准备提供了实用且高性能的基础,并为未来以数据为中心的 AI 发展奠定了系统级基石。

查看 arXiv 页面 (https://arxiv.org/abs/2512.16676)
查看 PDF (https://arxiv.org/pdf/2512.16676)
项目页面 (https://github.com/OpenDCAI/DataFlow)
GitHub 3.65k (https://github.com/OpenDCAI/DataFlow)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.16676)

在您的 Agent 中获取此论文:

hf papers read 2512.16676

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

无模型链接到此论文

请在模型的 README.md 中引用 arxiv.org/abs/2512.16676 以从此页面链接。

引用该论文的数据集 9

OpenDCAI/dataflow-demo-Text2SQL 预览 • 更新于 2月4日 • 1.11k • 1 (https://huggingface.co/datasets/OpenDCAI/dataflow-demo-Text2SQL)

OpenDCAI/dataflow-mm-context_vqa 查看器 • 更新于 1月30日 • 206k • 372 (https://huggingface.co/datasets/OpenDCAI/dataflow-mm-context_vqa)

OpenDCAI/dataflow-instruct-10k 查看器 • 更新于 2025年12月29日 • 10k • 259 • 6 (https://huggingface.co/datasets/OpenDCAI/dataflow-instruct-10k)

OpenDCAI/Infinity-Instruct-Curated-1M 查看器 • 更新于 3月16日 • 1M • 113 (https://huggingface.co/datasets/OpenDCAI/Infinity-Instruct-Curated-1M)

浏览引用该论文的 9 个数据集 (https://huggingface.co/datasets?other=arxiv:2512.16676)

引用该论文的 Space 0

无 Space 链接到此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2512.16676 以从此页面链接。

包含该论文的合集 18

浏览包含该论文的 18 个合集 (https://huggingface.co/collections?paper=2512.16676)

相似文章

@llama_index: 大多数AI管道的质量取决于我们提供的数据,而这些数据通常意味着PDF或其他非结构化文档…

X AI KOLs Timeline

Parse-Flow 是 LlamaIndex 构建的一个开源可视化工作流设计器,它将四个文档处理原语——Parse(解析)、Classify(分类)、Split(分割)和 Extract(提取)——串联到一个由 LlamaAgents 工作流驱动的拖拽画布中,能够从非结构化企业文档(如PDF、合同和发票)中可靠地提取结构化数据。