DataFlex:面向大语言模型数据驱动动态训练的统一框架

Papers with Code Trending 论文

摘要

DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。

以数据为中心的训练已成为改进大语言模型(LLMs)的一个有前景的方向,不仅优化模型参数,还优化训练数据的选择、组成和权重。然而,现有的数据选择、数据混合优化和数据重加权方法通常是在独立的代码库中开发的,接口不一致,阻碍了可复现性、公平比较和实际集成。在本文中,我们提出了DataFlex,一个基于LLaMA-Factory构建的统一数据驱动动态训练框架。DataFlex支持动态数据优化的三种主要范式:样本选择、领域混合调整和样本重加权,同时保持与原始训练工作流的完全兼容。它提供了可扩展的训练器抽象和模块化组件,可作为标准LLM训练的即插即用替代方案,并统一了嵌入提取、推理和梯度计算等关键模型相关操作,支持大规模设置,包括DeepSpeed ZeRO-3。我们跨多种数据驱动方法进行了全面实验。在MMLU上,动态数据选择在Mistral-7B和Llama-3.2-3B上始终优于静态全数据训练。对于数据混合,在SlimPajama上以6B和30B token规模预训练Qwen2.5-1.5B时,DoReMi和ODM在默认比例基础上提高了MMLU准确率和语料级困惑度。DataFlex还在运行时上相对于原始实现取得了一致的改进。这些结果表明,DataFlex为LLM的数据驱动动态训练提供了一个有效、高效且可复现的基础设施。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

论文页面 - DataFlex:大规模语言模型数据驱动动态训练的统一框架

来源:https://huggingface.co/papers/2603.26164 发布于 3月27日

#1 每日论文 (https://huggingface.co/papers/date/2026-04-03) 作者:

摘要

DataFlex 是一个用于大规模语言模型数据驱动动态训练的统一框架,支持样本选择、域混合调整和样本重新加权,同时保持与标准训练工作流的兼容性,并可实现高效的大规模部署。

数据驱动训练 (https://huggingface.co/papers?q=Data-centric%20training) 已成为改善大规模语言模型 (https://huggingface.co/papers?q=large%20language%20models)(LLM)的一个有前景的方向,它不仅在优化过程中优化模型参数,还优化训练数据的选择、构成和加权。然而,现有的数据选择、数据混合优化和数据重新加权方法通常是在隔离的代码库中开发的,接口不一致,阻碍了可复现性、公平比较和实际集成。在本文中,我们提出了 DataFlex,这是一个基于 LLaMA-Factory (https://huggingface.co/papers?q=LLaMA-Factory) 构建的统一数据驱动动态训练框架。DataFlex 支持三种主要的动态数据优化范式:样本选择 (https://huggingface.co/papers?q=sample%20selection)、域混合调整 (https://huggingface.co/papers?q=domain%20mixture%20adjustment) 和样本重新加权 (https://huggingface.co/papers?q=sample%20reweighting),同时与原始训练工作流完全兼容。它提供了可扩展的训练器抽象 (https://huggingface.co/papers?q=extensible%20trainer%20abstractions) 和模块化组件 (https://huggingface.co/papers?q=modular%20components),可作为标准 LLM 训练的即插即用替代方案,并统一了关键模型相关操作,如嵌入提取 (https://huggingface.co/papers?q=embedding%20extraction)、推理和梯度计算 (https://huggingface.co/papers?q=gradient%20computation),同时支持 DeepSpeed ZeRO-3 (https://huggingface.co/papers?q=DeepSpeed%20ZeRO-3) 等大规模设置。我们针对多种数据驱动方法进行了全面实验。在 Mistral-7B 和 Llama-3.2-3B 上,动态数据选择在 MMLU (https://huggingface.co/papers?q=MMLU) 上始终优于静态全数据训练。对于数据混合,DoReMi 和 ODM 在使用 SlimPajama (https://huggingface.co/papers?q=SlimPajama) 以 6B 和 30B token 规模预训练 Qwen2.5-1.5B (https://huggingface.co/papers?q=Qwen2.5-1.5B) 时,提高了 MMLU (https://huggingface.co/papers?q=MMLU) 准确率和语料级困惑度 (https://huggingface.co/papers?q=perplexity),效果优于默认比例。DataFlex 还在运行时方面相较于原始实现取得了一致的提升。这些结果表明,DataFlex 为 LLM 的数据驱动动态训练提供了有效、高效且可复现的基础设施。

查看 arXiv 页面 (https://arxiv.org/abs/2603.26164) 查看 PDF (https://arxiv.org/pdf/2603.26164) 项目页面 (https://opendcai.github.io/DataFlex-Doc/en/) GitHub 1.74k (https://github.com/OpenDCAI/DataFlex) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.26164)

在您的 Agent 中获取此论文:

hf papers read 2603.26164

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2603.26164 以从该页面建立链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2603.26164 以从该页面建立链接。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2603.26164 以从该页面建立链接。

包含此论文的收藏集 9

浏览包含此论文的 9 个收藏集 (https://huggingface.co/collections?paper=2603.26164)

相似文章

大语言模型预训练的数据混合:综述与展望

arXiv cs.CL

# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混