DataFlex:面向大语言模型数据驱动动态训练的统一框架
摘要
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。
查看缓存全文
缓存时间: 2026/07/28 06:27
论文页面 - DataFlex:大规模语言模型数据驱动动态训练的统一框架
来源:https://huggingface.co/papers/2603.26164 发布于 3月27日
#1 每日论文 (https://huggingface.co/papers/date/2026-04-03) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
DataFlex 是一个用于大规模语言模型数据驱动动态训练的统一框架,支持样本选择、域混合调整和样本重新加权,同时保持与标准训练工作流的兼容性,并可实现高效的大规模部署。
数据驱动训练 (https://huggingface.co/papers?q=Data-centric%20training) 已成为改善大规模语言模型 (https://huggingface.co/papers?q=large%20language%20models)(LLM)的一个有前景的方向,它不仅在优化过程中优化模型参数,还优化训练数据的选择、构成和加权。然而,现有的数据选择、数据混合优化和数据重新加权方法通常是在隔离的代码库中开发的,接口不一致,阻碍了可复现性、公平比较和实际集成。在本文中,我们提出了 DataFlex,这是一个基于 LLaMA-Factory (https://huggingface.co/papers?q=LLaMA-Factory) 构建的统一数据驱动动态训练框架。DataFlex 支持三种主要的动态数据优化范式:样本选择 (https://huggingface.co/papers?q=sample%20selection)、域混合调整 (https://huggingface.co/papers?q=domain%20mixture%20adjustment) 和样本重新加权 (https://huggingface.co/papers?q=sample%20reweighting),同时与原始训练工作流完全兼容。它提供了可扩展的训练器抽象 (https://huggingface.co/papers?q=extensible%20trainer%20abstractions) 和模块化组件 (https://huggingface.co/papers?q=modular%20components),可作为标准 LLM 训练的即插即用替代方案,并统一了关键模型相关操作,如嵌入提取 (https://huggingface.co/papers?q=embedding%20extraction)、推理和梯度计算 (https://huggingface.co/papers?q=gradient%20computation),同时支持 DeepSpeed ZeRO-3 (https://huggingface.co/papers?q=DeepSpeed%20ZeRO-3) 等大规模设置。我们针对多种数据驱动方法进行了全面实验。在 Mistral-7B 和 Llama-3.2-3B 上,动态数据选择在 MMLU (https://huggingface.co/papers?q=MMLU) 上始终优于静态全数据训练。对于数据混合,DoReMi 和 ODM 在使用 SlimPajama (https://huggingface.co/papers?q=SlimPajama) 以 6B 和 30B token 规模预训练 Qwen2.5-1.5B (https://huggingface.co/papers?q=Qwen2.5-1.5B) 时,提高了 MMLU (https://huggingface.co/papers?q=MMLU) 准确率和语料级困惑度 (https://huggingface.co/papers?q=perplexity),效果优于默认比例。DataFlex 还在运行时方面相较于原始实现取得了一致的提升。这些结果表明,DataFlex 为 LLM 的数据驱动动态训练提供了有效、高效且可复现的基础设施。
查看 arXiv 页面 (https://arxiv.org/abs/2603.26164) 查看 PDF (https://arxiv.org/pdf/2603.26164) 项目页面 (https://opendcai.github.io/DataFlex-Doc/en/) GitHub 1.74k (https://github.com/OpenDCAI/DataFlex) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.26164)
在您的 Agent 中获取此论文:
hf papers read 2603.26164
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2603.26164 以从该页面建立链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2603.26164 以从该页面建立链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2603.26164 以从该页面建立链接。
包含此论文的收藏集 9
浏览包含此论文的 9 个收藏集 (https://huggingface.co/collections?paper=2603.26164)
相似文章
大语言模型预训练的数据混合:综述与展望
# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
基于大语言模型的数据驱动动态算法调度
本文提出一种由LLM驱动的方法,结合LLaMA 3和性能数据库,用于在线性代数中生成动态算法调度启发式方法,并通过LU分解案例研究来优化计算性能。
面向大型语言模型的 Compatibility-Aware Dynamic Fine-Tuning
介绍 Compatibility-Aware Dynamic Fine-Tuning (CADFT),这是 Dynamic Fine-Tuning 的扩展,在 LLM 监督微调中控制样本级优化方差,从而提高稳定性和泛化能力。
DataFlex-RL:一个针对RLVR数据策略的评估平台
DataFlex-RL是一个评估RLVR数据策略的平台,它发现均匀采样在数学、逻辑和科学基准测试中与自适应方法表现相当。