DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG 论文

摘要

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。

arXiv:2607.20465v1 公告类型:新 摘要:训练数据的质量从根本上决定了大语言模型(LLM)的能力,但目前还没有统一的基准来衡量LLM、智能体以及以数据为中心的工作流程在端到端准备训练数据方面的表现。我们将LLM驱动的数据准备视为包含两种互补能力:数据构建(将原始来源转换为有监督的训练数据)和数据质量评估(在下游训练前预测候选数据集的训练价值);在整个过程中,“质量”指的是下游训练效用,而非表面层次的文本属性。我们引入了DataPrep-Bench,这是第一个统一的基准测试,在六个领域和多个基础模型上,基于共享的下游协议同时评估这两种能力。对于数据构建,方法消耗相同的原始来源,并通过在其输出与Dolly-15k联合微调基础模型来进行评分;与此轨道并行,我们发布了Data-Construction-Skill,这是一种技能引导的智能体,在Llama-3.1-8B金融领域上将仅使用Dolly的基线提升了近20个绝对百分点,并且在知识提取密集的领域中与最强的智能体和基于DataFlow的方法竞争。对于数据质量评估,评分函数通过与共享候选池上的下游性能的皮尔逊相关性进行评分;我们发布了分布对齐分数(DAS),这是一种基于分布的评估器,使用候选数据集与领域代理之间的MMD。DAS在六个领域中的四个领域达到了最强的跨模型相关性,并且是唯一同时在数学、科学和医学领域清除r > 0.70的指标,优于现有的基于质量、多样性和启发式的评估器。DataPrep-Bench提供了一个统一的、基于下游的框架,用于衡量两种能力作为LLM驱动的数据准备的同等目标的进展。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:10

# DataPrep-Bench:以大型语言模型为训练数据准备工具的基准测试
来源:https://arxiv.org/html/2607.20465

¹北京大学,²上海算法创新研究院,³OriginHub科技,⁴中关村实验室

蔡齐峰、林逸博、杜建卓、夏启锋、邱思哲、孙林壮、强美怡、韩朝阳、马晓晨、曾博涵、安瑞川、何聪辉、张文涛

[[email protected]](https://arxiv.org/html/2607.20465v1/mailto:[email protected])

(2026年5月19日)

###### 摘要

训练数据的质量从根本上决定了大型语言模型(LLM)的能力,然而目前尚不存在统一的基准来衡量LLM、智能体以及以数据为中心的工作流究竟如何端到端地准备训练数据。我们认为,LLM驱动的数据准备包含两种互补的能力:**数据构建**,它将原始数据源转化为有监督的训练数据;以及**数据质量评估**,它在下游训练之前预测候选数据集的训练价值;在整个过程中,“质量”指的是下游训练效用,而非表面上的文本属性。我们引入了**DataPrep-Bench**,这是第一个在六个领域和多个基础模型上,基于共享的下游评估协议,同时评估这两种能力的统一基准。对于**数据构建**,各方法使用相同的原始数据源,并通过在其输出与Dolly-15k联合微调基础模型来评分;在此赛道中,我们发布了**Data-Construction-Skill**,一个技能引导的智能体,它将在Llama-3.1-8B金融领域将仅使用Dolly的基线提升了近20个绝对百分点,并且在知识提取密集的领域中与最强的基于智能体和基于DataFlow的方法相竞争。对于**数据质量评估**,评分函数通过与共享候选池中下游性能的皮尔逊相关性来评分;我们发布了**分布对齐分数**(DAS),一种基于分布的评估器,它使用候选数据集与领域代理之间的最大均值差异(MMD)。DAS在六个领域中的四个中获得了最强的跨模型相关性,并且是唯一同时在数学、科学和医学领域使r>0.70的指标,优于现有的基于质量、多样性和启发式的评估器。DataPrep-Bench为衡量LLM驱动数据准备的这两种能力作为同等目标的进展提供了一个统一的、基于下游的框架。

###### 目录

1. [1 引言](#S1)
2. [2 背景与相关工作](#S2)
    1. [2.1 基于LLM的数据构建](#S2.SS1)
    2. [2.2 LLM训练的数据质量评估](#S2.SS2)
    3. [2.3 LLM数据准备的基准](#S2.SS3)
3. [3 基准设计](#S3)
    1. [3.1 数据构建赛道](#S3.SS1)
    2. [3.2 数据构建的源语料库](#S3.SS2)
    3. [3.3 数据质量评估赛道](#S3.SS3)
    4. [3.4 数据质量评估的候选与代理数据集](#S3.SS4)
    5. [3.5 下游评估基准](#S3.SS5)
4. [4 方法](#S4)
    1. [4.1 Data-Construction-Skill:技能引导的智能体数据构建](#S4.SS1)
        1. [4.1.1 动机与概述](#S4.SS1.SSS1)
        2. [4.1.2 方法实现](#S4.SS1.SSS2)
    2. [4.2 数据质量评估的分布对齐分数](#S4.SS2)
        1. [4.2.1 理论动机](#S4.SS2.SSS1)
        2. [4.2.2 文本数据集的MMD定义](#S4.SS2.SSS2)
        3. [4.2.3 DAS指标](#S4.SS2.SSS3)
5. [5 实验](#S5)
    1. [5.1 实验设置](#S5.SS1)
        1. [5.1.1 数据构建](#S5.SS1.SSS1)
        2. [5.1.2 数据质量评估](#S5.SS1.SSS2)
    2. [5.2 数据构建结果](#S5.SS2)
    3. [5.3 数据质量评估结果](#S5.SS3)
6. [6 结论](#S6)
7. [参考文献](#bib)
8. [7 基准详细介绍](#S7)
9. [8 实现细节](#S8)
    1. [8.1 数据构建:训练超参数](#S8.SS1)
    2. [8.2 数据集大小设计](#S8.SS2)
    3. [8.3 数据质量评估:实现细节](#S8.SS3)
10. [9 提示词](#S9)
    1. [9.1 基于LLM的生成器提示词](#S9.SS1)
    2. [9.2 基于智能体的生成器提示词](#S9.SS2)
    3. [9.3 带技能的智能体生成器提示词](#S9.SS3)

## 1 引言

大型语言模型(LLM)的性能从根本上取决于其训练数据的质量、多样性和规模[kaplan2020scaling],精心整理的数据可以匹配甚至击败规模大得多的噪声语料库[zhou2023lima,gunasekar2023textbooks]。随着自然语料库无法满足需求,社区越来越多地使用LLM、智能体和以数据为中心的工作流来自行生成训练数据。我们将这种范式称为**LLM驱动的数据准备**,并将其分解为两种能力。**数据构建**将原始的、不可训练的源数据(领域书籍、技术手册、网络转储)转化为有监督的训练数据,例如Self-Instruct[wang2023self]、Evol-Instruct[xu2304wizardlm]和UltraChat[UltraChat]。**数据质量评估**在训练之前,通过诸如影响估计、分布分析或LLM-as-a-judge评分[xia2024less]等信号,预测哪些候选数据集能提升下游模型。尽管这两种能力的文献增长迅速,但跨方法的比较大多是零散的:现有工作使用不同的来源、基础模型和下游基准,因此不清楚哪些构建策略实际上能产生有用的训练数据,以及任何给定的质量分数是否真正预测了下游性能。

我们通过提出**DataPrep-Bench**来解决这个问题,这是一个统一的、基于下游的基准,它在相同的原始数据源、相同的基础模型、相同的训练协议和相同的下游基准下评估这两种能力(图1)。该基准由两个赛道组成,每个赛道都配有一个强基线:

* • **数据构建赛道**。给定原始领域数据源,构建方法输出一个监督数据集;我们在该数据集上微调基础模型,同时与Dolly-15k作为共享的指令遵循语料库进行联合训练,并在预留的领域基准上进行评估。我们发布的基线**Data-Construction-Skill**是一个技能引导的智能体,它通过一个可复用的技能层(输出模式、过滤规则、覆盖约束和验证工具)来操作化构建过程,而不是通过一次性的提示。
* • **数据质量评估赛道**。给定一个候选训练数据集池,评分函数为每个数据集分配一个标量,我们测量这些标量线性预测在同一数据集上微调的模型的下游性能的程度;我们随候选池一起发布真实性能记录。我们发布的基线**分布对齐分数**(DAS)是一种基于分布的评估器,它测量候选数据集与领域代理之间的最大均值差异(MMD)。

我们的实验支持三点启示。(T1)在Dolly-15k之上添加合成的领域数据通常会对下游性能造成损害,这一点在基于DataFlow、直接LLM和基于智能体的生成器以及两个基础模型上均成立。由于仅使用Dolly的基线与其它行之间的唯一区别在于领域特定的合成数据,因此性能下降可直接归因于该数据,这一结论是表面质量代理所无法捕捉的。这一结果本身就是一个行动号召:社区需要更强的数据构建方法,而DataPrep-Bench提供了端到端的测试平台,可以在该平台上开发和公平比较此类方法。(T2)没有单一的构建方法系列是普遍最好的。DataFlow-Skill在结构化领域(金融、法律)中领先;基于智能体的方法在推理密集型领域(数学、医学)中领先;我们的Data-Construction-Skill在知识提取密集的领域中最强,在Llama-3.1-8B金融领域将仅使用Dolly的基线提升了近20个绝对百分点,并匹配了最强的基于智能体和基于DataFlow的方法。科学和部分法律领域仍然有待探索。(T3)DAS是整体上最可靠的质量评估指标。它在六个领域中的四个中获得了领域平均相关性最强的下游性能,并且是唯一同时在数学、科学和医学领域使r>0.70的指标。现有的基于质量和多样性的评估器要么是狭窄的专精者,要么在跨(领域,模型)单元格时符号不一致;金融和法律领域对于我们测试的每个指标仍然困难。

![参考图注](图1: DataPrep-Bench的整体框架)

我们的贡献有三点:

1. 1. 我们提出了**DataPrep-Bench**,这是第一个统一的基于下游的基准,它在一个共享的领域、基础模型、训练协议和下游基准下,同时涵盖了LLM驱动的数据构建和数据质量评估。
2. 2. 我们发布了**Data-Construction-Skill**,一个用于数据构建赛道的技能引导智能体基线,同时发布了经过整理的原始源语料库。
3. 3. 我们发布了**分布对齐分数**(DAS),一个用于数据质量评估赛道的基于分布的基线,同时发布了候选池及其真实下游性能记录。

## 2 背景与相关工作

### 2.1 基于LLM的数据构建

基于LLM的数据构建已成为构建训练和后续训练语料库的标准技术[JCST-2509-15948,bai2024survey]。现有方法大致分为三类。

第一类从少量种子数据中合成指令数据。Self-Instruct[wang2023self]从人工编写的种子中引导出指令,WizardLM[xu2304wizardlm]重写指令以使其更难且更多样化,UltraChat[UltraChat]通过采样主题和角色来扩展多轮对话。Tülu 3[lambert2024tulu3]和Infinity-Instruct[li2025infinityinstructscalinginstruction]将此思路扩展到大型混合技能的后续训练语料库。这些方法用LLM生成取代了昂贵的人工标注,但生成的数据锚定在生成器自身的先验知识中,而非任何外部领域知识。

第二类将生成过程基于长格式、权威的领域材料,如书籍、论文和技术文档,从而生成特定领域的SFT语料库,例如UltraMedical[zhang2024ultramedical]和MegaScience[fan2025megascience](每个领域更具代表性的数据集见表1)。我们的数据构建赛道正是针对这种设定:监督信息必须从经过整理的领域数据源中提取和重新表述,而非从头生成。问题是这些工作使用了非常不同的来源、模型和训练配方,因此跨方法比较仍然是零散的。

第三类将数据构建视为一个系统而非单一提示。工作流式框架如DataFlow[liang2025dataflow]、Text2SQL-Flow[cai2025text2sql]和逐步验证[shen2025let]将构建过程拆分为可复用的阶段,如分块、过滤、评分、重写和验证。最近的工作构建了完全的智能体流水线,其中LLM智能体规划整个语料库的操作、调用工具、迭代生成和验证样本。在实践中,这些流水线仍然将其大部分控制逻辑硬编码在智能体的提示中,并且没有共享的方式来指定在语料库层面上什么是有效的监督。我们的Data-Construction-Skill基线通过将任务语义、输出模式和验证规则移入一个可复用的技能层,而不是隐藏在提示内部,来解决这一问题。

### 2.2 LLM训练的数据质量评估

随着LLM候选训练数据的持续增长[llama,openai2023gpt,bai2024survey,JCST-2509-15948],一个自然的问题是:如何预先判断哪些数据实际有用?近期工作表明,精心整理的高质量数据可以匹配甚至击败规模大得多的噪声语料库[zhou2023lima,gunasekar2023textbooks]。现有的质量评估方法(我们综述如下)主要区别在于其操作的粒度。

大多数现有方法对每个训练样本单独评分,然后汇总分数。一条工作线使用强模型作为评判者:QuRating[wettig2024qurating]学习四个维度(写作风格、所需专业知识、事实与琐事、教育价值)上的成对质量偏好,每个维度都可作为独立的评分器;Liu等人[liu2024what]系统地比较了对齐数据的自动质量评分器,并发布了Deita-Quality以及一个单独的Deita-Complexity评分器,后者用于衡量指令复杂度,作为一种面向多样性的信号。基于分类器的评分器,例如FineWeb-Edu¹¹¹https://huggingface.co/HuggingFaceFW/fineweb-edu-classifier(在Llama-3标注的教育价值上训练)和PairQual²²²https://huggingface.co/zks2856/PairQual-Scorer-entrained(在成对质量偏好上训练),提供了廉价的逐样本估计;奖励模型风格的评分器在每一个样本上应用偏好调优后的LLM作为代理质量头。模型侧信号提供了另一条途径:Superfiltering[li-etal-2024-superfiltering]使用弱模型和强模型之间的损失差异,LESS[xia2024less]使用基于梯度的影响力来选择与目标能力对齐的样本,使用固定参考模型计算的样本级困惑度是另一个广泛使用的轻量级指标。这些方法在逐样本过滤中效果良好,但一旦我们关心整个数据集的质量,它们就退化为取平均或top-k选择等启发式方法,并且通常只在单个骨干模型和单个领域上进行验证。

较小的一条工作线将数据集视为一个整体而非样本的集合。基于多样性的方法试图捕捉数据集涵盖的变异程度。Vendi Score[friedman2022vendi]应用了一种基于相似矩阵特征值的多样性估计器,并且可以使用不同的句子编码器(例如,在我们的实验中为BERT和SimCSE)实例化,得到BERTVendi和SimCSEVendi变体。词汇多样性度量[ploeger2024towards],包括MTLD和HD-D,量化了表面形式的词汇变化;简单的n-gram distinctness提供了一种相关的廉价基线。基于嵌入的方法,如Task2Vec[achille2019task2vec],则通过从Fisher信息中导出的单个“任务嵌入”来总结数据集,提供了数据集身份和难度的紧凑代理。分布对齐方法更进一步,将候选数据集的特征分布与反映目标能力的参考分布进行比较;经典的领域自适应结果[redko2020survey]

相似文章

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

PreAct-Bench: 对LLM进行预测性监控的基准测试

arXiv cs.LG

PreAct-Bench是一个包含五个领域、1000对道德与不道德行动轨迹的基准测试,旨在评估LLM从部分轨迹中预测有害结果的能力(预测性监控)。结果表明,虽然人类表现良好,但当前的LLM仍存在困难,凸显了未来导向的风险推理的必要性。