生成更好训练数据的智能体(25分钟阅读)
摘要
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。
Meta Autodata 训练 AI 智能体扮演数据科学家角色,以创建更高质量的训练和评估数据集。其 Agentic Self-Instruct 实现在编码、法律推理和数学推理任务上均提升了效果。
查看缓存全文
缓存时间: 2026/06/26 17:10
# Autodata:一种用于创建高质量合成数据的智能数据科学家 来源:https://arxiv.org/html/2606.25996 Chenxi Whitehouse† Tianhao Wu† Yixin Nie† Swarnadeep Saha Eryk Helenowski Weizhe Yuan Olga Golovneva Jack Lanchantin Yoram Bachrach Jakob Foerster Xian Li Han Fang Sainbayar Sukhbaatar Jason Weston \[kulikov@meta\.com (https://arxiv.org/html/2606.25996v2/mailto:[email protected]) jase@meta\.com (https://arxiv.org/html/2606.25996v2/mailto:[email protected]) (2026年6月25日) ###### 摘要 我们提出 Autodata,一种通用方法,使 AI 智能体能够扮演数据科学家,构建高质量的训练和评估数据。我们展示了如何训练(元优化)这样的数据科学家智能体,使其学会创建更强大的数据。我们描述了总体框架和一个具体的实践实现:智能体自我指令(Agentic Self-Instruct)。我们在计算机科学研究任务、法律推理任务和数学对象推理任务上进行了实验,与经典的合成数据集创建方法相比,取得了更优的结果。此外,对数据科学家智能体本身进行元优化带来了更大的性能提升。智能体数据创建提供了一种将增加的推理计算转化为更高质量模型训练的方式。总体而言,我们相信这一方向有潜力改变我们构建 AI 数据的方式。\] FAIR at Meta †联合第一作者 \correspondence,见图注 图 1:Autodata 流程。该框架采用一个自主智能体来模拟数据科学家的角色,迭代地生成数据、进行定性检查和定量性能评估、综合见解,并更新数据生成方案。智能体本身可以使用内部循环中使用的相同标准进行训练,以更好地扮演数据科学家的角色。这个循环过程旨在逐步提升数据质量;该图描绘了可能的具体实现所依据的通用工作流程。 ## 1 引言 AI 前沿的进步越来越依赖于高质量的训练数据和能够持续挑战模型的基准测试。当前 AI 系统训练的基础是人工编写的训练数据。然而,性能提升越来越多地来源于模型自身创建的合成数据。合成数据解决了几个实际挑战:它有助于生成真实语料库中代表性不足的边缘情况和长尾场景,减少了与人工标注相关的困难和延迟,并且有可能产生比人类生成的数据分布更具挑战性的数据。随着大型语言模型(LLMs)的出现以及使用上下文学习和指令遵循的能力,Self-Instruct (Wang et al., 2023 (https://arxiv.org/html/2606.25996#bib.bib24)) 作为一种通过零样本或少样本提示创建合成数据的方法应运而生。Grounded Self-Instruct (Lupidi et al., 2024 (https://arxiv.org/html/2606.25996#bib.bib16); Yuan et al., 2025 (https://arxiv.org/html/2606.25996#bib.bib32)) 将其扩展到基于文档和其他来源,以减少幻觉并增加多样性。此外,像 CoT Self-Instruct (Yu et al., 2025 (https://arxiv.org/html/2606.25996#bib.bib30)) 这样的方法将其扩展到在生成过程中使用思维链推理,以帮助更准确地构建更复杂的任务。最后,所谓的“自我挑战”方法 (Zhou et al., 2025 (https://arxiv.org/html/2606.25996#bib.bib37)) 允许一个挑战者智能体在提出任务和伴随的评估函数之前与工具进行交互。然而,这些方法都没有直接控制数据的难度和质量,从而激发了诸如过滤 (Yu et al., 2025 (https://arxiv.org/html/2606.25996#bib.bib30))、进化 (Xu et al., 2024 (https://arxiv.org/html/2606.25996#bib.bib26)) 和精炼 (Shah et al., 2024 (https://arxiv.org/html/2606.25996#bib.bib21)) 等方法。在这项工作中,我们引入了 Autodata,它概括了上述所有方法。扮演数据科学家的智能体被赋予构建和策划数据的任务,执行人类数据科学家为创建高质量数据所采取的行动:这既包括构建基准数据,也包括训练数据的用例。这个过程包括初始的数据创建迭代,然后是分析阶段,即“目测”数据以及测量其性能,构建学习经验,然后使用改进的方案进行迭代以创建更好的数据。此外,我们还展示了如何训练(元优化)这个智能体系统(外层循环)使其作为数据科学家(内层循环)达到最优。虽然最近关于自动研究 (Karpathy, 2026 (https://arxiv.org/html/2606.25996#bib.bib10)) 的大部分工作集中在用于架构或训练方案改进的智能体方法上,但我们认为,关注数据很可能在未来的进步中扮演同等重要,甚至更重要的角色。在我们的实验中,我们专注于 Autodata 的一个特定实现:Agentic Self-Instruct,并展示了它在多种不同任务上提供强有力结果的能力。我们在计算机科学研究任务、法律推理任务和数学对象推理任务上进行了实验,在每种情况下,与经典的合成数据集创建方法相比,我们都取得了更优的结果。此外,对数据科学家智能体本身进行元优化带来了更大的性能提升。随着最先进的 LLM 变得空前强大,人们担心现有的任务或合成数据方法无法产生足以推动进一步进步的挑战性任务。Autodata 通过智能体数据创建,提供了一种将增加的推理计算转化为更高质量的模型训练从而产生这种挑战性数据的方法。因此,我们相信这一方向有潜力改变我们创建新任务和基准测试以推进前沿的方式。 ## 2 Autodata Autodata 的高层设计如图 1 (https://arxiv.org/html/2606.25996#S0.F1) 所示,可以从此模板构建各种具体实现。整个循环包括以下组件。 **数据创建。** Autodata 智能体锚定在提供的某些数据上(例如,来自数学、法律、编程等领域的特定文档,或根据任务需要的其他有用数据源)以帮助创建数据。然后,智能体可以使用工具或先前获得的现有技能/学习经验以及推理时计算来创建用于模型训练和基准测试的训练或评估数据。重要的是,这个创建步骤可以在后续分析和学习之后重复进行,以进一步改进数据。 **数据分析。** 给定智能体已创建的数据,它可以分析数据以了解哪些做对了、哪些做错了,以及如何改进。这可以是在特定示例的层面上(检查示例是否正确?质量高?足够有挑战性?),也可能是在数据集层面上(样本多样化吗?如果用作训练数据,它们能改进模型吗?)。这些学习经验被反馈到数据创建过程中,以在下一轮迭代中改进数据,直到满足停止条件。 **总体数据科学家循环。** 智能体在数据创建和数据分析阶段之间循环,直到对数据质量满意,然后生成最终的训练数据集或基准测试。这可以包括外层循环中的特定防护措施以防止作弊。智能体循环允许模型在这些步骤中基于自己的学习经验进行构建。 **数据科学家的元优化。** 智能体本身也可以被优化,使其更擅长成为数据科学家。一种方法是使用自动研究 (Karpathy, 2026 (https://arxiv.org/html/2606.25996#bib.bib10)) 或元框架 (Lee et al., 2026 (https://arxiv.org/html/2606.25996#bib.bib11)) 风格的优化来优化智能体框架,使用相同的内层循环标准(创建更好的数据)来指导外层循环(智能体本身优化)的优化。这如图 1 (https://arxiv.org/html/2606.25996#S0.F1) 的外部方框所示。 见图注 图 2:弱-强 对比 的 Agentic Self-Instruct 方法。主 LLM 智能体指导四个子智能体:挑战者 LLM 生成示例;弱求解器和强求解器尝试求解;评判者评估它们的输出。该系统旨在生成训练数据,其中强求解器成功而弱求解器难以应对。主 LLM 分析数据并使用评判者的反馈更新挑战者提示,然后重复此循环,为训练弱求解器生成具有挑战性的示例。 ### 2.1 一个具体的实现:Agentic Self-Instruct 在我们的实验中,我们考虑 Autodata 的一个具体、实用的实现,用于创建高质量数据,我们称之为 Agentic Self-Instruct,如图 2 (https://arxiv.org/html/2606.25996#S2.F2) 所示。主编排者智能体可以访问四个 LLM 子智能体: - (i) **挑战者**,根据主智能体的详细提示创建训练示例, - (ii) **“弱”求解器**,预期通常难以求解所创建的训练数据; - (iii) **“强”求解器**,预期通常能成功求解所创建的训练数据, - (iv) **验证者/评判者**,给定示例和模型解决方案,检查其质量,并将其学习经验传回主智能体。 主智能体通过向挑战者发送包含锚定上下文的初始提示,开始创建一个示例(例如,根据任务给定的上下文/输入、期望的响应或参考答案,以及评估标准)。然后,通过将输入发送给弱求解器和强求解器,并根据验证者的判断分配奖励,来检查挑战者输出的质量。评判者还扮演检查示例本身质量的角色:问题、参考答案或生成的评分标准。对于可验证的任务(使用基于 LLM 的验证者),一种方法是要求强求解器的多数投票是正确的,而弱求解器的多数投票是错误的。对于不可验证的任务,我们要求评判者测量的质量存在差距,例如,给定由挑战者生成的评分标准,使得任务对弱求解器来说既不太容易也不太困难,同时强求解器有助于保证正确性。智能体分析验证者(包含求解器输出)的报告,如果未满足该标准,则继续根据这些新的学习经验修改发送给挑战者的输入提示,尝试创建新示例,直到满足标准。这个过程使得智能体能够有效地学习如何专门为训练“弱”求解器创建具有挑战性和高质量的示例。我们注意到,“弱”求解器和“强”求解器实际上可以是同一个 LLM,但处于不同的模式,例如,允许强版本使用增加的推理时计算,包括脚手架或聚合 (Zhao et al., 2025b (https://arxiv.org/html/2606.25996#bib.bib36)),以及访问特权信息。 ## 3 实验 ### 3.1 计算机科学研究任务 我们考虑使用学术计算机科学(CS)论文作为源材料来回答 CS 研究问题的任务。CS 研究问题是开放式的,与可验证任务不同,需要基于评分标准进行评估。挑战者生成一个上下文、一个问题、一个参考答案,以及一个自包含的评估评分标准,该评分标准由加权标准组成,LLM 评判者使用它来对任何响应进行评分,而无需访问参考答案。 表 1:生成的 CS 研究任务的质量统计。CoT Self-Instruct 是标准提示生成;Agentic Self-Instruct 是智能体循环接受的输出。两列均在生成时由 Kimi-K2.6 在同一 4B-弱 / 397B-强 求解器对上评分。 **流程概述。** 主编排者智能体调用挑战者从给定的论文生成一个上下文-问答对以及相应的评分标准。然后在最终评估之前(以及作为循环结束时的最后一步),质量验证者检查上下文泄露、评分标准覆盖范围和问题质量。问题和上下文被发送给两个求解器(每个调用 3 次以减少方差),评判者根据评分标准按每个标准对它们的答案进行评分。如果任何接受标准失败,智能体向挑战者提供有针对性的反馈:哪些先前的问题太简单(附弱求解器得分),哪些在强求解器上失败(附差距信息),以及哪些被质量验证者拒绝。然后,挑战者从不同的推理角度生成一个新问题。此循环通常每篇论文运行几轮,直到找到可接受的问题或耗尽步骤预算。我们使用 Kimi-K2.6 作为主编排者智能体和挑战者,Qwen3.5-397B-A17B 作为强求解器,Qwen3.5-4B 作为弱求解器。智能体系统提示见附录 C.1 节 (https://arxiv.org/html/2606.25996#A3.SS1)。 **标准。** 一个对弱求解器有用的训练示例要求强求解器在评分标准上的得分显著高于弱求解器。然而,在初步实验中,由提示的 Kimi-K2.6 生成的大多数问题对弱求解器来说太容易了,几乎没有改进空间:如表 1 (https://arxiv.org/html/2606.25996#S3.T1) 的“CoT Self-Instruct”栏所示,这些问题在弱求解器上的平均分高于 0.67,弱/强差距仅为 0.02。因此,我们直接在智能体循环中根据这个差距定义接受标准:只有当强求解器平均分 ≥0.65 ≥0.65,弱求解器平均分 <0.5 <0.5,并且所有求解器尝试中的强弱差距 ≥20 ≥20 个百分点时,候选问题才被接受。考虑到弱求解器的强大性质,我们通过让评判者仅在弱求解器通过其相应成功标准时才评估强求解器,从而节省每次迭代的计算资源。 **数据设置。** 我们处理了来自 S2ORC 语料库(2022+)(Lo et al., 2020 (https://arxiv.org/html/2606.25996#bib.bib14)) 的超过 10k 篇 CS 论文,使用 Agentic Self-Instruct 生成了 2.8k 个被接受的示例。循环结束时的质量验证者(使用 Kimi-K2.6,它移除了具有特定论文参考泄露、上下文过短或格式错误评分标准的问题)进一步过滤了这个集合,我们保留了 1.3k 个高质量的被接受示例,作为用于 RL 训练的 Agentic Self-Instruct 数据。对于 CoT Self-Instruct 基线,我们也应用相同的质量验证者,并采样相同数量的 1.3k 过滤数据进行公平比较。 表 2:CS 研究任务的 RL 训练结果。autodata 的 Agentic Self-Instruct 方法优于使用标准 CoT Self-Instruct 创建的数据。我们使用 GRPO 在来自每个数据源的 1.3k 示例上训练 Qwen3.5-4B,并在一个 200 个提示的保留测试集上进行评估。分数基于评分标准,由 Kimi-K2.6 评定。如图 3 (https://arxiv.org/html/2606.25996#S3.F3) 所示,在整个训练过程中,Agentic 数据始终优于 CoT 数据;我们在表中展示了步骤 200 的结果。 见图注 图 3:两个 CS RL 运行(在 Agentic 与 CoT Self-Instruct 数据上训练的 Qwen3.5-4B)的训练奖励和保留验证。 左:每步的 Kimi-K2.6 评分标准奖励,EMA 平滑。 中/右:CoT 和 Agentic 保留测试集上的 mean@3(每个测试集对一个分支为分布内,对另一个分支为分布外)。在整个训练过程中,Agentic 训练的模型在两个保留测试集上都领先,在更难的 Agentic 测试上差距更大。 #### 3.1.1 Agentic Self-Instruct 循环分析 运行数据创建
相似文章
Autodata:一个用于创建高质量合成数据的智能体数据科学家
Autodata是一种方法,通过元优化使AI智能体能够扮演数据科学家的角色,创建高质量合成训练数据,在计算机科学、法律推理和数学任务等领域实现了性能提升。
@mylifcc: 这篇刚修订的 arXiv(2606.25996)把 agentic data creation 讲得很直接。 Meta 团队提出 Autodata:让 AI agent 自己当数据科学家,迭代生成高质量 synthetic trainin…
Meta团队在arXiv预印本(2606.25996)中提出Autodata方法,通过AI agent作为数据科学家迭代生成高质量合成训练数据和评估数据,核心机制Agentic Self-Instruct利用orchestrator、challenger、weak/strong solver和judge形成闭环,并引入meta-optimization进化prompt,显著提升数据质量。
@rohanpaul_ai: 非常重要的Meta论文带来Autodata,一个自主数据科学家,用于创建高质量合成数据。主要…
Meta的新论文'Autodata'介绍了一个自主数据科学家,能够生成并元优化合成训练数据,显著优于标准方法,并使一个4B小模型在法律任务中击败了397B的基线模型。
@neural_avb: https://x.com/neural_avb/status/2072294078805684613
本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。
@jaseweston: 主张:推动前沿的自动研究将围绕更好的数据展开——我们称之为 *Autodata*。1/6 —— 论文已发布!ht…
介绍了 Autodata,一种让 AI 代理扮演数据科学家以创建高质量合成训练数据的方法,在计算机科学、法律和数学推理任务上展示了优于经典方法的效果。