Autodata:一个用于创建高质量合成数据的智能体数据科学家

Hugging Face Daily Papers 论文

摘要

Autodata是一种方法,通过元优化使AI智能体能够扮演数据科学家的角色,创建高质量合成训练数据,在计算机科学、法律推理和数学任务等领域实现了性能提升。

我们介绍了Autodata,这是一种通用方法,使AI智能体能够扮演数据科学家的角色,构建高质量的训练和评估数据。我们展示了如何训练(元优化)这样一个人工智能体数据科学家,使其学会创建更强大的数据。我们描述了整体框架以及一个具体的实际实现——Agentic Self-Instruct。我们在计算机科学研究任务、法律推理任务和数学对象推理任务上进行了实验,与经典的合成数据集创建方法相比,获得了更好的结果。此外,对数据科学家智能体本身进行元优化可实现更大的性能提升。智能体数据创建提供了一种将增加的推理计算转化为更高质量模型训练的方法。总体而言,我们相信这一方向有可能改变我们构建AI数据的方式。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:17

论文页面 - Autodata: 一种用于创建高质量合成数据的智能数据科学家

来源: https://huggingface.co/papers/2606.25996 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Autodata 使 AI 智能体能够像数据科学家一样,通过元优化创建高质量的训练数据,并在多个任务领域展现出性能提升。

我们提出了 Autodata,一种通用方法,使 AI 智能体能够像数据科学家一样构建高质量的训练和评估数据。我们展示了如何训练(元优化)这样的数据科学家智能体 (https://huggingface.co/papers?q=data%20scientist%20agent),使其学会创建更强大的数据。我们描述了整体框架以及一个具体的实践实现:智能体自我指令 (https://huggingface.co/papers?q=Agentic%20Self-Instruct)。我们在计算机科学研究任务、法律推理任务以及数学对象推理任务上进行了实验,与传统的合成数据集创建方法 (https://huggingface.co/papers?q=synthetic%20dataset%20creation) 相比,取得了更优的结果。此外,对数据科学家智能体 (https://huggingface.co/papers?q=data%20scientist%20agent) 本身进行元优化带来了更大的性能提升。智能体数据创建提供了一种方法,将增加的推理计算量 (https://huggingface.co/papers?q=inference%20compute) 转化为更高质量的模型训练 (https://huggingface.co/papers?q=model%20training)。总体而言,我们相信这一方向有潜力改变我们构建 AI 数据的方式。

查看 arXiv 页面 (https://arxiv.org/abs/2606.25996) 查看 PDF (https://arxiv.org/pdf/2606.25996) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.25996)

在您的智能体中获取此论文:

hf papers read 2606.25996

没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.25996 以从本页链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.25996 以从本页链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.25996 以从本页链接到它。

包含此论文的收藏集0

没有收藏集包含此论文

添加此论文到收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。

@mylifcc: 这篇刚修订的 arXiv(2606.25996)把 agentic data creation 讲得很直接。 Meta 团队提出 Autodata:让 AI agent 自己当数据科学家,迭代生成高质量 synthetic trainin…

X AI KOLs Timeline

Meta团队在arXiv预印本(2606.25996)中提出Autodata方法,通过AI agent作为数据科学家迭代生成高质量合成训练数据和评估数据,核心机制Agentic Self-Instruct利用orchestrator、challenger、weak/strong solver和judge形成闭环,并引入meta-optimization进化prompt,显著提升数据质量。

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。