AutoDataBench:智能体能否编写为自我改进循环提供数据的内容?

Hugging Face Daily Papers 论文

摘要

AutoDataBench 引入了一个基准测试,用于评估智能体能否为数据管道编写符合实际验收标准的任务,旨在实现 AI 递归自我改进的可扩展数据合成。

近期语言模型能力的提升更多来自数据,而非架构。前沿实验室和数据公司生产可验证的智能体任务,然后通过监督微调和强化学习将其转化为能力。这条生产线仍然依赖于人工劳动和人在回路中的协作。自动化任务创建可以让数据生产随计算能力扩展,而不是依赖专家人数,扩展到更多领域,并实现递归自我改进(RSI)的关键一步。当前对智能体编写此类任务能力的评估,是衡量模型在训练后基于智能体产出的表现。这与数据行业的常见做法不符,在行业中,数据是逐样本交付的,每个样本根据一组标准接受验收,而不是直接用于训练。现有评估都没有询问单个任务是否符合数据管道的验收标准。因此,我们引入了 AutoDataBench。给定一个原始基准任务和目标模型尝试该任务的记录,智能体必须为同一套件编写一个新任务,该任务需在有效性、新颖性、难度和行为覆盖方面符合实际验收标准。在三个可执行智能体任务的基准测试中,在默认时间预算为45分钟的情况下,我们评估的智能体得分均未超过20分(满分100分)。给最强的智能体四倍的时间能显著提高其得分,而一个可用任务的成本几乎保持不变。当前的智能体可以编写符合要求质量的训练任务,但效率不高。AutoDataBench 直接衡量智能体自主数据合成的能力:一次一个工件,根据生产管道将应用的标准进行判断,无需训练运行。代码和数据可在 https://github.com/StarDewXXX/AutoDataBench 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:16

论文页面 - AutoDataBench:智能体能否生成驱动自我提升循环的数据?

来源:https://huggingface.co/papers/2609.35025

摘要

近期语言模型能力的提升更多源于数据而非架构。前沿实验室与数据公司生产可验证的智能体任务,再通过监督微调与强化学习将其转化为能力。这条生产流程仍依赖人力及人机协作。自动化任务生成将使数据生产得以随计算规模扩展,而非依赖专家人力;它将拓展至更多领域,并为递归式自我提升的关键一步铺平道路。现有对智能体生成此类任务能力的评估,衡量的是模型在智能体生成数据上训练后的表现。这与数据行业的普遍实践不符——数据通常是逐条交付,每条样本需依据一系列标准验收,而非直接投入训练。目前尚无评估考察单个任务是否符合数据管道的验收标准。因此我们提出AutoDataBench。给定一个原始基准任务及目标模型尝试该任务的记录,智能体需为同一套件创建新任务,使其满足有效性、新颖性、难度和行为覆盖度等实际验收标准。在三个可执行智能体任务基准测试中,我们评估的所有智能体在默认45分钟时间预算下得分均未超过100分中的20分。为最强智能体提供四倍时间可显著提升其分数,而单个可用任务的成本几乎保持不变。当前智能体能生成所需质量的训练任务,但效率不足。AutoDataBench提供了衡量智能体自主数据合成能力的直接指标:逐条生成,依据生产管道标准评判,无需训练运行。代码与数据已开源于 https://github.com/StarDewXXX/AutoDataBench。

查看 arXiv 页面 (https://arxiv.org/abs/2609.35025) 查看 PDF (https://arxiv.org/pdf/2609.35025) 项目页面 (https://autodatabench.com/) GitHub18 (https://github.com/StarDewXXX/AutoDataBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.35025)

在你的智能体中获取此论文:

hf papers read 2609\.35025

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.35025 以从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.35025 以从本页链接。

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.35025 以从本页链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

AutoMedBench:迈向基于智能体AI模型的医学自动研究

Hugging Face Daily Papers

AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。