AutoDataBench:智能体能否编写为自我改进循环提供数据的内容?
摘要
AutoDataBench 引入了一个基准测试,用于评估智能体能否为数据管道编写符合实际验收标准的任务,旨在实现 AI 递归自我改进的可扩展数据合成。
查看缓存全文
缓存时间: 2026/09/30 04:16
论文页面 - AutoDataBench:智能体能否生成驱动自我提升循环的数据?
来源:https://huggingface.co/papers/2609.35025
摘要
近期语言模型能力的提升更多源于数据而非架构。前沿实验室与数据公司生产可验证的智能体任务,再通过监督微调与强化学习将其转化为能力。这条生产流程仍依赖人力及人机协作。自动化任务生成将使数据生产得以随计算规模扩展,而非依赖专家人力;它将拓展至更多领域,并为递归式自我提升的关键一步铺平道路。现有对智能体生成此类任务能力的评估,衡量的是模型在智能体生成数据上训练后的表现。这与数据行业的普遍实践不符——数据通常是逐条交付,每条样本需依据一系列标准验收,而非直接投入训练。目前尚无评估考察单个任务是否符合数据管道的验收标准。因此我们提出AutoDataBench。给定一个原始基准任务及目标模型尝试该任务的记录,智能体需为同一套件创建新任务,使其满足有效性、新颖性、难度和行为覆盖度等实际验收标准。在三个可执行智能体任务基准测试中,我们评估的所有智能体在默认45分钟时间预算下得分均未超过100分中的20分。为最强智能体提供四倍时间可显著提升其分数,而单个可用任务的成本几乎保持不变。当前智能体能生成所需质量的训练任务,但效率不足。AutoDataBench提供了衡量智能体自主数据合成能力的直接指标:逐条生成,依据生产管道标准评判,无需训练运行。代码与数据已开源于 https://github.com/StarDewXXX/AutoDataBench。
查看 arXiv 页面 (https://arxiv.org/abs/2609.35025) 查看 PDF (https://arxiv.org/pdf/2609.35025) 项目页面 (https://autodatabench.com/) GitHub18 (https://github.com/StarDewXXX/AutoDataBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.35025)
在你的智能体中获取此论文:
hf papers read 2609\.35025
尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.35025 以从本页链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.35025 以从本页链接。
引用此论文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.35025 以从本页链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
AutoMedBench:迈向基于智能体AI模型的医学自动研究
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
神经数据不再无聊:代理型AI在数据复用中的基准测试
本文对代理型AI系统在加载、理解和重新格式化碎片化的神经科学数据任务上进行基准测试,发现尽管代理在子任务上表现良好,但很少能实现完全无错误的端到端解决方案,人工监督仍然必要。
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。