AutoDataBench:一个加速自动化研究的数据中心型测试平台

Hugging Face Daily Papers 论文

摘要

AutoDataBench 提出了一个受控的数据中心型测试平台,用于隔离并评估 LLM 智能体的“数据智能”——即诊断、组织和构建训练数据的能力,同时固定非数据因素,结果显示这些轨迹也可在中期训练中复用以带来增益。

现有的自动化研究基准往往将多种改进来源纠缠在一起,包括训练框架、超参数、算力预算和数据等,这使得难以将某个前沿智能体优于另一个智能体的原因归因于特定的研究能力。在这项工作中,我们隔离并系统地评估了“数据智能”:智能体理解、处理和改进塑造模型能力的数据的能力。我们提出了 AutoDataBench,这是一个基于数据智能概念框架构建的受控测试平台,该框架涵盖数据诊断、数据组织和数据构建三个维度,并通过三个高度精心设计的优化任务加以实例化,同时固定非数据因素。在工具使用、检索和知识注入三类任务上,我们在任务特定的资源预算下,评估前沿 LLM 通过迭代实验改进训练数据的能力。除了优化性能之外,我们还进一步追问:LLM 是否理解自己对数据的干预会产生什么效果?我们将训练前的预测与观察到的结果进行对比,以寻找超越试错的“数据效果推理”证据,并探讨迭代反馈是否有助于 LLM 更好地理解训练数据的变化如何影响模型性能。最后,我们展示了将 AutoDataBench 的轨迹用于中期训练可以提升下游代码生成性能,凸显了该平台在评估数据智能和生成高质量训练数据两方面的价值。代码和资源已发布于 https://github.com/AutoDataBench/AutoDataBench。
查看原文
查看缓存全文

缓存时间: 2026/10/02 04:28

论文页面 - AutoDataBench:一个用于加速自动化研究的数据驱动测试平台

来源:https://huggingface.co/papers/2609.40097 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

现有的自动化研究基准往往将多种改进来源混杂在一起,包括训练框架、超参数、计算预算和数据,这使得难以将某个前沿智能体优于另一个智能体的原因归因到具体的研究能力上。在本工作中,我们隔离并系统性地评估了数据智能(Data Intelligence):智能体理解、操作和改进塑造模型能力的数据的能力。我们提出了 AutoDataBench,这是一个建立在数据智能概念框架之上的受控测试平台,该框架涵盖数据诊断、数据组织和数据构建,通过三个高度精心设计的优化任务实例化,同时将非数据因素固定不变。在工具使用、检索和知识注入方面,我们评估了前沿 LLM 在任务特定资源预算下通过迭代实验改进训练数据的能力。除了优化性能之外,我们还追问:LLM 是否理解它们的数据干预会产生什么效果?我们将训练前做出的预测与观察到的结果进行比较,以寻找超越试错的数据效果推理证据,并探索迭代反馈是否能帮助 LLM 更好地理解对训练数据的改动如何影响模型性能。最后,我们展示了复用 AutoDataBench 轨迹进行中训练(mid-training)可以提升下游代码能力,凸显了它在评估数据智能和生成高质量训练数据两方面的价值。代码和资源已在 https://github.com/AutoDataBench/AutoDataBench 提供。

查看 arXiv 页面(https://arxiv.org/abs/2609.40097) 查看 PDF(https://arxiv.org/pdf/2609.40097) GitHub(3)(https://github.com/AutoDataBench/AutoDataBench) 添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2609.40097)

在你的 agent 中获取这篇论文:

hf papers read 2609\.40097

还没有最新版 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型(3)

AutoDataBench/Retrieval-resources 更新于约 11 小时前(https://huggingface.co/AutoDataBench/Retrieval-resources)

AutoDataBench/Knowledge-Injection-resources 问答(QA)• 更新于约 11 小时前(https://huggingface.co/AutoDataBench/Knowledge-Injection-resources)

AutoDataBench/Function-Calling-resources 更新于约 11 小时前(https://huggingface.co/AutoDataBench/Function-Calling-resources)

引用本文的数据集(0)

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.40097,即可从本页面链接到它。

引用本文的 Space(0)

没有 Space 链接到本文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.40097,即可从本页面链接到它。

收录本文的收藏集(0)

没有收藏集收录本文

将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从本页面链接到它。

相似文章

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。

AutoMedBench:迈向基于智能体AI模型的医学自动研究

Hugging Face Daily Papers

AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。