AutoDataBench:一个加速自动化研究的数据中心型测试平台
摘要
AutoDataBench 提出了一个受控的数据中心型测试平台,用于隔离并评估 LLM 智能体的“数据智能”——即诊断、组织和构建训练数据的能力,同时固定非数据因素,结果显示这些轨迹也可在中期训练中复用以带来增益。
查看缓存全文
缓存时间: 2026/10/02 04:28
论文页面 - AutoDataBench:一个用于加速自动化研究的数据驱动测试平台
来源:https://huggingface.co/papers/2609.40097 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
现有的自动化研究基准往往将多种改进来源混杂在一起,包括训练框架、超参数、计算预算和数据,这使得难以将某个前沿智能体优于另一个智能体的原因归因到具体的研究能力上。在本工作中,我们隔离并系统性地评估了数据智能(Data Intelligence):智能体理解、操作和改进塑造模型能力的数据的能力。我们提出了 AutoDataBench,这是一个建立在数据智能概念框架之上的受控测试平台,该框架涵盖数据诊断、数据组织和数据构建,通过三个高度精心设计的优化任务实例化,同时将非数据因素固定不变。在工具使用、检索和知识注入方面,我们评估了前沿 LLM 在任务特定资源预算下通过迭代实验改进训练数据的能力。除了优化性能之外,我们还追问:LLM 是否理解它们的数据干预会产生什么效果?我们将训练前做出的预测与观察到的结果进行比较,以寻找超越试错的数据效果推理证据,并探索迭代反馈是否能帮助 LLM 更好地理解对训练数据的改动如何影响模型性能。最后,我们展示了复用 AutoDataBench 轨迹进行中训练(mid-training)可以提升下游代码能力,凸显了它在评估数据智能和生成高质量训练数据两方面的价值。代码和资源已在 https://github.com/AutoDataBench/AutoDataBench 提供。
查看 arXiv 页面(https://arxiv.org/abs/2609.40097) 查看 PDF(https://arxiv.org/pdf/2609.40097) GitHub(3)(https://github.com/AutoDataBench/AutoDataBench) 添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2609.40097)
在你的 agent 中获取这篇论文:
hf papers read 2609\.40097
还没有最新版 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型(3)
AutoDataBench/Retrieval-resources 更新于约 11 小时前(https://huggingface.co/AutoDataBench/Retrieval-resources)
AutoDataBench/Knowledge-Injection-resources 问答(QA)• 更新于约 11 小时前(https://huggingface.co/AutoDataBench/Knowledge-Injection-resources)
AutoDataBench/Function-Calling-resources 更新于约 11 小时前(https://huggingface.co/AutoDataBench/Function-Calling-resources)
引用本文的数据集(0)
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.40097,即可从本页面链接到它。
引用本文的 Space(0)
没有 Space 链接到本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.40097,即可从本页面链接到它。
收录本文的收藏集(0)
没有收藏集收录本文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从本页面链接到它。
相似文章
AutoDataBench:智能体能否编写为自我改进循环提供数据的内容?
AutoDataBench 引入了一个基准测试,用于评估智能体能否为数据管道编写符合实际验收标准的任务,旨在实现 AI 递归自我改进的可扩展数据合成。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
AutoMedBench:迈向基于智能体AI模型的医学自动研究
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。