什么是好的代理数据?从ACE视角看LLM代理的数据生成
摘要
本文介绍了使用ACE视角的两层代理数据生成框架,专注于准确性、复杂性和多样性,为LLM代理创建有效的训练数据。
查看缓存全文
缓存时间: 2026/08/28 03:24
论文页面 - 何为优质的智能体数据?从ACE视角解析LLM智能体的数据生成
来源:https://huggingface.co/papers/2608.27260 发布于 8月27日
#1 当日热门论文 (https://huggingface.co/papers/date/2026-08-28) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
智能体数据生成被框架化为对因子化经验元组的受约束分布设计,强调基于执行的准确性、相对于学习者的复杂度,而非仅仅追求规模。
大语言模型智能体 (https://huggingface.co/papers?q=LLM%20agents) 越来越依赖生成的交互数据来学习如何与外部环境互动。智能体数据生成 (https://huggingface.co/papers?q=Agentic%20data%20generation) 必须在环境、任务、交互和成功信号之间保持一致性,同时产出有价值而非仅仅是数量庞大的经验。现有工作涵盖众多智能体领域,但以领域为中心的组织方式和异质性评估常常模糊了共通的生成机制,并将候选构建与验证选择混为一谈。本文为此领域开发了一个两级框架。首先,我们将智能体数据表示为一个通用的因子化对象 (https://huggingface.co/papers?q=factorized%20object) (E,q,τ,v),包含环境规范、任务信号、交互实现和可选的验证器 (https://huggingface.co/papers?q=verifier)。我们根据其主要锚点和依赖结构来组织生成范式。其次,我们通过准确度-复杂度-多样性 (https://huggingface.co/papers?q=divErsity) (ACE) 视角,将生成过程构建为受约束的分布设计 (https://huggingface.co/papers?q=constrained%20distribution%20design)。准确度建立了基于执行且内部一致的数据的可行支持集。在此支持集内,复杂度根据声明的学习者能力和执行配置来放置学习质量,而多样性 (https://huggingface.co/papers?q=divErsity) 则控制数据的覆盖范围和冗余度。利用此框架,我们探讨了先前工作如何验证生成的经验、构建和校准难度,并扩展行为覆盖范围。文献显示出向基于执行的准确性 (https://huggingface.co/papers?q=execution-grounded%20accuracy)、相对于学习者的复杂度 (https://huggingface.co/papers?q=learner-relative%20complexity) 以及超越表面变异或数据集规模的多样性 (https://huggingface.co/papers?q=diversity) 的转变。我们进一步通过ACE视角讨论了智能体数据生成 (https://huggingface.co/papers?q=agentic%20data%20generation) 的更广泛方向和新兴趋势,包括它们对规模化、数据来源、训练范式和自适应学习 (https://huggingface.co/papers?q=adaptive%20learning) 的启示。总体而言,核心挑战并非简单地生成更多数据,而是随着智能体和环境的演进,持续分配有效、信息丰富且非冗余的经验。
查看arXiv页面 (https://arxiv.org/abs/2608.27260) 查看PDF (https://arxiv.org/pdf/2608.27260) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27260)
在您的智能体中获取此论文:
hf papers read 2608\.27260
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.27260以从此页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.27260以从此页面链接它。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.27260以从此页面链接它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。
LLM Agents Factory: Retrieval of Domain-Specific LLM Agents
The paper presents LLM Agents Factory, a retrieval-based framework that constructs domain-specific LLM agents from a base of over 20K predefined agent profiles, offering a cost-efficient and controllable alternative to dynamic agent generation. Experiments show accuracy comparable to AutoGen with a 120B backbone at substantially lower inference cost.
通过人类对齐设计用于药物发现代理AI的健壮LLM评估系统
本文提出一种用于药物发现代理AI的LLM-as-a-Judge评估框架,通过专家标注者的人类对齐研究验证。优化法官模型以提升与人类判断的契合度,并为科学领域可重用评估提供洞见。
探索用于模型特化的自主代理数据工程
本文形式化了自主代理数据工程,其中LLMs作为自主数据工程师,为特定领域策划和优化训练数据,使用GPT-5.2使学生模型性能提升了57.29%。